View a markdown version of this page

AWS 深度学习基础 GPU AMI (Ubuntu 20.04) - AWS Deep Learning AMIs

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

AWS 深度学习基础 GPU AMI (Ubuntu 20.04)

终止支持通知

有关入门帮助,请参阅 DLAMI 入门

AMI 名称格式

  • 深度学习基础 OSS Nvidia 驱动程序 GPU AMI (Ubuntu 20.04) $ {} YYYY-MM-DD

  • 深度学习基础专有 Nvidia 驱动程序 GPU AMI (Ubuntu 20.04) $ {} YYYY-MM-DD

支持的 EC2 实例

  • 请参阅 DLAMI 的重要更改

  • 采用 OSS Nvidia Driver 的 Deep Learning 支持 G4dn、G5、G6、Gr6、G6e、P4d、P4de、P5、P5e、P5en

  • 使用专有 Nvidia 驱动程序进行深度学习支持 G3(G3.16x 不支持)、P3、P3DN

该 AMI 包含以下内容:

  • 支持的 AWS 服务:亚马逊 EC2

  • 操作系统:Ubuntu 20.04

  • 计算架构:x86

  • 已为以下软件包安装了最新的可用版本:

    • Linux 内核 5.15

    • fsX Lustre

    • Docker

    • AWS CLI v2 在/usr/local/bin/aws2 和 AWS CLI v1 在//usr/binaws

    • NVIDIA DCGM

    • Nvidia Container Toolkit

      • 版本命令:nvidia-container-cli -V

    • Nvidia-docker2:

      • 版本命令:nvidia-docker 版本

  • NVIDIA Driver

    • OSS Nvidia 驱动程序:550.163.01

    • Proprietary Nvidia Driver:550.163.01

  • NVIDIA CUDA 11.7、12.1-12.4 堆栈

    • CUDA、NCCL 和 cudDN 安装目录://cuda-xx.x/ usr/local

      • 示例:/usr/local/cuda-12.1/

    • 编译的 NCCL 版本:2.22.3+ CUDA12.4

    • 默认 CUDA:12.1

      • PATH/usr/local/cuda 指向 CUDA 12.1

      • 更新以下环境变量:

        • LD_LIBRARY_PATH 需要有//cuda-12。usr/local1/lib:/usr/local/cuda-12。1/lib64:/usr/local/cuda-12.1:/ /cuda usr/local -12。1/targets/x86_64-linux/lib

        • 获取路径/usr/local/cuda-12。1/bin/:/usr/local/cuda-12。1/include/

        • 对于任何不同的 CUDA 版本,请相应地更新 LD_LIBRARY_PATH。

    • NCCL 测试位置:

      • all_reduce、all_gather 和 reduce_scatter://cuda-xx。usr/localx/efa/test-cuda-xx.x/

      • 要运行 NCCL 测试,需要传递包含以下更新的 LD_LIBRARY_PATH。

        • 常用 PATH 已经被添加到 LD_LIBRARY_PATH:

          • /opt/amazon/efa/lib:/opt/amazon/openmpi/lib:/opt/aws-ofi-nccl/lib:/usr/local/lib:/usr/lib

        • 对于任何不同的 CUDA 版本,请相应地更新 LD_LIBRARY_PATH。

  • EFA 安装程序:1.39.0

  • Nvidia GDRCopy:2.4

  • AWS OFI NCCL 插件:作为插件的一部分安装 EFA Installer-aws

    • AWS OFI NCCL 现在支持单一版本的多个 NCCL 版本

    • 安装路径:/opt/aws-ofi-nccl/。路径已添加到 LD_LI /opt/aws-ofi-nccl/lib BRARY_PATH。

    • 响铃、message _transfer 的测试路径:/opt/aws-ofi-nccl/tests

  • EBS 卷类型:gp3

  • Python:/usr/bin/python3.9

  • NVMe 实例存储位置(在支持的 EC2 实例上)://opt/dlaminvme

  • AMI-ID 使用 SSM 参数查询(示例 Region 为 us-east-1):

    • OSS Nvidia Driver:

      aws ssm get-parameter --region us-east-1 \ --name /aws/service/deeplearning/ami/x86_64/base-oss-nvidia-driver-gpu-ubuntu-20.04/latest/ami-id \ --query "Parameter.Value" \ --output text
    • Proprietary Nvidia Driver:

      aws ssm get-parameter --region us-east-1 \ --name /aws/service/deeplearning/ami/x86_64/base-proprietary-nvidia-driver-gpu-ubuntu-20.04/latest/ami-id \ --query "Parameter.Value" \ --output text
  • AMI-ID 使用 AWSCLI 查询(示例 Region 是 us-east-1):

    • OSS Nvidia Driver:

      aws ec2 describe-images --region us-east-1 \ --owners amazon \ --filters 'Name=name,Values=Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output text
    • Proprietary Nvidia Driver:

      aws ec2 describe-images --region us-east-1 \ --owners amazon \ --filters 'Name=name,Values=Deep Learning Base Proprietary Nvidia Driver GPU AMI (Ubuntu 20.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output text

通知

NVIDIA Container Toolkit 1.17.4

在 Container Toolkit 版本 1.17.4 中,现在禁用挂载 CUDA 兼容性库。为了确保与容器工作流中的多个 CUDA 版本兼容,请确保更新 LD_LIBRARY_PATH 以包含您的 CUDA 兼容性库,如如果您使用 CUDA 兼容层教程中所示。

EFA 版本从 1.37 更新为 1.38(2025-02-04 发布)

EFA 现在捆绑了 AWS OFI NCCL 插件,现在可以在原版中找到该插件/opt/amazon/ofi-nccl/opt/aws-ofi-nccl/如果更新 LD_LIBRARY_PATH 变量,请确保正确修改 OFI NCCL 位置。

支持政策

此 AMI 的组件(如 CUDA 版本)可能在未来版本中基于框架支持策略或为了优化深度学习容器性能、减小 AMI 大小等原因而被移除或更改,恕不另行通知。如果 CUDA 版本没有被任何受支持的框架版本所使用,则我们会将其从 AMI 中移除。

使用多个网卡的 EC2 实例
  • 许多支持 EFA 的实例类型也有多个网卡。

  • DeviceIndex 对于每个网卡都是唯一的,并且必须是小于每个 ENI 限制的非负整数。 NetworkCard在 P5 上,每个 ENI 的数量 NetworkCard 为 2,这意味着的唯一有效值 DeviceIndex 为 0 或 1。

    • 对于主网络接口(网卡索引 0、设备索引 0),创建一个 EFA(兼具 ENA 功能的 EFA)接口。您不能使用 EFA-only 网络接口作为主要网络接口。

    • 对于每个额外的网络接口,使用下一个未使用的网卡索引,即设备索引 1,以及 EFA(带有 ENA 的 EFA)或 EFA-only 网络接口,具体取决于您的用例,例如 ENA 带宽要求或 IP 地址空间。有关使用案例示例,请参阅 P5 实例的 EFA 配置。

    • 有关更多信息,请参阅此处的《EFA 指南》。

P5/P5e 实例
  • P5 和 P5e 实例包含 32 个网络接口卡,可以使用以下命令启动: AWS CLI

aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=31,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
P5en 实例
  • P5en 包含 16 个网络接口卡,可以使用以下 AWS CLI 命令启动:

aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=15,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
内核
  • 使用以下命令固定内核版本:

    echo linux-aws hold | sudo dpkg —set-selections echo linux-headers-aws hold | sudo dpkg —set-selections echo linux-image-aws hold | sudo dpkg —set-selections
  • 我们建议用户避免更新其内核版本(除非为了安全修补原因),以确保与已安装的驱动程序和软件包版本兼容。如果用户仍希望更新,则可以运行以下命令来取消固定内核版本:

    echo linux-aws install | sudo dpkg -set-selections echo linux-headers-aws install | sudo dpkg -set-selections echo linux-image-aws install | sudo dpkg -set-selections
  • 对于每个新版本的 DLAMI,使用最新可用的兼容内核。

发布日期:2025-04-24

AMI 名称
  • Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20250424

  • Deep Learning Base Proprietary Nvidia Driver GPU AMI(Ubuntu 20.04)20250424

已更新

发布日期:2025-02-17

AMI 名称
  • Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20250214

  • Deep Learning Base Proprietary Nvidia Driver GPU AMI(Ubuntu 20.04)20250214

已更新
已删除

发布日期:2025-02-04

AMI 名称
  • Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20250204

  • Deep Learning Base Proprietary Nvidia Driver GPU AMI(Ubuntu 20.04)20250204

已更新
  • EFA 版本从 1.37.0 升级到 1.38.0

    • EFA 现在捆绑了 AWS OFI NCCL 插件,现在可以在原版中找到该插件/opt/amazon/ofi-nccl/opt/aws-ofi-nccl/如果更新 LD_LIBRARY_PATH 变量,请确保正确修改 OFI NCCL 位置。

已删除

发布日期:2025-01-17

AMI 名称
  • Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20250117

  • Deep Learning Base Proprietary Nvidia Driver GPU AMI(Ubuntu 20.04)20250117

已更新

发布日期:2024-12-09

AMI 名称
  • Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20241206

  • Deep Learning Base Proprietary Nvidia Driver GPU AMI(Ubuntu 20.04)20241206

已更新
  • Nvidia Container Toolkit 版本从 1.17.0 升级到 1.17.3

发布日期:2024-11-22

AMI 名称:Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20241122

新增了
  • 增加了对 P5en EC2 实例的支持。

已更新
  • EFA 安装程序版本从 1.35.0 升级到 1.37.0

  • 将 AWS OFI NCCL 插件从 1.12.1-aws 版本升级到 1.13.0-aws

发布日期:2024-10-26

AMI 名称
  • Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20241025

  • Deep Learning Base Proprietary Nvidia Driver GPU AMI(Ubuntu 20.04)20241025

已更新

发布日期:2024-10-03

AMI 名称:Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20240927

已更新
  • Nvidia Container Toolkit 版本从 1.16.1 升级到 1.16.2

发布日期:2024-08-27

AMI 名称:Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20240827

已更新
  • Nvidia 驱动程序和 Fabric Manager 版本从 535.183.01 升级到 550.90.07

  • EFA 版本从 1.32.0 升级到 1.34.0

  • 针对所有 CUDA 版本将 NCCL 升级到最新版本 2.22.3

    • CUDA 11.7 从 2.16.2+ 版本升级 CUDA11.7

    • CUDA 12.1、12.2 从 2.18.5+ 升级 CUDA12.2

    • CUDA 12.3 从 2.21.5+ 版本升级 CUDA12.4

新增了
  • 在目录//cuda-12.4 中添加了 CUDA 工具包版本 12.4 usr/local

  • 增加了对 P5e EC2 实例的支持。

已删除
  • 删除了目录/ /cuda-11.8 中存在的 CUDA Toolkit 版本 11.8 堆栈 usr/local

发布日期:2024-08-19

AMI 名称:Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20240816

新增了

发布日期:2024-06-06

AMI 名称
  • Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20240606

  • Deep Learning Base Proprietary Nvidia Driver GPU AMI(Ubuntu 20.04)20240606

已更新
  • Nvidia 驱动程序版本从 535.183.01 更新为 535.161.08

发布日期:2024-05-15

AMI 名称
  • Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20240515

  • Deep Learning Base Proprietary Nvidia Driver GPU AMI(Ubuntu 20.04)20240515

新增了
  • 在目录/usr/local/cuda-11.7 处添加了返回 CUDA11.7 堆栈,支持 NCCL 2.16.2 CUDA11.7、cuDNN 8.7.0 作为 1.13 PyTorch CUDA11.7

发布日期:2024-05-02

AMI 名称
  • Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20240502

  • Deep Learning Base Proprietary Nvidia Driver GPU AMI(Ubuntu 20.04)20240502

已更新
  • EFA 版本从 1.30 更新为 1.32

  • 将 AWS OFI NCCL 插件从版本 1.7.4 更新到版本 1.9.1

  • Nvidia Container Toolkit 版本从 1.13.5 更新为 1.15.0

    • 版本 1.15.0 不包括 nvidia-container-runtime 和 nvidia-docker2 软件包。建议按照 Nvidia Container Toolkit 文档直接使用 nvidia-container-toolkit 软件包。

新增了
  • 使用 NCCL 2.21.5 CUDA12.3、cuDNN 8.9.7 添加了 CUDA12.3 堆栈

已删除
  • 移除 CUDA11.7, CUDA12.0 堆栈存在于/usr/local/cuda-11.7 和//cuda-12.0 目录中 usr/local

  • Nvidia Container Toolkit 版本从 1.13.5 更新为 1.15.0 时,移除了 nvidia-docker2 软件包及其命令 nvidia-docker,因此不再包括 nvidia-container-runtime 和 nvidia-docker2 软件包。

发布日期:2024-04-04

AMI 名称:Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20240404

新增了
  • 对于 OSS Nvidia Driver DLAMI,增加了 G6 和 Gr6 EC2 实例支持。有关更多信息,请参阅推荐的 GPU 实例

发布日期:2024-03-29

AMI 名称
  • Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20240326

  • Deep Learning Base Proprietary Nvidia Driver GPU AMI(Ubuntu 20.04)20240326

已更新
  • 在 Proprietary 和 OSS Nvidia 驱动程序 DLAMI 中,Nvidia 驱动程序版本从 535.104.12 更新为 535.161.08。

  • 从 Proprietary Nvidia Driver DLAMI 中移除了 G4dn、G5 EC2 实例支持。

  • 每个 DLAMI 支持的新实例如下:

    • 使用专有 Nvidia 驱动程序进行深度学习支持 G3(G3.16x 不支持)、P3、P3DN

    • 采用 OSS Nvidia Driver 的 Deep Learning 支持 G4dn、G5、P4d、P4de、P5。

发布日期:2024-03-20

AMI 名称
  • Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20240318

  • Deep Learning Base Proprietary Nvidia Driver GPU AMI(Ubuntu 20.04)20240318

新增了
  • 在 AMI awscliv2 中添加到/usr/local/bin/aws2,在专有和 OSS Nvidia 驱动程序 AMI 上添加awscliv1为 usr/bin /aws

发布日期:2024-03-14

AMI 名称:Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20240314

已更新
  • 更新了 OSS Nvidia Driver DLAMI,支持 G4dn 和 G5,更新后的当前支持如下:

    • Deep Learning Base Proprietary Nvidia Driver AMI(Ubuntu 20.04)支持 P3、P3dn、G3、G5、G4dn。

    • Deep Learning Base OSS Nvidia Driver AMI(Ubuntu 20.04)支持 G5、G4dn、P4、P5。

  • 对于 G5、G4dn、P4、P5,建议使用 OSS Nvidia Driver DLAMI。

发布日期:2024-02-12

AMI 名称
  • Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20240208

  • Deep Learning Base Proprietary Nvidia Driver GPU AMI(Ubuntu 20.04)20240208

已更新
  • AWS OFI NCCL 插件从 1.7.3 更新到 1.7.4

发布日期:2024-02-01

AMI 名称
  • Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20240201

  • Deep Learning Base Proprietary Nvidia Driver GPU AMI(Ubuntu 20.04)20240201

安全性

发布日期:2023-12-04

AMI 名称
  • Deep Learning Base OSS Nvidia Driver GPU AMI(Ubuntu 20.04)20231204

  • Deep Learning Base Proprietary Nvidia Driver GPU AMI(Ubuntu 20.04)20231204

新增了
  • AWS 深度学习 AMI (DLAMI) 分为两个独立的组:

    • 使用 Nvidia Proprietary Driver 的 DLAMI(以支持 P3、P3dn、G3、G5、G4dn)。

    • 使用 Nvidia OSS Driver 以启用 EFA 的 DLAMI(以支持 P4、P5)。

  • 有关 DLAMI 拆分的更多信息,请参阅 DLAMI 的重要更改

  • AWS CLI 上述查询位于要点下方 AMI-ID 使用 AWSCLI 进行查询(示例 Region 为 us-east-1)

已更新
  • EFA 版本从 1.26.1 更新为 1.29.0

  • GDRCopy 版本从 2.3 更新为 2.4

发布日期:2023-10-18

AMI 名称:Deep Learning Base GPU AMI(Ubuntu 20.04)20231018

已更新
  • AWS OFI NCCL 插件从版本 1.7.2 更新到版本 1.7.3

  • CUDA 12.0-12.1 目录中的 NCCL 版本更新为 2.18.5 以与 CUDA 12.2 环境保持一致

  • CUDA12.1 更新为默认 CUDA 版本

    • 将 LD_LIBRARY_PATH 更新为//cuda-12。usr/local1/targets/x86_64-linux/lib/://cuda-12。usr/local1/lib:/usr/local/cuda-12。1/lib64:/usr/local/cuda-12.1 和 PATH 为//cuda-12。usr/local1/bin/

    • 对于想要切换到任何不同 CUDA 版本的客户,请相应地定义 LD_LIBRARY_PATH 和 PATH 变量。

发布日期:2023-10-02

AMI 名称:Deep Learning Base GPU AMI(Ubuntu 20.04)20231002

已更新
  • NVIDIA Driver 版本从 535.54.03 更新为 535.104.12

    • 这个最新的驱动程序修复了在 535.54.03 版本中发现的 NVML ABI 中断性变更,以及在 535.86.10 版本中发现的影响 P5 实例上 CUDA Toolkit 的驱动程序回归问题。有关修复的详细信息,请参阅以下 NVIDIA 发布说明:

    • 有关修复的详细信息,请参阅以下 NVIDIA 发布说明:

      • 4235941 - NVML ABI 中断性变更修复

      • 4228552 - CUDA Toolkit 错误修复

  • 将 CUDA 12.2 目录下的 NCCL 版本更新为 2.18.5

  • EFA 版本从 1.24.1 更新为最新的 1.26.1

新增了
  • 添加 CUDA12.2 于/usr/local/cuda-12.2

已删除
  • 移除了对 CUDA 11.5 和 CUDA 11.6 的支持

发布日期:2023-09-26

AMI 名称:Deep Learning Base GPU AMI(Ubuntu 20.04)20230926

新增了
  • 增加了 net.naming-scheme 变更,以修复 P5 上出现的不可预测的网络接口命名问题(链接)。此更改是通过在文件 //grub 的 linux 启动参数中设置 net.naming-scheme=v247 来进行的 etc/default

发布日期:2023-08-30

AMI 名称:Deep Learning Base GPU AMI(Ubuntu 20.04)20230830

已更新
  • aws-ofi-nccl插件从 v1.7.1 更新到 v1.7.2

发布日期:2023-08-11

AMI 名称:Deep Learning Base GPU AMI(Ubuntu 20.04)20230811

新增了
  • 此 AMI 现在为 P5 和所有之前支持的 EC2 实例上的 Multi-node 训练功能提供支持。

  • 对于 P5 EC2 实例,建议使用 NCCL 2.18,并已添加到和中。 CUDA12.0 CUDA12.1

已删除
  • 移除了对 CUDA11.3 和的支持 CUDA11.4。

发布日期:2023-08-04

AMI 名称:Deep Learning Base GPU AMI(Ubuntu 20.04)20230804

已更新
  • 将 AWS OFI NCCL 插件更新到 v1.7.1

  • 设置 CUDA11.8 为默认值,因为 PyTorch 2.0 支持 11.8,对于 P5 EC2 实例,建议使用 >= CUDA11.8

    • 将 LD_LIBRARY_PATH 更新为//cuda-11。usr/local8/targets/x86_64-linux/lib/://cuda-11。usr/local8/lib:/usr/local/cuda-11。8/lib64:/usr/local/cuda-11.8 和 PATH 需要有//cuda-11。usr/local8/bin/

    • 对于任何不同的 cuda 版本,请相应地定义 LD_LIBRARY_PATH。

  • 将 CUDA 12.0、12.1 目录下的 NCCL 版本更新为 2.18.3

Fixed
  • 修复了之前发布日期 2023-07-19 中提到的 Nvidia Fabric Manager(FM)软件包加载问题。

发布日期:2023-07-19

AMI 名称:Deep Learning Base GPU AMI(Ubuntu 20.04)20230719

已更新
  • EFA 版本从 1.22.1 更新为 1.24.1

  • NVIDIA 驱动程序版本从 525.85.12 更新为 535.54.03

新增了
  • 通过将 max c-state 设置为 C1,增加了 c-state 变更以禁用处理器的空闲状态。此更改是通过在文件//grub 的 linux 启动参数中设置 `intel_idle.max_cstate=1 processor.max_cstate=1` 来进行的 etc/default

  • AWS EC2 P5 实例支持:

    • 为使用单一 node/instance的工作流程添加了 P5 EC2 实例支持。 Multi-node 在即将发布的版本中将增加使用EFA(弹性结构适配器)和 AWS OFI NCCL插件的支持(例如对多节点训练)的支持。

    • 请使用 CUDA>=11.8 以获得最佳性能。

    • 已知问题:Nvidia Fabric Manager(FM)软件包在 P5 上加载时间较长,客户在启动 P5 实例后需要等待 2-3 分钟才能加载 FM。要检查 FM 是否已启动,请运行命令 sudo systemctl is-active nvidia-fabricmanager,在开始任何工作流之前,该命令应该返回 active 状态。将在未来的版本中修复该问题。

发布日期:2023-05-19

AMI 名称:Deep Learning Base GPU AMI(Ubuntu 20.04)20230519

已更新
  • EFA 更新到最新版本 1.22.1

  • 将 CUDA 12.1 环境下的 NCCL 版本更新为 2.17.1

新增了
  • 添加 CUDA12.1 于/usr/local/cuda-12.1

  • 通过 datacenter-gpu-manager 包增加了对 NVIDIA Data Center GPU Monitor(DCGM)的支持

    • 您可以通过以下查询来查看此服务的状态:sudo systemctl status nvidia-dcgm

  • 临时 NVMe 实例存储现在会自动挂载到支持的 EC2 实例上,并且可以在文件夹//nvme/中访问存储。opt/dlami您可以通过下列方式来检查或修改此服务:

    • 检查 NVMe 服务的状态:sudo systemctl status dlami-nvme

    • 要访问或修改服务,请执行以下操作:/opt/aws/dlami/bin/nvme_ephemeral_drives.sh

  • NVMe 卷为需要 IOPS 性能的高吞吐量工作流程提供了最快、最高效的存储解决方案。临时性 NVMe 实例存储的费用已包含在实例的费用中,因此使用此服务不会产生任何额外成本。

  • NVMe 实例存储只会被挂载到支持它们的 EC2 实例上。有关哪些 EC2 实例支持 NVMe 实例存储,请参阅可用实例存储卷并验证是否支持 NVMe。

  • 为了提高磁盘性能并减少首次写入的损失,您可以初始化实例存储(注意,此过程可能需要几个小时,具体取决于 EC2 实例类型)- 在 EC2 实例上初始化实例存储卷

  • 注意:NVMe 实例存储挂载在实例上,不像 EBS 那样连接到网络。在您重启或停止实例时,这些 NVMe 卷上的数据可能会丢失。

发布日期:2023-04-17

AMI 名称:Deep Learning Base GPU AMI(Ubuntu 20.04)20230414

已更新
  • 将 DLAMI 名称从 AWS 深度学习基础 AMI GPU CUDA 11 (Ubuntu 20.04) $ {YYYY-MM-DD} 更新为深度学习基础 GPU AMI (Ubuntu 20.04) $ {} YYYY-MM-DD

    • 请注意,自本次发布起,我们将在一个月内继续使用旧的 AMI 名称来支持最新的 DLAMI,以应对任何所需的支持。客户可以更新其操作系统包 apt-get update && apt-get upgrade 以使用安全补丁。

  • 将 AWS OFI NCCL 插件路径从更新为 /usr/local/cuda-xx.x/efa/ /opt/aws-ofi-nccl/

  • 将 NCCL 更新为 v2.16.2 自定义 GIT 分支,该分支由所有 CUDA 版本 AWS 和 NCCL 团队共同创作。它在 AWS 基础设施上的表现更好。

新增了
  • 添加 CUDA12.0 于/usr/local/cuda-12.0

  • 增加了 AWS FSx

  • 在/usr/bin/python3.9 中添加了对 Python 3.9 版本的支持

    • 请注意,此更改并不能取代默认系统 Python,python3 仍将指向系统。 Python3.8

    • Python3.9 可以使用以下命令进行访问:

      /usr/bin/python3.9 python3.9
已删除
  • 已 CUDA11.0-11.1 从/usr/local/cuda-11.x/ 中移除,因为根据框架支持政策,任何支持的框架版本均未使用它们。DLAMI 支持策略

发布日期:2022-05-25

AMI 名称: AWS 深度学习基础 AMI GPU CUDA 11 (Ubuntu 20.04) 20220523

已更新
  • 此版本增加了对新 EC2 实例 p4de.24xlarge 的支持。

    • 已更新aws-efa-installer至 1.15.2 版

    • 已更新aws-ofi-nccl到包含 p4de 1.3.0-aws .24xlarge 拓扑结构的版本。

发布日期:2022-03-25

AMI 名称: AWS 深度学习基础 AMI GPU CUDA 11 (Ubuntu 20.04) 20220325

已更新
  • EFA 版本从 1.15.0 更新为 1.15.1

发布日期:2022-03-17

AMI 名称: AWS 深度学习基础 AMI GPU CUDA 11 (Ubuntu 20.04) 20220323

新增了
  • 初始版本