Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
AWS AMI GPU de base d'apprentissage profond (Ubuntu 20.04)
Avis de non-prise en charge
Ubuntu Linux 20.04 LTS arrivera à la fin de sa fenêtre LTS de cinq ans le 31 mai 2025 et ne sera plus pris en charge par son fournisseur. Par conséquent, l'AMI GPU AWS Deep Learning Base (Ubuntu 20.04) ne bénéficiera d'aucune mise à jour après le 31 mai 2025. Les versions précédentes continueront d'être disponibles. Veuillez noter que toute AMI publiée publiquement devient obsolète par EC2 deux ans après sa date de création. Consultez la section Déprécier une AMI Amazon EC2 pour plus d'informations.
Pendant 3 mois, jusqu'au 31 août 2025, le support ne sera fourni que pour les problèmes de fonctionnalité (pas pour les correctifs de sécurité).
Les utilisateurs d'Ubuntu 20.04 DLAMI doivent passer à l'AMI GPU AWS Deep Learning Base (Ubuntu 22.04)
ou à l'AMI GPU AWS Deep Learning Base (Ubuntu 24.04). Vous pouvez également utiliser l'AMI AWS Deep Learning Base (Amazon Linux 2023) .
Pour obtenir de l'aide pour démarrer, consultezCommencer à utiliser le DLAMI.
Format de nom AMI
Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) $ {} YYYY-MM-DD
Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) $ {} YYYY-MM-DD
Instances EC2 prises en charge
Veuillez vous reporter à la section Modifications importantes apportées à la DLAMI.
Le pilote Nvidia Deep Learning avec OSS est compatible avec G4dn, G5, G6, Gr6, G6e, P4d, P4de, P5, P5e, P5en
Deep Learning avec pilote propriétaire Nvidia compatible avec G3 (G3.16x non pris en charge), P3, P3dn
L'AMI inclut les éléments suivants :
AWS Service pris en charge : Amazon EC2
Système d'exploitation : Ubuntu 20.04
Architecture informatique : x86
La dernière version disponible est installée pour les packages suivants :
Noyau Linux 5.15
Lustre FSx
Docker
AWS CLI v2 at/usr/local/bin/aws2 et AWS CLI v1 at/usr/bin/aws
NVIDIA DCGM
Boîte à outils Nvidia Container :
Version de la commande : nvidia-container-cli -V
Nvidia-docker2:
Commande de version : version nvidia-docker
Pilote NVIDIA :
Pilote OSS Nvidia : 550.163.01
Pilote propriétaire Nvidia : 550.163.01
Pile NVIDIA CUDA 11.7, 12.1-12.4 :
Répertoires d'installation CUDA, NCCL et CudDN ://cuda-xx.x/ usr/local
Exemple :/usr/local/cuda-12.1/
Version NCCL compilée : 2.22.3+ CUDA12.4
CUDA par défaut : 12.1
PATH/usr/local/cuda pointe vers CUDA 12.1
Mise à jour des variables d'environnement ci-dessous :
LD_LIBRARY_PATH pour avoir//cuda-12. usr/local 1/lib:/usr/local/cuda-12. 1/lib64:/usr/local/cuda-12.1:/ usr/local /cuda-12. 1/targets/x86_64- linux/lib
PATH pour avoir/usr/local/cuda-12. 1/bin/:/usr/local/cuda-12. 1/include/
Pour toute version de CUDA différente, veuillez mettre à jour LD_LIBRARY_PATH en conséquence.
Lieu des tests NCCL :
all_reduce, all_gather et reduce_scatter ://cuda-xx. usr/local x/efa/test-cuda-xx.x/
Pour exécuter les tests NCCL, LD_LIBRARY_PATH doit réussir les mises à jour ci-dessous.
Les PATH courants sont déjà ajoutés à LD_LIBRARY_PATH :
/opt/amazon/efa/lib:/opt/amazon/openmpi/lib:/opt/aws-ofi-nccl/lib:/usr/local/lib:/usr/lib
Pour toute version de CUDA différente, veuillez mettre à jour LD_LIBRARY_PATH en conséquence.
Installateur EFA : 1.39.0
Nvidia GDRCopy : 2.4
AWS Plugin OFI NCCL : est installé dans le cadre du
EFA Installer-awsAWS OFI NCCL prend désormais en charge plusieurs versions de NCCL avec une seule version
Chemin d'installation :
/opt/aws-ofi-nccl/./opt/aws-ofi-nccl/libLe chemin est ajouté à LD_LIBRARY_PATH.Teste le chemin pour ring, message_transfer :
/opt/aws-ofi-nccl/tests
Type de volume EBS : GP3
Python :usr/bin//python3.9
Emplacement du magasin d'instances NVMe (sur les instances EC2 prises en charge) ://nvme opt/dlami
Requête AMI-ID avec le paramètre SSM (par exemple, la région est us-east-1) :
Pilote OSS Nvidia :
aws ssm get-parameter --regionus-east-1\ --name /aws/service/deeplearning/ami/x86_64/base-oss-nvidia-driver-gpu-ubuntu-20.04/latest/ami-id \ --query "Parameter.Value" \ --output textPilote Nvidia propriétaire :
aws ssm get-parameter --regionus-east-1\ --name /aws/service/deeplearning/ami/x86_64/base-proprietary-nvidia-driver-gpu-ubuntu-20.04/latest/ami-id \ --query "Parameter.Value" \ --output text
Requête AMI-ID avec AWSCLI (exemple : Region : us-east-1) :
Pilote OSS Nvidia :
aws ec2 describe-images --regionus-east-1\ --owners amazon \ --filters 'Name=name,Values=Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output textPilote Nvidia propriétaire :
aws ec2 describe-images --regionus-east-1\ --owners amazon \ --filters 'Name=name,Values=Deep Learning Base Proprietary Nvidia Driver GPU AMI (Ubuntu 20.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output text
Notifications
Kit d'outils NVIDIA Container 1.17.4
Dans la version 1.17.4 de Container Toolkit, le montage des bibliothèques compatibles CUDA est désormais désactivé. Afin de garantir la compatibilité avec plusieurs versions de CUDA sur les flux de travail de conteneurs, assurez-vous de mettre à jour votre LD_LIBRARY_PATH pour inclure vos bibliothèques de compatibilité CUDA, comme indiqué dans le didacticiel Si vous utilisez une couche de compatibilité CUDA.
Mises à jour EFA de 1.37 à 1.38 (sortie le 04/02/2025)
EFA intègre désormais le plugin AWS OFI NCCL, qui se trouve désormais dans l'original /opt/amazon/ofi-nccl plutôt que dans l'original. /opt/aws-ofi-nccl/ Si vous mettez à jour votre variable LD_LIBRARY_PATH, assurez-vous de modifier correctement l'emplacement de votre OFI NCCL.
Politique de support
Les composants de cette AMI, tels que les versions CUDA, peuvent être supprimés et modifiés en fonction de la politique de support du framework ou pour optimiser les performances des conteneurs de deep learning
Instances EC2 avec plusieurs cartes réseau
De nombreux types d’instances compatibles avec EFA possèdent également plusieurs cartes réseau.
DeviceIndex est propre à chaque carte réseau et doit être un entier non négatif inférieur à la limite d'ENI par. NetworkCard Sur P5, le nombre d'ENI par NetworkCard est de 2, ce qui signifie que les seules valeurs valides pour DeviceIndex sont 0 ou 1.
Pour l'interface réseau principale (indice de carte réseau 0, indice de périphérique 0), créez une interface EFA (EFA avec ENA). Vous ne pouvez pas utiliser une interface EFA-only réseau comme interface réseau principale.
Pour chaque interface réseau supplémentaire, utilisez l'index de carte réseau non utilisé suivant, l'indice de périphérique 1, et une interface EFA (EFA avec ENA) ou EFA-only réseau, selon votre cas d'utilisation, comme les exigences en matière de bande passante de l'ENA ou l'espace d'adressage IP. Pour des exemples de cas d'utilisation, consultez la section Configuration EFA pour une instance P5.
Pour plus d'informations, consultez le guide EFA ici.
P5/P5e instances
Les instances P5 et P5e contiennent 32 cartes d'interface réseau et peuvent être lancées à l'aide de la commande suivante : AWS CLI
aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=31,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
Instances P5en
Le P5en contient 16 cartes d'interface réseau et peut être lancé à l'aide de la commande suivante : AWS CLI
aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=15,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
Noyau
La version du noyau est épinglée à l'aide de la commande :
echo linux-aws hold | sudo dpkg —set-selections echo linux-headers-aws hold | sudo dpkg —set-selections echo linux-image-aws hold | sudo dpkg —set-selectionsNous recommandons aux utilisateurs d'éviter de mettre à jour la version de leur noyau (sauf en raison d'un correctif de sécurité) afin de garantir la compatibilité avec les pilotes installés et les versions des packages. Si les utilisateurs souhaitent toujours effectuer la mise à jour, ils peuvent exécuter les commandes suivantes pour extraire la version de leur noyau :
echo linux-aws install | sudo dpkg -set-selections echo linux-headers-aws install | sudo dpkg -set-selections echo linux-image-aws install | sudo dpkg -set-selectionsPour chaque nouvelle version de DLAMI, le dernier noyau compatible disponible est utilisé.
Date de sortie : 24/04/2025
Noms AMI
Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20250424
Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20250424
Mis à jour
Mise à niveau du pilote Nvidia de la version 550.144.03 à la version 550.163.01 pour traiter les CVE présents dans le bulletin de sécurité des pilotes d'affichage des GPU NVIDIA d'avril 2025 https://nvidia.custhelp.com/app/answers/detail/a_id/5630
Date de sortie : 17/02/2025
Noms AMI
Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20250214
Pilote Nvidia propriétaire GPU AMI (Ubuntu 20.04) 20250214 de Deep Learning Base
Mis à jour
Mise à jour de NVIDIA Container Toolkit de la version 1.17.3 à la version 1.17.4
Consultez la page des notes de publication ici pour plus d'informations : https://github.com/NVIDIA/nvidia-container-toolkit/releases/tag/v1.17.4
Dans la version 1.17.4 de Container Toolkit, le montage des bibliothèques compatibles CUDA est désormais désactivé. Afin de garantir la compatibilité avec plusieurs versions de CUDA sur les flux de travail de conteneurs, assurez-vous de mettre à jour votre LD_LIBRARY_PATH pour inclure vos bibliothèques de compatibilité CUDA, comme indiqué dans le didacticiel Si vous utilisez une couche de compatibilité CUDA.
Supprimé
Suppression des bibliothèques d'espace utilisateur cuobj et nvdisasm fournies par la boîte à outils NVIDIA CUDA
pour traiter les CVE présentes dans le bulletin de sécurité du kit NVIDIA CUDA du 18 février 2025
Date de sortie : 2025-02-04
Noms AMI
Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20250204
Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20250204
Mis à jour
Version EFA améliorée de 1.37.0 à 1.38.0
EFA intègre désormais le plugin AWS OFI NCCL, qui se trouve désormais dans l'original
/opt/amazon/ofi-ncclplutôt que dans l'original./opt/aws-ofi-nccl/Si vous mettez à jour votre variable LD_LIBRARY_PATH, assurez-vous de modifier correctement l'emplacement de votre OFI NCCL.
Supprimé
Le paquet emacs a été supprimé de ces DLAMis. Les clients peuvent installer Emacs à partir de GNU Emacs. https://www.gnu.org/software/emacs/download.html
Date de sortie : 17/01/2025
Noms AMI
Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20250117
Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20250117
Mis à jour
Mise à niveau du pilote Nvidia de la version 550.127.05 à la version 550.144.03 pour traiter les CVE présents dans le bulletin de sécurité des pilotes d'affichage des GPU NVIDIA de janvier 2025 https://nvidia.custhelp.com/app/answers/detail/a_id/5614
Date de sortie : 2024-12-09
Noms AMI
Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20241206
Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20241206
Mis à jour
Mise à niveau de la boîte à outils Nvidia Container de la version 1.17.0 à la version 1.17.3
Date de sortie : 2024-11-22
Nom de l'AMI : Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20241122
Ajouté
Ajout du support pour les instances EC2 P5en.
Mis à jour
Mise à niveau du programme d'installation EFA de la version 1.35.0 à la version 1.37.0
Mise à niveau du plug-in AWS OFI NCCL de la version 1.12.1-aws vers la version 1.13.0-aws
Date de sortie : 2024-10-26
Noms AMI
Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20241025
Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20241025
Mis à jour
Mise à niveau du pilote Nvidia de la version 550.90.07 à la version 550.127.05 pour traiter les CVE présents dans le bulletin de sécurité de l'affichage des GPU NVIDIA d'octobre 2024
Date de sortie : 2024-10-03
Nom de l'AMI : Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240927
Mis à jour
Mise à niveau du Nvidia Container Toolkit de la version 1.16.1 à la version 1.16.2
Date de sortie : 2024-08-27
Nom de l'AMI : Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240827
Mis à jour
Pilote Nvidia et Fabric Manager mis à niveau de la version 535.183.01 à 550.90.07
Version EFA améliorée de 1.32.0 à 1.34.0
Mise à niveau de NCCL vers la dernière version 2.22.3 pour toutes les versions de CUDA
CUDA 11.7 mis à niveau depuis la version 2.16.2+ CUDA11.7
CUDA 12.1, 12.2 mis à niveau depuis 2.18.5+ CUDA12.2
CUDA 12.3 mis à niveau depuis la version 2.21.5+ CUDA12.4
Ajouté
Ajout de la version 12.4 de la boîte à outils CUDA dans le répertoire//cuda-12.4 usr/local
Ajout du support pour l'instance P5e EC2.
Supprimé
Suppression de la pile CUDA Toolkit version 11.8 présente dans le répertoire//cuda-11.8 usr/local
Date de sortie : 2024-08-19
Nom de l'AMI : Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240816
Ajouté
Ajout du support pour l'instance G6e EC2.
Date de sortie : 2024-06-06
Noms AMI
Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20240606
Pilote Nvidia propriétaire GPU AMI (Ubuntu 20.04) 20240606
Mis à jour
Mise à jour de la version du pilote Nvidia à 535.183.01 au lieu de 535.161.08
Date de sortie : 15/05/2024
Noms AMI
Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20240515
Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20240515
Ajouté
Ajout d'une CUDA11.7 pile arrière dans le répertoire/usr/local/cuda-11.7 avec CUDA11.7, NCCL 2.16.2, cuDNN 8.7.0 comme supports 1.13 PyTorch CUDA11.7
Date de sortie : 2024-05-02
Noms AMI
Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20240502
Pilote Nvidia propriétaire GPU AMI (Ubuntu 20.04) 20240502 de Deep Learning Base
Mis à jour
Version EFA mise à jour de la version 1.30 à la version 1.32
Plugin AWS OFI NCCL mis à jour de la version 1.7.4 à la version 1.9.1
Mise à jour de la boîte à outils de conteneurs Nvidia de la version 1.13.5 à la version 1.15.0 https://github.com/NVIDIA/nvidia-container-toolkit/releases/tag/v1.15.0
La version 1.15.0 n'inclut PAS les packages nvidia-container-runtime et nvidia-docker2. Il est recommandé d'utiliser les packages nvidia-container-toolkit directement en suivant la documentation du Nvidia Container Toolkit. https://docs.nvidia.com/datacenter/cloud-native/container-toolkit/latest/sample-workload.html
Ajouté
Ajout d'une CUDA12.3 pile avec CUDA12.3, NCCL 2.21.5, cuDNN 8.9.7
Supprimé
Supprimé CUDA11.7, les CUDA12.0 piles sont présentes dans les répertoires//cuda-11.7 et/usr/local/cuda-12.0 usr/local
Suppression du package nvidia-docker2 et de sa commande nvidia-docker dans le cadre de la mise à jour de la boîte à outils Nvidia Container de 1.13.5 à 1.15.0, qui n'inclut PAS les packages nvidia-container-runtime et nvidia-docker2. https://github.com/NVIDIA/nvidia-container-toolkit/releases/tag/v1.15.0
Date de sortie : 2024-04-04
Nom des AMI : Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240404
Ajouté
Pour le pilote OSS Nvidia DLAMis, ajout de la prise en charge des instances G6 et Gr6 EC2. Reportez-vous à la section Instances GPU recommandées pour plus d'informations.
Date de sortie : 2024-03-29
Noms AMI
Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20240326
Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20240326
Mis à jour
Mise à jour du pilote Nvidia de 535.104.12 à 535.161.08 dans le pilote Nvidia propriétaire et OSS DLAMis.
Suppression du support des instances G4dn et G5 EC2 du pilote propriétaire Nvidia DLAMI.
Les nouvelles instances prises en charge pour chaque DLAMI sont les suivantes :
Deep Learning avec pilote propriétaire Nvidia compatible avec G3 (G3.16x non pris en charge), P3, P3dn
Le Deep Learning avec OSS Nvidia Driver est compatible avec G4dn, G5, P4d, P4de, P5.
Date de sortie : 2024-03-20
Noms AMI
Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20240318
Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20240318
Ajouté
Ajouté
awscliv2dans l'AMI à/usr/local/bin/aws2, à côtéawscliv1de/usr/bin/aws sur l'AMI propriétaire et OSS Nvidia Driver
Date de sortie : 2024-03-14
Nom de l'AMI : Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240314
Mis à jour
Mise à jour du pilote OSS Nvidia DLAMI avec support G4dn et G5, sur la base de celui-ci, le support actuel ressemble à ce qui suit :
L'AMI du pilote Nvidia propriétaire de Deep Learning Base (Ubuntu 20.04) est compatible avec P3, P3dn, G3, G5, G4dn.
L'AMI du pilote Nvidia Deep Learning Base OSS (Ubuntu 20.04) est compatible avec G5, G4dn, P4, P5.
Il est recommandé d'utiliser le pilote OSS Nvidia DLAMI pour G5, G4dn, P4, P5.
Date de sortie : 2024-02-12
Noms AMI
Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20240208
Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20240208
Mis à jour
AWS Le plugin OFI NCCL est mis à jour de 1.7.3 à 1.7.4
Date de sortie : 2024-02-01
Noms AMI
Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20240201
Pilote Nvidia propriétaire GPU AMI (Ubuntu 20.04) 20240201 de Deep Learning Base
Sécurité
Version du package runc mise à jour pour utiliser le correctif. CVE-2024-21626
Date de sortie : 04/12/2023
Noms AMI
Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20231204
Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20231204
Ajouté
AWS L'AMI Deep Learning (DLAMI) est divisée en deux groupes distincts :
DLAMI utilisant le pilote propriétaire Nvidia (pour prendre en charge P3, P3dn, G3, G5, G4dn).
DLAMI qui utilise le pilote Nvidia OSS pour activer EFA (pour prendre en charge P4, P5).
Veuillez consulter la section Modifications importantes apportées à la DLAMI pour plus d'informations sur la division DLAMI.
AWS CLI les requêtes ci-dessus sont sous forme de requête à puce AMI-ID avec AWSCLI (par exemple, Region is us-east-1)
Mis à jour
EFA mis à jour de la version 1.26.1 à la version 1.29.0
GDRCopy a été mis à jour de la version 2.3 à la version 2.4
Date de sortie : 18-010-2023
Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20231018
Mis à jour
AWS Plugin OFI NCCL mis à jour de la version 1.7.2 à la version 1.7.3
Mise à jour des répertoires CUDA 12.0-12.1 avec la version NCCL 2.18.5 pour correspondre à CUDA 12.2
CUDA12.1 mise à jour en tant que version CUDA par défaut
LD_LIBRARY_PATH a été mis à jour pour avoir//cuda-12. usr/local 1/targetslinux/lib/x86_64-/://cuda-12. usr/local 1/lib:/usr/local/cuda-12. 1/lib64:/usr/local/cuda-12.1 et PATH pour avoir//cuda-12. usr/local 1/bin/
Pour les clients qui souhaitent passer à une version de CUDA différente, veuillez définir les variables LD_LIBRARY_PATH et PATH en conséquence.
Date de sortie : 2023-10-02
Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20231002
Mis à jour
Pilote NVIDIA mis à jour de 535.54.03 à 535.104.12
Ce dernier pilote corrige les modifications de rupture de l'ABI NVML trouvées dans la version 535.54.03 du pilote, ainsi que la régression de pilote trouvée dans la version 535.86.10 qui affectait les boîtes à outils CUDA sur les instances P5. Consultez les notes de mise à jour NVIDIA suivantes pour plus de détails sur les correctifs :
Consultez les notes de mise à jour NVIDIA suivantes pour plus de détails sur les correctifs :
Répertoires CUDA 12.2 mis à jour avec NCCL 2.18.5
EFA a été mis à jour de la version 1.24.1 à la dernière version 1.26.1
Ajouté
Ajouté CUDA12.2 à/usr/local/cuda-12.2
Supprimé
Suppression du support pour CUDA 11.5 et CUDA 11.6
Date de sortie : 2023-09-26
Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20230926
Ajouté
Ajout de modifications au schéma net.naming-scheme pour corriger un problème imprévisible de dénomination de l'interface réseau (lien
) observé sur P5. Cette modification est effectuée en définissant net.naming-scheme=v247 dans les arguments de démarrage de Linux dans le fichier//grub etc/default
Date de sortie : 2023-08-30
Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20230830
Mis à jour
aws-ofi-ncclPlugin mis à jour de la v1.7.1 à la v1.7.2
Date de sortie : 2023-08-11
Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20230811
Ajouté
Cette AMI prend désormais en charge les fonctionnalités de Multi-node formation sur P5 et sur toutes les instances EC2 précédemment prises en charge.
Pour l'instance P5 EC2, il est recommandé d'utiliser NCCL 2.18 et a été ajouté à, et. CUDA12.0 CUDA12.1
Supprimé
Suppression du support pour CUDA11.3 et CUDA11.4.
Date de sortie : 2023-08-04
Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20230804
Mis à jour
Mise à jour du plugin AWS OFI NCCL vers la version 1.7.1
CUDA11.8 Par défaut, la PyTorch version 2.0 prend en charge la version 11.8 et pour l'instance P5 EC2, il est recommandé d'utiliser >= CUDA11.8
LD_LIBRARY_PATH a été mis à jour pour avoir//cuda-11. usr/local 8/targetslinux/lib/x86_64-/://cuda-11. usr/local 8/lib:/usr/local/cuda-11. 8/lib64:/usr/local/cuda-11.8 et PATH pour avoir//cuda-11. usr/local 8/bin/
Pour toute version de cuda différente, veuillez définir LD_LIBRARY_PATH en conséquence.
Mise à jour des répertoires CUDA 12.0, 12.1 avec NCCL 2.18.3
Fixe
Correction du problème de chargement du package Nvidia Fabric Manager (FM) mentionné dans la date de sortie précédente 2023-07-19.
Date de sortie : 2023-07-19
Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20230719
Mis à jour
EFA mis à jour de 1.22.1 à 1.24.1
Pilote Nvidia mis à jour de 525.85.12 à 535.54.03
Ajouté
Ajout de modifications de l'état C pour désactiver l'état inactif du processeur en réglant l'état C maximum sur C1. Cette modification est effectuée en définissant intel_idle.max_cstate=1 processor.max_cstate=1 dans les arguments de démarrage de Linux dans le fichier//grub etc/default
AWS Prise en charge des instances EC2 P5 :
Ajout de la prise en charge des instances P5 EC2 pour les flux de travail utilisant une seule instance. node/instance Multi-node le support (par exemple pour la formation multi-nœuds) utilisant EFA (Elastic Fabric Adapter) et le plugin AWS OFI NCCL sera ajouté dans une prochaine version.
Veuillez utiliser CUDA>=11.8 pour des performances optimales.
Problème connu : le chargement du package Nvidia Fabric Manager (FM) sur P5 prend du temps. Les clients doivent attendre 2 à 3 minutes pour que FM se charge après le lancement de l'instance P5. Pour vérifier si FM est démarré, veuillez exécuter la commande sudo systemctl is-active nvidia-fabricmanager, elle devrait revenir active avant de démarrer tout flux de travail. Cela sera amélioré dans la prochaine version.
Date de sortie : 2023-05-19
Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20230519
Mis à jour
EFA mise à jour vers la dernière version 1.22.1
Version NCCL mise à jour pour CUDA 12.1 à 2.17.1
Ajouté
Ajouté CUDA12.1 à/usr/local/cuda-12.1
Ajout du support pour NVIDIA Data Center GPU Monitor (DCGM)
via le package datacenter-gpu-manager Vous pouvez vérifier l'état de ce service via la requête suivante : sudo systemctl status nvidia-dcgm
Les magasins d'instances NVMe éphémères sont désormais automatiquement montés sur les instances EC2 prises en charge et le stockage est accessible dans le dossier//nvme/. opt/dlami Vous pouvez vérifier ou modifier ce service de la manière suivante :
Vérifiez l'état du service NVMe : sudo systemctl status dlami-nvme
Pour accéder au service ou le modifier :
/opt/aws/dlami/bin/nvme_ephemeral_drives.sh
Les volumes NVMe ont fourni les solutions de stockage les plus rapides et les plus efficaces pour les flux de travail à haut débit nécessitant des performances IOPS. Les magasins d'instances NVMe éphémères sont inclus dans le coût des instances, ce service n'entraîne donc aucun coût supplémentaire.
Les magasins d'instances NVMe ne seront montés que sur les instances EC2 qui les prennent en charge. Pour plus d'informations sur les instances EC2 dotées de magasins d'instances pris en charge par NVMe, consultez la section Volumes de stockage d'instance disponibles et vérifiez que NVMe est pris en charge.
Pour améliorer les performances du disque et réduire les pénalités liées à la première écriture, vous pouvez initialiser les magasins d'instances (notez que ce processus peut prendre des heures selon le type d'instance EC2) - Initialisez les volumes de stockage d'instance sur les instances EC2
REMARQUE : les magasins d'instance NVMe sont montés sur l'instance et ne sont pas connectés au réseau comme EBS. Les données de ces volumes NVMe peuvent être perdues lors du redémarrage ou de l'arrêt de votre instance.
Date de sortie : 2023-04-17
Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20230414
Mis à jour
Nom DLAMI mis à jour de AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) $ {YYYY-MM-DD} à Deep Learning Base GPU AMI (Ubuntu 20.04) $ {} YYYY-MM-DD
Veuillez noter que nous prendrons en charge le dernier DLAMI avec l'ancien nom d'AMI pendant un mois à compter de cette version pour toute assistance nécessaire. Les clients peuvent mettre à jour leurs packages de système d'exploitation apt-get update && apt-get upgrade pour utiliser des correctifs de sécurité.
Chemin du plug-in AWS OFI NCCL mis à jour de à
/usr/local/cuda-xx.x/efa//opt/aws-ofi-nccl/Mise à jour de NCCL vers une branche GIT personnalisée
de la version 2.16.2, co-écrite par AWS l'équipe NCCL pour toutes les versions de CUDA. Il fonctionne mieux sur AWS l'infrastructure.
Ajouté
Ajouté CUDA12.0 à/usr/local/cuda-12.0
Ajout de AWS FSx
Ajout du support pour la version 3.9 de Python dans/usr/bin/python3.9
Notez que cette modification ne remplace pas le système par défaut Python, python3 pointera toujours le système. Python3.8
Python3.9 est accessible à l'aide des commandes suivantes :
/usr/bin/python3.9 python3.9
Supprimé
Supprimés CUDA11.0-11.1 de/usr/local/cuda-11.x/ car ils ne sont utilisés par aucune version de framework prise en charge sur la base de la politique de support du framework. Politique de support DLAMI
Date de sortie : 25/05/22
Nom de l'AMI : AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) 20220523
Mis à jour
Cette version ajoute la prise en charge de la nouvelle instance EC2 p4de.24xlarge.
Mise à jour
aws-efa-installervers version 1.15.2Mise à jour
aws-ofi-ncclvers une version1.3.0-awsqui inclut la topologie de p4de.24xlarge.
Date de sortie : 25/03/22
Nom de l'AMI : AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) 20220325
Mis à jour
Version EFA mise à jour de 1.15.0 à 1.15.1
Date de sortie : 15/03/17
Nom de l'AMI : AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) 20220323
Ajouté
Première publication