View a markdown version of this page

AWS AMI GPU de base d'apprentissage profond (Ubuntu 20.04) - AWS Apprentissage profond (deep learning) AMIs

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

AWS AMI GPU de base d'apprentissage profond (Ubuntu 20.04)

Avis de non-prise en charge

  • Ubuntu Linux 20.04 LTS arrivera à la fin de sa fenêtre LTS de cinq ans le 31 mai 2025 et ne sera plus pris en charge par son fournisseur. Par conséquent, l'AMI GPU AWS Deep Learning Base (Ubuntu 20.04) ne bénéficiera d'aucune mise à jour après le 31 mai 2025. Les versions précédentes continueront d'être disponibles. Veuillez noter que toute AMI publiée publiquement devient obsolète par EC2 deux ans après sa date de création. Consultez la section Déprécier une AMI Amazon EC2 pour plus d'informations.

  • Pendant 3 mois, jusqu'au 31 août 2025, le support ne sera fourni que pour les problèmes de fonctionnalité (pas pour les correctifs de sécurité).

  • Les utilisateurs d'Ubuntu 20.04 DLAMI doivent passer à l'AMI GPU AWS Deep Learning Base (Ubuntu 22.04) ou à l'AMI GPU AWS Deep Learning Base (Ubuntu 24.04). Vous pouvez également utiliser l'AMI AWS Deep Learning Base (Amazon Linux 2023).

Pour obtenir de l'aide pour démarrer, consultezCommencer à utiliser le DLAMI.

Format de nom AMI

  • Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) $ {} YYYY-MM-DD

  • Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) $ {} YYYY-MM-DD

Instances EC2 prises en charge

  • Veuillez vous reporter à la section Modifications importantes apportées à la DLAMI.

  • Le pilote Nvidia Deep Learning avec OSS est compatible avec G4dn, G5, G6, Gr6, G6e, P4d, P4de, P5, P5e, P5en

  • Deep Learning avec pilote propriétaire Nvidia compatible avec G3 (G3.16x non pris en charge), P3, P3dn

L'AMI inclut les éléments suivants :

  • AWS Service pris en charge  : Amazon EC2

  • Système d'exploitation  : Ubuntu 20.04

  • Architecture informatique  : x86

  • La dernière version disponible est installée pour les packages suivants :

    • Noyau Linux 5.15

    • Lustre FSx

    • Docker

    • AWS CLI v2 at/usr/local/bin/aws2 et AWS CLI v1 at/usr/bin/aws

    • NVIDIA DCGM

    • Boîte à outils Nvidia Container  :

      • Version de la commande : nvidia-container-cli -V

    • Nvidia-docker2:

      • Commande de version : version nvidia-docker

  • Pilote NVIDIA  :

    • Pilote OSS Nvidia : 550.163.01

    • Pilote propriétaire Nvidia : 550.163.01

  • Pile NVIDIA CUDA 11.7, 12.1-12.4 :

    • Répertoires d'installation CUDA, NCCL et CudDN ://cuda-xx.x/ usr/local

      • Exemple :/usr/local/cuda-12.1/

    • Version NCCL compilée : 2.22.3+ CUDA12.4

    • CUDA par défaut : 12.1

      • PATH/usr/local/cuda pointe vers CUDA 12.1

      • Mise à jour des variables d'environnement ci-dessous :

        • LD_LIBRARY_PATH pour avoir//cuda-12. usr/local 1/lib:/usr/local/cuda-12. 1/lib64:/usr/local/cuda-12.1:/ usr/local /cuda-12. 1/targets/x86_64- linux/lib

        • PATH pour avoir/usr/local/cuda-12. 1/bin/:/usr/local/cuda-12. 1/include/

        • Pour toute version de CUDA différente, veuillez mettre à jour LD_LIBRARY_PATH en conséquence.

    • Lieu des tests NCCL :

      • all_reduce, all_gather et reduce_scatter ://cuda-xx. usr/local x/efa/test-cuda-xx.x/

      • Pour exécuter les tests NCCL, LD_LIBRARY_PATH doit réussir les mises à jour ci-dessous.

        • Les PATH courants sont déjà ajoutés à LD_LIBRARY_PATH :

          • /opt/amazon/efa/lib:/opt/amazon/openmpi/lib:/opt/aws-ofi-nccl/lib:/usr/local/lib:/usr/lib

        • Pour toute version de CUDA différente, veuillez mettre à jour LD_LIBRARY_PATH en conséquence.

  • Installateur EFA  : 1.39.0

  • Nvidia GDRCopy : 2.4

  • AWS Plugin OFI NCCL  : est installé dans le cadre du EFA Installer-aws

    • AWS OFI NCCL prend désormais en charge plusieurs versions de NCCL avec une seule version

    • Chemin d'installation : /opt/aws-ofi-nccl/. /opt/aws-ofi-nccl/libLe chemin est ajouté à LD_LIBRARY_PATH.

    • Teste le chemin pour ring, message_transfer : /opt/aws-ofi-nccl/tests

  • Type de volume EBS  : GP3

  • Python  :usr/bin//python3.9

  • Emplacement du magasin d'instances NVMe (sur les instances EC2 prises en charge) ://nvme opt/dlami

  • Requête AMI-ID avec le paramètre SSM (par exemple, la région est us-east-1) :

    • Pilote OSS Nvidia :

      aws ssm get-parameter --region us-east-1 \ --name /aws/service/deeplearning/ami/x86_64/base-oss-nvidia-driver-gpu-ubuntu-20.04/latest/ami-id \ --query "Parameter.Value" \ --output text
    • Pilote Nvidia propriétaire :

      aws ssm get-parameter --region us-east-1 \ --name /aws/service/deeplearning/ami/x86_64/base-proprietary-nvidia-driver-gpu-ubuntu-20.04/latest/ami-id \ --query "Parameter.Value" \ --output text
  • Requête AMI-ID avec AWSCLI (exemple : Region : us-east-1) :

    • Pilote OSS Nvidia :

      aws ec2 describe-images --region us-east-1 \ --owners amazon \ --filters 'Name=name,Values=Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output text
    • Pilote Nvidia propriétaire :

      aws ec2 describe-images --region us-east-1 \ --owners amazon \ --filters 'Name=name,Values=Deep Learning Base Proprietary Nvidia Driver GPU AMI (Ubuntu 20.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output text

Notifications

Kit d'outils NVIDIA Container 1.17.4

Dans la version 1.17.4 de Container Toolkit, le montage des bibliothèques compatibles CUDA est désormais désactivé. Afin de garantir la compatibilité avec plusieurs versions de CUDA sur les flux de travail de conteneurs, assurez-vous de mettre à jour votre LD_LIBRARY_PATH pour inclure vos bibliothèques de compatibilité CUDA, comme indiqué dans le didacticiel Si vous utilisez une couche de compatibilité CUDA.

Mises à jour EFA de 1.37 à 1.38 (sortie le 04/02/2025)

EFA intègre désormais le plugin AWS OFI NCCL, qui se trouve désormais dans l'original /opt/amazon/ofi-nccl plutôt que dans l'original. /opt/aws-ofi-nccl/ Si vous mettez à jour votre variable LD_LIBRARY_PATH, assurez-vous de modifier correctement l'emplacement de votre OFI NCCL.

Politique de support

Les composants de cette AMI, tels que les versions CUDA, peuvent être supprimés et modifiés en fonction de la politique de support du framework ou pour optimiser les performances des conteneurs de deep learning ou pour réduire la taille de l'AMI dans une future version, sans préavis. Nous supprimons les versions CUDA des AMI si elles ne sont utilisées par aucune version de framework prise en charge.

Instances EC2 avec plusieurs cartes réseau
  • De nombreux types d’instances compatibles avec EFA possèdent également plusieurs cartes réseau.

  • DeviceIndex est propre à chaque carte réseau et doit être un entier non négatif inférieur à la limite d'ENI par. NetworkCard Sur P5, le nombre d'ENI par NetworkCard est de 2, ce qui signifie que les seules valeurs valides pour DeviceIndex sont 0 ou 1.

    • Pour l'interface réseau principale (indice de carte réseau 0, indice de périphérique 0), créez une interface EFA (EFA avec ENA). Vous ne pouvez pas utiliser une interface EFA-only réseau comme interface réseau principale.

    • Pour chaque interface réseau supplémentaire, utilisez l'index de carte réseau non utilisé suivant, l'indice de périphérique 1, et une interface EFA (EFA avec ENA) ou EFA-only réseau, selon votre cas d'utilisation, comme les exigences en matière de bande passante de l'ENA ou l'espace d'adressage IP. Pour des exemples de cas d'utilisation, consultez la section Configuration EFA pour une instance P5.

    • Pour plus d'informations, consultez le guide EFA ici.

P5/P5e instances
  • Les instances P5 et P5e contiennent 32 cartes d'interface réseau et peuvent être lancées à l'aide de la commande suivante : AWS CLI

aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=31,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
Instances P5en
  • Le P5en contient 16 cartes d'interface réseau et peut être lancé à l'aide de la commande suivante : AWS CLI

aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=15,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
Noyau
  • La version du noyau est épinglée à l'aide de la commande :

    echo linux-aws hold | sudo dpkg —set-selections echo linux-headers-aws hold | sudo dpkg —set-selections echo linux-image-aws hold | sudo dpkg —set-selections
  • Nous recommandons aux utilisateurs d'éviter de mettre à jour la version de leur noyau (sauf en raison d'un correctif de sécurité) afin de garantir la compatibilité avec les pilotes installés et les versions des packages. Si les utilisateurs souhaitent toujours effectuer la mise à jour, ils peuvent exécuter les commandes suivantes pour extraire la version de leur noyau :

    echo linux-aws install | sudo dpkg -set-selections echo linux-headers-aws install | sudo dpkg -set-selections echo linux-image-aws install | sudo dpkg -set-selections
  • Pour chaque nouvelle version de DLAMI, le dernier noyau compatible disponible est utilisé.

Date de sortie : 24/04/2025

Noms AMI
  • Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20250424

  • Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20250424

Mis à jour

Date de sortie : 17/02/2025

Noms AMI
  • Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20250214

  • Pilote Nvidia propriétaire GPU AMI (Ubuntu 20.04) 20250214 de Deep Learning Base

Mis à jour
  • Mise à jour de NVIDIA Container Toolkit de la version 1.17.3 à la version 1.17.4

Supprimé

Date de sortie : 2025-02-04

Noms AMI
  • Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20250204

  • Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20250204

Mis à jour
  • Version EFA améliorée de 1.37.0 à 1.38.0

    • EFA intègre désormais le plugin AWS OFI NCCL, qui se trouve désormais dans l'original /opt/amazon/ofi-nccl plutôt que dans l'original. /opt/aws-ofi-nccl/ Si vous mettez à jour votre variable LD_LIBRARY_PATH, assurez-vous de modifier correctement l'emplacement de votre OFI NCCL.

Supprimé

Date de sortie : 17/01/2025

Noms AMI
  • Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20250117

  • Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20250117

Mis à jour

Date de sortie : 2024-12-09

Noms AMI
  • Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20241206

  • Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20241206

Mis à jour
  • Mise à niveau de la boîte à outils Nvidia Container de la version 1.17.0 à la version 1.17.3

Date de sortie : 2024-11-22

Nom de l'AMI : Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20241122

Ajouté
  • Ajout du support pour les instances EC2 P5en.

Mis à jour
  • Mise à niveau du programme d'installation EFA de la version 1.35.0 à la version 1.37.0

  • Mise à niveau du plug-in AWS OFI NCCL de la version 1.12.1-aws vers la version 1.13.0-aws

Date de sortie : 2024-10-26

Noms AMI
  • Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20241025

  • Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20241025

Mis à jour

Date de sortie : 2024-10-03

Nom de l'AMI : Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240927

Mis à jour
  • Mise à niveau du Nvidia Container Toolkit de la version 1.16.1 à la version 1.16.2

Date de sortie : 2024-08-27

Nom de l'AMI : Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240827

Mis à jour
  • Pilote Nvidia et Fabric Manager mis à niveau de la version 535.183.01 à 550.90.07

  • Version EFA améliorée de 1.32.0 à 1.34.0

  • Mise à niveau de NCCL vers la dernière version 2.22.3 pour toutes les versions de CUDA

    • CUDA 11.7 mis à niveau depuis la version 2.16.2+ CUDA11.7

    • CUDA 12.1, 12.2 mis à niveau depuis 2.18.5+ CUDA12.2

    • CUDA 12.3 mis à niveau depuis la version 2.21.5+ CUDA12.4

Ajouté
  • Ajout de la version 12.4 de la boîte à outils CUDA dans le répertoire//cuda-12.4 usr/local

  • Ajout du support pour l'instance P5e EC2.

Supprimé
  • Suppression de la pile CUDA Toolkit version 11.8 présente dans le répertoire//cuda-11.8 usr/local

Date de sortie : 2024-08-19

Nom de l'AMI : Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240816

Ajouté

Date de sortie : 2024-06-06

Noms AMI
  • Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20240606

  • Pilote Nvidia propriétaire GPU AMI (Ubuntu 20.04) 20240606

Mis à jour
  • Mise à jour de la version du pilote Nvidia à 535.183.01 au lieu de 535.161.08

Date de sortie : 15/05/2024

Noms AMI
  • Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20240515

  • Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20240515

Ajouté
  • Ajout d'une CUDA11.7 pile arrière dans le répertoire/usr/local/cuda-11.7 avec CUDA11.7, NCCL 2.16.2, cuDNN 8.7.0 comme supports 1.13 PyTorch CUDA11.7

Date de sortie : 2024-05-02

Noms AMI
  • Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20240502

  • Pilote Nvidia propriétaire GPU AMI (Ubuntu 20.04) 20240502 de Deep Learning Base

Mis à jour
Ajouté
  • Ajout d'une CUDA12.3 pile avec CUDA12.3, NCCL 2.21.5, cuDNN 8.9.7

Supprimé
  • Supprimé CUDA11.7, les CUDA12.0 piles sont présentes dans les répertoires//cuda-11.7 et/usr/local/cuda-12.0 usr/local

  • Suppression du package nvidia-docker2 et de sa commande nvidia-docker dans le cadre de la mise à jour de la boîte à outils Nvidia Container de 1.13.5 à 1.15.0, qui n'inclut PAS les packages nvidia-container-runtime et nvidia-docker2. https://github.com/NVIDIA/nvidia-container-toolkit/releases/tag/v1.15.0

Date de sortie : 2024-04-04

Nom des AMI : Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240404

Ajouté
  • Pour le pilote OSS Nvidia DLAMis, ajout de la prise en charge des instances G6 et Gr6 EC2. Reportez-vous à la section Instances GPU recommandées pour plus d'informations.

Date de sortie : 2024-03-29

Noms AMI
  • Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20240326

  • Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20240326

Mis à jour
  • Mise à jour du pilote Nvidia de 535.104.12 à 535.161.08 dans le pilote Nvidia propriétaire et OSS DLAMis.

  • Suppression du support des instances G4dn et G5 EC2 du pilote propriétaire Nvidia DLAMI.

  • Les nouvelles instances prises en charge pour chaque DLAMI sont les suivantes :

    • Deep Learning avec pilote propriétaire Nvidia compatible avec G3 (G3.16x non pris en charge), P3, P3dn

    • Le Deep Learning avec OSS Nvidia Driver est compatible avec G4dn, G5, P4d, P4de, P5.

Date de sortie : 2024-03-20

Noms AMI
  • Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20240318

  • Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20240318

Ajouté
  • Ajouté awscliv2 dans l'AMI à/usr/local/bin/aws2, à côté awscliv1 de/usr/bin/aws sur l'AMI propriétaire et OSS Nvidia Driver

Date de sortie : 2024-03-14

Nom de l'AMI : Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240314

Mis à jour
  • Mise à jour du pilote OSS Nvidia DLAMI avec support G4dn et G5, sur la base de celui-ci, le support actuel ressemble à ce qui suit :

    • L'AMI du pilote Nvidia propriétaire de Deep Learning Base (Ubuntu 20.04) est compatible avec P3, P3dn, G3, G5, G4dn.

    • L'AMI du pilote Nvidia Deep Learning Base OSS (Ubuntu 20.04) est compatible avec G5, G4dn, P4, P5.

  • Il est recommandé d'utiliser le pilote OSS Nvidia DLAMI pour G5, G4dn, P4, P5.

Date de sortie : 2024-02-12

Noms AMI
  • Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20240208

  • Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20240208

Mis à jour
  • AWS Le plugin OFI NCCL est mis à jour de 1.7.3 à 1.7.4

Date de sortie : 2024-02-01

Noms AMI
  • Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20240201

  • Pilote Nvidia propriétaire GPU AMI (Ubuntu 20.04) 20240201 de Deep Learning Base

Sécurité
  • Version du package runc mise à jour pour utiliser le correctif. CVE-2024-21626

Date de sortie : 04/12/2023

Noms AMI
  • Deep Learning Base OSS Nvidia Pilote GPU AMI (Ubuntu 20.04) 20231204

  • Pilote graphique Nvidia propriétaire de la base Deep Learning Base (Ubuntu 20.04) 20231204

Ajouté
  • AWS L'AMI Deep Learning (DLAMI) est divisée en deux groupes distincts :

    • DLAMI utilisant le pilote propriétaire Nvidia (pour prendre en charge P3, P3dn, G3, G5, G4dn).

    • DLAMI qui utilise le pilote Nvidia OSS pour activer EFA (pour prendre en charge P4, P5).

  • Veuillez consulter la section Modifications importantes apportées à la DLAMI pour plus d'informations sur la division DLAMI.

  • AWS CLI les requêtes ci-dessus sont sous forme de requête à puce AMI-ID avec AWSCLI (par exemple, Region is us-east-1)

Mis à jour
  • EFA mis à jour de la version 1.26.1 à la version 1.29.0

  • GDRCopy a été mis à jour de la version 2.3 à la version 2.4

Date de sortie : 18-010-2023

Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20231018

Mis à jour
  • AWS Plugin OFI NCCL mis à jour de la version 1.7.2 à la version 1.7.3

  • Mise à jour des répertoires CUDA 12.0-12.1 avec la version NCCL 2.18.5 pour correspondre à CUDA 12.2

  • CUDA12.1 mise à jour en tant que version CUDA par défaut

    • LD_LIBRARY_PATH a été mis à jour pour avoir//cuda-12. usr/local 1/targetslinux/lib/x86_64-/://cuda-12. usr/local 1/lib:/usr/local/cuda-12. 1/lib64:/usr/local/cuda-12.1 et PATH pour avoir//cuda-12. usr/local 1/bin/

    • Pour les clients qui souhaitent passer à une version de CUDA différente, veuillez définir les variables LD_LIBRARY_PATH et PATH en conséquence.

Date de sortie : 2023-10-02

Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20231002

Mis à jour
  • Pilote NVIDIA mis à jour de 535.54.03 à 535.104.12

    • Ce dernier pilote corrige les modifications de rupture de l'ABI NVML trouvées dans la version 535.54.03 du pilote, ainsi que la régression de pilote trouvée dans la version 535.86.10 qui affectait les boîtes à outils CUDA sur les instances P5. Consultez les notes de mise à jour NVIDIA suivantes pour plus de détails sur les correctifs :

    • Consultez les notes de mise à jour NVIDIA suivantes pour plus de détails sur les correctifs :

      • 4235941 - Correction d'une modification majeure de l'ABI NVML

      • 4228552 - Correction d'une erreur dans le kit d'outils CUDA

  • Répertoires CUDA 12.2 mis à jour avec NCCL 2.18.5

  • EFA a été mis à jour de la version 1.24.1 à la dernière version 1.26.1

Ajouté
  • Ajouté CUDA12.2 à/usr/local/cuda-12.2

Supprimé
  • Suppression du support pour CUDA 11.5 et CUDA 11.6

Date de sortie : 2023-09-26

Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20230926

Ajouté
  • Ajout de modifications au schéma net.naming-scheme pour corriger un problème imprévisible de dénomination de l'interface réseau (lien) observé sur P5. Cette modification est effectuée en définissant net.naming-scheme=v247 dans les arguments de démarrage de Linux dans le fichier//grub etc/default

Date de sortie : 2023-08-30

Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20230830

Mis à jour
  • aws-ofi-ncclPlugin mis à jour de la v1.7.1 à la v1.7.2

Date de sortie : 2023-08-11

Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20230811

Ajouté
  • Cette AMI prend désormais en charge les fonctionnalités de Multi-node formation sur P5 et sur toutes les instances EC2 précédemment prises en charge.

  • Pour l'instance P5 EC2, il est recommandé d'utiliser NCCL 2.18 et a été ajouté à, et. CUDA12.0 CUDA12.1

Supprimé
  • Suppression du support pour CUDA11.3 et CUDA11.4.

Date de sortie : 2023-08-04

Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20230804

Mis à jour
  • Mise à jour du plugin AWS OFI NCCL vers la version 1.7.1

  • CUDA11.8 Par défaut, la PyTorch version 2.0 prend en charge la version 11.8 et pour l'instance P5 EC2, il est recommandé d'utiliser >= CUDA11.8

    • LD_LIBRARY_PATH a été mis à jour pour avoir//cuda-11. usr/local 8/targetslinux/lib/x86_64-/://cuda-11. usr/local 8/lib:/usr/local/cuda-11. 8/lib64:/usr/local/cuda-11.8 et PATH pour avoir//cuda-11. usr/local 8/bin/

    • Pour toute version de cuda différente, veuillez définir LD_LIBRARY_PATH en conséquence.

  • Mise à jour des répertoires CUDA 12.0, 12.1 avec NCCL 2.18.3

Fixe
  • Correction du problème de chargement du package Nvidia Fabric Manager (FM) mentionné dans la date de sortie précédente 2023-07-19.

Date de sortie : 2023-07-19

Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20230719

Mis à jour
  • EFA mis à jour de 1.22.1 à 1.24.1

  • Pilote Nvidia mis à jour de 525.85.12 à 535.54.03

Ajouté
  • Ajout de modifications de l'état C pour désactiver l'état inactif du processeur en réglant l'état C maximum sur C1. Cette modification est effectuée en définissant intel_idle.max_cstate=1 processor.max_cstate=1 dans les arguments de démarrage de Linux dans le fichier//grub etc/default

  • AWS Prise en charge des instances EC2 P5 :

    • Ajout de la prise en charge des instances P5 EC2 pour les flux de travail utilisant une seule instance. node/instance Multi-node le support (par exemple pour la formation multi-nœuds) utilisant EFA (Elastic Fabric Adapter) et le plugin AWS OFI NCCL sera ajouté dans une prochaine version.

    • Veuillez utiliser CUDA>=11.8 pour des performances optimales.

    • Problème connu : le chargement du package Nvidia Fabric Manager (FM) sur P5 prend du temps. Les clients doivent attendre 2 à 3 minutes pour que FM se charge après le lancement de l'instance P5. Pour vérifier si FM est démarré, veuillez exécuter la commande sudo systemctl is-active nvidia-fabricmanager, elle devrait revenir active avant de démarrer tout flux de travail. Cela sera amélioré dans la prochaine version.

Date de sortie : 2023-05-19

Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20230519

Mis à jour
  • EFA mise à jour vers la dernière version 1.22.1

  • Version NCCL mise à jour pour CUDA 12.1 à 2.17.1

Ajouté
  • Ajouté CUDA12.1 à/usr/local/cuda-12.1

  • Ajout du support pour NVIDIA Data Center GPU Monitor (DCGM) via le package datacenter-gpu-manager

    • Vous pouvez vérifier l'état de ce service via la requête suivante : sudo systemctl status nvidia-dcgm

  • Les magasins d'instances NVMe éphémères sont désormais automatiquement montés sur les instances EC2 prises en charge et le stockage est accessible dans le dossier//nvme/. opt/dlami Vous pouvez vérifier ou modifier ce service de la manière suivante :

    • Vérifiez l'état du service NVMe : sudo systemctl status dlami-nvme

    • Pour accéder au service ou le modifier : /opt/aws/dlami/bin/nvme_ephemeral_drives.sh

  • Les volumes NVMe ont fourni les solutions de stockage les plus rapides et les plus efficaces pour les flux de travail à haut débit nécessitant des performances IOPS. Les magasins d'instances NVMe éphémères sont inclus dans le coût des instances, ce service n'entraîne donc aucun coût supplémentaire.

  • Les magasins d'instances NVMe ne seront montés que sur les instances EC2 qui les prennent en charge. Pour plus d'informations sur les instances EC2 dotées de magasins d'instances pris en charge par NVMe, consultez la section Volumes de stockage d'instance disponibles et vérifiez que NVMe est pris en charge.

  • Pour améliorer les performances du disque et réduire les pénalités liées à la première écriture, vous pouvez initialiser les magasins d'instances (notez que ce processus peut prendre des heures selon le type d'instance EC2) - Initialisez les volumes de stockage d'instance sur les instances EC2

  • REMARQUE  : les magasins d'instance NVMe sont montés sur l'instance et ne sont pas connectés au réseau comme EBS. Les données de ces volumes NVMe peuvent être perdues lors du redémarrage ou de l'arrêt de votre instance.

Date de sortie : 2023-04-17

Nom de l'AMI : AMI GPU Deep Learning Base (Ubuntu 20.04) 20230414

Mis à jour
  • Nom DLAMI mis à jour de AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) $ {YYYY-MM-DD} à Deep Learning Base GPU AMI (Ubuntu 20.04) $ {} YYYY-MM-DD

    • Veuillez noter que nous prendrons en charge le dernier DLAMI avec l'ancien nom d'AMI pendant un mois à compter de cette version pour toute assistance nécessaire. Les clients peuvent mettre à jour leurs packages de système d'exploitation apt-get update && apt-get upgrade pour utiliser des correctifs de sécurité.

  • Chemin du plug-in AWS OFI NCCL mis à jour de à /usr/local/cuda-xx.x/efa/ /opt/aws-ofi-nccl/

  • Mise à jour de NCCL vers une branche GIT personnalisée de la version 2.16.2, co-écrite par AWS l'équipe NCCL pour toutes les versions de CUDA. Il fonctionne mieux sur AWS l'infrastructure.

Ajouté
  • Ajouté CUDA12.0 à/usr/local/cuda-12.0

  • Ajout de AWS FSx

  • Ajout du support pour la version 3.9 de Python dans/usr/bin/python3.9

    • Notez que cette modification ne remplace pas le système par défaut Python, python3 pointera toujours le système. Python3.8

    • Python3.9 est accessible à l'aide des commandes suivantes :

      /usr/bin/python3.9 python3.9
Supprimé
  • Supprimés CUDA11.0-11.1 de/usr/local/cuda-11.x/ car ils ne sont utilisés par aucune version de framework prise en charge sur la base de la politique de support du framework. Politique de support DLAMI

Date de sortie : 25/05/22

Nom de l'AMI : AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) 20220523

Mis à jour
  • Cette version ajoute la prise en charge de la nouvelle instance EC2 p4de.24xlarge.

    • Mise à jour aws-efa-installer vers version 1.15.2

    • Mise à jour aws-ofi-nccl vers une version 1.3.0-aws qui inclut la topologie de p4de.24xlarge.

Date de sortie : 25/03/22

Nom de l'AMI : AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) 20220325

Mis à jour
  • Version EFA mise à jour de 1.15.0 à 1.15.1

Date de sortie : 15/03/17

Nom de l'AMI : AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) 20220323

Ajouté
  • Première publication