Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
AWS API GPU di base per il deep learning (Ubuntu 20.04)
Avviso di esaurimento del supporto
Ubuntu Linux 20.04 LTS sta per scadere la sua finestra LTS quinquennale il 31 maggio 2025 e non sarà più supportato dal suo fornitore. Di conseguenza, AWS Deep Learning Base GPU AMI (Ubuntu 20.04) non avrà aggiornamenti dopo il 31 maggio 2025. Le versioni precedenti continueranno a essere disponibili. Tieni presente che qualsiasi AMI rilasciata pubblicamente viene dichiarata obsoleta da EC2 dopo 2 anni dalla data di creazione. Per ulteriori informazioni, consulta Deprecare un'AMI Amazon EC2.
Per 3 mesi, fino al 31 agosto 2025, il supporto verrà fornito solo per problemi di funzionalità (non per le patch di sicurezza).
Gli utenti di Ubuntu 20.04 DLAMI dovrebbero passare a AWS Deep Learning Base GPU AMI (Ubuntu 22.04)
o AWS Deep Learning Base GPU AMI (Ubuntu 24.04). In alternativa, è possibile AWS utilizzare Deep Learning Base AMI (Amazon Linux 2023).
Per assistenza su come iniziare, consultaGuida introduttiva a DLAMI.
Formato del nome AMI
Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) $ {} YYYY-MM-DD
GPU AMI proprietaria di Nvidia Driver di Deep Learning Base (Ubuntu 20.04) $ {} YYYY-MM-DD
Istanze EC2 supportate
Fai riferimento a Modifiche importanti a DLAMI.
Deep Learning con OSS Il driver Nvidia supporta G4dn, G5, G6, Gr6, G6e, P4d, P4de, P5, P5e, P5en
Il deep learning con driver Nvidia proprietario supporta G3 (non supportato), P3, P3dn G3.16x
L'AMI include quanto segue:
AWS Servizio supportato: Amazon EC2
Sistema operativo: Ubuntu 20.04
Architettura di calcolo: x86
L'ultima versione disponibile è installata per i seguenti pacchetti:
Linux Kernel 5.15
FSx Lustre
Docker
AWS CLI v2 su//bin/aws2 e AWS CLI v1 suusr/local//aws usr/bin
NVIDIA DCGM
Toolkit per contenitori Nvidia:
Comando di versione: nvidia-container-cli -V
Nvidia-docker2:
Comando di versione: versione nvidia-docker
Driver NVIDIA:
Driver OSS Nvidia: 550.163.01
Driver Nvidia proprietario: 550.163.01
Stack NVIDIA CUDA 11.7, 12.1-12.4:
Directory di installazione di CUDA, NCCL e cuDDN://cuda-xx.x/ usr/local
Esempio://cuda-12.1/ usr/local
Versione NCCL compilata: 2.22.3+ CUDA12.4
CUDA predefinito: 12.1
PATH//cuda punta a CUDA 12.1 usr/local
Aggiornato di seguito env vars:
LD_LIBRARY_PATH per avere//cuda-12. usr/local 1/lib:/usr/local/cuda-12. 1/lib64://cuda-12.1:/ /cuda-12. usr/local usr/local 1/targets/x86_64- linux/lib
PATH per avere//cuda-12. usr/local 1/bin/://cuda-12. usr/local 1/include/
Per qualsiasi versione CUDA diversa, aggiorna LD_LIBRARY_PATH di conseguenza.
Luogo dei test NCCL:
all_reduce, all_gather e reduce_scatter://cuda-xx. usr/local x/efa/test-cuda-xx.x/
Per eseguire i test NCCL, LD_LIBRARY_PATH deve superare gli aggiornamenti seguenti.
I PATH comuni sono già stati aggiunti a LD_LIBRARY_PATH:
/opt/amazon/efa/lib:/opt/amazon/openmpi/lib:/opt/aws-ofi-nccl/lib:/usr/local/lib:/usr/lib
Per qualsiasi versione CUDA diversa, aggiorna LD_LIBRARY_PATH di conseguenza.
Programma di installazione EFA: 1.39.0
Nvidia GDRCopy: 2.4
AWS Plugin OFI NCCL: è installato come parte del
EFA Installer-awsAWS OFI NCCL ora supporta più versioni NCCL con una singola build
Percorso
/opt/aws-ofi-nccl/di installazione:./opt/aws-ofi-nccl/libIl percorso viene aggiunto a LD_LIBRARY_PATH.Verifica il percorso per ring, message_transfer:
/opt/aws-ofi-nccl/tests
Tipo di volume EBS: gp3
Python://python3.9 usr/bin
Posizione dell'archivio delle istanze NVMe (sulle istanze EC2 supportate)://nvme https://docs.aws.amazon.com/AWSEC2/latest/UserGuide/instance-store-volumes.html#available-instance-store-volumes opt/dlami
Interrogazione AMI-ID con parametro SSM (la regione di esempio è us-east-1):
Driver Nvidia OSS:
aws ssm get-parameter --regionus-east-1\ --name /aws/service/deeplearning/ami/x86_64/base-oss-nvidia-driver-gpu-ubuntu-20.04/latest/ami-id \ --query "Parameter.Value" \ --output textDriver Nvidia proprietario:
aws ssm get-parameter --regionus-east-1\ --name /aws/service/deeplearning/ami/x86_64/base-proprietary-nvidia-driver-gpu-ubuntu-20.04/latest/ami-id \ --query "Parameter.Value" \ --output text
Interrogazione AMI-ID con AWSCLI (la regione di esempio è us-east-1):
Driver Nvidia OSS:
aws ec2 describe-images --regionus-east-1\ --owners amazon \ --filters 'Name=name,Values=Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output textDriver Nvidia proprietario:
aws ec2 describe-images --regionus-east-1\ --owners amazon \ --filters 'Name=name,Values=Deep Learning Base Proprietary Nvidia Driver GPU AMI (Ubuntu 20.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output text
Note
NVIDIA Container Toolkit 1.17.4
Nella versione 1.17.4 di Container Toolkit il montaggio delle librerie compat CUDA è ora disabilitato. Per garantire la compatibilità con più versioni CUDA sui flussi di lavoro dei contenitori, assicurati di aggiornare LD_LIBRARY_PATH per includere le librerie di compatibilità CUDA, come mostrato nel tutorial If you use a CUDA compatibility layer. https://docs.aws.amazon.com/sagemaker/latest/dg/inference-gpu-drivers.html#collapsible-cuda-compat
Aggiornamenti EFA da 1.37 a 1.38 (versione il 2025-02-04)
L'EFA ora include il plugin AWS OFI NCCL, che ora può essere trovato in anziché nell'originale. /opt/amazon/ofi-nccl /opt/aws-ofi-nccl/ Se state aggiornando la variabile LD_LIBRARY_PATH, assicuratevi di modificare correttamente la posizione OFI NCCL.
Politica di supporto
I componenti di questa AMI, come le versioni CUDA, possono essere rimossi e modificati in base alla politica di supporto del framework o per ottimizzare le prestazioni dei contenitori di deep learning
Istanze EC2 con più schede di rete
Molti tipi di istanze che supportano EFA hanno anche più schede di rete.
DeviceIndex è univoco per ogni scheda di rete e deve essere un numero intero non negativo inferiore al limite di ENI per. NetworkCard In P5, il numero di ENI per NetworkCard è 2, il che significa che gli unici valori validi per DeviceIndex sono 0 o 1.
Per l'interfaccia di rete principale (indice della scheda di rete 0, indice del dispositivo 0), creare un'interfaccia EFA (EFA con ENA). Non è possibile utilizzare un'interfaccia EFA-only di rete come interfaccia di rete principale.
Per ogni interfaccia di rete aggiuntiva, utilizzate il successivo indice della scheda di rete non utilizzata, l'indice del dispositivo 1 e un'interfaccia EFA (EFA con ENA) o di EFA-only rete, a seconda del caso d'uso, ad esempio i requisiti di larghezza di banda ENA o lo spazio degli indirizzi IP. Per esempi di casi d'uso, vedi Configurazione EFA per un'istanza P5.
Per ulteriori informazioni, consulta la guida EFA qui. https://docs.aws.amazon.com/AWSEC2/latest/UserGuide/efa-acc-inst-types.html
P5/P5e casi
Le istanze P5 e P5e contengono 32 schede di interfaccia di rete e possono essere avviate utilizzando il seguente comando: AWS CLI
aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=31,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
Istanze P5en
P5en contiene 16 schede di interfaccia di rete e può essere avviato utilizzando il seguente comando: AWS CLI
aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=15,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
Kernel
La versione del kernel è bloccata usando il comando:
echo linux-aws hold | sudo dpkg —set-selections echo linux-headers-aws hold | sudo dpkg —set-selections echo linux-image-aws hold | sudo dpkg —set-selectionsConsigliamo agli utenti di evitare l'aggiornamento della versione del kernel (a meno che non sia dovuto a una patch di sicurezza) per garantire la compatibilità con i driver installati e le versioni dei pacchetti. Se gli utenti desiderano comunque effettuare l'aggiornamento, possono eseguire i seguenti comandi per sbloccare le proprie versioni del kernel:
echo linux-aws install | sudo dpkg -set-selections echo linux-headers-aws install | sudo dpkg -set-selections echo linux-image-aws install | sudo dpkg -set-selectionsPer ogni nuova versione di DLAMI, viene utilizzato l'ultimo kernel compatibile disponibile.
Data di rilascio: 24/04/2020
Nomi AMI
Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20250424
Driver GPU AMI proprietario di Nvidia Base per Deep Learning Base (Ubuntu 20.04) 20250424
Aggiornato
Driver Nvidia aggiornato dalla versione 550.144.03 alla 550.163.01 per risolvere i CVE presenti nel NVIDIA GPU Display Driver Security Bulletin di aprile 2025 https://nvidia.custhelp.com/app/answers/detail/a_id/5630
Data di rilascio: 17/02/2020
Nomi AMI
Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20250214
Scheda grafica Nvidia Driver AMI proprietaria di Deep Learning Base (Ubuntu 20.04) 20250214
Aggiornato
NVIDIA Container Toolkit aggiornato dalla versione 1.17.3 alla versione 1.17.4
Per ulteriori informazioni, consulta la pagina delle note di rilascio qui: https://github.com/NVIDIA/nvidia-container-toolkit/releases/tag/v1.17.4
Nella versione 1.17.4 di Container Toolkit, il montaggio delle librerie compat CUDA è ora disabilitato. Per garantire la compatibilità con più versioni CUDA sui flussi di lavoro dei contenitori, assicurati di aggiornare LD_LIBRARY_PATH per includere le librerie di compatibilità CUDA, come mostrato nel tutorial If you use a CUDA compatibility layer. https://docs.aws.amazon.com/sagemaker/latest/dg/inference-gpu-drivers.html#collapsible-cuda-compat
Rimosso
Sono state rimosse le librerie di spazio utente cuobj e nvdisasm fornite dal toolkit NVIDIA CUDA
per affrontare i CVE presenti nel bollettino sulla sicurezza di NVIDIA CUDA Toolkit del 18 febbraio 2025
Data di rilascio: 04/02/2020
Nomi AMI
Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20250204
Scheda grafica Nvidia Driver AMI proprietaria di Deep Learning Base (Ubuntu 20.04) 20250204
Aggiornato
Versione EFA aggiornata da 1.37.0 a 1.38.0
EFA ora raggruppa il plugin AWS OFI NCCL, che ora può essere trovato in anziché nell'originale.
/opt/amazon/ofi-nccl/opt/aws-ofi-nccl/Se state aggiornando la variabile LD_LIBRARY_PATH, assicuratevi di modificare correttamente la posizione OFI NCCL.
Rimosso
Il pacchetto emacs è stato rimosso da questi DLAMI. I clienti possono installare emacs da GNU emacs. https://www.gnu.org/software/emacs/download.html
Data di rilascio: 17/01/2020
Nomi AMI
Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20250117
Scheda grafica Nvidia Driver AMI proprietaria di Deep Learning Base (Ubuntu 20.04) 20250117
Aggiornato
Driver Nvidia aggiornato dalla versione 550.127.05 alla 550.144.03 per risolvere i CVE presenti nel NVIDIA GPU Display Driver Security Bulletin di gennaio 2025 https://nvidia.custhelp.com/app/answers/detail/a_id/5614
Data di rilascio: 09/12/2020
Nomi AMI
Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20241206
Scheda grafica Nvidia Driver AMI proprietaria di Deep Learning Base (Ubuntu 20.04) 20241206
Aggiornato
Nvidia Container Toolkit aggiornato dalla versione 1.17.0 alla 1.17.3
Data di rilascio: 2024-11-22
Nome AMI: Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20241122
Aggiunto
È stato aggiunto il supporto per le istanze EC2 P5en.
Aggiornato
EFA Installer aggiornato dalla versione 1.35.0 alla 1.37.0
Aggiornare il plugin AWS OFI NCCL dalla versione 1.12.1-aws a 1.13.0-aws
Data di rilascio: 26/10/2020
Nomi AMI
Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20241025
Driver GPU AMI proprietario di Nvidia Base di Deep Learning (Ubuntu 20.04) 20241025
Aggiornato
Driver Nvidia aggiornato dalla versione 550.90.07 alla 550.127.05 per risolvere i CVE presenti nel NVIDIA GPU Display Security Bulletin di ottobre 2024 https://nvidia.custhelp.com/app/answers/detail/a_id/5586
Data di rilascio: 2024-10-03
Nome AMI: Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240927
Aggiornato
Nvidia Container Toolkit aggiornato dalla versione 1.16.1 alla 1.16.2
Data di rilascio: 27/08/2024
Nome AMI: Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240827
Aggiornato
Driver Nvidia e Fabric Manager aggiornati dalla versione 535.183.01 alla 550.90.07
Versione EFA aggiornata da 1.32.0 a 1.34.0
NCCL aggiornato all'ultima versione 2.22.3 per tutte le versioni CUDA
CUDA 11.7 aggiornato dalla versione 2.16.2+ CUDA11.7
CUDA 12.1, 12.2 aggiornato da 2.18.5+ CUDA12.2
CUDA 12.3 aggiornato dalla versione 2.21.5+ CUDA12.4
Aggiunto
È stata aggiunta la versione 12.4 del toolkit CUDA nella directory//cuda-12.4 usr/local
È stato aggiunto il supporto per l'istanza EC2 P5e.
Rimosso
Rimosso lo stack CUDA Toolkit versione 11.8 presente nella directory//cuda-11.8 usr/local
Data di rilascio: 19/08/2020
Nome AMI: Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240816
Aggiunto
È stato aggiunto il supporto per l'istanza G6e EC2. https://aws.amazon.com/ec2/instance-types/g6e/
Data di rilascio: 2024-06-06
Nomi AMI
Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240606
Scheda grafica Nvidia Driver AMI proprietaria di Deep Learning Base (Ubuntu 20.04) 20240606
Aggiornato
Versione del driver Nvidia aggiornata a 535.183.01 da 535.161.08
Data di rilascio: 15/05/2020
Nomi AMI
Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240515
Driver GPU AMI proprietario di Nvidia Base per Deep Learning Base (Ubuntu 20.04) 20240515
Aggiunto
È stato aggiunto un nuovo CUDA11.7 stack nella directory usr/local /cuda-11.7 con, NCCL 2.16.2, cuDNN 8.7.0 come supporta la versione 1.13 CUDA11.7 PyTorch CUDA11.7
Data di rilascio: 2024-05-02
Nomi AMI
Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240502
Scheda grafica proprietaria Nvidia Driver AMI (Ubuntu 20.04) 20240502 di Deep Learning Base
Aggiornato
Versione EFA aggiornata dalla versione 1.30 alla versione 1.32
Plugin AWS OFI NCCL aggiornato dalla versione 1.7.4 alla versione 1.9.1
Toolkit Nvidia container aggiornato dalla versione 1.13.5 alla versione 1.15.0 https://github.com/NVIDIA/nvidia-container-toolkit/releases/tag/v1.15.0
La versione 1.15.0 NON include i pacchetti nvidia-container-runtime e nvidia-docker2. Si consiglia di utilizzare i pacchetti nvidia-container-toolkit direttamente seguendo i documenti del toolkit contenitore Nvidia. https://docs.nvidia.com/datacenter/cloud-native/container-toolkit/latest/sample-workload.html
Aggiunto
Aggiunto CUDA12.3 stack con CUDA12.3, NCCL 2.21.5, cuDNN 8.9.7
Rimosso
Rimossi CUDA11.7, gli stack presenti nelle directory//cuda-11.7 e/ CUDA12.0 /cuda-12.0 usr/local usr/local
Rimosso il pacchetto nvidia-docker2 e il relativo comando nvidia-docker come parte dell'aggiornamento del toolkit per container Nvidia da 1.13.5 a 1.15.0 che NON include i pacchetti nvidia-container-runtime e nvidia-docker2. https://github.com/NVIDIA/nvidia-container-toolkit/releases/tag/v1.15.0
Data di rilascio: 2024-04-04
Nomi AMI: Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240404
Aggiunto
Per i driver OSS Nvidia DLAMIS, è stato aggiunto il supporto per le istanze EC2 G6 e Gr6. Per ulteriori informazioni, consulta le istanze GPU consigliate. Istanze GPU consigliate
Data di rilascio: 29/03/2020
Nomi AMI
Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240326
Scheda grafica proprietaria Nvidia Driver AMI (Ubuntu 20.04) 20240326 di Deep Learning Base
Aggiornato
Driver Nvidia aggiornato da 535.104.12 a 535.161.08 nei driver DLAMI proprietari e OSS Nvidia.
È stato rimosso il supporto per le istanze G4dn, G5 EC2 dal driver proprietario Nvidia DLAMI.
Le nuove istanze supportate per ogni DLAMI sono le seguenti:
Il deep learning con driver Nvidia proprietario supporta G3 (G3.16x non supportato), P3, P3dn
Deep Learning con OSS Il driver Nvidia supporta G4dn, G5, P4d, P4de, P5.
Data di rilascio: 2024-03-20
Nomi AMI
Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240318
Scheda grafica proprietaria Nvidia Driver AMI (Ubuntu 20.04) 20240318 di Deep Learning Base
Aggiunto
Aggiunto
awscliv2nell'AMI su//bin/aws2, insieme ausr/local//aws su Nvidia Driver AMI proprietaria eawscliv1usr/bin OSS
Data di rilascio: 14/03/2024
Nome AMI: Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240314
Aggiornato
Driver OSS Nvidia DLAMI aggiornato con supporto G4dn e G5, in base al supporto attuale, è il seguente:
Il driver AMI proprietario di Nvidia (Ubuntu 20.04) di Deep Learning Base supporta P3, P3dn, G3, G5, G4dn.
Deep Learning Base OSS Nvidia Driver AMI (Ubuntu 20.04) supporta G5, G4dn, P4, P5.
Si consiglia di utilizzare i driver OSS Nvidia DLAMI per G5, G4dn, P4, P5.
Data di rilascio: 2024-02-12
Nomi AMI
Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240208
Scheda grafica Nvidia Driver AMI proprietaria di Deep Learning Base (Ubuntu 20.04) 20240208
Aggiornato
AWS Il plugin OFI NCCL è aggiornato da 1.7.3 a 1.7.4
Data di rilascio: 2024-02-01
Nomi AMI
API GPU con driver Nvidia OSS Deep Learning Base (Ubuntu 20.04) 20240201
API GPU con driver Nvidia proprietario di Deep Learning Base (Ubuntu 20.04) 20240201
Sicurezza
Versione aggiornata del pacchetto runc per cui utilizzare la patch per. CVE-2024-21626
Data di rilascio: 2023-12-04
Nomi AMI
Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20231204
Scheda grafica Nvidia Driver AMI proprietaria di Deep Learning Base (Ubuntu 20.04) 20231204
Aggiunto
AWS Deep Learning AMI (DLAMI) è suddiviso in due gruppi separati:
DLAMI che utilizza Nvidia Proprietary Driver (per supportare P3, P3dn, G3, G5, G4dn).
DLAMI che utilizza il driver Nvidia OSS per abilitare EFA (per supportare P4, P5).
Fai riferimento a Modifiche importanti al DLAMI per ulteriori informazioni sulla divisione DLAMI.
AWS CLI le domande di cui sopra sono elencate all'elenco Query AMI-ID with AWSCLI (la regione di esempio è us-east-1)
Aggiornato
EFA aggiornato da 1.26.1 a 1.29.0
GDRCopy aggiornato da 2.3 a 2.4
Data di rilascio: 2023-10-18
Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20231018
Aggiornato
AWS Plugin OFI NCCL aggiornato dalla versione 1.7.2 alla versione 1.7.3
Directory CUDA 12.0-12.1 aggiornate con la versione NCCL 2.18.5 in modo che corrispondano a CUDA 12.2
CUDA12.1 aggiornata come versione CUDA predefinita
LD_LIBRARY_PATH aggiornato con//cuda-12. usr/local 1/targetslinux/lib/x86_64-/:usr/local//cuda-12. 1/libusr/local://cuda-12. 1/lib64:/usr/local/cuda-12.1 e PATH per avere//cuda-12. usr/local 1/bin/
Per i clienti che desiderano passare a una versione CUDA diversa, definisci di conseguenza le variabili LD_LIBRARY_PATH e PATH.
Data di rilascio: 2023-10-02
Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20231002
Aggiornato
Driver NVIDIA aggiornato da 535.54.03 a 535.104.12
Quest'ultimo driver corregge le modifiche sostanziali di NVML ABI rilevate nella versione 535.54.03, nonché la regressione del driver riscontrata nella versione 535.86.10 che interessava i toolkit CUDA sulle istanze P5. Per informazioni dettagliate sulle correzioni, consulta le seguenti note di rilascio di NVIDIA:
Per informazioni dettagliate sulle correzioni, consulta le seguenti note di rilascio di NVIDIA:
Directory CUDA 12.2 aggiornate con NCCL 2.18.5
EFA aggiornato dalla versione 1.24.1 all'ultima 1.26.1
Aggiunto
CUDA12.2 Aggiunto usr/local in //cuda-12.2
Rimosso
È stato rimosso il supporto per CUDA 11.5 e CUDA 11.6
Data di rilascio: 26/09/2023
Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230926
Aggiunto
Sono state aggiunte modifiche a net.naming-scheme per risolvere un problema imprevedibile di denominazione delle interfacce di rete (link) riscontrato su P5. https://bugs.launchpad.net/ubuntu/+source/systemd/+bug/1945225
Questa modifica viene effettuata impostando net.naming-scheme=v247 negli argomenti di avvio di linux nel file//grub etc/default
Data di rilascio: 30/08/2023
Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230830
Aggiornato
Plugin aggiornato
aws-ofi-nccldalla v1.7.1 alla v1.7.2
Data di rilascio: 2023-08-11
Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230811
Aggiunto
Questa AMI ora fornisce supporto per la funzionalità di Multi-node training su P5 e su tutte le istanze EC2 supportate in precedenza.
Per l'istanza P5 EC2, si consiglia di utilizzare NCCL 2.18 ed è stato aggiunto a, e. CUDA12.0 CUDA12.1
Rimosso
È stato rimosso il supporto per e. CUDA11.3 CUDA11.4
Data di rilascio: 2023-08-04
Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230804
Aggiornato
Plugin OFI NCCL aggiornato AWS alla v1.7.1
Impostato CUDA11.8 come predefinito in quanto PyTorch 2.0 supporta la versione 11.8 e per l'istanza P5 EC2, si consiglia di utilizzare >= CUDA11.8
LD_LIBRARY_PATH aggiornato con//cuda-11. usr/local 8/targetslinux/lib/x86_64-/:usr/local//cuda-11. 8/libusr/local://cuda-11. 8/lib64:/usr/local/cuda-11.8 e PATH per avere//cuda-11. usr/local 8/bin/
Per qualsiasi versione di cuda diversa, definisci LD_LIBRARY_PATH di conseguenza.
Directory CUDA 12.0, 12.1 aggiornate con NCCL 2.18.3
Fixed
Risolto il problema di caricamento dei pacchetti Nvidia Fabric Manager (FM) menzionato nella precedente data di rilascio 2023-07-19.
Data di rilascio: 19/07/2023
Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230719
Aggiornato
EFA aggiornato da 1.22.1 a 1.24.1
Driver Nvidia aggiornato da 525.85.12 a 535.54.03
Aggiunto
Sono state aggiunte modifiche allo stato c per disabilitare lo stato inattivo del processore impostando lo stato c massimo su C1. Questa modifica viene effettuata impostando `intel_idle.max_cstate=1 processor.max_cstate=1` negli argomenti di avvio di linux nel file//grub etc/default
AWS Supporto per le istanze EC2 P5:
È stato aggiunto il supporto per le istanze EC2 P5 per i flussi di lavoro che utilizzano single. node/instance Multi-node il supporto (ad esempio per la formazione su più nodi) tramite EFA (Elastic Fabric Adapter) e il plug-in AWS OFI NCCL verrà aggiunto in una prossima versione.
Si prega di utilizzare CUDA>=11.8 per prestazioni ottimali.
Problema noto: il caricamento del pacchetto Nvidia Fabric Manager (FM) richiede tempo su P5, i clienti devono attendere 2-3 minuti prima che FM si carichi dopo aver avviato l'istanza P5. Per verificare se FM è avviato, esegui il comando sudo systemctl is-active nvidia-fabricmanager, dovrebbe tornare attivo prima di iniziare qualsiasi flusso di lavoro. Questo sarà migliorato nella prossima versione.
Data di rilascio: 19/05/2023
Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230519
Aggiornato
EFA aggiornato all'ultima versione 1.22.1
Versione NCCL aggiornata per CUDA 12.1 a 2.17.1
Aggiunto
CUDA12.1 Aggiunto inusr/local//cuda-12.1
È stato aggiunto il supporto per NVIDIA Data Center GPU Monitor (DCGM) tramite il pacchetto datacenter-gpu-manager
È possibile verificare lo stato di questo servizio tramite la seguente query: sudo systemctl status nvidia-dcgm
Gli store temporanei di istanze NVMe vengono ora montati automaticamente sulle istanze EC2 supportate ed è possibile accedere allo storage nella cartella//nvme/. opt/dlami È possibile controllare o modificare questo servizio nei seguenti modi:
Verifica lo stato del servizio NVMe: sudo systemctl status dlami-nvme
Per accedere o modificare il servizio:
/opt/aws/dlami/bin/nvme_ephemeral_drives.sh
I volumi NVMe hanno fornito le soluzioni di storage più veloci ed efficienti per flussi di lavoro ad alto rendimento che richiedono prestazioni IOPS. Gli store di istanze NVMe effimeri sono inclusi nel costo delle istanze, quindi questo servizio non comporta costi aggiuntivi.
Gli archivi di istanze NVMe verranno montati solo sulle istanze EC2 che li supportano. Per informazioni sulle istanze EC2 con archivi di istanze supportati da NVMe, consulta Volumi di archiviazione di istanze disponibili e verifica che NVMe sia supportato.
Per migliorare le prestazioni del disco e ridurre le penalità per la prima scrittura, puoi inizializzare gli archivi di istanze (nota, questo processo può richiedere ore a seconda del tipo di istanza EC2) - Inizializza i volumi degli archivi di istanza sulle istanze EC2 https://docs.aws.amazon.com/AWSEC2/latest/UserGuide/disk-performance.html
NOTA: gli store di istanze NVMe sono montati sull'istanza e non sono collegati alla rete come EBS. I dati su questi volumi NVMe potrebbero andare persi al riavvio o all'arresto dell'istanza.
Data di rilascio: 17/04/2023
Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230414
Aggiornato
Nome DLAMI aggiornato da AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) $ {YYYY-MM-DD} a Deep Learning Base GPU AMI (Ubuntu 20.04) $ {} YYYY-MM-DD
Tieni presente che supporteremo il DLAMI più recente con il vecchio nome AMI per un mese a partire da questa versione per qualsiasi supporto necessario. I clienti possono aggiornare i pacchetti del sistema operativo apt-get update && apt-get upgrade per utilizzare le patch di sicurezza.
Percorso del plug-in OFI NCCL aggiornato AWS da a
/usr/local/cuda-xx.x/efa//opt/aws-ofi-nccl/NCCL aggiornato a un ramo GIT personalizzato
della v2.16.2, creato in collaborazione con il team NCCL per tutte le versioni CUDA. AWS AWS Funziona meglio sull'infrastruttura.
Aggiunto
Aggiunto CUDA12.0 in/usr/local/cuda-12.0
È stato aggiunto il supporto per la versione 3.9 di Python in//python3.9 usr/bin
Nota che questa modifica non sostituisce il sistema predefinito Python, python3 punterà comunque al sistema. Python3.8
Python3.9 è possibile accedervi utilizzando i seguenti comandi:
/usr/bin/python3.9 python3.9
Rimosso
Rimossi CUDA11.0-11.1 da/usr/local/cuda-11.x/ in quanto non vengono utilizzati da nessuna versione del framework supportata in base alla politica di supporto del framework. Politica di supporto DLAMI
Data di rilascio: 25/05/2022
Nome AMI: AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) 20220523
Aggiornato
Questa versione aggiunge il supporto per la nuova istanza EC2 p4de.24xlarge.
Aggiornato
aws-efa-installeralla versione 1.15.2Aggiornato
aws-ofi-ncclalla versione1.3.0-awsche include la topologia per p4de.24xlarge.
Data di rilascio: 25/03/2022
Nome AMI: AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) 20220325
Aggiornato
Versione EFA aggiornata da 1.15.0 a 1.15.1
Data di rilascio: 17/03/2022
Nome AMI: AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) 20220323
Aggiunto
Primo rilascio