View a markdown version of this page

AWS API GPU di base per il deep learning (Ubuntu 20.04) - AWS Deep Learning AMIs

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

AWS API GPU di base per il deep learning (Ubuntu 20.04)

Avviso di esaurimento del supporto

Per assistenza su come iniziare, consultaGuida introduttiva a DLAMI.

Formato del nome AMI

  • Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) $ {} YYYY-MM-DD

  • GPU AMI proprietaria di Nvidia Driver di Deep Learning Base (Ubuntu 20.04) $ {} YYYY-MM-DD

Istanze EC2 supportate

  • Fai riferimento a Modifiche importanti a DLAMI.

  • Deep Learning con OSS Il driver Nvidia supporta G4dn, G5, G6, Gr6, G6e, P4d, P4de, P5, P5e, P5en

  • Il deep learning con driver Nvidia proprietario supporta G3 (non supportato), P3, P3dn G3.16x

L'AMI include quanto segue:

  • AWS Servizio supportato: Amazon EC2

  • Sistema operativo: Ubuntu 20.04

  • Architettura di calcolo: x86

  • L'ultima versione disponibile è installata per i seguenti pacchetti:

    • Linux Kernel 5.15

    • FSx Lustre

    • Docker

    • AWS CLI v2 su//bin/aws2 e AWS CLI v1 suusr/local//aws usr/bin

    • NVIDIA DCGM

    • Toolkit per contenitori Nvidia:

      • Comando di versione: nvidia-container-cli -V

    • Nvidia-docker2:

      • Comando di versione: versione nvidia-docker

  • Driver NVIDIA:

    • Driver OSS Nvidia: 550.163.01

    • Driver Nvidia proprietario: 550.163.01

  • Stack NVIDIA CUDA 11.7, 12.1-12.4:

    • Directory di installazione di CUDA, NCCL e cuDDN://cuda-xx.x/ usr/local

      • Esempio://cuda-12.1/ usr/local

    • Versione NCCL compilata: 2.22.3+ CUDA12.4

    • CUDA predefinito: 12.1

      • PATH//cuda punta a CUDA 12.1 usr/local

      • Aggiornato di seguito env vars:

        • LD_LIBRARY_PATH per avere//cuda-12. usr/local 1/lib:/usr/local/cuda-12. 1/lib64://cuda-12.1:/ /cuda-12. usr/local usr/local 1/targets/x86_64- linux/lib

        • PATH per avere//cuda-12. usr/local 1/bin/://cuda-12. usr/local 1/include/

        • Per qualsiasi versione CUDA diversa, aggiorna LD_LIBRARY_PATH di conseguenza.

    • Luogo dei test NCCL:

      • all_reduce, all_gather e reduce_scatter://cuda-xx. usr/local x/efa/test-cuda-xx.x/

      • Per eseguire i test NCCL, LD_LIBRARY_PATH deve superare gli aggiornamenti seguenti.

        • I PATH comuni sono già stati aggiunti a LD_LIBRARY_PATH:

          • /opt/amazon/efa/lib:/opt/amazon/openmpi/lib:/opt/aws-ofi-nccl/lib:/usr/local/lib:/usr/lib

        • Per qualsiasi versione CUDA diversa, aggiorna LD_LIBRARY_PATH di conseguenza.

  • Programma di installazione EFA: 1.39.0

  • Nvidia GDRCopy: 2.4

  • AWS Plugin OFI NCCL: è installato come parte del EFA Installer-aws

    • AWS OFI NCCL ora supporta più versioni NCCL con una singola build

    • Percorso /opt/aws-ofi-nccl/ di installazione:. /opt/aws-ofi-nccl/libIl percorso viene aggiunto a LD_LIBRARY_PATH.

    • Verifica il percorso per ring, message_transfer: /opt/aws-ofi-nccl/tests

  • Tipo di volume EBS: gp3

  • Python://python3.9 usr/bin

  • Posizione dell'archivio delle istanze NVMe (sulle istanze EC2 supportate)://nvme https://docs.aws.amazon.com/AWSEC2/latest/UserGuide/instance-store-volumes.html#available-instance-store-volumes opt/dlami

  • Interrogazione AMI-ID con parametro SSM (la regione di esempio è us-east-1):

    • Driver Nvidia OSS:

      aws ssm get-parameter --region us-east-1 \ --name /aws/service/deeplearning/ami/x86_64/base-oss-nvidia-driver-gpu-ubuntu-20.04/latest/ami-id \ --query "Parameter.Value" \ --output text
    • Driver Nvidia proprietario:

      aws ssm get-parameter --region us-east-1 \ --name /aws/service/deeplearning/ami/x86_64/base-proprietary-nvidia-driver-gpu-ubuntu-20.04/latest/ami-id \ --query "Parameter.Value" \ --output text
  • Interrogazione AMI-ID con AWSCLI (la regione di esempio è us-east-1):

    • Driver Nvidia OSS:

      aws ec2 describe-images --region us-east-1 \ --owners amazon \ --filters 'Name=name,Values=Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output text
    • Driver Nvidia proprietario:

      aws ec2 describe-images --region us-east-1 \ --owners amazon \ --filters 'Name=name,Values=Deep Learning Base Proprietary Nvidia Driver GPU AMI (Ubuntu 20.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output text

Note

NVIDIA Container Toolkit 1.17.4

Nella versione 1.17.4 di Container Toolkit il montaggio delle librerie compat CUDA è ora disabilitato. Per garantire la compatibilità con più versioni CUDA sui flussi di lavoro dei contenitori, assicurati di aggiornare LD_LIBRARY_PATH per includere le librerie di compatibilità CUDA, come mostrato nel tutorial If you use a CUDA compatibility layer. https://docs.aws.amazon.com/sagemaker/latest/dg/inference-gpu-drivers.html#collapsible-cuda-compat

Aggiornamenti EFA da 1.37 a 1.38 (versione il 2025-02-04)

L'EFA ora include il plugin AWS OFI NCCL, che ora può essere trovato in anziché nell'originale. /opt/amazon/ofi-nccl /opt/aws-ofi-nccl/ Se state aggiornando la variabile LD_LIBRARY_PATH, assicuratevi di modificare correttamente la posizione OFI NCCL.

Politica di supporto

I componenti di questa AMI, come le versioni CUDA, possono essere rimossi e modificati in base alla politica di supporto del framework o per ottimizzare le prestazioni dei contenitori di deep learning o per ridurre le dimensioni dell'AMI in una versione futura, senza preavviso. Rimuoviamo le versioni CUDA dalle AMI se non vengono utilizzate da nessuna versione del framework supportata.

Istanze EC2 con più schede di rete
  • Molti tipi di istanze che supportano EFA hanno anche più schede di rete.

  • DeviceIndex è univoco per ogni scheda di rete e deve essere un numero intero non negativo inferiore al limite di ENI per. NetworkCard In P5, il numero di ENI per NetworkCard è 2, il che significa che gli unici valori validi per DeviceIndex sono 0 o 1.

    • Per l'interfaccia di rete principale (indice della scheda di rete 0, indice del dispositivo 0), creare un'interfaccia EFA (EFA con ENA). Non è possibile utilizzare un'interfaccia EFA-only di rete come interfaccia di rete principale.

    • Per ogni interfaccia di rete aggiuntiva, utilizzate il successivo indice della scheda di rete non utilizzata, l'indice del dispositivo 1 e un'interfaccia EFA (EFA con ENA) o di EFA-only rete, a seconda del caso d'uso, ad esempio i requisiti di larghezza di banda ENA o lo spazio degli indirizzi IP. Per esempi di casi d'uso, vedi Configurazione EFA per un'istanza P5.

    • Per ulteriori informazioni, consulta la guida EFA qui. https://docs.aws.amazon.com/AWSEC2/latest/UserGuide/efa-acc-inst-types.html

P5/P5e casi
  • Le istanze P5 e P5e contengono 32 schede di interfaccia di rete e possono essere avviate utilizzando il seguente comando: AWS CLI

aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=31,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
Istanze P5en
  • P5en contiene 16 schede di interfaccia di rete e può essere avviato utilizzando il seguente comando: AWS CLI

aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=15,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
Kernel
  • La versione del kernel è bloccata usando il comando:

    echo linux-aws hold | sudo dpkg —set-selections echo linux-headers-aws hold | sudo dpkg —set-selections echo linux-image-aws hold | sudo dpkg —set-selections
  • Consigliamo agli utenti di evitare l'aggiornamento della versione del kernel (a meno che non sia dovuto a una patch di sicurezza) per garantire la compatibilità con i driver installati e le versioni dei pacchetti. Se gli utenti desiderano comunque effettuare l'aggiornamento, possono eseguire i seguenti comandi per sbloccare le proprie versioni del kernel:

    echo linux-aws install | sudo dpkg -set-selections echo linux-headers-aws install | sudo dpkg -set-selections echo linux-image-aws install | sudo dpkg -set-selections
  • Per ogni nuova versione di DLAMI, viene utilizzato l'ultimo kernel compatibile disponibile.

Data di rilascio: 24/04/2020

Nomi AMI
  • Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20250424

  • Driver GPU AMI proprietario di Nvidia Base per Deep Learning Base (Ubuntu 20.04) 20250424

Aggiornato

Data di rilascio: 17/02/2020

Nomi AMI
  • Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20250214

  • Scheda grafica Nvidia Driver AMI proprietaria di Deep Learning Base (Ubuntu 20.04) 20250214

Aggiornato
Rimosso

Data di rilascio: 04/02/2020

Nomi AMI
  • Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20250204

  • Scheda grafica Nvidia Driver AMI proprietaria di Deep Learning Base (Ubuntu 20.04) 20250204

Aggiornato
  • Versione EFA aggiornata da 1.37.0 a 1.38.0

    • EFA ora raggruppa il plugin AWS OFI NCCL, che ora può essere trovato in anziché nell'originale. /opt/amazon/ofi-nccl /opt/aws-ofi-nccl/ Se state aggiornando la variabile LD_LIBRARY_PATH, assicuratevi di modificare correttamente la posizione OFI NCCL.

Rimosso

Data di rilascio: 17/01/2020

Nomi AMI
  • Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20250117

  • Scheda grafica Nvidia Driver AMI proprietaria di Deep Learning Base (Ubuntu 20.04) 20250117

Aggiornato

Data di rilascio: 09/12/2020

Nomi AMI
  • Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20241206

  • Scheda grafica Nvidia Driver AMI proprietaria di Deep Learning Base (Ubuntu 20.04) 20241206

Aggiornato
  • Nvidia Container Toolkit aggiornato dalla versione 1.17.0 alla 1.17.3

Data di rilascio: 2024-11-22

Nome AMI: Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20241122

Aggiunto
  • È stato aggiunto il supporto per le istanze EC2 P5en.

Aggiornato
  • EFA Installer aggiornato dalla versione 1.35.0 alla 1.37.0

  • Aggiornare il plugin AWS OFI NCCL dalla versione 1.12.1-aws a 1.13.0-aws

Data di rilascio: 26/10/2020

Nomi AMI
  • Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20241025

  • Driver GPU AMI proprietario di Nvidia Base di Deep Learning (Ubuntu 20.04) 20241025

Aggiornato

Data di rilascio: 2024-10-03

Nome AMI: Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240927

Aggiornato
  • Nvidia Container Toolkit aggiornato dalla versione 1.16.1 alla 1.16.2

Data di rilascio: 27/08/2024

Nome AMI: Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240827

Aggiornato
  • Driver Nvidia e Fabric Manager aggiornati dalla versione 535.183.01 alla 550.90.07

  • Versione EFA aggiornata da 1.32.0 a 1.34.0

  • NCCL aggiornato all'ultima versione 2.22.3 per tutte le versioni CUDA

    • CUDA 11.7 aggiornato dalla versione 2.16.2+ CUDA11.7

    • CUDA 12.1, 12.2 aggiornato da 2.18.5+ CUDA12.2

    • CUDA 12.3 aggiornato dalla versione 2.21.5+ CUDA12.4

Aggiunto
  • È stata aggiunta la versione 12.4 del toolkit CUDA nella directory//cuda-12.4 usr/local

  • È stato aggiunto il supporto per l'istanza EC2 P5e.

Rimosso
  • Rimosso lo stack CUDA Toolkit versione 11.8 presente nella directory//cuda-11.8 usr/local

Data di rilascio: 19/08/2020

Nome AMI: Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240816

Aggiunto

Data di rilascio: 2024-06-06

Nomi AMI
  • Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240606

  • Scheda grafica Nvidia Driver AMI proprietaria di Deep Learning Base (Ubuntu 20.04) 20240606

Aggiornato
  • Versione del driver Nvidia aggiornata a 535.183.01 da 535.161.08

Data di rilascio: 15/05/2020

Nomi AMI
  • Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240515

  • Driver GPU AMI proprietario di Nvidia Base per Deep Learning Base (Ubuntu 20.04) 20240515

Aggiunto
  • È stato aggiunto un nuovo CUDA11.7 stack nella directory usr/local /cuda-11.7 con, NCCL 2.16.2, cuDNN 8.7.0 come supporta la versione 1.13 CUDA11.7 PyTorch CUDA11.7

Data di rilascio: 2024-05-02

Nomi AMI
  • Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240502

  • Scheda grafica proprietaria Nvidia Driver AMI (Ubuntu 20.04) 20240502 di Deep Learning Base

Aggiornato
Aggiunto
  • Aggiunto CUDA12.3 stack con CUDA12.3, NCCL 2.21.5, cuDNN 8.9.7

Rimosso
  • Rimossi CUDA11.7, gli stack presenti nelle directory//cuda-11.7 e/ CUDA12.0 /cuda-12.0 usr/local usr/local

  • Rimosso il pacchetto nvidia-docker2 e il relativo comando nvidia-docker come parte dell'aggiornamento del toolkit per container Nvidia da 1.13.5 a 1.15.0 che NON include i pacchetti nvidia-container-runtime e nvidia-docker2. https://github.com/NVIDIA/nvidia-container-toolkit/releases/tag/v1.15.0

Data di rilascio: 2024-04-04

Nomi AMI: Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240404

Aggiunto
  • Per i driver OSS Nvidia DLAMIS, è stato aggiunto il supporto per le istanze EC2 G6 e Gr6. Per ulteriori informazioni, consulta le istanze GPU consigliate. Istanze GPU consigliate

Data di rilascio: 29/03/2020

Nomi AMI
  • Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240326

  • Scheda grafica proprietaria Nvidia Driver AMI (Ubuntu 20.04) 20240326 di Deep Learning Base

Aggiornato
  • Driver Nvidia aggiornato da 535.104.12 a 535.161.08 nei driver DLAMI proprietari e OSS Nvidia.

  • È stato rimosso il supporto per le istanze G4dn, G5 EC2 dal driver proprietario Nvidia DLAMI.

  • Le nuove istanze supportate per ogni DLAMI sono le seguenti:

    • Il deep learning con driver Nvidia proprietario supporta G3 (G3.16x non supportato), P3, P3dn

    • Deep Learning con OSS Il driver Nvidia supporta G4dn, G5, P4d, P4de, P5.

Data di rilascio: 2024-03-20

Nomi AMI
  • Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240318

  • Scheda grafica proprietaria Nvidia Driver AMI (Ubuntu 20.04) 20240318 di Deep Learning Base

Aggiunto
  • Aggiunto awscliv2 nell'AMI su//bin/aws2, insieme ausr/local//aws su Nvidia Driver AMI proprietaria e awscliv1 usr/bin OSS

Data di rilascio: 14/03/2024

Nome AMI: Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240314

Aggiornato
  • Driver OSS Nvidia DLAMI aggiornato con supporto G4dn e G5, in base al supporto attuale, è il seguente:

    • Il driver AMI proprietario di Nvidia (Ubuntu 20.04) di Deep Learning Base supporta P3, P3dn, G3, G5, G4dn.

    • Deep Learning Base OSS Nvidia Driver AMI (Ubuntu 20.04) supporta G5, G4dn, P4, P5.

  • Si consiglia di utilizzare i driver OSS Nvidia DLAMI per G5, G4dn, P4, P5.

Data di rilascio: 2024-02-12

Nomi AMI
  • Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20240208

  • Scheda grafica Nvidia Driver AMI proprietaria di Deep Learning Base (Ubuntu 20.04) 20240208

Aggiornato
  • AWS Il plugin OFI NCCL è aggiornato da 1.7.3 a 1.7.4

Data di rilascio: 2024-02-01

Nomi AMI
  • API GPU con driver Nvidia OSS Deep Learning Base (Ubuntu 20.04) 20240201

  • API GPU con driver Nvidia proprietario di Deep Learning Base (Ubuntu 20.04) 20240201

Sicurezza
  • Versione aggiornata del pacchetto runc per cui utilizzare la patch per. CVE-2024-21626

Data di rilascio: 2023-12-04

Nomi AMI
  • Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) 20231204

  • Scheda grafica Nvidia Driver AMI proprietaria di Deep Learning Base (Ubuntu 20.04) 20231204

Aggiunto
  • AWS Deep Learning AMI (DLAMI) è suddiviso in due gruppi separati:

    • DLAMI che utilizza Nvidia Proprietary Driver (per supportare P3, P3dn, G3, G5, G4dn).

    • DLAMI che utilizza il driver Nvidia OSS per abilitare EFA (per supportare P4, P5).

  • Fai riferimento a Modifiche importanti al DLAMI per ulteriori informazioni sulla divisione DLAMI.

  • AWS CLI le domande di cui sopra sono elencate all'elenco Query AMI-ID with AWSCLI (la regione di esempio è us-east-1)

Aggiornato
  • EFA aggiornato da 1.26.1 a 1.29.0

  • GDRCopy aggiornato da 2.3 a 2.4

Data di rilascio: 2023-10-18

Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20231018

Aggiornato
  • AWS Plugin OFI NCCL aggiornato dalla versione 1.7.2 alla versione 1.7.3

  • Directory CUDA 12.0-12.1 aggiornate con la versione NCCL 2.18.5 in modo che corrispondano a CUDA 12.2

  • CUDA12.1 aggiornata come versione CUDA predefinita

    • LD_LIBRARY_PATH aggiornato con//cuda-12. usr/local 1/targetslinux/lib/x86_64-/:usr/local//cuda-12. 1/libusr/local://cuda-12. 1/lib64:/usr/local/cuda-12.1 e PATH per avere//cuda-12. usr/local 1/bin/

    • Per i clienti che desiderano passare a una versione CUDA diversa, definisci di conseguenza le variabili LD_LIBRARY_PATH e PATH.

Data di rilascio: 2023-10-02

Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20231002

Aggiornato
  • Driver NVIDIA aggiornato da 535.54.03 a 535.104.12

    • Quest'ultimo driver corregge le modifiche sostanziali di NVML ABI rilevate nella versione 535.54.03, nonché la regressione del driver riscontrata nella versione 535.86.10 che interessava i toolkit CUDA sulle istanze P5. Per informazioni dettagliate sulle correzioni, consulta le seguenti note di rilascio di NVIDIA:

    • Per informazioni dettagliate sulle correzioni, consulta le seguenti note di rilascio di NVIDIA:

      • 4235941 - NVML ABI Breaking change fix

      • 4228552 - Correzione degli errori del CUDA Toolkit

  • Directory CUDA 12.2 aggiornate con NCCL 2.18.5

  • EFA aggiornato dalla versione 1.24.1 all'ultima 1.26.1

Aggiunto
  • CUDA12.2 Aggiunto usr/local in //cuda-12.2

Rimosso
  • È stato rimosso il supporto per CUDA 11.5 e CUDA 11.6

Data di rilascio: 26/09/2023

Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230926

Aggiunto
  • Sono state aggiunte modifiche a net.naming-scheme per risolvere un problema imprevedibile di denominazione delle interfacce di rete (link) riscontrato su P5. https://bugs.launchpad.net/ubuntu/+source/systemd/+bug/1945225 Questa modifica viene effettuata impostando net.naming-scheme=v247 negli argomenti di avvio di linux nel file//grub etc/default

Data di rilascio: 30/08/2023

Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230830

Aggiornato
  • Plugin aggiornato aws-ofi-nccl dalla v1.7.1 alla v1.7.2

Data di rilascio: 2023-08-11

Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230811

Aggiunto
  • Questa AMI ora fornisce supporto per la funzionalità di Multi-node training su P5 e su tutte le istanze EC2 supportate in precedenza.

  • Per l'istanza P5 EC2, si consiglia di utilizzare NCCL 2.18 ed è stato aggiunto a, e. CUDA12.0 CUDA12.1

Rimosso
  • È stato rimosso il supporto per e. CUDA11.3 CUDA11.4

Data di rilascio: 2023-08-04

Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230804

Aggiornato
  • Plugin OFI NCCL aggiornato AWS alla v1.7.1

  • Impostato CUDA11.8 come predefinito in quanto PyTorch 2.0 supporta la versione 11.8 e per l'istanza P5 EC2, si consiglia di utilizzare >= CUDA11.8

    • LD_LIBRARY_PATH aggiornato con//cuda-11. usr/local 8/targetslinux/lib/x86_64-/:usr/local//cuda-11. 8/libusr/local://cuda-11. 8/lib64:/usr/local/cuda-11.8 e PATH per avere//cuda-11. usr/local 8/bin/

    • Per qualsiasi versione di cuda diversa, definisci LD_LIBRARY_PATH di conseguenza.

  • Directory CUDA 12.0, 12.1 aggiornate con NCCL 2.18.3

Fixed
  • Risolto il problema di caricamento dei pacchetti Nvidia Fabric Manager (FM) menzionato nella precedente data di rilascio 2023-07-19.

Data di rilascio: 19/07/2023

Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230719

Aggiornato
  • EFA aggiornato da 1.22.1 a 1.24.1

  • Driver Nvidia aggiornato da 525.85.12 a 535.54.03

Aggiunto
  • Sono state aggiunte modifiche allo stato c per disabilitare lo stato inattivo del processore impostando lo stato c massimo su C1. Questa modifica viene effettuata impostando `intel_idle.max_cstate=1 processor.max_cstate=1` negli argomenti di avvio di linux nel file//grub etc/default

  • AWS Supporto per le istanze EC2 P5:

    • È stato aggiunto il supporto per le istanze EC2 P5 per i flussi di lavoro che utilizzano single. node/instance Multi-node il supporto (ad esempio per la formazione su più nodi) tramite EFA (Elastic Fabric Adapter) e il plug-in AWS OFI NCCL verrà aggiunto in una prossima versione.

    • Si prega di utilizzare CUDA>=11.8 per prestazioni ottimali.

    • Problema noto: il caricamento del pacchetto Nvidia Fabric Manager (FM) richiede tempo su P5, i clienti devono attendere 2-3 minuti prima che FM si carichi dopo aver avviato l'istanza P5. Per verificare se FM è avviato, esegui il comando sudo systemctl is-active nvidia-fabricmanager, dovrebbe tornare attivo prima di iniziare qualsiasi flusso di lavoro. Questo sarà migliorato nella prossima versione.

Data di rilascio: 19/05/2023

Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230519

Aggiornato
  • EFA aggiornato all'ultima versione 1.22.1

  • Versione NCCL aggiornata per CUDA 12.1 a 2.17.1

Aggiunto
  • CUDA12.1 Aggiunto inusr/local//cuda-12.1

  • È stato aggiunto il supporto per NVIDIA Data Center GPU Monitor (DCGM) tramite il pacchetto datacenter-gpu-manager

    • È possibile verificare lo stato di questo servizio tramite la seguente query: sudo systemctl status nvidia-dcgm

  • Gli store temporanei di istanze NVMe vengono ora montati automaticamente sulle istanze EC2 supportate ed è possibile accedere allo storage nella cartella//nvme/. opt/dlami È possibile controllare o modificare questo servizio nei seguenti modi:

    • Verifica lo stato del servizio NVMe: sudo systemctl status dlami-nvme

    • Per accedere o modificare il servizio: /opt/aws/dlami/bin/nvme_ephemeral_drives.sh

  • I volumi NVMe hanno fornito le soluzioni di storage più veloci ed efficienti per flussi di lavoro ad alto rendimento che richiedono prestazioni IOPS. Gli store di istanze NVMe effimeri sono inclusi nel costo delle istanze, quindi questo servizio non comporta costi aggiuntivi.

  • Gli archivi di istanze NVMe verranno montati solo sulle istanze EC2 che li supportano. Per informazioni sulle istanze EC2 con archivi di istanze supportati da NVMe, consulta Volumi di archiviazione di istanze disponibili e verifica che NVMe sia supportato.

  • Per migliorare le prestazioni del disco e ridurre le penalità per la prima scrittura, puoi inizializzare gli archivi di istanze (nota, questo processo può richiedere ore a seconda del tipo di istanza EC2) - Inizializza i volumi degli archivi di istanza sulle istanze EC2 https://docs.aws.amazon.com/AWSEC2/latest/UserGuide/disk-performance.html

  • NOTA: gli store di istanze NVMe sono montati sull'istanza e non sono collegati alla rete come EBS. I dati su questi volumi NVMe potrebbero andare persi al riavvio o all'arresto dell'istanza.

Data di rilascio: 17/04/2023

Nome AMI: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230414

Aggiornato
  • Nome DLAMI aggiornato da AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) $ {YYYY-MM-DD} a Deep Learning Base GPU AMI (Ubuntu 20.04) $ {} YYYY-MM-DD

    • Tieni presente che supporteremo il DLAMI più recente con il vecchio nome AMI per un mese a partire da questa versione per qualsiasi supporto necessario. I clienti possono aggiornare i pacchetti del sistema operativo apt-get update && apt-get upgrade per utilizzare le patch di sicurezza.

  • Percorso del plug-in OFI NCCL aggiornato AWS da a /usr/local/cuda-xx.x/efa/ /opt/aws-ofi-nccl/

  • NCCL aggiornato a un ramo GIT personalizzato della v2.16.2, creato in collaborazione con il team NCCL per tutte le versioni CUDA. AWS AWS Funziona meglio sull'infrastruttura.

Aggiunto
  • Aggiunto CUDA12.0 in/usr/local/cuda-12.0

  • AWS Aggiunto FSx

  • È stato aggiunto il supporto per la versione 3.9 di Python in//python3.9 usr/bin

    • Nota che questa modifica non sostituisce il sistema predefinito Python, python3 punterà comunque al sistema. Python3.8

    • Python3.9 è possibile accedervi utilizzando i seguenti comandi:

      /usr/bin/python3.9 python3.9
Rimosso
  • Rimossi CUDA11.0-11.1 da/usr/local/cuda-11.x/ in quanto non vengono utilizzati da nessuna versione del framework supportata in base alla politica di supporto del framework. Politica di supporto DLAMI

Data di rilascio: 25/05/2022

Nome AMI: AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) 20220523

Aggiornato
  • Questa versione aggiunge il supporto per la nuova istanza EC2 p4de.24xlarge.

    • Aggiornato aws-efa-installer alla versione 1.15.2

    • Aggiornato aws-ofi-nccl alla versione 1.3.0-aws che include la topologia per p4de.24xlarge.

Data di rilascio: 25/03/2022

Nome AMI: AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) 20220325

Aggiornato
  • Versione EFA aggiornata da 1.15.0 a 1.15.1

Data di rilascio: 17/03/2022

Nome AMI: AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) 20220323

Aggiunto
  • Primo rilascio