

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

# AWS GPU AMI PyTorch 2.4 con apprendimento approfondito (Ubuntu 22.04)
<a name="aws-deep-learning-ami-gpu-pytorch-2.4-ubuntu-22-04"></a>

Per assistenza su come iniziare, consulta. [Guida introduttiva a DLAMI](getting-started.md)

#### Formato del nome AMI
<a name="name-gpu-pytorch-2.4-ubuntu-22-04"></a>
+ GPU AMI con driver Nvidia OSS con apprendimento approfondito 2.4 PyTorch . $ {PATCH\_VERSION} (Ubuntu 22.04) $ {} YYYY-MM-DD

#### Istanze EC2 supportate
<a name="instances-gpu-pytorch-2.4-ubuntu-22-04"></a>
+ Fai riferimento a Modifiche [ importanti a DLAMI. ](important-changes.md)
+ Deep Learning con OSS Il driver Nvidia supporta G4dn, G5, G6, Gr6, P4, P4de, P5, P5e, P5en.

#### L'AMI include quanto segue:
<a name="contents-gpu-pytorch-2.4-ubuntu-22-04"></a>
+ ** AWS Servizio supportato**: EC2
+ **Sistema operativo**: Ubuntu 22.04
+ **Architettura ** di calcolo: x86
+ **Python**:///opt/condaenvs/pytorchbin/python
+ **Driver NVIDIA: **
  + Driver Nvidia OSS: 550.144.03
+ ** CUDA12.1 Stack ** NVIDIA:
  + Percorso di installazione di CUDA, NCCL e cuDDN://cuda-12.4/ usr/local
  + **CUDA predefinito:** 12.4
    + usr/localPATH/usr/local/cuda punta a//cuda-12.4/
    + Aggiornato di seguito env vars:
      +  LD\_LIBRARY\_PATH deve avere//:/cuda/lib://cuda:/usr/local//x86\_64- usr/local cuda/lib64 usr/local usr/local cuda/targets linux/lib
      + PERCORSO da avere usr/local/cuda/bin/:/usr/local/cuda/include/
  + Versione NCCL del sistema compilato presente inusr/local//cuda/: 2.21.5
  + PyTorch Versione NCCL compilata dall'ambiente conda: 2.20.5 PyTorch 
+  **Posizione dei test NCCL: ** 
  + all\_reduce, all\_gather e reduce\_scatter://cuda-xx. usr/local x/efa/test-cuda-xx.x/
  + Per eseguire i test NCCL, LD\_LIBRARY\_PATH è già aggiornato con i percorsi necessari.
    + I PERCORSI comuni sono già stati aggiunti a LD\_LIBRARY\_PATH:
      +  `/opt/amazon/efa/lib:/opt/amazon/openmpi/lib:/opt/aws-ofi-nccl/lib:/usr/local/lib:/usr/lib`
  + LD\_LIBRARY\_PATH viene aggiornato con i percorsi di versione CUDA
    +  //://:/usr/localcuda/lib/cuda://usr/local/x86\_64- cuda/lib64 usr/local usr/local cud/targets linux/lib
+ **Programma di installazione EFA**: 1.34.0
+ **Nvidia ** GDRCopy: 2.4.1
+ **Motore Nvidia Transformer: v1.11.0 **
+ **AWS Plugin OFI NCCL: è installato come parte del ** `EFA Installer-aws`
  + **Percorso di installazione:. ** `/opt/aws-ofi-nccl/` `/opt/aws-ofi-nccl/lib`Il percorso viene aggiunto a LD\_LIBRARY\_PATH.
  + **Verifica il percorso ** per ring, message\_transfer: `/opt/aws-ofi-nccl/tests`
  + Nota: il PyTorch pacchetto include il plug-in AWS OFI NCCL collegato dinamicamente anche come pacchetto conda e PyTorch utilizzerà quel `aws-ofi-nccl-dlc` pacchetto al posto del sistema OFI NCCL. AWS 
+ **AWS CLI v2 as e v1 as ** `aws2` **AWS CLI ** `aws`
+ **Tipo di volume EBS: gp3 **
+ **Versione Python: 3.11 **
+  **Interrogazione AMI-ID con parametro SSM (la regione di esempio è us-east-1): ** 
  +  **Driver Nvidia OSS: ** 

    ```
    aws ssm get-parameter --region {{us-east-1}} \
            --name /aws/service/deeplearning/ami/x86_64/oss-nvidia-driver-gpu-pytorch-2.4-ubuntu-22.04/latest/ami-id \
            --query "Parameter.Value" \
            --output text
    ```
+  **Interrogazione AMI-ID con AWSCLI (la regione di esempio è us-east-1): ** 
  +  **Driver Nvidia OSS: ** 

    ```
    aws ec2 describe-images --region {{us-east-1}} \
        --owners amazon \
        --filters 'Name=name,Values=Deep Learning OSS Nvidia Driver AMI GPU PyTorch 2.4.? (Ubuntu 22.04) ????????' 'Name=state,Values=available' \
        --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \
        --output text
    ```

#### Note
<a name="notices-gpu-pytorch-2.4-ubuntu-22-04"></a>

**P5/P5e istanze**
+ DeviceIndex è univoco per ciascuna NetworkCard e deve essere un numero intero non negativo inferiore al limite di ENI per. NetworkCard In P5, il numero di ENI per NetworkCard è 2, il che significa che gli unici valori validi per DeviceIndex sono 0 o 1. Di seguito è riportato l'esempio del comando di avvio dell'istanza EC2 P5 che utilizza awscli visualizzato NetworkCardIndex dal numero 0-31 e DeviceIndex come 0 per la prima interfaccia e come 1 per le altre 31 interfacce. DeviceIndex 

```
aws ec2 run-instances --region $REGION \
    --instance-type $INSTANCETYPE \
    --image-id $AMI --key-name $KEYNAME \
    --iam-instance-profile "Name=dlami-builder" \
    --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \
    --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \
      "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \
      "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \
      "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \
      "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \
      ...
      "NetworkCardIndex=31,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
```

#### Data di rilascio: 17/02/2020
<a name="2025-02-17-gpu-pytorch-2.4-ubuntu-22-04"></a>

**Nome AMI: ** Deep Learning OSS Nvidia Driver AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20250216

##### Aggiornato
<a name="w2aac25c15c11c35c13b5"></a>
+ NVIDIA Container Toolkit aggiornato dalla versione 1.17.3 alla versione 1.17.4
  + Per ulteriori informazioni, consulta la pagina delle note di rilascio qui: [ https://github.com/NVIDIA/nvidia-container-toolkit/releases/tag/v1.17.4 ](https://github.com/NVIDIA/nvidia-container-toolkit/releases/tag/v1.17.4)
  + Nella versione 1.17.4 di Container Toolkit, il montaggio delle librerie compat CUDA è ora disabilitato. Per garantire la compatibilità con più versioni CUDA sui flussi di lavoro dei contenitori, assicurati di aggiornare LD\_LIBRARY\_PATH per includere le librerie di compatibilità CUDA, come mostrato nel tutorial If you use a CUDA compatibility layer. [https://docs.aws.amazon.com/sagemaker/latest/dg/inference-gpu-drivers.html#collapsible-cuda-compat](https://docs.aws.amazon.com/sagemaker/latest/dg/inference-gpu-drivers.html#collapsible-cuda-compat)

#### Data di rilascio: 21-01-2025
<a name="2025-01-21-gpu-pytorch-2.4-ubuntu-22-04"></a>

**Nome AMI: ** Deep Learning OSS Nvidia Driver AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20250119

##### Aggiornato
<a name="w2aac25c15c11c35c15b5"></a>
+ Driver Nvidia aggiornato dalla versione 550.127.05 alla 550.144.03 per risolvere i problemi CVE presenti nel NVIDIA GPU Display Driver Security Bulletin di gennaio 2025. [https://nvidia.custhelp.com/app/answers/detail/a_id/5614](https://nvidia.custhelp.com/app/answers/detail/a_id/5614)

#### Data di rilascio: 18/11/2020
<a name="2024-11-18-gpu-pytorch-2.4-ubuntu-22-04"></a>

**Nome AMI: ** Deep Learning OSS Nvidia Driver AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20241116

##### Fixed
<a name="w2aac25c15c11c35c17b5"></a>
+ A causa di una modifica nel kernel di Ubuntu per risolvere un difetto nella funzionalità Kernel Address Space Layout Randomization (KASLR), le G4Dn/G5 istanze non sono in grado di inizializzare correttamente CUDA sul driver OSS Nvidia. Per mitigare questo problema, questo DLAMI include funzionalità che caricano dinamicamente il driver proprietario per le istanze G4Dn e G5. Attendi un breve periodo di inizializzazione per questo caricamento per assicurarti che le tue istanze siano in grado di funzionare correttamente.
  + Per verificare lo stato e l'integrità di questo servizio, puoi utilizzare i seguenti comandi:

```
sudo systemctl is-active dynamic_driver_load.service active
```

#### Data di rilascio: 16-10-2020
<a name="2024-10-16-gpu-pytorch-2.4-ubuntu-22-04"></a>

**Nome AMI**: Deep Learning OSS Nvidia Driver AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20241016

##### Aggiunto
<a name="w2aac25c15c11c35c19b5"></a>
+ Aggiunta Nvidia TransformerEngine v1.11.0 per accelerare i modelli Transformer (per maggiori dettagli, fare riferimento a) [ https://docs.nvidia.com/deeplearning/transformer-engine/user-guide/index.html ](https://docs.nvidia.com/deeplearning/transformer-engine/user-guide/index.html)

#### Data di rilascio: 30/09/2020
<a name="2024-09-30-gpu-pytorch-2.4-ubuntu-22-04"></a>

**Nome AMI**: Deep Learning OSS Nvidia Driver AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20240929

##### Aggiornato
<a name="w2aac25c15c11c35c21b5"></a>
+ Nvidia Container Toolkit è stato aggiornato dalla versione 1.16.1 alla 1.16.2, risolvendo la vulnerabilità di sicurezza. [ CVE-2024-0133 ](https://nvd.nist.gov/vuln/detail/CVE-2024-0133)

#### Data di rilascio: 26/09/2024
<a name="2024-09-26-gpu-pytorch-2.4-ubuntu-22-04"></a>

**Nome AMI**: Deep Learning OSS Nvidia Driver AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20240925

##### Aggiunto
<a name="w2aac25c15c11c35c23b5"></a>
+ Versione iniziale della serie Deep Learning AMI PyTorch GPU 2.4.1 (Ubuntu 22.04). Include un pytorch in ambiente conda integrato con NVIDIA Driver R550, CUDA=12.4.1, cuDNN=8.9.7, NCCL=2.20.5 ed EFA=1.34.0. PyTorch 