Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
AWS AMI-GPU PyTorch 2.4 für tiefes Lernen (Ubuntu 22.04)
Hilfe zu den ersten Schritten finden Sie unterErste Schritte mit DLAMI.
AMI-Namensformat
-
Deep-Learning-OSS-Nvidia-Treiber AMI GPU PyTorch 2.4. $ {PATCH_VERSION} (Ubuntu 22.04) $ {} YYYY-MM-DD
Unterstützte EC2-Instances
-
Weitere Informationen finden Sie unter Wichtige Änderungen an DLAMI.
-
Deep Learning mit dem OSS Nvidia-Treiber unterstützt G4dn, G5, G6, Gr6, P4, P4de, P5, P5e, P5en.
Das AMI beinhaltet Folgendes:
-
Unterstützter AWS Dienst: EC2
-
Betriebssystem: Ubuntu 22.04
-
Compute-Architektur: x86
-
Python:/opt/conda/envs/pytorchbin/python
-
NVIDIA-Treiber:
-
OSS Nvidia-Treiber: 550.144.03
-
-
CUDA12.1 NVIDIA-Stapel:
-
CUDA-, NCCL- und cuDDN-Installationspfad://cuda-12.4/ usr/local
-
Standard-CUDA: 12.4
-
usr/localPATH/usr/local/cuda zeigt auf//cuda-12.4/
-
Die folgenden Umgebungsvariablen wurden aktualisiert:
-
LD_LIBRARY_PATH soll//://cuda/lib:/usr/local/cuda:/ /x86_64- haben usr/local cuda/lib64 usr/local usr/local cuda/targets linux/lib
-
PATH, umusr/local/cuda/bin//usr/localzu haben:///cuda/include
-
-
-
Die kompilierte NCCL-Version des Systems befindet sich unter/usr/local/cuda/: 2.21.5
-
PyTorch Kompilierte NCCL-Version aus der Conda-Umgebung: 2.20.5 PyTorch
-
-
Ort der NCCL-Tests:
-
all_reduce, all_gather und reduce_scatter://cuda-xx. usr/local x/efa/test-cuda-xx.x/
-
Um NCCL-Tests ausführen zu können, wurde LD_LIBRARY_PATH bereits mit den benötigten Pfaden aktualisiert.
-
Allgemeine PATHs wurden bereits zu LD_LIBRARY_PATH hinzugefügt:
-
/opt/amazon/efa/lib:/opt/amazon/openmpi/lib:/opt/aws-ofi-nccl/lib:/usr/local/lib:/usr/lib
-
-
-
LD_LIBRARY_PATH wurde mit CUDA-Versionspfaden aktualisiert
-
//://:/usr/localcuda/lib/cuda://usr/local/x86_64- cuda/lib64 usr/local usr/local cud/targets linux/lib
-
-
-
EFA-Installationsprogramm: 1.34.0
-
Nvidia GDRCopy: 2.4.1
-
Nvidia-Transformer-Motor: v1.11.0
-
AWS OFI NCCL-Plugin: wird als Teil des installiert
EFA Installer-aws-
Installationspfad:.
/opt/aws-ofi-nccl/Der Pfad/opt/aws-ofi-nccl/libwird zu LD_LIBRARY_PATH hinzugefügt. -
Testet den Pfad für den Ring, message_transfer:
/opt/aws-ofi-nccl/tests -
Hinweis: Das PyTorch Paket enthält auch das dynamisch verknüpfte AWS OFI-NCCL-Plugin als Conda-Paketpaket und PyTorch verwendet dieses
aws-ofi-nccl-dlcPaket anstelle von System-OFI-NCCL. AWS
-
-
AWS CLI v2 als und v1 als
aws2AWS CLIaws -
EBS-Datenträgertyp: gp3
-
Python-Version: 3.11
-
Abfrage AMI-ID mit SSM-Parameter (Beispielregion ist us-east-1):
-
OSS Nvidia-Treiber:
aws ssm get-parameter --regionus-east-1\ --name /aws/service/deeplearning/ami/x86_64/oss-nvidia-driver-gpu-pytorch-2.4-ubuntu-22.04/latest/ami-id \ --query "Parameter.Value" \ --output text
-
-
Abfrage AMI-ID mit AWSCLI (Beispielregion ist us-east-1):
-
OSS Nvidia-Treiber:
aws ec2 describe-images --regionus-east-1\ --owners amazon \ --filters 'Name=name,Values=Deep Learning OSS Nvidia Driver AMI GPU PyTorch 2.4.? (Ubuntu 22.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output text
-
Hinweise
P5/P5e Instanzen
-
DeviceIndex ist für jede Einheit einzigartig und muss eine nichtnegative Ganzzahl sein NetworkCard, die unter dem Grenzwert von ENIs pro liegt. NetworkCard Bei P5 ist die Anzahl der ENIs pro NetworkCard 2, was bedeutet, dass die einzig gültigen Werte für 0 oder 1 DeviceIndex sind. Unten sehen Sie ein Beispiel für den Befehl zum Starten der EC2 P5-Instance unter Verwendung von awscli, wobei die Zahlen 0 NetworkCardIndex bis 31 und 0 für die ersten Schnittstellen und DeviceIndex DeviceIndex 1 für die restlichen 31 Schnittstellen angezeigt werden.
aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=31,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
Veröffentlichungsdatum: 17.02.2025
AMI-Name: Deep Learning OSS Nvidia-Treiber AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20250216
Aktualisiert
-
Das NVIDIA Container Toolkit wurde von Version 1.17.3 auf Version 1.17.4 aktualisiert
-
Weitere Informationen finden Sie auf der Seite mit den Versionshinweisen hier: https://github.com/NVIDIA/nvidia-container-toolkit/releases/tag/v1.17.4
-
In der Container Toolkit-Version 1.17.4 ist das Mounten von CUDA-kompatiblen Bibliotheken jetzt deaktiviert. Um die Kompatibilität mit mehreren CUDA-Versionen in Container-Workflows sicherzustellen, stellen Sie bitte sicher, dass Sie Ihren LD_LIBRARY_PATH so aktualisieren, dass er Ihre CUDA-Kompatibilitätsbibliotheken enthält, wie im Tutorial Wenn Sie eine CUDA-Kompatibilitätsschicht verwenden gezeigt. https://docs.aws.amazon.com/sagemaker/latest/dg/inference-gpu-drivers.html#collapsible-cuda-compat
-
Veröffentlichungsdatum: 2025-01-21
AMI-Name: Deep Learning OSS Nvidia-Treiber AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20250119
Aktualisiert
-
Der Nvidia-Treiber wurde von Version 550.127.05 auf 550.144.03 aktualisiert, um den Problemen von CVE im NVIDIA GPU Display Driver Security Bulletin für Januar 2025 Rechnung zu tragen. https://nvidia.custhelp.com/app/answers/detail/a_id/5614
Veröffentlichungsdatum: 18.11.2021
AMI-Name: Deep Learning OSS Nvidia-Treiber AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20241116
Fixed
-
Aufgrund einer Änderung im Ubuntu-Kernel zur Behebung eines Fehlers in der KASLR-Funktionalität (Kernel Address Space Layout Randomization) können G4Dn/G5 Instances CUDA auf dem OSS Nvidia-Treiber nicht ordnungsgemäß initialisieren. Um dieses Problem zu beheben, enthält dieses DLAMI Funktionen, die den proprietären Treiber für G4Dn- und G5-Instances dynamisch laden. Bitte planen Sie für dieses Laden eine kurze Initialisierungszeit ein, um sicherzustellen, dass Ihre Instances ordnungsgemäß funktionieren.
-
Um den Status und den Zustand dieses Dienstes zu überprüfen, können Sie die folgenden Befehle verwenden:
-
sudo systemctl is-active dynamic_driver_load.serviceactive
Datum der Veröffentlichung: 2024-10-16
AMI-Name: Deep Learning OSS Nvidia-Treiber AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20241016
Hinzugefügt
-
Nvidia TransformerEngine v1.11.0 zur Beschleunigung von Transformer-Modellen hinzugefügt (Weitere Informationen finden Sie unter) https://docs.nvidia.com/deeplearning/transformer-engine/user-guide/index.html
Veröffentlichungsdatum: 2024-09-30
AMI-Name: Deep Learning OSS Nvidia-Treiber AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20240929
Aktualisiert
-
Das Nvidia Container Toolkit wurde von Version 1.16.1 auf 1.16.2 aktualisiert, um die Sicherheitslücke zu beheben. CVE-2024-0133
Veröffentlichungsdatum: 2024-09-26
AMI-Name: Deep Learning OSS Nvidia-Treiber AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) 20240925
Hinzugefügt
-
Erste Veröffentlichung der Deep Learning AMI GPU PyTorch 2.4.1 (Ubuntu 22.04) -Serie. Einschließlich eines Pytorch für die Conda-Umgebung, ergänzt durch den NVIDIA-Treiber R550, CUDA=12.4.1, cuDNN=8.9.7, NCCL=2.20.5 und EFA=1.34.0. PyTorch