Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
AWS Deep Learning-Basis-GPU-AMI (Ubuntu 20.04)
Hinweis, dass der Support nicht mehr verfügbar ist
Ubuntu Linux 20.04 LTS erreicht am 31. Mai 2025 das Ende seines fünfjährigen LTS-Fensters und wird von seinem Anbieter nicht mehr unterstützt. Folglich wird es für das AWS Deep Learning Base GPU AMI (Ubuntu 20.04) nach dem 31. Mai 2025 keine Updates mehr geben. Frühere Versionen werden weiterhin verfügbar sein. Bitte beachten Sie, dass jedes öffentlich veröffentlichte AMI 2 Jahre nach seinem Erstellungsdatum von EC2 als veraltet eingestuft wird. Weitere Informationen finden Sie unter Ablehnen eines Amazon EC2-AMI.
Drei Monate lang, bis zum 31. August 2025, wird Support nur für Funktionsprobleme (keine Sicherheitspatches) bereitgestellt.
Benutzer von Ubuntu 20.04 DLAMI sollten auf AWS Deep Learning Base GPU AMI (Ubuntu 22.04)
oder AWS Deep Learning Base GPU AMI (Ubuntu 24.04) umsteigen. Alternativ kann AWS Deep Learning Base AMI (Amazon Linux 2023) verwendet werden.
Hilfe zu den ersten Schritten finden Sie unterErste Schritte mit DLAMI.
AMI-Namensformat
Nvidia-Treiber-GPU-AMI für Deep Learning-Basis für OSS (Ubuntu 20.04) $ {} YYYY-MM-DD
Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) $ {} YYYY-MM-DD
Unterstützte EC2-Instances
Weitere Informationen finden Sie unter Wichtige Änderungen an DLAMI.
Deep Learning mit dem OSS Nvidia-Treiber unterstützt G4dn, G5, G6, Gr6, G6e, P4d, P4de, P5, P5e, P5en
Deep Learning mit dem proprietären Nvidia-Treiber unterstützt G3 (nicht unterstützt), P3, P3dn G3.16x
Das AMI beinhaltet Folgendes:
Unterstützter AWS Dienst: Amazon EC2
Betriebssystem: Ubuntu 20.04
Compute-Architektur: x86
Die neueste verfügbare Version ist für die folgenden Pakete installiert:
Linux-Kernel 5.15
FSx Luster
Docker
AWS CLI v2 unterusr/local/bin/aws2 und AWS CLI v1 unter /aws usr/bin
NVIDIA DCGM
Nvidia-Container-Toolkit:
Versionsbefehl: nvidia-container-cli -V
Nvidia-docker2:
Versionsbefehl: nvidia-Docker-Version
NVIDIA-Treiber:
OSS-Nvidia-Treiber: 550.163.01
Proprietärer Nvidia-Treiber: 550.163.01
NVIDIA CUDA 11.7, 12.1-12.4-Stapel:
CUDA-, NCCL- und cuDDN-Installationsverzeichnisse://cuda-xx.x/ usr/local
Beispiel://cuda-12.1/ usr/local
Kompilierte NCCL-Version: 2.22.3+ CUDA12.4
Standard-CUDA: 12.1
PATH/usr/local/cuda zeigt auf CUDA 12.1
Die folgenden Umgebungsvariablen wurden aktualisiert:
LD_LIBRARY_PATH hat nun//cuda-12. usr/local 1/lib:/usr/local/cuda-12. 1/lib64://cuda-12.1:/ /cuda-12. usr/local usr/local 1/targets/x86_64- linux/lib
PFAD, um//cuda-12. zu haben. usr/local 1/bin/://cuda-12. usr/local 1/include/
Für jede andere CUDA-Version aktualisieren Sie bitte LD_LIBRARY_PATH entsprechend.
Ort der NCCL-Tests:
all_reduce, all_gather und reduce_scatter://cuda-xx. usr/local x/efa/test-cuda-xx.x/
Um NCCL-Tests ausführen zu können, muss LD_LIBRARY_PATH die folgenden Aktualisierungen bestanden haben.
Allgemeine PATHs wurden bereits zu LD_LIBRARY_PATH hinzugefügt:
/opt/amazon/efa/lib:/opt/amazon/openmpi/lib:/opt/aws-ofi-nccl/lib:/usr/local/lib:/usr/lib
Für jede andere CUDA-Version aktualisieren Sie bitte LD_LIBRARY_PATH entsprechend.
EFA-Installationsprogramm: 1.39.0
Nvidia GDRCopy: 2.4
AWS OFI NCCL-Plugin: wird als Teil des installiert
EFA Installer-awsAWS OFI NCCL unterstützt jetzt mehrere NCCL-Versionen mit einem einzigen Build
/opt/aws-ofi-nccl/Installationspfad:. Der Pfad/opt/aws-ofi-nccl/libwird zu LD_LIBRARY_PATH hinzugefügt.Testet den Pfad für den Ring, message_transfer:
/opt/aws-ofi-nccl/tests
EBS-Datenträgertyp: gp3
Python://python3.9 usr/bin
Speicherort der NVMe-Instance (auf unterstützten EC2-Instances)://nvme opt/dlami
Abfrage AMI-ID mit SSM-Parameter (Beispielregion ist us-east-1):
OSS Nvidia-Treiber:
aws ssm get-parameter --regionus-east-1\ --name /aws/service/deeplearning/ami/x86_64/base-oss-nvidia-driver-gpu-ubuntu-20.04/latest/ami-id \ --query "Parameter.Value" \ --output textEigener Nvidia-Treiber:
aws ssm get-parameter --regionus-east-1\ --name /aws/service/deeplearning/ami/x86_64/base-proprietary-nvidia-driver-gpu-ubuntu-20.04/latest/ami-id \ --query "Parameter.Value" \ --output text
Abfrage AMI-ID mit AWSCLI (Beispielregion ist us-east-1):
OSS Nvidia-Treiber:
aws ec2 describe-images --regionus-east-1\ --owners amazon \ --filters 'Name=name,Values=Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output textEigener Nvidia-Treiber:
aws ec2 describe-images --regionus-east-1\ --owners amazon \ --filters 'Name=name,Values=Deep Learning Base Proprietary Nvidia Driver GPU AMI (Ubuntu 20.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output text
Hinweise
NVIDIA Container-Toolkit 1.17.4
In der Container Toolkit-Version 1.17.4 ist das Mounten von CUDA-kompatiblen Bibliotheken jetzt deaktiviert. Um die Kompatibilität mit mehreren CUDA-Versionen in Container-Workflows sicherzustellen, stellen Sie bitte sicher, dass Sie Ihren LD_LIBRARY_PATH so aktualisieren, dass er Ihre CUDA-Kompatibilitätsbibliotheken enthält, wie im Tutorial Wenn Sie eine CUDA-Kompatibilitätsschicht verwenden gezeigt. https://docs.aws.amazon.com/sagemaker/latest/dg/inference-gpu-drivers.html#collapsible-cuda-compat
EFA-Updates von 1.37 auf 1.38 (Veröffentlichung am 04.02.2025)
EFA bündelt jetzt das AWS OFI NCCL-Plugin, das jetzt nicht mehr im Original, sondern im Original zu finden ist. /opt/amazon/ofi-nccl /opt/aws-ofi-nccl/ Wenn Sie Ihre LD_LIBRARY_PATH-Variable aktualisieren, stellen Sie bitte sicher, dass Sie Ihren OFI-NCCL-Standort korrekt ändern.
Richtlinie zur Unterstützung
Komponenten dieses AMI, wie CUDA-Versionen, können aufgrund von Framework-Supportrichtlinien oder zur Leistungsoptimierung für Deep-Learning-Container
EC2-Instances mit mehreren Netzwerkkarten
Viele Instance-Typen, die EFA unterstützen, verfügen auch über mehrere Netzwerkkarten.
DeviceIndex ist für jede Netzwerkkarte eindeutig und muss eine nicht negative Ganzzahl sein, die unter dem Grenzwert der ENIs pro liegt. NetworkCard Auf P5 ist die Anzahl der ENIs pro NetworkCard Einheit 2, was bedeutet, dass die einzig gültigen Werte für 0 oder 1 DeviceIndex sind.
Erstellen Sie für die primäre Netzwerkschnittstelle (Netzwerkkartenindex 0, Geräteindex 0) eine EFA-Schnittstelle (EFA mit ENA). Sie können keine EFA-only Netzwerkschnittstelle als primäre Netzwerkschnittstelle verwenden.
Verwenden Sie für jede weitere Netzwerkschnittstelle den nächsten unbenutzten Netzwerkkartenindex, Geräteindex 1 und entweder eine EFA (EFA mit ENA) oder eine EFA-only Netzwerkschnittstelle, abhängig von Ihrem Anwendungsfall, z. B. den ENA-Bandbreitenanforderungen oder dem IP-Adressraum. Beispiele für Anwendungsfälle finden Sie unter EFA-Konfiguration für eine P5-Instance.
Weitere Informationen finden Sie im EFA-Leitfaden hier. https://docs.aws.amazon.com/AWSEC2/latest/UserGuide/efa-acc-inst-types.html
P5/P5e Instanzen
P5- und P5e-Instances enthalten 32 Netzwerkschnittstellenkarten und können mit dem folgenden Befehl gestartet werden: AWS CLI
aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=31,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
P5en-Instanzen
P5en enthalten 16 Netzwerkschnittstellenkarten und können mit dem folgenden Befehl gestartet werden: AWS CLI
aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=15,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
Kernel
Die Kernel-Version wird mit dem folgenden Befehl angeheftet:
echo linux-aws hold | sudo dpkg —set-selections echo linux-headers-aws hold | sudo dpkg —set-selections echo linux-image-aws hold | sudo dpkg —set-selectionsWir empfehlen Benutzern, ihre Kernelversion nicht zu aktualisieren (es sei denn, es liegt ein Sicherheitspatch vor), um die Kompatibilität mit den installierten Treibern und Paketversionen sicherzustellen. Wenn Benutzer dennoch ein Update durchführen möchten, können sie die folgenden Befehle ausführen, um ihre Kernelversionen zu entpinnen:
echo linux-aws install | sudo dpkg -set-selections echo linux-headers-aws install | sudo dpkg -set-selections echo linux-image-aws install | sudo dpkg -set-selectionsFür jede neue Version von DLAMI wird der neueste verfügbare kompatible Kernel verwendet.
Datum der Veröffentlichung: 2025-04-24
AMI-Namen
Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20250424
Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20250424
Aktualisiert
Der Nvidia-Treiber wurde von Version 550.144.03 auf 550.163.01 aktualisiert, um CVEs zu beheben, die im NVIDIA GPU Display Driver Security Bulletin für April 2025 enthalten sind https://nvidia.custhelp.com/app/answers/detail/a_id/5630
Veröffentlichungsdatum: 2025-02-17
AMI-Namen
Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20250214
Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20250214
Aktualisiert
Das NVIDIA Container Toolkit wurde von Version 1.17.3 auf Version 1.17.4 aktualisiert
Weitere Informationen finden Sie auf der Seite mit den Versionshinweisen hier: https://github.com/NVIDIA/nvidia-container-toolkit/releases/tag/v1.17.4
In der Container Toolkit-Version 1.17.4 ist das Mounten von CUDA-kompatiblen Bibliotheken jetzt deaktiviert. Um die Kompatibilität mit mehreren CUDA-Versionen in Container-Workflows sicherzustellen, stellen Sie bitte sicher, dass Sie Ihren LD_LIBRARY_PATH so aktualisieren, dass er Ihre CUDA-Kompatibilitätsbibliotheken enthält, wie im Tutorial Wenn Sie eine CUDA-Kompatibilitätsschicht verwenden gezeigt. https://docs.aws.amazon.com/sagemaker/latest/dg/inference-gpu-drivers.html#collapsible-cuda-compat
Entfernt
Die Benutzerbereichsbibliotheken cuobj und nvdisasm, die vom NVIDIA CUDA Toolkit bereitgestellt wurden, um CVEs
zu behandeln, die im NVIDIA CUDA Toolkit Security Bulletin vom 18. Februar 2025 enthalten sind, wurden entfernt
Veröffentlichungsdatum: 2025-02-04
AMI-Namen
Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20250204
Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20250204
Aktualisiert
Die EFA-Version wurde von 1.37.0 auf 1.38.0 aktualisiert
EFA bündelt jetzt das AWS OFI NCCL-Plugin, das jetzt nicht mehr im Original, sondern im Original zu finden ist.
/opt/amazon/ofi-nccl/opt/aws-ofi-nccl/Wenn Sie Ihre LD_LIBRARY_PATH-Variable aktualisieren, stellen Sie bitte sicher, dass Sie Ihren OFI-NCCL-Standort korrekt ändern.
Entfernt
Das Emacs-Paket wurde aus diesen DLAMIs entfernt. Kunden können Emacs von GNU Emacs aus installieren. https://www.gnu.org/software/emacs/download.html
Veröffentlichungsdatum: 2025-01-17
AMI-Namen
Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20250117
Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20250117
Aktualisiert
Der Nvidia-Treiber wurde von Version 550.127.05 auf 550.144.03 aktualisiert, um CVEs zu beheben, die im NVIDIA GPU Display Driver Security Bulletin für Januar 2025 enthalten sind https://nvidia.custhelp.com/app/answers/detail/a_id/5614
Veröffentlichungsdatum: 2024-12-09
AMI-Namen
Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20241206
Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20241206
Aktualisiert
Das Nvidia Container Toolkit wurde von Version 1.17.0 auf 1.17.3 aktualisiert
Veröffentlichungsdatum: 2024-11-22
AMI-Name: Deep Learning Base OSS Nvidia-Treiber-GPU-AMI (Ubuntu 20.04) 20241122
Hinzugefügt
Unterstützung für P5en EC2-Instances hinzugefügt.
Aktualisiert
Der EFA Installer wurde von Version 1.35.0 auf 1.37.0 aktualisiert
Aktualisieren Sie das AWS OFI NCCL Plugin von Version 1.12.1-aws auf 1.13.0-aws
Veröffentlichungsdatum: 2024-10-26
AMI-Namen
Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20241025
Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20241025
Aktualisiert
Der Nvidia-Treiber wurde von Version 550.90.07 auf 550.127.05 aktualisiert, um CVEs zu beheben, die im NVIDIA GPU Display Security Bulletin für Oktober 2024 enthalten sind https://nvidia.custhelp.com/app/answers/detail/a_id/5586
Veröffentlichungsdatum: 2024-10-03
AMI-Name: Deep Learning Base OSS Nvidia-Treiber-GPU-AMI (Ubuntu 20.04) 20240927
Aktualisiert
Das Nvidia Container Toolkit wurde von Version 1.16.1 auf 1.16.2 aktualisiert
Veröffentlichungsdatum: 2024-08-27
AMI-Name: Deep Learning Base OSS Nvidia-Treiber-GPU-AMI (Ubuntu 20.04) 20240827
Aktualisiert
Der Nvidia-Treiber und der Fabric Manager wurden von Version 535.183.01 auf 550.90.07 aktualisiert
Die EFA-Version wurde von 1.32.0 auf 1.34.0 aktualisiert
NCCL wurde für alle CUDA-Versionen auf die neueste Version 2.22.3 aktualisiert
CUDA 11.7 wurde von Version 2.16.2+ aktualisiert CUDA11.7
CUDA 12.1, 12.2 wurde von 2.18.5+ aktualisiert CUDA12.2
CUDA 12.3 wurde von Version 2.21.5+ aktualisiert CUDA12.4
Hinzugefügt
CUDA-Toolkit-Version 12.4 wurde im Verzeichnis//cuda-12.4 hinzugefügt usr/local
Unterstützung für P5e EC2-Instance hinzugefügt.
Entfernt
Der CUDA Toolkit-Stack der Version 11.8 wurde entfernt, der sich im Verzeichnis//cuda-11.8 befindet usr/local
Veröffentlichungsdatum: 2024-08-19
AMI-Name: Deep Learning Base OSS Nvidia-Treiber-GPU-AMI (Ubuntu 20.04) 20240816
Hinzugefügt
Unterstützung für die G6e EC2-Instance hinzugefügt. https://aws.amazon.com/ec2/instance-types/g6e/
Veröffentlichungsdatum: 2024-06-06
AMI-Namen
Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20240606
Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20240606
Aktualisiert
Die Nvidia-Treiberversion wurde von 535.161.08 auf 535.183.01 aktualisiert
Veröffentlichungsdatum: 2024-05-15
AMI-Namen
Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20240515
Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20240515
Hinzugefügt
CUDA11.7 Backstack im Verzeichnis/usr/local/cuda-11.7 mit CUDA11.7 NCCL 2.16.2, cuDNN 8.7.0 hinzugefügt, da 1.13 dies unterstützt PyTorch CUDA11.7
Veröffentlichungsdatum: 2024-05-02
AMI-Namen
Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20240502
Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20240502
Aktualisiert
Die EFA-Version wurde von Version 1.30 auf Version 1.32 aktualisiert
Das AWS OFI NCCL-Plugin wurde von Version 1.7.4 auf Version 1.9.1 aktualisiert
Das Nvidia-Container-Toolkit wurde von Version 1.13.5 auf Version 1.15.0 aktualisiert https://github.com/NVIDIA/nvidia-container-toolkit/releases/tag/v1.15.0
Version 1.15.0 enthält NICHT die Pakete nvidia-container-runtime und nvidia-docker2. Es wird empfohlen, die nvidia-container-toolkit-Pakete direkt zu verwenden, indem Sie den Nvidia-Container-Toolkit-Dokumenten folgen. https://docs.nvidia.com/datacenter/cloud-native/container-toolkit/latest/sample-workload.html
Hinzugefügt
CUDA12.3 Stack mit CUDA12.3, NCCL 2.21.5, cuDNN 8.9.7 hinzugefügt
Entfernt
Entfernt CUDA11.7, CUDA12.0 Stapel befinden sich in den Verzeichnissen//cuda-11.7 und//cuda-12.0 usr/local usr/local
Das nvidia-docker2-Paket und sein Befehl nvidia-docker wurden als Teil des Nvidia-Container-Toolkit-Updates von 1.13.5 auf 1.15.0 entfernt, das NICHT die Pakete nvidia-container-runtime und nvidia-docker2 enthält. https://github.com/NVIDIA/nvidia-container-toolkit/releases/tag/v1.15.0
Veröffentlichungsdatum: 2024-04-04
AMI-Namen: Deep Learning Base OSS Nvidia-Treiber-GPU-AMI (Ubuntu 20.04) 20240404
Hinzugefügt
Für den OSS Nvidia-Treiber DLAMIS wurde die Unterstützung für G6- und Gr6-EC2-Instances hinzugefügt. Weitere Informationen finden Sie unter Empfohlene GPU-Instances.
Veröffentlichungsdatum: 2024-03-29
AMI-Namen
Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20240326
Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20240326
Aktualisiert
Der Nvidia-Treiber wurde sowohl im proprietären als auch im OSS-Nvidia-Treiber-DLAMIS von 535.104.12 auf 535.161.08 aktualisiert.
Die Unterstützung für G4dn- und G5-EC2-Instances wurde aus dem proprietären Nvidia-Treiber DLAMI entfernt.
Die neuen unterstützten Instances für jeden DLAMI lauten wie folgt:
Deep Learning mit proprietärem Nvidia-Treiber unterstützt G3 (G3.16x nicht unterstützt), P3, P3dn
Deep Learning mit dem OSS Nvidia-Treiber unterstützt G4dn, G5, P4d, P4de, P5.
Veröffentlichungsdatum: 2024-03-20
AMI-Namen
Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20240318
Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20240318
Hinzugefügt
awscliv2Im AMI unter/hinzugefügtbin/aws2, zusammen mitusr/local/usr/bin/aws im proprietären undawscliv1OSS-Nvidia-Treiber-AMI
Veröffentlichungsdatum: 2024-03-14
AMI-Name: Deep Learning Base OSS Nvidia-Treiber-GPU-AMI (Ubuntu 20.04) 20240314
Aktualisiert
Der OSS Nvidia-Treiber DLAMI mit G4dn- und G5-Unterstützung wurde aktualisiert. Basierend darauf sieht die aktuelle Unterstützung wie folgt aus:
Das proprietäre Nvidia-Treiber-AMI (Ubuntu 20.04) von Deep Learning Base unterstützt P3, P3dn, G3, G5, G4dn.
Das Deep Learning Base OSS Nvidia-Treiber-AMI (Ubuntu 20.04) unterstützt G5, G4dn, P4, P5.
Es wird empfohlen, den OSS Nvidia-Treiber DLAMIs für G5, G4dn, P4, P5 zu verwenden.
Veröffentlichungsdatum: 2024-02-12
AMI-Namen
Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20240208
Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20240208
Aktualisiert
AWS Das OFI NCCL-Plugin wurde von 1.7.3 auf 1.7.4 aktualisiert
Veröffentlichungsdatum: 2024-02-01
AMI-Namen
Deep Learning Base OSS Nvidia-Treiber-GPU-AMI (Ubuntu 20.04) 20240201
Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20240201
Sicherheit
Die Runc-Paketversion wurde aktualisiert, für die der Patch verwendet werden soll. CVE-2024-21626
Veröffentlichungsdatum: 2023-12-04
AMI-Namen
Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20231204
Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20231204
Hinzugefügt
AWS Deep Learning AMI (DLAMI) ist in zwei separate Gruppen aufgeteilt:
DLAMI, das den proprietären Nvidia-Treiber verwendet (zur Unterstützung von P3, P3dn, G3, G5, G4dn).
DLAMI, das den Nvidia OSS-Treiber verwendet, um EFA zu aktivieren (zur Unterstützung von P4, P5).
Weitere Informationen zur DLAMI-Aufteilung finden Sie unter Wichtige Änderungen an DLAMI.
AWS CLI Die obigen Abfragen befinden sich unter dem Aufzählungspunkt Query AMI-ID with AWSCLI (die Beispielregion ist us-east-1)
Aktualisiert
EFA wurde von 1.26.1 auf 1.29.0 aktualisiert
GDRCopy wurde von 2.3 auf 2.4 aktualisiert
Veröffentlichungsdatum: 18.10.2023
AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20231018
Aktualisiert
AWS Das OFI NCCL Plugin wurde von Version 1.7.2 auf Version 1.7.3 aktualisiert
Die CUDA 12.0-12.1-Verzeichnisse wurden mit der NCCL-Version 2.18.5 aktualisiert, sodass sie mit CUDA 12.2 übereinstimmen
CUDA12.1 als Standard-CUDA-Version aktualisiert
LD_LIBRARY_PATH wurde auf//cuda-12 aktualisiert. usr/local 1/targetslinux/lib/x86_64-/:usr/local//cuda-12. 1/libusr/local://cuda-12. 1/lib64:/usr/local/cuda-12.1 und PATH, um//cuda-12 zu haben. usr/local 1/bin/
Für Kunden, die zu einer anderen CUDA-Version wechseln möchten, definieren Sie bitte die Variablen LD_LIBRARY_PATH und PATH entsprechend.
Veröffentlichungsdatum: 2023-10-02
AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20231002
Aktualisiert
Der NVIDIA-Treiber wurde von 535.54.03 auf 535.104.12 aktualisiert
Dieser neueste Treiber behebt die NVML-ABI-Änderungen, die in der Treiberversion 535.54.03 gefunden wurden, sowie die Treiberregression in Version 535.86.10, die sich auf CUDA-Toolkits auf P5-Instances auswirkte. Einzelheiten zu den Korrekturen finden Sie in den folgenden NVIDIA-Versionshinweisen:
Einzelheiten zu den Korrekturen finden Sie in den folgenden NVIDIA-Versionshinweisen:
Die CUDA 12.2-Verzeichnisse wurden mit NCCL 2.18.5 aktualisiert
EFA wurde von Version 1.24.1 auf die neueste Version 1.26.1 aktualisiert
Hinzugefügt
Hinzugefügt CUDA12.2 unterusr/local//cuda-12.2
Entfernt
Unterstützung für CUDA 11.5 und CUDA 11.6 entfernt
Veröffentlichungsdatum: 2023-09-26
AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20230926
Hinzugefügt
Änderungen am net.naming-schema wurden hinzugefügt, um das unvorhersehbare Problem mit der Benennung der Netzwerkschnittstelle (Link) auf P5 zu beheben. https://bugs.launchpad.net/ubuntu/+source/systemd/+bug/1945225
Diese Änderung wird vorgenommen, indem net.naming-scheme=v247 in den Linux-Boot-Argumenten in der Datei//grub gesetzt wird etc/default
Veröffentlichungsdatum: 2023-08-30
AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20230830
Aktualisiert
Das
aws-ofi-ncclPlugin wurde von v1.7.1 auf v1.7.2 aktualisiert
Veröffentlichungsdatum: 2023-08-11
AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20230811
Hinzugefügt
Dieses AMI bietet jetzt Unterstützung für Multi-node Trainingsfunktionen auf P5 und allen zuvor unterstützten EC2-Instances.
Für die P5 EC2-Instance wird die Verwendung von NCCL 2.18 empfohlen und wurde zu, und hinzugefügt. CUDA12.0 CUDA12.1
Entfernt
Die Unterstützung für und wurde entfernt. CUDA11.3 CUDA11.4
Veröffentlichungsdatum: 2023-08-04
AMI-Name: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230804
Aktualisiert
Das OFI NCCL-Plugin wurde auf Version 1.7.1 aktualisiert AWS
CUDA11.8 Als Standard festgelegt, da PyTorch 2.0 11.8 unterstützt, und für P5 EC2-Instanzen wird empfohlen, >= zu verwenden CUDA11.8
LD_LIBRARY_PATH wurde auf//cuda-11 aktualisiert. usr/local 8/targetslinux/lib/x86_64-/:usr/local//cuda-11. 8/libusr/local://cuda-11. 8/lib64:/usr/local/cuda-11.8 und PATH, um//cuda-11 zu haben. usr/local 8/bin/
Für jede andere Cuda-Version definieren Sie bitte LD_LIBRARY_PATH entsprechend.
Die Verzeichnisse CUDA 12.0, 12.1 wurden mit NCCL 2.18.3 aktualisiert
Fixed
Das Problem beim Laden des Nvidia Fabric Manager (FM) -Pakets, das in einem früheren Veröffentlichungsdatum 2023-07-19 erwähnt wurde, wurde behoben.
Veröffentlichungsdatum: 2023-07-19
AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20230719
Aktualisiert
EFA wurde von 1.22.1 auf 1.24.1 aktualisiert
Der Nvidia-Treiber wurde von 525.85.12 auf 535.54.03 aktualisiert
Hinzugefügt
C-State-Änderungen wurden hinzugefügt, um den Ruhezustand des Prozessors zu deaktivieren, indem der maximale C-Status auf C1 gesetzt wird. Diese Änderung wird vorgenommen, indem `intel_idle.max_cstate=1 processor.max_cstate=1` in den Linux-Boot-Argumenten in der Datei//grub gesetzt wird etc/default
AWS Unterstützung für EC2 P5-Instanzen:
Unterstützung für P5-EC2-Instances für Workflows hinzugefügt, die Single verwenden. node/instance Multi-node Unterstützung (z. B. für Training mit mehreren Knoten) mithilfe von EFA (Elastic Fabric Adapter) und dem AWS OFI NCCL-Plugin wird in einer kommenden Version hinzugefügt.
Bitte verwenden Sie CUDA>=11.8 für eine optimale Leistung.
Bekanntes Problem: Das Nvidia Fabric Manager (FM) -Paket braucht Zeit, um auf P5 geladen zu werden. Kunden müssen nach dem Start der P5-Instance 2-3 Minuten warten, bis das FM geladen wird. Um zu überprüfen, ob FM gestartet wurde, führen Sie bitte den Befehl sudo systemctl is-active nvidia-fabricmanager aus. Er sollte wieder aktiv sein, bevor ein Workflow gestartet wird. Dies wird in der kommenden Version verbessert.
Datum der Veröffentlichung: 2023-05-19
AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20230519
Aktualisiert
EFA wurde auf die neueste Version 1.22.1 aktualisiert
Die NCCL-Version für CUDA 12.1 wurde auf 2.17.1 aktualisiert
Hinzugefügt
CUDA12.1 Hinzugefügt unter/usr/local/cuda-12.1
Unterstützung für NVIDIA Data Center GPU Monitor (DCGM) wurde über das Paket datacenter-gpu-manager hinzugefügt
Sie können den Status dieses Dienstes mithilfe der folgenden Abfrage überprüfen: sudo systemctl status nvidia-dcgm
Kurzlebige NVMe-Instance-Speicher werden jetzt automatisch in unterstützte EC2-Instances eingebunden, und auf den Speicher kann im Ordner//nvme/ zugegriffen werden. opt/dlami Sie können diesen Dienst auf folgende Weise überprüfen oder ändern:
Überprüfen Sie den Status des NVMe-Dienstes: sudo systemctl status dlami-nvme
Um auf den Dienst zuzugreifen oder ihn zu ändern:
/opt/aws/dlami/bin/nvme_ephemeral_drives.sh
NVMe-Volumes boten die schnellsten und effizientesten Speicherlösungen für Workflows mit hohem Durchsatz, die IOPS-Leistung erfordern. Temporäre NVMe-Instance-Speicher sind in den Kosten der Instances enthalten, sodass für diesen Service keine zusätzlichen Kosten anfallen.
NVMe-Instance-Speicher werden nur auf EC2-Instances bereitgestellt, die sie unterstützen. Informationen zu EC2-Instances mit von NVMe unterstützten Instance-Speichern finden Sie unter Verfügbare Instance-Speicher-Volumes und überprüfen Sie, ob NVMe unterstützt wird.
Um die Festplattenleistung zu verbessern und die Kosten beim ersten Schreiben zu reduzieren, können Sie die Instance-Speicher initialisieren (beachten Sie, dass dieser Vorgang je nach EC2-Instance-Typ Stunden dauern kann) — Initialisieren Sie die Instance-Speicher-Volumes auf EC2-Instances
HINWEIS: NVMe-Instance-Speicher werden auf der Instance bereitgestellt und sind nicht wie EBS mit dem Netzwerk verbunden. Die Daten auf diesen NVMe-Volumes können beim Neustart oder beim Beenden Ihrer Instance verloren gehen.
Veröffentlichungsdatum: 2023-04-17
AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20230414
Aktualisiert
Der DLAMI-Name wurde von AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) $ {YYYY-MM-DD} auf Deep Learning Base GPU AMI (Ubuntu 20.04) $ {} aktualisiert YYYY-MM-DD
Bitte beachten Sie, dass wir das neueste DLAMI mit dem alten AMI-Namen ab dieser Version einen Monat lang unterstützen werden, falls Sie Unterstützung benötigen. Kunden können ihre Betriebssystempakete apt-get update && apt-get upgrade aktualisieren, um Sicherheitspatches nutzen zu können.
Der Pfad AWS des OFI NCCL-Plugins wurde von bis aktualisiert
/usr/local/cuda-xx.x/efa//opt/aws-ofi-nccl/NCCL wurde auf einen benutzerdefinierten GIT-Zweig
von v2.16.2 aktualisiert, der von einem NCCL-Team für alle CUDA-Versionen gemeinsam verfasst wurde. AWS Es AWS funktioniert besser in der Infrastruktur.
Hinzugefügt
Hinzugefügt CUDA12.0 unter/usr/local/cuda-12.0
Unterstützung für Python-Version 3.9 in usr/bin /python3.9 hinzugefügt
Beachten Sie, dass diese Änderung das Standardsystem Python nicht ersetzt. Python3 wird weiterhin auf das System verweisen. Python3.8
Python3.9 kann mit den folgenden Befehlen aufgerufen werden:
/usr/bin/python3.9 python3.9
Entfernt
CUDA11.0-11.1 Aus/usr/local/cuda-11.x/ entfernt, da sie von keiner unterstützten Framework-Version verwendet werden, die auf der Framework-Support-Richtlinie basiert. DLAMI-Supportrichtlinie
Veröffentlichungsdatum: 2022-05-25
AMI-Name: AWS Deep Learning-Basis-AMI-GPU CUDA 11 (Ubuntu 20.04) 20220523
Aktualisiert
Diese Version bietet Unterstützung für die neue EC2-Instance p4de.24xlarge.
Auf
aws-efa-installerVersion 1.15.2 aktualisiertAuf Version aktualisiert
aws-ofi-nccl, die1.3.0-awsdie Topologie für p4de.24xlarge enthält.
Veröffentlichungsdatum: 25.03.2022
AMI-Name: AWS Deep Learning-Basis-AMI-GPU CUDA 11 (Ubuntu 20.04) 20220325
Aktualisiert
Die EFA-Version wurde von 1.15.0 auf 1.15.1 aktualisiert
Veröffentlichungsdatum: 17.03.2022
AMI-Name: AWS Deep Learning-Basis-AMI-GPU CUDA 11 (Ubuntu 20.04) 20220323
Hinzugefügt
Erste Version