View a markdown version of this page

AWS Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) - AWS Deep Learning AMIs

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

AWS Deep Learning-Basis-GPU-AMI (Ubuntu 20.04)

Hinweis, dass der Support nicht mehr verfügbar ist

Hilfe zu den ersten Schritten finden Sie unterErste Schritte mit DLAMI.

AMI-Namensformat

  • Nvidia-Treiber-GPU-AMI für Deep Learning-Basis für OSS (Ubuntu 20.04) $ {} YYYY-MM-DD

  • Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) $ {} YYYY-MM-DD

Unterstützte EC2-Instances

  • Weitere Informationen finden Sie unter Wichtige Änderungen an DLAMI.

  • Deep Learning mit dem OSS Nvidia-Treiber unterstützt G4dn, G5, G6, Gr6, G6e, P4d, P4de, P5, P5e, P5en

  • Deep Learning mit dem proprietären Nvidia-Treiber unterstützt G3 (nicht unterstützt), P3, P3dn G3.16x

Das AMI beinhaltet Folgendes:

  • Unterstützter AWS Dienst: Amazon EC2

  • Betriebssystem: Ubuntu 20.04

  • Compute-Architektur: x86

  • Die neueste verfügbare Version ist für die folgenden Pakete installiert:

    • Linux-Kernel 5.15

    • FSx Luster

    • Docker

    • AWS CLI v2 unterusr/local/bin/aws2 und AWS CLI v1 unter /aws usr/bin

    • NVIDIA DCGM

    • Nvidia-Container-Toolkit:

      • Versionsbefehl: nvidia-container-cli -V

    • Nvidia-docker2:

      • Versionsbefehl: nvidia-Docker-Version

  • NVIDIA-Treiber:

    • OSS-Nvidia-Treiber: 550.163.01

    • Proprietärer Nvidia-Treiber: 550.163.01

  • NVIDIA CUDA 11.7, 12.1-12.4-Stapel:

    • CUDA-, NCCL- und cuDDN-Installationsverzeichnisse://cuda-xx.x/ usr/local

      • Beispiel://cuda-12.1/ usr/local

    • Kompilierte NCCL-Version: 2.22.3+ CUDA12.4

    • Standard-CUDA: 12.1

      • PATH/usr/local/cuda zeigt auf CUDA 12.1

      • Die folgenden Umgebungsvariablen wurden aktualisiert:

        • LD_LIBRARY_PATH hat nun//cuda-12. usr/local 1/lib:/usr/local/cuda-12. 1/lib64://cuda-12.1:/ /cuda-12. usr/local usr/local 1/targets/x86_64- linux/lib

        • PFAD, um//cuda-12. zu haben. usr/local 1/bin/://cuda-12. usr/local 1/include/

        • Für jede andere CUDA-Version aktualisieren Sie bitte LD_LIBRARY_PATH entsprechend.

    • Ort der NCCL-Tests:

      • all_reduce, all_gather und reduce_scatter://cuda-xx. usr/local x/efa/test-cuda-xx.x/

      • Um NCCL-Tests ausführen zu können, muss LD_LIBRARY_PATH die folgenden Aktualisierungen bestanden haben.

        • Allgemeine PATHs wurden bereits zu LD_LIBRARY_PATH hinzugefügt:

          • /opt/amazon/efa/lib:/opt/amazon/openmpi/lib:/opt/aws-ofi-nccl/lib:/usr/local/lib:/usr/lib

        • Für jede andere CUDA-Version aktualisieren Sie bitte LD_LIBRARY_PATH entsprechend.

  • EFA-Installationsprogramm: 1.39.0

  • Nvidia GDRCopy: 2.4

  • AWS OFI NCCL-Plugin: wird als Teil des installiert EFA Installer-aws

    • AWS OFI NCCL unterstützt jetzt mehrere NCCL-Versionen mit einem einzigen Build

    • /opt/aws-ofi-nccl/Installationspfad:. Der Pfad /opt/aws-ofi-nccl/lib wird zu LD_LIBRARY_PATH hinzugefügt.

    • Testet den Pfad für den Ring, message_transfer: /opt/aws-ofi-nccl/tests

  • EBS-Datenträgertyp: gp3

  • Python://python3.9 usr/bin

  • Speicherort der NVMe-Instance (auf unterstützten EC2-Instances)://nvme opt/dlami

  • Abfrage AMI-ID mit SSM-Parameter (Beispielregion ist us-east-1):

    • OSS Nvidia-Treiber:

      aws ssm get-parameter --region us-east-1 \ --name /aws/service/deeplearning/ami/x86_64/base-oss-nvidia-driver-gpu-ubuntu-20.04/latest/ami-id \ --query "Parameter.Value" \ --output text
    • Eigener Nvidia-Treiber:

      aws ssm get-parameter --region us-east-1 \ --name /aws/service/deeplearning/ami/x86_64/base-proprietary-nvidia-driver-gpu-ubuntu-20.04/latest/ami-id \ --query "Parameter.Value" \ --output text
  • Abfrage AMI-ID mit AWSCLI (Beispielregion ist us-east-1):

    • OSS Nvidia-Treiber:

      aws ec2 describe-images --region us-east-1 \ --owners amazon \ --filters 'Name=name,Values=Deep Learning Base OSS Nvidia Driver GPU AMI (Ubuntu 20.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output text
    • Eigener Nvidia-Treiber:

      aws ec2 describe-images --region us-east-1 \ --owners amazon \ --filters 'Name=name,Values=Deep Learning Base Proprietary Nvidia Driver GPU AMI (Ubuntu 20.04) ????????' 'Name=state,Values=available' \ --query 'reverse(sort_by(Images, &CreationDate))[:1].ImageId' \ --output text

Hinweise

NVIDIA Container-Toolkit 1.17.4

In der Container Toolkit-Version 1.17.4 ist das Mounten von CUDA-kompatiblen Bibliotheken jetzt deaktiviert. Um die Kompatibilität mit mehreren CUDA-Versionen in Container-Workflows sicherzustellen, stellen Sie bitte sicher, dass Sie Ihren LD_LIBRARY_PATH so aktualisieren, dass er Ihre CUDA-Kompatibilitätsbibliotheken enthält, wie im Tutorial Wenn Sie eine CUDA-Kompatibilitätsschicht verwenden gezeigt. https://docs.aws.amazon.com/sagemaker/latest/dg/inference-gpu-drivers.html#collapsible-cuda-compat

EFA-Updates von 1.37 auf 1.38 (Veröffentlichung am 04.02.2025)

EFA bündelt jetzt das AWS OFI NCCL-Plugin, das jetzt nicht mehr im Original, sondern im Original zu finden ist. /opt/amazon/ofi-nccl /opt/aws-ofi-nccl/ Wenn Sie Ihre LD_LIBRARY_PATH-Variable aktualisieren, stellen Sie bitte sicher, dass Sie Ihren OFI-NCCL-Standort korrekt ändern.

Richtlinie zur Unterstützung

Komponenten dieses AMI, wie CUDA-Versionen, können aufgrund von Framework-Supportrichtlinien oder zur Leistungsoptimierung für Deep-Learning-Container oder zur Reduzierung der AMI-Größe in einer zukünftigen Version ohne vorherige Ankündigung entfernt und geändert werden. Wir entfernen CUDA-Versionen aus AMIs, wenn sie von keiner unterstützten Framework-Version verwendet werden.

EC2-Instances mit mehreren Netzwerkkarten
  • Viele Instance-Typen, die EFA unterstützen, verfügen auch über mehrere Netzwerkkarten.

  • DeviceIndex ist für jede Netzwerkkarte eindeutig und muss eine nicht negative Ganzzahl sein, die unter dem Grenzwert der ENIs pro liegt. NetworkCard Auf P5 ist die Anzahl der ENIs pro NetworkCard Einheit 2, was bedeutet, dass die einzig gültigen Werte für 0 oder 1 DeviceIndex sind.

    • Erstellen Sie für die primäre Netzwerkschnittstelle (Netzwerkkartenindex 0, Geräteindex 0) eine EFA-Schnittstelle (EFA mit ENA). Sie können keine EFA-only Netzwerkschnittstelle als primäre Netzwerkschnittstelle verwenden.

    • Verwenden Sie für jede weitere Netzwerkschnittstelle den nächsten unbenutzten Netzwerkkartenindex, Geräteindex 1 und entweder eine EFA (EFA mit ENA) oder eine EFA-only Netzwerkschnittstelle, abhängig von Ihrem Anwendungsfall, z. B. den ENA-Bandbreitenanforderungen oder dem IP-Adressraum. Beispiele für Anwendungsfälle finden Sie unter EFA-Konfiguration für eine P5-Instance.

    • Weitere Informationen finden Sie im EFA-Leitfaden hier. https://docs.aws.amazon.com/AWSEC2/latest/UserGuide/efa-acc-inst-types.html

P5/P5e Instanzen
  • P5- und P5e-Instances enthalten 32 Netzwerkschnittstellenkarten und können mit dem folgenden Befehl gestartet werden: AWS CLI

aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=31,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
P5en-Instanzen
  • P5en enthalten 16 Netzwerkschnittstellenkarten und können mit dem folgenden Befehl gestartet werden: AWS CLI

aws ec2 run-instances --region $REGION \ --instance-type $INSTANCETYPE \ --image-id $AMI --key-name $KEYNAME \ --iam-instance-profile "Name=dlami-builder" \ --tag-specifications "ResourceType=instance,Tags=[{Key=Name,Value=$TAG}]" \ --network-interfaces "NetworkCardIndex=0,DeviceIndex=0,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=1,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=2,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=3,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ "NetworkCardIndex=4,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa" \ ... "NetworkCardIndex=15,DeviceIndex=1,Groups=$SG,SubnetId=$SUBNET,InterfaceType=efa"
Kernel
  • Die Kernel-Version wird mit dem folgenden Befehl angeheftet:

    echo linux-aws hold | sudo dpkg —set-selections echo linux-headers-aws hold | sudo dpkg —set-selections echo linux-image-aws hold | sudo dpkg —set-selections
  • Wir empfehlen Benutzern, ihre Kernelversion nicht zu aktualisieren (es sei denn, es liegt ein Sicherheitspatch vor), um die Kompatibilität mit den installierten Treibern und Paketversionen sicherzustellen. Wenn Benutzer dennoch ein Update durchführen möchten, können sie die folgenden Befehle ausführen, um ihre Kernelversionen zu entpinnen:

    echo linux-aws install | sudo dpkg -set-selections echo linux-headers-aws install | sudo dpkg -set-selections echo linux-image-aws install | sudo dpkg -set-selections
  • Für jede neue Version von DLAMI wird der neueste verfügbare kompatible Kernel verwendet.

Datum der Veröffentlichung: 2025-04-24

AMI-Namen
  • Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20250424

  • Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20250424

Aktualisiert

Veröffentlichungsdatum: 2025-02-17

AMI-Namen
  • Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20250214

  • Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20250214

Aktualisiert
Entfernt

Veröffentlichungsdatum: 2025-02-04

AMI-Namen
  • Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20250204

  • Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20250204

Aktualisiert
  • Die EFA-Version wurde von 1.37.0 auf 1.38.0 aktualisiert

    • EFA bündelt jetzt das AWS OFI NCCL-Plugin, das jetzt nicht mehr im Original, sondern im Original zu finden ist. /opt/amazon/ofi-nccl /opt/aws-ofi-nccl/ Wenn Sie Ihre LD_LIBRARY_PATH-Variable aktualisieren, stellen Sie bitte sicher, dass Sie Ihren OFI-NCCL-Standort korrekt ändern.

Entfernt

Veröffentlichungsdatum: 2025-01-17

AMI-Namen
  • Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20250117

  • Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20250117

Aktualisiert

Veröffentlichungsdatum: 2024-12-09

AMI-Namen
  • Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20241206

  • Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20241206

Aktualisiert
  • Das Nvidia Container Toolkit wurde von Version 1.17.0 auf 1.17.3 aktualisiert

Veröffentlichungsdatum: 2024-11-22

AMI-Name: Deep Learning Base OSS Nvidia-Treiber-GPU-AMI (Ubuntu 20.04) 20241122

Hinzugefügt
  • Unterstützung für P5en EC2-Instances hinzugefügt.

Aktualisiert
  • Der EFA Installer wurde von Version 1.35.0 auf 1.37.0 aktualisiert

  • Aktualisieren Sie das AWS OFI NCCL Plugin von Version 1.12.1-aws auf 1.13.0-aws

Veröffentlichungsdatum: 2024-10-26

AMI-Namen
  • Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20241025

  • Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20241025

Aktualisiert

Veröffentlichungsdatum: 2024-10-03

AMI-Name: Deep Learning Base OSS Nvidia-Treiber-GPU-AMI (Ubuntu 20.04) 20240927

Aktualisiert
  • Das Nvidia Container Toolkit wurde von Version 1.16.1 auf 1.16.2 aktualisiert

Veröffentlichungsdatum: 2024-08-27

AMI-Name: Deep Learning Base OSS Nvidia-Treiber-GPU-AMI (Ubuntu 20.04) 20240827

Aktualisiert
  • Der Nvidia-Treiber und der Fabric Manager wurden von Version 535.183.01 auf 550.90.07 aktualisiert

  • Die EFA-Version wurde von 1.32.0 auf 1.34.0 aktualisiert

  • NCCL wurde für alle CUDA-Versionen auf die neueste Version 2.22.3 aktualisiert

    • CUDA 11.7 wurde von Version 2.16.2+ aktualisiert CUDA11.7

    • CUDA 12.1, 12.2 wurde von 2.18.5+ aktualisiert CUDA12.2

    • CUDA 12.3 wurde von Version 2.21.5+ aktualisiert CUDA12.4

Hinzugefügt
  • CUDA-Toolkit-Version 12.4 wurde im Verzeichnis//cuda-12.4 hinzugefügt usr/local

  • Unterstützung für P5e EC2-Instance hinzugefügt.

Entfernt
  • Der CUDA Toolkit-Stack der Version 11.8 wurde entfernt, der sich im Verzeichnis//cuda-11.8 befindet usr/local

Veröffentlichungsdatum: 2024-08-19

AMI-Name: Deep Learning Base OSS Nvidia-Treiber-GPU-AMI (Ubuntu 20.04) 20240816

Hinzugefügt

Veröffentlichungsdatum: 2024-06-06

AMI-Namen
  • Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20240606

  • Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20240606

Aktualisiert
  • Die Nvidia-Treiberversion wurde von 535.161.08 auf 535.183.01 aktualisiert

Veröffentlichungsdatum: 2024-05-15

AMI-Namen
  • Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20240515

  • Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20240515

Hinzugefügt
  • CUDA11.7 Backstack im Verzeichnis/usr/local/cuda-11.7 mit CUDA11.7 NCCL 2.16.2, cuDNN 8.7.0 hinzugefügt, da 1.13 dies unterstützt PyTorch CUDA11.7

Veröffentlichungsdatum: 2024-05-02

AMI-Namen
  • Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20240502

  • Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20240502

Aktualisiert
Hinzugefügt
  • CUDA12.3 Stack mit CUDA12.3, NCCL 2.21.5, cuDNN 8.9.7 hinzugefügt

Entfernt
  • Entfernt CUDA11.7, CUDA12.0 Stapel befinden sich in den Verzeichnissen//cuda-11.7 und//cuda-12.0 usr/local usr/local

  • Das nvidia-docker2-Paket und sein Befehl nvidia-docker wurden als Teil des Nvidia-Container-Toolkit-Updates von 1.13.5 auf 1.15.0 entfernt, das NICHT die Pakete nvidia-container-runtime und nvidia-docker2 enthält. https://github.com/NVIDIA/nvidia-container-toolkit/releases/tag/v1.15.0

Veröffentlichungsdatum: 2024-04-04

AMI-Namen: Deep Learning Base OSS Nvidia-Treiber-GPU-AMI (Ubuntu 20.04) 20240404

Hinzugefügt
  • Für den OSS Nvidia-Treiber DLAMIS wurde die Unterstützung für G6- und Gr6-EC2-Instances hinzugefügt. Weitere Informationen finden Sie unter Empfohlene GPU-Instances.

Veröffentlichungsdatum: 2024-03-29

AMI-Namen
  • Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20240326

  • Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20240326

Aktualisiert
  • Der Nvidia-Treiber wurde sowohl im proprietären als auch im OSS-Nvidia-Treiber-DLAMIS von 535.104.12 auf 535.161.08 aktualisiert.

  • Die Unterstützung für G4dn- und G5-EC2-Instances wurde aus dem proprietären Nvidia-Treiber DLAMI entfernt.

  • Die neuen unterstützten Instances für jeden DLAMI lauten wie folgt:

    • Deep Learning mit proprietärem Nvidia-Treiber unterstützt G3 (G3.16x nicht unterstützt), P3, P3dn

    • Deep Learning mit dem OSS Nvidia-Treiber unterstützt G4dn, G5, P4d, P4de, P5.

Veröffentlichungsdatum: 2024-03-20

AMI-Namen
  • Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20240318

  • Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20240318

Hinzugefügt
  • awscliv2Im AMI unter/hinzugefügtbin/aws2, zusammen mitusr/local/usr/bin/aws im proprietären und awscliv1 OSS-Nvidia-Treiber-AMI

Veröffentlichungsdatum: 2024-03-14

AMI-Name: Deep Learning Base OSS Nvidia-Treiber-GPU-AMI (Ubuntu 20.04) 20240314

Aktualisiert
  • Der OSS Nvidia-Treiber DLAMI mit G4dn- und G5-Unterstützung wurde aktualisiert. Basierend darauf sieht die aktuelle Unterstützung wie folgt aus:

    • Das proprietäre Nvidia-Treiber-AMI (Ubuntu 20.04) von Deep Learning Base unterstützt P3, P3dn, G3, G5, G4dn.

    • Das Deep Learning Base OSS Nvidia-Treiber-AMI (Ubuntu 20.04) unterstützt G5, G4dn, P4, P5.

  • Es wird empfohlen, den OSS Nvidia-Treiber DLAMIs für G5, G4dn, P4, P5 zu verwenden.

Veröffentlichungsdatum: 2024-02-12

AMI-Namen
  • Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20240208

  • Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20240208

Aktualisiert
  • AWS Das OFI NCCL-Plugin wurde von 1.7.3 auf 1.7.4 aktualisiert

Veröffentlichungsdatum: 2024-02-01

AMI-Namen
  • Deep Learning Base OSS Nvidia-Treiber-GPU-AMI (Ubuntu 20.04) 20240201

  • Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20240201

Sicherheit
  • Die Runc-Paketversion wurde aktualisiert, für die der Patch verwendet werden soll. CVE-2024-21626

Veröffentlichungsdatum: 2023-12-04

AMI-Namen
  • Nvidia-Treiber-GPU-AMI für Deep Learning Base OSS (Ubuntu 20.04) 20231204

  • Proprietärer Nvidia-Treiber-GPU-AMI für Deep Learning Base (Ubuntu 20.04) 20231204

Hinzugefügt
  • AWS Deep Learning AMI (DLAMI) ist in zwei separate Gruppen aufgeteilt:

    • DLAMI, das den proprietären Nvidia-Treiber verwendet (zur Unterstützung von P3, P3dn, G3, G5, G4dn).

    • DLAMI, das den Nvidia OSS-Treiber verwendet, um EFA zu aktivieren (zur Unterstützung von P4, P5).

  • Weitere Informationen zur DLAMI-Aufteilung finden Sie unter Wichtige Änderungen an DLAMI.

  • AWS CLI Die obigen Abfragen befinden sich unter dem Aufzählungspunkt Query AMI-ID with AWSCLI (die Beispielregion ist us-east-1)

Aktualisiert
  • EFA wurde von 1.26.1 auf 1.29.0 aktualisiert

  • GDRCopy wurde von 2.3 auf 2.4 aktualisiert

Veröffentlichungsdatum: 18.10.2023

AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20231018

Aktualisiert
  • AWS Das OFI NCCL Plugin wurde von Version 1.7.2 auf Version 1.7.3 aktualisiert

  • Die CUDA 12.0-12.1-Verzeichnisse wurden mit der NCCL-Version 2.18.5 aktualisiert, sodass sie mit CUDA 12.2 übereinstimmen

  • CUDA12.1 als Standard-CUDA-Version aktualisiert

    • LD_LIBRARY_PATH wurde auf//cuda-12 aktualisiert. usr/local 1/targetslinux/lib/x86_64-/:usr/local//cuda-12. 1/libusr/local://cuda-12. 1/lib64:/usr/local/cuda-12.1 und PATH, um//cuda-12 zu haben. usr/local 1/bin/

    • Für Kunden, die zu einer anderen CUDA-Version wechseln möchten, definieren Sie bitte die Variablen LD_LIBRARY_PATH und PATH entsprechend.

Veröffentlichungsdatum: 2023-10-02

AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20231002

Aktualisiert
  • Der NVIDIA-Treiber wurde von 535.54.03 auf 535.104.12 aktualisiert

    • Dieser neueste Treiber behebt die NVML-ABI-Änderungen, die in der Treiberversion 535.54.03 gefunden wurden, sowie die Treiberregression in Version 535.86.10, die sich auf CUDA-Toolkits auf P5-Instances auswirkte. Einzelheiten zu den Korrekturen finden Sie in den folgenden NVIDIA-Versionshinweisen:

    • Einzelheiten zu den Korrekturen finden Sie in den folgenden NVIDIA-Versionshinweisen:

      • 4235941 — Fehlerhafte Änderungen an NVML ABI behoben

      • 4228552 - CUDA Toolkit-Fehlerkorrektur

  • Die CUDA 12.2-Verzeichnisse wurden mit NCCL 2.18.5 aktualisiert

  • EFA wurde von Version 1.24.1 auf die neueste Version 1.26.1 aktualisiert

Hinzugefügt
  • Hinzugefügt CUDA12.2 unterusr/local//cuda-12.2

Entfernt
  • Unterstützung für CUDA 11.5 und CUDA 11.6 entfernt

Veröffentlichungsdatum: 2023-09-26

AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20230926

Hinzugefügt
  • Änderungen am net.naming-schema wurden hinzugefügt, um das unvorhersehbare Problem mit der Benennung der Netzwerkschnittstelle (Link) auf P5 zu beheben. https://bugs.launchpad.net/ubuntu/+source/systemd/+bug/1945225 Diese Änderung wird vorgenommen, indem net.naming-scheme=v247 in den Linux-Boot-Argumenten in der Datei//grub gesetzt wird etc/default

Veröffentlichungsdatum: 2023-08-30

AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20230830

Aktualisiert
  • Das aws-ofi-nccl Plugin wurde von v1.7.1 auf v1.7.2 aktualisiert

Veröffentlichungsdatum: 2023-08-11

AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20230811

Hinzugefügt
  • Dieses AMI bietet jetzt Unterstützung für Multi-node Trainingsfunktionen auf P5 und allen zuvor unterstützten EC2-Instances.

  • Für die P5 EC2-Instance wird die Verwendung von NCCL 2.18 empfohlen und wurde zu, und hinzugefügt. CUDA12.0 CUDA12.1

Entfernt
  • Die Unterstützung für und wurde entfernt. CUDA11.3 CUDA11.4

Veröffentlichungsdatum: 2023-08-04

AMI-Name: Deep Learning Base GPU AMI (Ubuntu 20.04) 20230804

Aktualisiert
  • Das OFI NCCL-Plugin wurde auf Version 1.7.1 aktualisiert AWS

  • CUDA11.8 Als Standard festgelegt, da PyTorch 2.0 11.8 unterstützt, und für P5 EC2-Instanzen wird empfohlen, >= zu verwenden CUDA11.8

    • LD_LIBRARY_PATH wurde auf//cuda-11 aktualisiert. usr/local 8/targetslinux/lib/x86_64-/:usr/local//cuda-11. 8/libusr/local://cuda-11. 8/lib64:/usr/local/cuda-11.8 und PATH, um//cuda-11 zu haben. usr/local 8/bin/

    • Für jede andere Cuda-Version definieren Sie bitte LD_LIBRARY_PATH entsprechend.

  • Die Verzeichnisse CUDA 12.0, 12.1 wurden mit NCCL 2.18.3 aktualisiert

Fixed
  • Das Problem beim Laden des Nvidia Fabric Manager (FM) -Pakets, das in einem früheren Veröffentlichungsdatum 2023-07-19 erwähnt wurde, wurde behoben.

Veröffentlichungsdatum: 2023-07-19

AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20230719

Aktualisiert
  • EFA wurde von 1.22.1 auf 1.24.1 aktualisiert

  • Der Nvidia-Treiber wurde von 525.85.12 auf 535.54.03 aktualisiert

Hinzugefügt
  • C-State-Änderungen wurden hinzugefügt, um den Ruhezustand des Prozessors zu deaktivieren, indem der maximale C-Status auf C1 gesetzt wird. Diese Änderung wird vorgenommen, indem `intel_idle.max_cstate=1 processor.max_cstate=1` in den Linux-Boot-Argumenten in der Datei//grub gesetzt wird etc/default

  • AWS Unterstützung für EC2 P5-Instanzen:

    • Unterstützung für P5-EC2-Instances für Workflows hinzugefügt, die Single verwenden. node/instance Multi-node Unterstützung (z. B. für Training mit mehreren Knoten) mithilfe von EFA (Elastic Fabric Adapter) und dem AWS OFI NCCL-Plugin wird in einer kommenden Version hinzugefügt.

    • Bitte verwenden Sie CUDA>=11.8 für eine optimale Leistung.

    • Bekanntes Problem: Das Nvidia Fabric Manager (FM) -Paket braucht Zeit, um auf P5 geladen zu werden. Kunden müssen nach dem Start der P5-Instance 2-3 Minuten warten, bis das FM geladen wird. Um zu überprüfen, ob FM gestartet wurde, führen Sie bitte den Befehl sudo systemctl is-active nvidia-fabricmanager aus. Er sollte wieder aktiv sein, bevor ein Workflow gestartet wird. Dies wird in der kommenden Version verbessert.

Datum der Veröffentlichung: 2023-05-19

AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20230519

Aktualisiert
  • EFA wurde auf die neueste Version 1.22.1 aktualisiert

  • Die NCCL-Version für CUDA 12.1 wurde auf 2.17.1 aktualisiert

Hinzugefügt
  • CUDA12.1 Hinzugefügt unter/usr/local/cuda-12.1

  • Unterstützung für NVIDIA Data Center GPU Monitor (DCGM) wurde über das Paket datacenter-gpu-manager hinzugefügt

    • Sie können den Status dieses Dienstes mithilfe der folgenden Abfrage überprüfen: sudo systemctl status nvidia-dcgm

  • Kurzlebige NVMe-Instance-Speicher werden jetzt automatisch in unterstützte EC2-Instances eingebunden, und auf den Speicher kann im Ordner//nvme/ zugegriffen werden. opt/dlami Sie können diesen Dienst auf folgende Weise überprüfen oder ändern:

    • Überprüfen Sie den Status des NVMe-Dienstes: sudo systemctl status dlami-nvme

    • Um auf den Dienst zuzugreifen oder ihn zu ändern: /opt/aws/dlami/bin/nvme_ephemeral_drives.sh

  • NVMe-Volumes boten die schnellsten und effizientesten Speicherlösungen für Workflows mit hohem Durchsatz, die IOPS-Leistung erfordern. Temporäre NVMe-Instance-Speicher sind in den Kosten der Instances enthalten, sodass für diesen Service keine zusätzlichen Kosten anfallen.

  • NVMe-Instance-Speicher werden nur auf EC2-Instances bereitgestellt, die sie unterstützen. Informationen zu EC2-Instances mit von NVMe unterstützten Instance-Speichern finden Sie unter Verfügbare Instance-Speicher-Volumes und überprüfen Sie, ob NVMe unterstützt wird.

  • Um die Festplattenleistung zu verbessern und die Kosten beim ersten Schreiben zu reduzieren, können Sie die Instance-Speicher initialisieren (beachten Sie, dass dieser Vorgang je nach EC2-Instance-Typ Stunden dauern kann) — Initialisieren Sie die Instance-Speicher-Volumes auf EC2-Instances

  • HINWEIS: NVMe-Instance-Speicher werden auf der Instance bereitgestellt und sind nicht wie EBS mit dem Netzwerk verbunden. Die Daten auf diesen NVMe-Volumes können beim Neustart oder beim Beenden Ihrer Instance verloren gehen.

Veröffentlichungsdatum: 2023-04-17

AMI-Name: Deep Learning-Basis-GPU-AMI (Ubuntu 20.04) 20230414

Aktualisiert
  • Der DLAMI-Name wurde von AWS Deep Learning Base AMI GPU CUDA 11 (Ubuntu 20.04) $ {YYYY-MM-DD} auf Deep Learning Base GPU AMI (Ubuntu 20.04) $ {} aktualisiert YYYY-MM-DD

    • Bitte beachten Sie, dass wir das neueste DLAMI mit dem alten AMI-Namen ab dieser Version einen Monat lang unterstützen werden, falls Sie Unterstützung benötigen. Kunden können ihre Betriebssystempakete apt-get update && apt-get upgrade aktualisieren, um Sicherheitspatches nutzen zu können.

  • Der Pfad AWS des OFI NCCL-Plugins wurde von bis aktualisiert /usr/local/cuda-xx.x/efa/ /opt/aws-ofi-nccl/

  • NCCL wurde auf einen benutzerdefinierten GIT-Zweig von v2.16.2 aktualisiert, der von einem NCCL-Team für alle CUDA-Versionen gemeinsam verfasst wurde. AWS Es AWS funktioniert besser in der Infrastruktur.

Hinzugefügt
  • Hinzugefügt CUDA12.0 unter/usr/local/cuda-12.0

  • AWS FSx hinzugefügt

  • Unterstützung für Python-Version 3.9 in usr/bin /python3.9 hinzugefügt

    • Beachten Sie, dass diese Änderung das Standardsystem Python nicht ersetzt. Python3 wird weiterhin auf das System verweisen. Python3.8

    • Python3.9 kann mit den folgenden Befehlen aufgerufen werden:

      /usr/bin/python3.9 python3.9
Entfernt
  • CUDA11.0-11.1 Aus/usr/local/cuda-11.x/ entfernt, da sie von keiner unterstützten Framework-Version verwendet werden, die auf der Framework-Support-Richtlinie basiert. DLAMI-Supportrichtlinie

Veröffentlichungsdatum: 2022-05-25

AMI-Name: AWS Deep Learning-Basis-AMI-GPU CUDA 11 (Ubuntu 20.04) 20220523

Aktualisiert
  • Diese Version bietet Unterstützung für die neue EC2-Instance p4de.24xlarge.

    • Auf aws-efa-installer Version 1.15.2 aktualisiert

    • Auf Version aktualisiertaws-ofi-nccl, die 1.3.0-aws die Topologie für p4de.24xlarge enthält.

Veröffentlichungsdatum: 25.03.2022

AMI-Name: AWS Deep Learning-Basis-AMI-GPU CUDA 11 (Ubuntu 20.04) 20220325

Aktualisiert
  • Die EFA-Version wurde von 1.15.0 auf 1.15.1 aktualisiert

Veröffentlichungsdatum: 17.03.2022

AMI-Name: AWS Deep Learning-Basis-AMI-GPU CUDA 11 (Ubuntu 20.04) 20220323

Hinzugefügt
  • Erste Version