View a markdown version of this page

Verwaltung von Speicherpfaden für verschiedene Arten von lokalem Instance-Speicher - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Verwaltung von Speicherpfaden für verschiedene Arten von lokalem Instance-Speicher

Beachten Sie Folgendes, wenn Sie Speicherpfade für Trainingsjobs in SageMaker KI einrichten.

  • Wenn Sie Trainingsartefakte für verteiltes Training im /opt/ml/output/data Verzeichnis speichern möchten, müssen Sie Unterverzeichnisse ordnungsgemäß anhängen oder in Ihrer Modelldefinition oder Ihrem Trainingsskript eindeutige Dateinamen für die Artefakte verwenden. Wenn die Unterverzeichnisse und Dateinamen nicht richtig konfiguriert sind, schreiben alle verteilten Trainingsmitarbeiter möglicherweise Ausgaben in denselben Dateinamen im gleichen Ausgabepfad in Amazon S3.

  • Wenn Sie einen benutzerdefinierten Trainingscontainer verwenden, stellen Sie sicher, dass Sie das SageMaker Training Toolkit installieren, das Sie bei der Einrichtung der Umgebung für SageMaker Trainingsjobs unterstützt. Andernfalls müssen Sie die Umgebungsvariablen explizit in Ihrem Dockerfile angeben. Weitere Informationen finden Sie unter Erstellen eines Containers mit Ihren eigenen Algorithmen und Modellen.

  • Wenn Sie eine ML-Instance mit NVMe-SSD-Volumes verwenden, stellt SageMaker AI keinen Amazon EBS-GP2-Speicher bereit. Der verfügbare Speicher ist an die Speicherkapazität der NVMe-type Instance gebunden. SageMaker AI konfiguriert Speicherpfade für Trainingsdatensätze, Checkpoints, Modellartefakte und Ausgaben so, dass die gesamte Kapazität des Instanzspeichers genutzt wird. Zu den ML-Instance-Familien mit dem NVMe-type Instance-Speicher gehören beispielsweiseml.p4d, undml.g4dn. ml.g5 Wenn Sie eine ML-Instance mit der EBS-only Speicheroption und ohne Instance-Speicher verwenden, müssen Sie die Größe des EBS-Volumes über den volume_size Parameter in der SageMaker ModelTrainer AI-Klasse definieren (oder VolumeSizeInGB wenn Sie die ResourceConfig API verwenden). Zu den ML-Instance-Familien, die EBS-Volumes verwenden, gehören beispielsweise ml.c5 und ml.p2. Informationen zu Instance-Typen und ihren Instance-Speichertypen und Volumes finden Sie unter Amazon-EC2-Instance-Typen.

  • Die Standardpfade für SageMaker Trainingsjobs werden auf Amazon EBS-Volumes oder NVMe-SSD-Volumes der ML-Instance bereitgestellt. Wenn Sie Ihr Trainingsskript an SageMaker KI anpassen, stellen Sie sicher, dass Sie die im vorherigen Thema über aufgeführten Standardpfade verwenden. SageMaker KI-Umgebungsvariablen und die Standardpfade für Trainingsspeicherorte Wir empfehlen, dass Sie das /tmp Verzeichnis als Speicherplatz für die temporäre Speicherung großer Objekte während des Trainings verwenden. Das bedeutet, dass Sie keine Verzeichnisse verwenden dürfen, die auf einem kleinen, für das System zugewiesenen Speicherplatz gespeichert sind, wie z. B. /user und /home, um Fehler bei Platzmangel zu vermeiden.

Weitere Informationen finden Sie im AWS Blog „Wählen Sie die beste Datenquelle für Ihren SageMaker Amazon-Schulungsjob“, in dem Fallstudien und Leistungsbenchmarks von Datenquellen und Eingabemodi näher erläutert werden.