Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Starten verteilter Trainingsjobs mit SMDDP mithilfe des SageMaker Python-SDK
Um einen verteilten Trainingsjob mit Ihrem angepassten Skript von auszuführenAnpassung Ihres Trainingsskripts zur Nutzung der kollektiven SMDDP-Operationen, verwenden Sie das Framework des SageMaker Python-SDK oder generische Schätzer, indem Sie das vorbereitete Trainingsskript als Einstiegsskript und die verteilte Trainingskonfiguration angeben.
Auf dieser Seite erfahren Sie, wie Sie das SageMaker AI Python SDK
-
Wenn Sie eine schnelle Akzeptanz Ihres verteilten KI-Schulungsjobs erreichen möchten, konfigurieren Sie eine SageMaker SageMaker KI PyTorch
- oder TensorFlow Framework-Schätzerklasse. Der Framework-Schätzer nimmt Ihr Trainingsskript auf und gleicht anhand des für den Parameter angegebenen Werts automatisch die richtige Bild-URI der vorgefertigten PyTorch oder TensorFlow Deep Learning Container (DLC) ab. framework_version -
Wenn Sie einen der vorgefertigten Container erweitern oder einen benutzerdefinierten Container erstellen möchten, um Ihre eigene ML-Umgebung mit SageMaker KI zu erstellen, verwenden Sie die generische
EstimatorAI-Klasse und geben Sie die SageMaker Image-URI des benutzerdefinierten Docker-Containers an, der in Ihrer Amazon Elastic Container Registry (Amazon ECR) gehostet wird.
Ihre Trainingsdatensätze sollten in Amazon S3 oder Amazon FSx for Lustre gespeichert werden, AWS-Region in dem Sie Ihren Trainingsjob starten. Wenn Sie Jupyter-Notebooks verwenden, sollten Sie eine Notebook-Instance oder eine SageMaker Studio Classic-App SageMaker haben, die in derselben ausgeführt wird. AWS-Region Weitere Informationen zum Speichern Ihrer Trainingsdaten finden Sie in der Dokumentation zur SageMaker Python-SDK-Dateneingabe.
Tipp
Wir empfehlen, dass Sie Amazon FSx für Lustre anstelle von Amazon S3 verwenden, um die Trainingsleistung zu verbessern. Amazon FSx hat einen höheren Durchsatz und eine geringere Latenz als Amazon S3.
Tipp
Um das verteilte Training für die EFA-enabled Instance-Typen ordnungsgemäß durchzuführen, sollten Sie den Datenverkehr zwischen den Instances aktivieren, indem Sie die Sicherheitsgruppe Ihrer VPC so einrichten, dass der gesamte eingehende und ausgehende Datenverkehr zu und von der Sicherheitsgruppe selbst zugelassen wird. Informationen zum Einrichten der Sicherheitsgruppenregeln finden Sie unter Schritt 1: Vorbereitung einer EFA-enabled Sicherheitsgruppe im Amazon EC2-Benutzerhandbuch.
Wählen Sie eines der folgenden Themen mit Anweisungen zum Ausführen eines verteilten Trainingsjobs aus. Nachdem Sie einen Schulungsauftrag gestartet haben, können Sie die Systemauslastung überwachen und die Leistung mithilfe von SageMaker Amazon-Debugger Amazon CloudWatch modellieren.
Folgen Sie den Anweisungen in den folgenden Themen, um mehr über technische Details zu erfahren. Wir empfehlen Ihnen jedoch, zunächst Beispiele für die Amazon SageMaker AI-Bibliothek zur Datenparallelität das auszuprobieren.