Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Multi-node parallele Jobs
Sie können parallele Jobs mit mehreren Knoten verwenden, um einzelne Jobs auszuführen, die sich über mehrere Amazon EC2-Instances erstrecken. Mit parallelen Jobs mit AWS Batch mehreren Knoten (auch bekannt als Gruppenplanung) können Sie umfangreiche Hochleistungsrechneranwendungen und verteilte GPU-Modellschulungen ausführen, ohne Amazon EC2-Ressourcen direkt starten, konfigurieren und verwalten zu müssen. Ein paralleler Job mit AWS Batch mehreren Knoten ist mit jedem Framework kompatibel, das die Kommunikation zwischen Knoten unterstützt IP-based. Beispiele hierfür sind Apache MXNet TensorFlow, Caffe2 oder Message Passing Interface (MPI).
Multi-node parallele Jobs werden als ein einziger Job eingereicht. Ihre Auftragsdefinition (oder Überschreibungen durch den Auftragsübergabeknoten) legt jedoch die Anzahl der Knoten fest, die für den Auftrag erstellt werden müssen, und welche Knotengruppen erstellt werden müssen. Jeder parallele Auftrag mit mehreren Knoten enthält einen Hauptknoten, der zuerst gestartet wird. Nachdem der Hauptknoten betriebsbereit ist, werden die untergeordneten Knoten gestartet und gestartet. Der Job ist nur abgeschlossen, wenn der Hauptknoten beendet wird. Alle untergeordneten Knoten werden dann gestoppt. Weitere Informationen finden Sie unter Knotengruppen.
Multi-node parallele Jobknoten sind Single-Tenant. Das bedeutet, dass auf jeder Amazon EC2-Instance nur ein einziger Jobcontainer ausgeführt wird.
Der letzte Auftragsstatus (SUCCEEDED oder FAILED) wird durch den letzten Auftragsstatus des Hauptknotens bestimmt. Um den Status eines parallelen Jobs mit mehreren Knoten abzurufen, beschreiben Sie den Job anhand der Job-ID, die beim Senden des Jobs zurückgegeben wurde. Wenn Sie die Details für untergeordnete Knoten benötigen, beschreiben Sie jeden untergeordneten Knoten einzeln. Sie können Knoten mithilfe der # Notation (beginnend mit 0) adressieren. Um beispielsweise auf die Details des zweiten Knotens eines Jobs zuzugreifen, beschreiben Sie Naws_batch_job_id #1 mithilfe der AWS Batch DescribeJobs API-Operation. Die Informationen started, stoppedAt, statusReason und exit für einen parallelen Auftrag mit mehreren Knoten stammen aus dem Hauptknoten.
Wenn Sie Auftragswiederholungen angeben, führt ein Ausfall des Hauptknotens zu einem weiteren Versuch. Ausfälle untergeordneter Knoten führen nicht zu weiteren Versuchen. Jeder neue Versuch eines parallelen Auftrags mit mehreren Knoten aktualisiert den entsprechenden Versuch seiner zugehörigen untergeordneten Knoten.
Um parallele Jobs mit mehreren Knoten ausführen zu können AWS Batch, muss Ihr Anwendungscode die Frameworks und Bibliotheken enthalten, die für die verteilte Kommunikation erforderlich sind.