View a markdown version of this page

Multi-node lavori paralleli - AWS Batch

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Multi-node lavori paralleli

Puoi utilizzare processi paralleli a più nodi per eseguire singoli processi che si estendono su più istanze Amazon EC2. Con i processi AWS Batch paralleli multinodo (noti anche come pianificazione di gruppo), puoi eseguire applicazioni di calcolo ad alte prestazioni su larga scala e formazione di modelli GPU distribuiti senza la necessità di avviare, configurare e gestire direttamente le risorse Amazon EC2. Un job parallelo a AWS Batch più nodi è compatibile con qualsiasi framework che supporti la comunicazione tra nodi. IP-based Gli esempi includono Apache MXNet TensorFlow, Caffe2 o Message Passing Interface (MPI).

Multi-node i lavori paralleli vengono inviati come un unico lavoro. Tuttavia, la definizione del processo (o sostituzioni del nodo di invio del processo) specifica il numero di nodi da creare per il processo e quali gruppi di nodo creare. Ogni processo parallelo a più nodi contiene un nodo principale, che viene avviato prima. Dopo che il nodo principale è attivo, i nodi secondari vengono lanciati e avviati. Il lavoro è terminato solo se il nodo principale esce. Tutti i nodi secondari vengono quindi interrotti. Per ulteriori informazioni, consulta Gruppi di nodi.

Multi-node i nodi di lavoro paralleli sono a tenant singolo. Ciò significa che viene eseguito un solo contenitore di processi su ogni istanza Amazon EC2.

Lo stato del processo finale (SUCCEEDED o FAILED) è determinato dallo stato del processo finale del nodo principale. Per ottenere lo stato di un job parallelo a più nodi, descrivi il job utilizzando l'ID del job che è stato restituito al momento dell'invio del job. Se hai bisogno dei dettagli per i nodi figlio, descrivi ogni nodo figlio singolarmente. È possibile indirizzare i nodi utilizzando la #N notazione (a partire da 0). Ad esempio, per accedere ai dettagli del secondo nodo di un job, descrivi aws_batch_job_id #1 utilizzando l'operazione AWS Batch DescribeJobs API. Le informazioni started, stoppedAt, statusReason e exit per un processo parallelo a più nodi, vengono popolate dal nodo principale.

Se si specificano nuovi tentativi di lavoro, un errore del nodo principale causa un altro tentativo. Gli errori del nodo secondario non provocano ulteriori tentativi. Ogni nuovo tentativo di un processo parallelo a più nodi aggiorna il tentativo corrispondente dei suoi nodi figlio associati.

Per eseguire processi paralleli a più nodi AWS Batch, il codice dell'applicazione deve contenere i framework e le librerie necessari per la comunicazione distribuita.