Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Multi-node emplois parallèles
Vous pouvez utiliser des tâches parallèles multi-nœuds pour exécuter des tâches uniques couvrant plusieurs instances Amazon EC2. Grâce aux tâches parallèles AWS Batch multi-nœuds (également appelées planification par groupes), vous pouvez exécuter des applications informatiques hautes performances à grande échelle et entraîner des modèles de GPU distribués sans avoir à lancer, configurer et gérer directement les ressources Amazon EC2. Une tâche parallèle AWS Batch multi-nœuds est compatible avec tout framework prenant en charge IP-based la communication entre nœuds. Les exemples incluent Apache MXNet TensorFlow, Caffe2 ou l'interface MPI (Message Passing Interface).
Multi-node les tâches parallèles sont soumises en tant que tâche unique. Toutefois, votre définition de tâche (ou les remplacements de nœud de soumission de tâche) spécifie le nombre de nœuds à créer pour la tâche et les groupes de nœuds à créer. Chaque tâche parallèle à plusieurs nœuds contient un nœud principal qui est lancé en premier. Une fois le nœud principal activé, les nœuds enfants sont lancés et démarrés. La tâche n'est terminée que si le nœud principal se ferme. Tous les nœuds enfants sont ensuite arrêtés. Pour de plus amples informations, veuillez consulter Groupes de nœuds.
Multi-node les nœuds de travail parallèles sont à locataire unique. Cela signifie qu'un seul conteneur de tâches est exécuté sur chaque instance Amazon EC2.
Le statut de la tâche finale (SUCCEEDED ou FAILED) est déterminé par le statut de la tâche finale du nœud principal. Pour obtenir le statut d'une tâche parallèle à plusieurs nœuds, décrivez-la à l'aide de l'ID de tâche qui vous a été renvoyé lorsque vous l'avez soumise. Si vous avez besoin de détails sur les nœuds enfants, décrivez chaque nœud enfant individuellement. Vous pouvez adresser des nœuds en utilisant la # notation (en commençant par 0). Par exemple, pour accéder aux détails du deuxième nœud d'une tâche, décrivez Naws_batch_job_id #1 à l'aide de l'opération AWS Batch DescribeJobs API. Les informations started, stoppedAt, statusReason et exit concernant une tâche en parallèle à plusieurs nœuds sont renseignées à partir du nœud principal.
Si vous spécifiez de nouvelles tentatives de tâche, une défaillance du nœud principal entraîne une nouvelle tentative. Les défaillances des nœuds enfants n'entraînent pas de nouvelles tentatives. Chaque nouvelle tentative d'une tâche parallèle à plusieurs nœuds met à jour la tentative correspondante de ses nœuds enfants associés.
Pour exécuter des tâches parallèles sur plusieurs nœuds AWS Batch, le code de votre application doit contenir les frameworks et les bibliothèques nécessaires à la communication distribuée.