View a markdown version of this page

Exécution de tâches d’entraînement sur un cluster hétérogène - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Exécution de tâches d’entraînement sur un cluster hétérogène

Grâce à la fonctionnalité de cluster hétérogène de SageMaker Training, vous pouvez exécuter une tâche de formation avec plusieurs types d'instances de machine learning afin d'améliorer l'évolutivité et l'utilisation des ressources pour différentes tâches et objectifs de formation ML. Par exemple, si votre travail de formation sur un cluster comportant des instances GPU présente une faible utilisation du GPU et des problèmes d'engorgement du processeur dus à des CPU-intensive tâches, l'utilisation d'un cluster hétérogène peut vous aider à décharger les CPU-intensive tâches en ajoutant des groupes d'instances de processeur plus rentables, en résolvant ces problèmes de goulot d'étranglement et en optimisant l'utilisation du GPU.

Note

Cette fonctionnalité est disponible dans le SDK SageMaker Python v2.98.0 et versions ultérieures.

Note

Cette fonctionnalité est disponible via la ModelTrainer classe SageMaker AI. Les frameworks pris en charge sont la PyTorch version 1.10 ou ultérieure et la TensorFlow version 2.6 ou ultérieure.

Consultez également le blog Améliorez les performances tarifaires de votre formation sur les modèles à l'aide des clusters hétérogènes Amazon SageMaker AI.