View a markdown version of this page

Profilage et optimisation des performances de calcul - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Profilage et optimisation des performances de calcul

Note

Avis de fin de support : le 30 juin 2027, le support d'Amazon SageMaker Profiler AWS prendra fin. Après le 30 juin 2027, vous ne pourrez plus accéder à la console Profiler ni aux ressources du Profiler. Pour de plus amples informations, veuillez consulter Modification de la disponibilité du profileur.

Lors de l’entraînement de modèles de deep learning de pointe dont la taille augmente rapidement, il devient difficile de mettre à l’échelle la tâche d’entraînement de ces modèles à un grand cluster de GPU et d’identifier les problèmes de performance de calcul liés à des milliards et à des milliers de milliards d’opérations et de communications à chaque itération du processus de descente du gradient.

SageMaker L'IA fournit des outils de profilage permettant de visualiser et de diagnostiquer des problèmes de calcul aussi complexes liés à l'exécution de tâches de formation sur des ressources de AWS cloud computing. L' SageMaker IA propose deux options de profilage : Amazon SageMaker Profiler et un moniteur d'utilisation des ressources dans Amazon SageMaker Studio Classic. Consultez les présentations suivantes des deux fonctionnalités pour obtenir un aperçu rapide et savoir laquelle utiliser en fonction de vos besoins.

SageMaker Profileur Amazon

Amazon SageMaker Profiler est une fonctionnalité de profilage de l' SageMaker IA qui vous permet d'approfondir les ressources de calcul provisionnées tout en formant des modèles de deep learning, et d'obtenir une visibilité sur les détails au niveau des opérations. SageMaker Profiler fournit des modules Python permettant d'ajouter des annotations dans l'ensemble des scripts PyTorch ou d' TensorFlow entraîner des scripts et d'activer SageMaker Profiler. Vous pouvez accéder aux modules via le SDK SageMaker Python et les conteneurs AWS Deep Learning.

Avec SageMaker Profiler, vous pouvez suivre toutes les activités sur les processeurs et les GPU, telles que l'utilisation des processeurs et des GPU, les exécutions du noyau sur les GPU, les lancements de noyaux sur les processeurs, les opérations de synchronisation, les opérations de mémoire entre les processeurs et les GPU, les latences entre les lancements du noyau et les exécutions correspondantes, et le transfert de données entre les processeurs et les GPU.

SageMaker Profiler propose également une interface utilisateur (UI) qui visualise le profil, un résumé statistique des événements profilés et la chronologie d'une tâche de formation pour suivre et comprendre la relation temporelle des événements entre les GPU et les processeurs.

Pour en savoir plus sur SageMaker Profiler, consultezSageMaker Profileur Amazon.

Surveillance des ressources AWS informatiques dans Amazon SageMaker Studio Classic

SageMaker L'IA fournit également une interface utilisateur dans Studio Classic pour surveiller l'utilisation des ressources à un niveau élevé, mais avec une plus grande granularité par rapport aux mesures d'utilisation par défaut collectées par SageMaker AI à CloudWatch.

Pour toute tâche de formation que vous exécutez dans SageMaker AI à l'aide du SDK SageMaker Python, l' SageMaker IA commence à profiler les indicateurs d'utilisation des ressources de base, tels que l'utilisation du processeur, l'utilisation de la mémoire du GPU, le réseau et le temps d' I/O attente. Il collecte ces métriques d’utilisation des ressources toutes les 500 millisecondes.

Par rapport aux CloudWatch métriques Amazon, qui collectent des métriques à intervalles d'une seconde, la fonctionnalité de surveillance de l' SageMaker IA fournit une granularité plus fine des mesures d'utilisation des ressources jusqu'à des intervalles de 100 millisecondes (0,1 seconde), ce qui vous permet d'approfondir les métriques au niveau d'une opération ou d'une étape.

Pour accéder au tableau de bord permettant de surveiller les mesures d'utilisation des ressources d'une tâche de formation, consultez l'interface utilisateur d'SageMaker AI Debugger dans SageMaker Studio Experiments.