View a markdown version of this page

Modification de la disponibilité du débogueur - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Modification de la disponibilité du débogueur

Note

Amazon SageMaker Debugger n'est plus ouvert aux nouveaux clients. Les clients existants peuvent continuer à utiliser le service normalement. AWS continue d'investir dans l'amélioration de la sécurité et de la disponibilité de Debugger, mais nous ne prévoyons pas d'introduire de nouvelles fonctionnalités.

Remplacement d'Amazon SageMaker Debugger

Suivez ce guide pour passer à des services alternatifs.

Présentation de

Amazon SageMaker Debugger a fourni une formation sur l'observabilité, le débogage des modèles et le profilage du système en tant que fonctionnalité intégrée. SageMaker Ces fonctionnalités sont désormais mieux exploitées par la combinaison d'Amazon SageMaker AI MLflow, TensorBoard on SageMaker, et d'Amazon CloudWatch pour la formation à l'observabilité, le débogage des modèles et la surveillance des performances du système. Ces outils fournissent des fonctionnalités flexibles qui s'adaptent à votre flux de travail de formation spécifique, qu'il s'agisse de peaufiner des modèles de base, de former des architectures personnalisées ou d'exécuter des charges de travail distribuées.

Cartographie des capacités

Capacité de débogage Remplacé par Ce qu'il fournit
Enregistrement des métriques de formation Débit ML/ TensorBoard Enregistrez, visualisez et comparez les indicateurs des différentes sessions d'entraînement
Suivi des modèles et des paramètres MLflow Suivez les hyperparamètres, les versions de modèles et les artefacts avec une reproductibilité totale
Analyse du gradient, de l'activation et du poids TensorBoard Plug-ins d'histogramme et de distribution pour inspecter les composants internes du modèle au cours des étapes de formation
Profilage des ressources du système (CPU, GPU, mémoire, disque) Amazon CloudWatch Real-time mesures d'utilisation avec tableaux de bord configurables
Diagnostics d'entraînement automatisés Amazon CloudWatch Alarmes + MLflow Surveillez toutes les métriques enregistrées, telles que la convergence des pertes, les normes de gradient, l'utilisation des ressources et alertez en cas de dépassement des seuils. La comparaison des exécutions MLflow identifie les régressions entre les expériences

Étape 1 : Suppression de la configuration du débogueur

Supprimer DebuggerHookConfig de votre estimateur

Si votre script d'entraînement ou votre SageMaker estimateur inclutDebuggerHookConfig, ou des rules configurations Debugger-specific TensorBoardOutputConfig, supprimez-les. Cela désactive la capture automatique des tenseurs et l'évaluation des règles.

Note

Si vous utilisez la Estimator classe SageMaker Python SDK v2, envisagez également de passer aux nouvelles API de formation du SDK SageMaker Python ou d'CreateTrainingJobappeler directement Boto3, car les estimateurs sont une construction héritée.

Supprimer la sortie du débogueur dans Amazon S3

Le débogueur a stocké les données du tenseur et la sortie de profilage dans S3 sous des chemins tels que :

s3://<bucket>/<training-job-name>/debug-output/ s3://<bucket>/<training-job-name>/profiler-output/

Supprimez ces préfixes si vous n'avez plus besoin des données historiques. Vos journaux de tâches de formation et vos artefacts de modèle dans S3 restent inchangés.

Supprimer les règles de débogage personnalisées (si elles sont utilisées)

Si vous avez défini des conteneurs de règles personnalisés :

  • Supprimer les images Amazon ECR utilisées pour l'évaluation personnalisée des règles de débogage

  • Supprimer les scripts de définition de règles ou les configurations JSON qui ne sont plus nécessaires

Supprimer des groupes de CloudWatch journaux (facultatif)

Le débogueur a créé des groupes de journaux /aws/sagemaker/TrainingJobs pour l'évaluation des règles. Supprimez-les si vous n'en avez plus besoin pour réduire les coûts de stockage des journaux.

Passez en revue les politiques IAM

Supprimez les politiques IAM qui accordaient un accès spécifique à l'utilisation du débogueur :

  • s3:GetObject/limité s3:PutObject aux chemins de sortie du débogueur

  • logs:PutLogEventspour les groupes de Debugger-specific journaux

  • Autorisations pour l'exécution du conteneur de règles du débogueur

Conservez toutes les politiques encore nécessaires pour vos tâches de formation, MLflow ou CloudWatch.

Étape 2 : Configuration des remplacements

Intégrez MLflow pour le suivi des expériences

Amazon SageMaker AI propose une fonctionnalité MLflow sans serveur qui évolue de manière dynamique pour prendre en charge les tâches de développement de modèles d'IA sans frais supplémentaires. Consultez le blog de lancement.

Utilisez MLflow pour :

  • Enregistrez les hyperparamètres, les mesures d'entraînement et les artefacts du modèle

  • Comparez les essais côte à côte pour identifier les régressions ou les améliorations

  • Suivez les versions des modèles et leur traçabilité, de l'expérience à la production

Pour commencer : des expériences d'apprentissage automatique utilisant Amazon SageMaker AI avec MLflow couvrent la configuration, la création d'un serveur de suivi et l'intégration à votre code de formation.

À utiliser TensorBoard pour l'introspection des modèles

TensorBoard dans Amazon SageMaker AI fournit une visibilité approfondie sur les composants internes du modèle pendant la formation :

  • Visualisez les distributions des dégradés et les histogrammes de poids entre les étapes

  • Surveillez les modèles d'activation et le comportement des couches

  • Suivez les métriques scalaires, les images et les visualisations personnalisées

Quand utiliser TensorBoard vs. MLflow : MLflow suit les métriques scalaires et prend en charge la visualisation de base pour la comparaison des exécutions. TensorBoard excelle dans l'introspection de modèles multidimensionnels : histogrammes de gradient, distributions de poids, graphiques informatiques et projections intégrées. Utilisez les deux ensemble : MLflow pour la gestion des expériences, TensorBoard pour les sessions de débogage approfondies.

Commencez : TensorBoard dans Amazon SageMaker AI

Utilisez Amazon CloudWatch pour la surveillance du système et les alertes

Amazon collecte CloudWatch les statistiques d'utilisation des ressources pour vos tâches de formation et prend en charge les alarmes configurables :

  • Surveillez l'utilisation du processeur, du GPU, de la mémoire et du disque en temps réel

  • Définissez des alarmes sur n'importe quel indicateur d'entraînement afin de détecter les anomalies (plateaux de pertes, goulots d'étranglement des ressources ou comportement de mesure inattendu)

  • Créez des tableaux de bord combinant les mesures du système et les mesures de formation pour une visibilité unifiée

Commencez : Amazon CloudWatch Metrics pour le suivi et l'analyse des offres de formation

Qu'advient-il de vos données existantes

  • Journaux d'entraînement dans S3 : les résultats de vos tâches de formation, les artefacts de votre modèle et les journaux restent accessibles. Ils sont indépendants de Debugger.

  • Données du tenseur du débogueur : les collections de tenseurs historiques stockées par Debugger restent dans S3 aux chemins répertoriés ci-dessus jusqu'à ce que vous les supprimiez. La bibliothèque smdebug cliente peut toujours lire ces données à titre de référence.

  • CloudWatch métriques : les statistiques d'entraînement historiques déjà disponibles CloudWatch sont conservées conformément aux paramètres de conservation des journaux de votre compte.