Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Modification de la disponibilité du débogueur
Note
Amazon SageMaker Debugger n'est plus ouvert aux nouveaux clients. Les clients existants peuvent continuer à utiliser le service normalement. AWS continue d'investir dans l'amélioration de la sécurité et de la disponibilité de Debugger, mais nous ne prévoyons pas d'introduire de nouvelles fonctionnalités.
Remplacement d'Amazon SageMaker Debugger
Suivez ce guide pour passer à des services alternatifs.
Présentation de
Amazon SageMaker Debugger a fourni une formation sur l'observabilité, le débogage des modèles et le profilage du système en tant que fonctionnalité intégrée. SageMaker Ces fonctionnalités sont désormais mieux exploitées par la combinaison d'Amazon SageMaker AI MLflow, TensorBoard on SageMaker, et d'Amazon CloudWatch pour la formation à l'observabilité, le débogage des modèles et la surveillance des performances du système. Ces outils fournissent des fonctionnalités flexibles qui s'adaptent à votre flux de travail de formation spécifique, qu'il s'agisse de peaufiner des modèles de base, de former des architectures personnalisées ou d'exécuter des charges de travail distribuées.
Cartographie des capacités
| Capacité de débogage | Remplacé par | Ce qu'il fournit |
|---|---|---|
| Enregistrement des métriques de formation | Débit ML/ TensorBoard | Enregistrez, visualisez et comparez les indicateurs des différentes sessions d'entraînement |
| Suivi des modèles et des paramètres | MLflow | Suivez les hyperparamètres, les versions de modèles et les artefacts avec une reproductibilité totale |
| Analyse du gradient, de l'activation et du poids | TensorBoard | Plug-ins d'histogramme et de distribution pour inspecter les composants internes du modèle au cours des étapes de formation |
| Profilage des ressources du système (CPU, GPU, mémoire, disque) | Amazon CloudWatch | Real-time mesures d'utilisation avec tableaux de bord configurables |
| Diagnostics d'entraînement automatisés | Amazon CloudWatch Alarmes + MLflow | Surveillez toutes les métriques enregistrées, telles que la convergence des pertes, les normes de gradient, l'utilisation des ressources et alertez en cas de dépassement des seuils. La comparaison des exécutions MLflow identifie les régressions entre les expériences |
Étape 1 : Suppression de la configuration du débogueur
Supprimer DebuggerHookConfig de votre estimateur
Si votre script d'entraînement ou votre SageMaker estimateur inclutDebuggerHookConfig, ou des rules configurations Debugger-specific TensorBoardOutputConfig, supprimez-les. Cela désactive la capture automatique des tenseurs et l'évaluation des règles.
Note
Si vous utilisez la Estimator classe SageMaker Python SDK v2, envisagez également de passer aux nouvelles API de formation du SDK SageMaker Python ou d'CreateTrainingJobappeler directement Boto3, car les estimateurs sont une construction héritée.
Supprimer la sortie du débogueur dans Amazon S3
Le débogueur a stocké les données du tenseur et la sortie de profilage dans S3 sous des chemins tels que :
s3://<bucket>/<training-job-name>/debug-output/ s3://<bucket>/<training-job-name>/profiler-output/
Supprimez ces préfixes si vous n'avez plus besoin des données historiques. Vos journaux de tâches de formation et vos artefacts de modèle dans S3 restent inchangés.
Supprimer les règles de débogage personnalisées (si elles sont utilisées)
Si vous avez défini des conteneurs de règles personnalisés :
-
Supprimer les images Amazon ECR utilisées pour l'évaluation personnalisée des règles de débogage
-
Supprimer les scripts de définition de règles ou les configurations JSON qui ne sont plus nécessaires
Supprimer des groupes de CloudWatch journaux (facultatif)
Le débogueur a créé des groupes de journaux /aws/sagemaker/TrainingJobs pour l'évaluation des règles. Supprimez-les si vous n'en avez plus besoin pour réduire les coûts de stockage des journaux.
Passez en revue les politiques IAM
Supprimez les politiques IAM qui accordaient un accès spécifique à l'utilisation du débogueur :
-
s3:GetObject/limités3:PutObjectaux chemins de sortie du débogueur -
logs:PutLogEventspour les groupes de Debugger-specific journaux -
Autorisations pour l'exécution du conteneur de règles du débogueur
Conservez toutes les politiques encore nécessaires pour vos tâches de formation, MLflow ou CloudWatch.
Étape 2 : Configuration des remplacements
Intégrez MLflow pour le suivi des expériences
Amazon SageMaker AI propose une fonctionnalité MLflow sans serveur qui évolue de manière dynamique pour prendre en charge les tâches de développement de modèles d'IA sans frais supplémentaires. Consultez le blog de lancement
Utilisez MLflow pour :
-
Enregistrez les hyperparamètres, les mesures d'entraînement et les artefacts du modèle
-
Comparez les essais côte à côte pour identifier les régressions ou les améliorations
-
Suivez les versions des modèles et leur traçabilité, de l'expérience à la production
Pour commencer : des expériences d'apprentissage automatique utilisant Amazon SageMaker AI avec MLflow couvrent la configuration, la création d'un serveur de suivi et l'intégration à votre code de formation.
À utiliser TensorBoard pour l'introspection des modèles
TensorBoard dans Amazon SageMaker AI fournit une visibilité approfondie sur les composants internes du modèle pendant la formation :
-
Visualisez les distributions des dégradés et les histogrammes de poids entre les étapes
-
Surveillez les modèles d'activation et le comportement des couches
-
Suivez les métriques scalaires, les images et les visualisations personnalisées
Quand utiliser TensorBoard vs. MLflow : MLflow suit les métriques scalaires et prend en charge la visualisation de base pour la comparaison des exécutions. TensorBoard excelle dans l'introspection de modèles multidimensionnels : histogrammes de gradient, distributions de poids, graphiques informatiques et projections intégrées. Utilisez les deux ensemble : MLflow pour la gestion des expériences, TensorBoard pour les sessions de débogage approfondies.
Commencez : TensorBoard dans Amazon SageMaker AI
Utilisez Amazon CloudWatch pour la surveillance du système et les alertes
Amazon collecte CloudWatch les statistiques d'utilisation des ressources pour vos tâches de formation et prend en charge les alarmes configurables :
-
Surveillez l'utilisation du processeur, du GPU, de la mémoire et du disque en temps réel
-
Définissez des alarmes sur n'importe quel indicateur d'entraînement afin de détecter les anomalies (plateaux de pertes, goulots d'étranglement des ressources ou comportement de mesure inattendu)
-
Créez des tableaux de bord combinant les mesures du système et les mesures de formation pour une visibilité unifiée
Commencez : Amazon CloudWatch Metrics pour le suivi et l'analyse des offres de formation
Qu'advient-il de vos données existantes
-
Journaux d'entraînement dans S3 : les résultats de vos tâches de formation, les artefacts de votre modèle et les journaux restent accessibles. Ils sont indépendants de Debugger.
-
Données du tenseur du débogueur : les collections de tenseurs historiques stockées par Debugger restent dans S3 aux chemins répertoriés ci-dessus jusqu'à ce que vous les supprimiez. La bibliothèque
smdebugclientepeut toujours lire ces données à titre de référence. -
CloudWatch métriques : les statistiques d'entraînement historiques déjà disponibles CloudWatch sont conservées conformément aux paramètres de conservation des journaux de votre compte.