View a markdown version of this page

Änderung der Debugger-Verfügbarkeit - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Änderung der Debugger-Verfügbarkeit

Anmerkung

Amazon SageMaker Debugger steht neuen Kunden nicht mehr offen. Bestehende Kunden können den Service weiterhin wie gewohnt nutzen. AWS investiert weiterhin in Sicherheits- und Verfügbarkeitsverbesserungen für Debugger, aber wir planen nicht, neue Funktionen einzuführen.

Amazon SageMaker Debugger ersetzen

Folgen Sie dieser Anleitung, um zu alternativen Diensten überzugehen.

-Übersicht

Amazon SageMaker Debugger bot als integrierte Funktion die Beobachtbarkeit von Schulungen, das Debuggen von Modellen und die Erstellung von Systemprofilen. SageMaker Diese Funktionen werden jetzt besser durch eine Kombination aus Amazon SageMaker AI MLFlow, TensorBoard on und Amazon CloudWatch für das Training der Beobachtbarkeit SageMaker, das Modelldebugging und die Überwachung der Systemleistung unterstützt. Diese Tools bieten flexible Funktionen, die sich an Ihren spezifischen Trainingsablauf anpassen, unabhängig davon, ob Sie Basismodelle optimieren, benutzerdefinierte Architekturen trainieren oder verteilte Workloads ausführen.

Zuordnung der Fähigkeiten

Debugger-Fähigkeit Ersetzt durch Was es bietet
Protokollierung von Trainingsmetriken MLflow/ TensorBoard Protokollieren, visualisieren und vergleichen Sie Kennzahlen für alle Trainingsläufe
Modell- und Parameterverfolgung MLflow Verfolgen Sie Hyperparameter, Modellversionen und Artefakte mit voller Reproduzierbarkeit
Gradienten-, Aktivierungs- und Gewichtsanalyse TensorBoard Histogramm- und Verteilungs-Plugins zur Überprüfung der Modellinterna in allen Trainingsschritten
Profilerstellung von Systemressourcen (CPU, GPU, Speicher, Festplatte) Amazon CloudWatch Real-time Nutzungsmetriken mit konfigurierbaren Dashboards
Automatisierte Trainingsdiagnostik Amazon CloudWatch Alarms + MLFlow Überwachen Sie alle protokollierten Kennzahlen wie Verlustkonvergenz, Gradientennormen und Ressourcenauslastung und warnen Sie bei Grenzwertüberschreitungen. Der MLFlow-Vergleich identifiziert Regressionen zwischen Experimenten

Schritt 1: Debugger-Konfiguration entfernen

DebuggerHookConfig Aus Ihrem Schätzer entfernen

Wenn Ihr Trainingsskript oder SageMaker Kalkulator Konfigurationen enthält oder rules Konfigurationen enthält DebuggerHookConfig Debugger-specific TensorBoardOutputConfig, entfernen Sie diese. Dadurch werden die automatische Tensorerfassung und Regelauswertung deaktiviert.

Anmerkung

Wenn Sie die SageMaker Python SDK Estimator v2-Klasse verwenden, sollten Sie auch den Übergang zu den neueren SageMaker Python SDK-Training-APIs oder direkten CreateTrainingJob Boto3-Aufrufen in Betracht ziehen, da Estimators ein veraltetes Konstrukt sind.

Löschen Sie die Debugger-Ausgabe in Amazon S3

Der Debugger speicherte Tensordaten und die Profilerstellungsausgabe in S3 unter Pfaden wie:

s3://<bucket>/<training-job-name>/debug-output/ s3://<bucket>/<training-job-name>/profiler-output/

Löschen Sie diese Präfixe, wenn Sie die historischen Daten nicht mehr benötigen. Ihre Trainingsauftragsprotokolle und Modellartefakte in S3 bleiben davon unberührt.

Löschen Sie benutzerdefinierte Debugger-Regeln (falls verwendet)

Wenn Sie benutzerdefinierte Regelcontainer definiert haben:

  • Löschen Sie Amazon ECR-Images, die für die Bewertung benutzerdefinierter Debugger-Regeln verwendet wurden

  • Entfernen Sie Regeldefinitionsskripts oder JSON-Konfigurationen, die nicht mehr benötigt werden

Löschen Sie CloudWatch Protokollgruppen (optional)

Der Debugger hat unter Protokollgruppen /aws/sagemaker/TrainingJobs für die Regelauswertung erstellt. Löschen Sie diese, wenn sie nicht mehr benötigt werden, um die Kosten für die Protokollspeicherung zu senken.

Überprüfen Sie die IAM-Richtlinien

Entfernen Sie die IAM-Richtlinien, die den Zugriff speziell für die Verwendung des Debuggers gewährt haben:

  • s3:GetObject/beschränkt sich auf s3:PutObject Debugger-Ausgabepfade

  • logs:PutLogEventsfür Protokollgruppen Debugger-specific

  • Berechtigungen für die Ausführung von Debugger-Regelcontainern

Behalten Sie alle Richtlinien bei, die Sie für Ihre Trainingsjobs, MLflow oder noch benötigen. CloudWatch

Schritt 2: Ersatzprodukte konfigurieren

Integrieren Sie MLflow für die Nachverfolgung von Experimenten

Amazon SageMaker AI bietet eine serverlose MLFlow-Funktion, die dynamisch skaliert wird, um KI-Modellentwicklungsaufgaben ohne zusätzliche Kosten zu unterstützen. Sehen Sie sich den Launch-Blog an.

Verwenden Sie MLflow, um:

  • Protokollieren Sie Hyperparameter, Trainingsmetriken und Modellartefakte

  • Vergleichen Sie Läufe nebeneinander, um Regressionen oder Verbesserungen zu identifizieren

  • Verfolgen Sie die Modellversionen und den Verlauf vom Experiment bis zur Produktion

Erste Schritte: Experimente mit maschinellem Lernen unter Verwendung von Amazon SageMaker AI mit MLflow — behandelt die Einrichtung, die Erstellung eines Tracking-Servers und die Integration in Ihren Trainingscode.

TensorBoard Zur Modell-Introspektion verwenden

TensorBoard in Amazon bietet SageMaker KI während des Trainings einen umfassenden Einblick in die internen Abläufe der Modelle:

  • Visualisieren Sie Gradientenverteilungen und gewichten Sie Histogramme stufenweise

  • Überwachen Sie Aktivierungsmuster und Ebenenverhalten

  • Verfolgen Sie skalare Metriken, Bilder und benutzerdefinierte Visualisierungen

Wann sollte man vs. verwenden TensorBoard MLflow: MLflow verfolgt skalare Metriken und unterstützt grundlegende Visualisierungen für den Vergleich von Rechenläufen. TensorBoard zeichnet sich durch multidimensionale Modell-Introspektion aus — Gradientenhistogramme, Gewichtsverteilungen, Rechendiagramme und eingebettete Projektionen. Verwenden Sie beides zusammen: MLflow für das Experimentmanagement, für tiefgreifende Debugging-Sitzungen. TensorBoard

Erste Schritte: TensorBoard in Amazon AI SageMaker

Verwenden Sie Amazon CloudWatch für Systemüberwachung und Benachrichtigungen

Amazon CloudWatch erfasst Kennzahlen zur Ressourcenauslastung für Ihre Schulungsjobs und unterstützt konfigurierbare Alarme:

  • Überwachen Sie die CPU-, GPU-, Speicher- und Festplattenauslastung in Echtzeit

  • Stellen Sie Alarme für jede Trainingsmetrik ein, um Anomalien zu erkennen — Verlustplateaus, Ressourcenengpässe oder unerwartetes Verhalten der Messwerte

  • Erstellen Sie Dashboards, die Systemkennzahlen und Trainingsmetriken kombinieren, um einen einheitlichen Überblick zu erhalten

Erste Schritte: Amazon CloudWatch Metrics zur Überwachung und Analyse von Schulungsjobs

Was passiert mit Ihren vorhandenen Daten

  • Trainingsprotokolle in S3: Ihre Trainingsauftragsausgaben, Modellartefakte und Protokolle bleiben zugänglich. Diese sind unabhängig vom Debugger.

  • Debugger-Tensordaten: Historische Tensorsammlungen, die vom Debugger gespeichert wurden, verbleiben in S3 unter den oben aufgeführten Pfaden, bis Sie sie löschen. Die smdebug Client-Bibliothek kann diese Daten weiterhin als Referenz lesen.

  • CloudWatch Kennzahlen: Historische Trainingsmetriken, die bereits vorliegen, CloudWatch werden gemäß den Einstellungen für die Aufbewahrung von Protokollen in Ihrem Konto gespeichert.