View a markdown version of this page

Modifica della disponibilità del debugger - Amazon SageMaker AI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Modifica della disponibilità del debugger

Nota

Amazon SageMaker Debugger non è più aperto a nuovi clienti. I clienti esistenti possono continuare a utilizzare il servizio normalmente. AWS continua a investire in miglioramenti della sicurezza e della disponibilità di Debugger, ma non prevediamo di introdurre nuove funzionalità.

Sostituzione di Amazon Debugger SageMaker

Segui questa guida per passare a servizi alternativi.

Panoramica di

Amazon SageMaker Debugger ha fornito l'osservabilità della formazione, il debug dei modelli e la profilazione del sistema come funzionalità integrate. SageMaker Queste funzionalità sono ora meglio servite da una combinazione di Amazon SageMaker AI MLFlow, TensorBoard on e Amazon CloudWatch per la formazione sull'osservabilità SageMaker, il debug dei modelli e il monitoraggio delle prestazioni del sistema. Questi strumenti offrono funzionalità flessibili che si adattano al tuo flusso di lavoro di formazione specifico, sia che tu stia perfezionando i modelli di base, addestrando architetture personalizzate o eseguendo carichi di lavoro distribuiti.

Mappatura delle capacità

Capacità di debugger Sostituita da Cosa fornisce
Registrazione delle metriche di allenamento MLFlow/ TensorBoard Registra, visualizza e confronta le metriche tra le sessioni di formazione
Monitoraggio di modelli e parametri MLflow Tieni traccia degli iperparametri, delle versioni dei modelli e degli artefatti con una riproducibilità completa
Analisi del gradiente, dell'attivazione e del peso TensorBoard Plugin di istogramma e distribuzione per l'ispezione degli interni del modello durante le fasi di formazione
Profilazione delle risorse di sistema (CPU, GPU, memoria, disco) Amazon CloudWatch Real-time metriche di utilizzo con dashboard configurabili
Diagnostica automatizzata della formazione Amazon CloudWatch Alarms + MLFlow Monitora tutte le metriche registrate, come la convergenza delle perdite, le norme sui gradienti, l'utilizzo delle risorse e gli avvisi in caso di superamento delle soglie. Il confronto delle esecuzioni di MLFlow identifica le regressioni tra gli esperimenti

Passaggio 1: rimozione della configurazione del debugger

Rimuovi DebuggerHookConfig dal tuo stimatore

Se lo script di formazione o lo SageMaker stimatore include rules delle configurazioni DebuggerHookConfig Debugger-specific TensorBoardOutputConfig, rimuovile. Ciò disabilita l'acquisizione automatica dei tensori e la valutazione delle regole.

Nota

Se stai usando la Estimator classe SageMaker Python SDK v2, considera anche la transizione alle più recenti API di formazione SageMaker Python SDK o alle chiamate dirette a Boto3, poiché gli estimatori sono un costrutto legacy. CreateTrainingJob

Elimina l'output del debugger in Amazon S3

Il debugger ha archiviato i dati dei tensori e l'output di profilazione in S3 in percorsi come:

s3://<bucket>/<training-job-name>/debug-output/ s3://<bucket>/<training-job-name>/profiler-output/

Elimina questi prefissi se non hai più bisogno dei dati storici. I registri dei processi di formazione e gli artefatti del modello in S3 rimangono inalterati.

Elimina le regole Debugger personalizzate (se utilizzate)

Se hai definito contenitori di regole personalizzati:

  • Elimina le immagini Amazon ECR utilizzate per la valutazione personalizzata delle regole Debugger

  • Rimuovi gli script di definizione delle regole o le configurazioni JSON che non sono più necessari

Elimina i gruppi di CloudWatch log (opzionale)

Il debugger ha creato i gruppi di log in /aws/sagemaker/TrainingJobs per la valutazione delle regole. Eliminali se non sono più necessari per ridurre i costi di archiviazione dei log.

Rivedi le politiche IAM

Rimuovi le politiche IAM che concedevano l'accesso specificamente per l'utilizzo del Debugger:

  • s3:GetObject/ha come s3:PutObject ambito i percorsi di output del Debugger

  • logs:PutLogEventsper gruppi di log Debugger-specific

  • Autorizzazioni per l'esecuzione del contenitore di regole Debugger

Conserva tutte le politiche ancora necessarie per i tuoi lavori di formazione, MLFlow o. CloudWatch

Fase 2: Configurazione delle sostituzioni

Integra MLFlow per il monitoraggio degli esperimenti

Amazon SageMaker AI offre una funzionalità MLFlow senza server che si ridimensiona dinamicamente per supportare le attività di sviluppo di modelli AI senza costi aggiuntivi. Consulta il blog di lancio. https://aws.amazon.com/blogs/aws/accelerate-ai-development-using-amazon-sagemaker-ai-with-serverless-mlflow/

Usa MLFlow per:

  • Registra iperparametri, metriche di addestramento e artefatti del modello

  • Confronta le esecuzioni fianco a fianco per identificare regressioni o miglioramenti

  • Tieni traccia delle versioni dei modelli e della loro evoluzione dall'esperimento alla produzione

Inizia: esperimenti di machine learning che utilizzano Amazon SageMaker AI con MLFlow: includono la configurazione, la creazione di un server di tracciamento e l'integrazione con il codice di formazione.

Da utilizzare per l' TensorBoard introspezione dei modelli

TensorBoard in Amazon, l' SageMaker intelligenza artificiale offre una visibilità approfondita degli elementi interni del modello durante l'addestramento:

  • Visualizza le distribuzioni dei gradienti e gli istogrammi del peso nei vari passaggi

  • Monitora i modelli di attivazione e il comportamento dei livelli

  • Tieni traccia delle metriche scalari, delle immagini e delle visualizzazioni personalizzate

Quando usare vs. TensorBoard MLFlow: MLFlow tiene traccia delle metriche scalari e supporta la visualizzazione di base per il confronto delle esecuzioni. TensorBoard eccelle nell'introspezione multidimensionale dei modelli: istogrammi a gradiente, distribuzioni del peso, grafici computazionali e proiezioni di incorporamento. Usali entrambi insieme: MLFlow per la gestione degli esperimenti, per sessioni di debug approfondite. TensorBoard

Inizia: TensorBoard in Amazon AI SageMaker

Usa Amazon CloudWatch per il monitoraggio del sistema e gli avvisi

Amazon CloudWatch acquisisce i parametri di utilizzo delle risorse per i tuoi lavori di formazione e supporta allarmi configurabili:

  • Monitora l'utilizzo di CPU, GPU, memoria e disco in tempo reale

  • Imposta allarmi su qualsiasi metrica di addestramento per rilevare anomalie, ad esempio picchi di perdite, problemi nelle risorse o comportamenti imprevisti delle metriche

  • Crea dashboard combinando metriche di sistema e metriche di formazione per una visibilità unificata

Inizia subito: Amazon CloudWatch Metrics per il monitoraggio e l'analisi dei lavori di formazione

Cosa succede ai tuoi dati esistenti

  • Registri di formazione in S3: i risultati del lavoro di formazione, gli artefatti del modello e i registri rimangono accessibili. Sono indipendenti da Debugger.

  • Dati sui tensori del debugger: le raccolte di tensori storiche archiviate da Debugger rimangono in S3 nei percorsi sopra elencati finché non le elimini. La libreria smdebug client può ancora leggere questi dati come riferimento.

  • CloudWatch metriche: le metriche di formazione cronologiche già CloudWatch disponibili vengono conservate in base alle impostazioni di conservazione dei log del tuo account.