View a markdown version of this page

Alteração na disponibilidade do depurador - SageMaker IA da Amazon

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Alteração na disponibilidade do depurador

nota

O Amazon SageMaker Debugger não está mais aberto a novos clientes. Os clientes existentes podem continuar usando o serviço normalmente. AWS continua investindo em melhorias de segurança e disponibilidade para o Debugger, mas não planejamos introduzir novos recursos.

Substituindo o Amazon SageMaker Debugger

Siga este guia para fazer a transição para serviços alternativos.

Visão geral do

O Amazon SageMaker Debugger forneceu treinamento, observabilidade, depuração de modelos e criação de perfil do sistema como um recurso incorporado. SageMaker Agora, esses recursos são melhor atendidos por uma combinação do Amazon SageMaker AI MLFlow, TensorBoard on e Amazon CloudWatch para treinamentos SageMaker, observabilidade, depuração de modelos e monitoramento do desempenho do sistema. Essas ferramentas fornecem recursos flexíveis que se adaptam ao seu fluxo de trabalho de treinamento específico, esteja você ajustando modelos básicos, treinando arquiteturas personalizadas ou executando cargas de trabalho distribuídas.

Mapeamento de capacidades

Capacidade de depuração Substituído por O que ele fornece
Registro de métricas de treinamento Fluxo de mL/ TensorBoard Registre, visualize e compare métricas em todas as sessões de treinamento
Rastreamento de modelos e parâmetros MLFlow Rastreie hiperparâmetros, versões de modelos e artefatos com reprodutibilidade total
Análise de gradiente, ativação e peso TensorBoard Plugins de histograma e distribuição para inspecionar os componentes internos do modelo em todas as etapas de treinamento
Perfil de recursos do sistema (CPU, GPU, memória, disco) Amazônia CloudWatch Real-time métricas de utilização com painéis configuráveis
Diagnóstico automatizado de treinamento Amazon CloudWatch Alarms + MLFlow Monitore qualquer métrica registrada, como convergência de perdas, normas de gradiente, utilização de recursos e alerta sobre violações de limites. A comparação de execuções do MLflow identifica regressões entre experimentos

Etapa 1: Removendo a configuração do Debugger

Remova DebuggerHookConfig do seu estimador

Se seu script de treinamento ou SageMaker estimador incluirDebuggerHookConfig, ou rules configurações Debugger-specific TensorBoardOutputConfig, remova-os. Isso desativa a captura automática de tensores e a avaliação de regras.

nota

Se você estiver usando a Estimator classe SageMaker Python SDK v2, considere também fazer a transição para as novas APIs de treinamento do SDK do SageMaker Python ou chamadas diretas do CreateTrainingJob Boto3, pois os estimadores são uma construção legada.

Exclua a saída do Debugger no Amazon S3

O Debugger armazenou dados de tensor e saída de perfil no S3 em caminhos como:

s3://<bucket>/<training-job-name>/debug-output/ s3://<bucket>/<training-job-name>/profiler-output/

Exclua esses prefixos se você não precisar mais dos dados históricos. Seus registros de tarefas de treinamento e artefatos de modelo no S3 permanecem inalterados.

Excluir regras personalizadas do Debugger (se usadas)

Se você definiu contêineres de regras personalizados:

  • Exclua imagens do Amazon ECR usadas para avaliação personalizada de regras do Debugger

  • Remova scripts de definição de regras ou configurações JSON que não são mais necessários

Excluir grupos de CloudWatch registros (opcional)

O Debugger criou grupos de log em /aws/sagemaker/TrainingJobs para avaliação de regras. Exclua-os se não forem mais necessários para reduzir os custos de armazenamento de registros.

Analise as políticas do IAM

Remova as políticas do IAM que concediam acesso específico para uso do Debugger:

  • s3:GetObject/com s3:PutObject escopo para os caminhos de saída do Debugger

  • logs:PutLogEventspara grupos Debugger-specific de registros

  • Permissões para execução do contêiner de regras do Debugger

Mantenha todas as políticas ainda necessárias para seus trabalhos de treinamento, MLflow ou CloudWatch.

Etapa 2: Configurando substituições

Integre o MLflow para rastreamento de experimentos

O Amazon SageMaker AI oferece um recurso MLflow sem servidor que se expande dinamicamente para dar suporte às tarefas de desenvolvimento de modelos de IA sem custo adicional. Veja o blog de lançamento.

Use o MLflow para:

  • Registre hiperparâmetros, métricas de treinamento e artefatos de modelo

  • Compare as execuções lado a lado para identificar regressões ou melhorias

  • Acompanhe as versões e a linhagem do modelo, do experimento à produção

Comece: experimentos de aprendizado de máquina usando o Amazon SageMaker AI com o MLflow — abrangem a configuração, a criação de um servidor de rastreamento e a integração com seu código de treinamento.

Uso TensorBoard para introspecção de modelos

TensorBoard na Amazon, a SageMaker IA fornece visibilidade profunda dos componentes internos do modelo durante o treinamento:

  • Visualize distribuições de gradientes e histogramas de peso em todas as etapas

  • Monitore os padrões de ativação e o comportamento da camada

  • Acompanhe métricas escalares, imagens e visualizações personalizadas

Quando usar TensorBoard vs. MLflow: O MLflow rastreia métricas escalares e suporta visualização básica para comparação de execuções. TensorBoard se destaca na introspecção de modelos multidimensionais — histogramas de gradiente, distribuições de peso, gráficos computacionais e projeções de incorporação. Use os dois juntos: MLflow para gerenciamento de experimentos, TensorBoard para sessões de depuração profunda.

Comece a usar: TensorBoard na Amazon SageMaker AI

Use a Amazon CloudWatch para monitoramento e alertas do sistema

A Amazon CloudWatch captura métricas de utilização de recursos para seus trabalhos de treinamento e oferece suporte a alarmes configuráveis:

  • Monitore a utilização de CPU, GPU, memória e disco em tempo real

  • Defina alarmes em qualquer métrica de treinamento para detectar anomalias — níveis de perda, gargalos de recursos ou comportamento inesperado da métrica

  • Crie painéis combinando métricas do sistema e métricas de treinamento para uma visibilidade unificada

Comece a usar: CloudWatch Métricas da Amazon para monitorar e analisar trabalhos de treinamento

O que acontece com seus dados existentes

  • Registros de treinamento no S3: a saída do trabalho de treinamento, os artefatos do modelo e os registros permanecem acessíveis. Eles são independentes do Debugger.

  • Dados do tensor do depurador: as coleções históricas de tensores armazenadas pelo Debugger permanecem no S3 nos caminhos listados acima até que você as exclua. A biblioteca smdebug cliente ainda pode ler esses dados para referência.

  • CloudWatch métricas: as métricas históricas de treinamento já incluídas CloudWatch são mantidas de acordo com as configurações de retenção de registros da sua conta.