View a markdown version of this page

SageMaker HyperPod referência de eventos de cluster - SageMaker IA da Amazon

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

SageMaker HyperPod referência de eventos de cluster

Esta página fornece uma referência completa de todos os eventos estruturados emitidos pelos SageMaker HyperPod clusters da Amazon. Os eventos fornecem visibilidade das operações em nível de cluster, grupo de instâncias e instância, incluindo provisionamento, escalabilidade, aplicação de patches e mudanças no ciclo de vida específicas do orquestrador.

Os eventos de cluster estão disponíveis para HyperPod clusters com NodeProvisioningMode definido comoContinuous. Os eventos podem ser acessados por meio das DescribeClusterEvent APIs ListClusterEvents e, da guia Eventos do console de SageMaker IA e da Amazon EventBridge.

Registro de eventos de cluster

Cada evento de cluster é representado como um registro estruturado contendo identificação, tempo, escopo, severidade e metadados específicos da operação. O exemplo a seguir mostra um registro completo do evento fornecido por meio da DescribeClusterEvent API e da Amazon EventBridge:

{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }

Campos de registro de eventos

O objeto detail.EventDetails contém os campos a seguir.

Campo Tipo Obrigatório Description
EventId Cadeia de caracteres (UUID) Sim Identificador exclusivo para o evento.
ClusterArn String Sim ARN do HyperPod cluster.
ClusterName String Sim Nome do HyperPod cluster.
EventTime Timestamp Sim Quando o evento ocorreu (milissegundos de época).
ResourceType String Sim Escopo do evento:Cluster,InstanceGroup, ouInstance.
EventLevel String Sim Classificação de gravidade:Info,Warn, ouError.
Description String Não Human-readable resumo do evento.
InstanceGroupName String Não Nome do grupo de instâncias (presente quando ResourceType é InstanceGroup ouInstance).
InstanceId String Não ID da instância EC2 (presente quando ResourceType éInstance).
EventDetails Objeto Não Metadados adicionais específicos para o tipo e a operação do recurso.

Níveis de eventos

Nível Significado
Info A operação foi concluída com êxito ou está progredindo normalmente.
Warn Operação concluída com um problema não crítico ou uma condição que pode exigir atenção futura.
Error A operação falhou ou requer atenção imediata.

Resource types

ResourceType Escopo Eventos de exemplo
Cluster Whole-cluster operações Cluster creation/update iniciado, falha na operação do cluster
InstanceGroup Operações de grupos de instâncias Escalabilidade started/completed, aplicação de patches programada, ciclo de vida do FSx
Instance Operações de instância individual Provisionamento EC2, execução de scripts de ciclo de vida, gerenciamento de ENI, encerramento

EventDetails metadados

Os eventos de cluster incluem um EventMetadata objeto dentro do EventDetails campo que fornece um contexto específico da operação além do que a descrição do evento transmite. O conteúdo do EventMetadata varia de acordo com o tipo de recurso e o tipo de evento. Para ver o esquema completo e os campos compatíveis, consulte EventMetadata o Amazon SageMaker AI API Reference.

EventBridge campos de envelope

Quando entregue pela Amazon EventBridge, o registro do evento é embalado em um EventBridge envelope padrão:

Campo Description
version EventBridge versão do esquema (sempre"0").
id ID de EventBridge evento exclusivo.
detail-type SageMaker HyperPod Cluster Event
source aws.sagemaker
account AWS ID da conta que é proprietária do cluster.
time Carimbo de data/hora ISO 8601 do evento.
region AWS Região em que o cluster reside.
resources Matriz contendo o ARN do cluster.
detail Contém o EventDetails objeto descrito acima.

Eventos comuns (EKS e Slurm)

Os eventos a seguir são emitidos para todos os HyperPod clusters, independentemente do orquestrador. A coluna Descrição mostra o valor do Description campo no registro do evento conforme ele aparece na resposta da API e na guia Eventos do console.

Ciclo de vida do cluster

Event Description
Operação de cluster iniciada Cluster <cluster-name><operation>iniciado com sucesso
Falha no início da operação do cluster Falha ao iniciar o cluster <cluster-name><operation>
Operação de cluster concluída Cluster <cluster-name><operation>concluído com sucesso
Falha na operação do cluster <cluster-name><operation>Falha no cluster

Ciclo de vida do grupo de instâncias

Event Description
Operação de grupo de instâncias iniciada InstanceGroup <instance-group-name><operation>iniciado com sucesso no Cluster <cluster-name>
Falha no início da operação do grupo de instâncias Falha ao iniciar InstanceGroup <instance-group-name><operation>no cluster <cluster-name>
Operação de grupo de instâncias concluída Grupo de instâncias <instance-group-name><operation>no cluster <cluster-name>concluído com êxito
Falha na operação do grupo de instâncias <instance-group-name><operation><cluster-name>Falha no grupo de instâncias no cluster

Configuração de rede de grupos de instâncias

Event Description
Configuração de rede encontrada Sub-rede encontrada <subnet-id>em AZ <availability-zone>com SecurityGroupIds <security-group-ids>for IG <instance-group-name>in Cluster <cluster-name>
Falha na configuração da rede Falha ao processar detalhes de configuração de rede do grupo de instâncias para IG <instance-group-name>no cluster <cluster-name>
Foi encontrada uma substituição de AMI personalizada Foi encontrada uma substituição de AMI personalizada <ami-id>para IG <instance-group-name>no cluster <cluster-name>
Falha na substituição da AMI personalizada Falha ao processar detalhes de substituição de AMI personalizada para IG <instance-group-name>no cluster <cluster-name>
Configuração de rede da plataforma usada Usando a configuração de rede fornecida pela HyperPod plataforma para IG <instance-group-name>in Cluster <cluster-name>
Configuração de rede determinada Configuração de rede do grupo de instâncias determinada com sucesso para IG <instance-group-name>in Cluster <cluster-name>

Criação de instância

Event Description
Operação de instância iniciada Instância <operation>iniciada com sucesso no Cluster <cluster-name>e no IG <instance-group-name>
Falha no início da operação da instância Falha ao iniciar a instância <operation>no cluster <cluster-name>e no IG <instance-group-name>
Reserva de capacidade encontrada CapacityReservation ID encontrada <reservation-id>para Cluster <cluster-name>e IG<instance-group-name>, usando capacidade reservada
Reserva de capacidade não encontrada Não CapacityReservation foi encontrado para Cluster <cluster-name>e IG<instance-group-name>, usando pool sob demanda
Falha na configuração da carga útil da instância Falha ao processar CapacityReservationDetails para Cluster <cluster-name>e IG <instance-group-name>
Criação da ENI do cliente Customer ENI criado com sucesso, por exemplo, em Cluster <cluster-name>e IG <instance-group-name>
Falha na criação da ENI do cliente Falha ao criar o Customer ENI, por exemplo, no Cluster <cluster-name>e no IG <instance-group-name>
Instância EC2 provisionada <cluster-name>Instância EC2 <instance-id>provisionada com sucesso no cluster e no IG <instance-group-name>
Falha na criação da instância EC2 Falha ao provisionar a instância do EC2 no cluster <cluster-name>e no IG <instance-group-name>
Status do script do ciclo de vida atualizado <instance-id>A execução do script do ciclo de vida da instância para EC2 Instance tem <status>
Falha na atualização do status do script do ciclo de vida Falha ao atualizar o status de execução do script do ciclo de vida da instância para EC2InstanceId <instance-id>
Falha na criação da instância com registros do ciclo de vida <instance-id>A execução do script do ciclo de vida da instância para a instância do EC2 falhou. Para visualizar os registros do script do ciclo de vida, visite o grupo de registros...
A limpeza de ENI não utilizada foi bem-sucedida <cluster-name>Os ENIs do cliente não utilizados foram excluídos com sucesso para a instância do EC2 no cluster e <instance-id>no IG <instance-group-name>
Falha na limpeza de ENI não utilizada <cluster-name>Falha ao excluir ENIs do cliente não utilizados para a instância do EC2 no cluster e <instance-id>no IG <instance-group-name>

Exclusão de instância

Event Description
Encerramento da instância EC2 em andamento O encerramento da instância do EC2 <instance-id>está atualmente em andamento no Cluster <cluster-name>e no IG <instance-group-name>
Falha no encerramento da instância do EC2 <cluster-name>Falha ao encerrar a instância do EC2 <instance-id>no cluster e no IG <instance-group-name>
ENI do cliente excluído <cluster-name>O ENI do cliente foi excluído com sucesso para a instância do EC2 <instance-id>no cluster e no IG <instance-group-name>
Falha na exclusão do ENI do cliente <cluster-name>Falha ao excluir a ENI do cliente para a instância EC2 <instance-id>no cluster e no IG <instance-group-name>

Reinicialização da instância

Event Description
Reinicialização da instância EC2 em andamento <cluster-name>A reinicialização da instância do EC2 <instance-id>está em andamento no Cluster e no IG <instance-group-name>
Falha na solicitação de reinicialização da instância EC2 <cluster-name>Falha ao enviar a solicitação de reinicialização para a instância do EC2 <instance-id>no cluster e no IG <instance-group-name>

Operação de instância (genérica)

Event Description
Operação de instância concluída Instância <operation><instance-id>no Cluster <cluster-name>e no IG <instance-group-name>concluída com êxito
Falha na operação da instância <operation><instance-id><cluster-name><instance-group-name>Falha na instância no cluster e no IG

Substituição de instâncias

Event Description
A substituição da instância foi iniciada A instância <instance-id>está sendo iniciada como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name>
Falha no início da substituição da instância <instance-id>Falha ao iniciar a instância como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name>
Substituição de instância concluída Instância <instance-id><operation>concluída com sucesso como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name>
Falha na substituição da instância A instância <instance-id><operation>falhou como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name>

Ciclo de vida do sistema de arquivos FSx

Event Description
Criação de FSx iniciada Começou a criação do FSx para o IG <instance-group-name>in Cluster <cluster-name>
Falha na criação do FSx Falha ao criar FSx para IG <instance-group-name>no cluster <cluster-name>
Criação do FSx concluída Criação de FSx concluída com sucesso para IG <instance-group-name>in Cluster <cluster-name>
A exclusão do FSx foi iniciada <instance-group-name>A exclusão de FSx foi iniciada para IG in Cluster <cluster-name>
Falha na exclusão do FSx Falha ao excluir o FSx for IG <instance-group-name>no cluster <cluster-name>
Exclusão do FSx concluída <instance-group-name>Exclusão de FSx concluída com sucesso para IG in Cluster <cluster-name>
A atualização do FSx foi iniciada Atualização FSx iniciada para IG <instance-group-name>in Cluster <cluster-name>
Falha na atualização do FSx Falha ao atualizar o FSx para IG <instance-group-name>no cluster <cluster-name>
Atualização do FSx concluída Atualização do FSx concluída com sucesso para IG <instance-group-name>in Cluster <cluster-name>

Aplicação de patches (etapas comuns)

Esses eventos de patch são emitidos para clusters EKS e Slurm durante as operações. UpdateClusterSoftware

Event Description
Aplicação de patches em grupos de instâncias agendada InstanceGroup <instance-group-name>in Cluster <cluster-name>foi agendado UpdateClusterSoftware para o mais recente.
Falha no cronograma de correção do grupo de instâncias Falha ao agendar UpdateClusterSoftware o IG <instance-group-name>in Cluster<cluster-name>.
A correção de grupos de instâncias foi iniciada UpdateClusterSoftware iniciado para IG <instance-group-name>in Cluster <cluster-name>usando <strategy>estratégia.
Falha no início do patch do grupo de instâncias <cluster-name>Falha ao iniciar o UpdateClusterSoftware IG <instance-group-name>no Cluster.
Próximo lote de patches selecionado Próximo lote de atualização selecionado para IG <instance-group-name>in Cluster<cluster-name>.
Falha na seleção do próximo lote de patch Falha ao selecionar o próximo lote de atualização para IG <instance-group-name>no Cluster<cluster-name>.
Instâncias com falha na fila para substituição Instâncias com falha no IG <instance-group-name>in Cluster em <cluster-name>fila para substituição do nó.
Falha no enfileiramento de substituição de instâncias <cluster-name>Falha ao enfileirar instâncias para substituição de nós no IG <instance-group-name>in Cluster.
Aplicação de patches em grupos de instâncias concluída UpdateClusterSoftware concluído com sucesso para IG <instance-group-name>in Cluster<cluster-name>.
Falha na conclusão do patch do grupo de instâncias Falha na conclusão UpdateClusterSoftware do IG <instance-group-name>in Cluster<cluster-name>.
A substituição do volume raiz foi iniciada A substituição do volume raiz foi iniciada para Instance <instance-id>in IG<instance-group-name>.
Falha na substituição do volume raiz Falha ao iniciar a substituição do volume raiz para Instance <instance-id>in IG<instance-group-name>.
A correção de instâncias foi bem-sucedida Instância <instance-id>no IG <instance-group-name>atualizada com sucesso.

EKS-specific eventos

Os eventos a seguir são emitidos somente para HyperPod clusters orquestrados com o Amazon EKS.

Gerenciamento de entradas de acesso

Event Description
Operação de entrada de acesso SLR bem-sucedida Entrada de acesso SLR <operation>bem-sucedida para cluster <cluster-name>
Falha na operação de entrada de acesso à SLR <operation>Falha na entrada de acesso SLR para o cluster <cluster-name>
A operação de entradas de acesso do EKS foi bem-sucedida Entradas de acesso EKS <operation>bem-sucedidas para o cluster <cluster-name>
Falha na operação de entradas de acesso do EKS <operation>Falha nas entradas de acesso do EKS para o cluster <cluster-name>

Atualizações de configuração do Kubernetes

Event Description
A atualização de configuração do Kubernetes foi bem-sucedida <instance-id><cluster-name>Configuração do Kubernetes atualizada com sucesso, por exemplo, em Cluster e IG <instance-group-name>
Falha na atualização da configuração do Kubernetes <instance-id><cluster-name>Falha ao atualizar a configuração do Kubernetes, por exemplo, no Cluster e no IG <instance-group-name>

Escalonamento automático Karpenter

Event Description
A operação de escalonamento automático foi bem-sucedida AutoScaling <operation><status>com sucesso no Cluster <cluster-name>
Falha na operação de escalonamento automático Falha ao <operation> AutoScaling entrar no cluster <cluster-name>
A instalação do Karpenter CRD foi bem-sucedida CustomResourceDefinition instalação concluída com sucesso no EKS Cluster <cluster-name>
Falha na instalação do Karpenter CRD CustomResourceDefinition falha na instalação do EKS Cluster <cluster-name>
A atualização da política de acesso Karpenter SLR foi bem-sucedida <operation>políticas de acesso com entrada de AmazonSageMakerHyperPodServiceRole acesso no cluster EKS <cluster-name>com sucesso
Falha na atualização da política de acesso Karpenter SLR Falha ao <operation>acessar políticas com entrada de AmazonSageMakerHyperPodServiceRole acesso no cluster EKS <cluster-name>

Aplicação de patches — nível de instância do EKS

Event Description
A preparação do patch de instância foi bem-sucedida Instância <instance-id>no IG <instance-group-name>isolada e cápsulas despejadas.
O patch de instância foi ignorado (violação do PDB) UpdateClusterSoftware por exemplo, <instance-id>no IG <instance-group-name>foi ignorado devido a PodDisruptionBudget restrições.
Falha na preparação do patch de instância Falha ao preparar a instância <instance-id>no IG <instance-group-name>para UpdateClusterSoftware.
Instância restaurada ao estado programável Instância <instance-id>no IG <instance-group-name>restaurada ao estado programável.
Falha na restauração da instância para agendável Falha ao restaurar a instância <instance-id>no IG <instance-group-name>para o estado programável.

Aplicação de patches — reversão do EKS

Event Description
Hora de cozedura iniciada O período de cozimento começou para o IG <instance-group-name>in Cluster<cluster-name>. Monitorando alarmes [<alarm-names>] por <duration>segundos.
Tempo de cozimento concluído Período de cozimento concluído para IG <instance-group-name>in Cluster<cluster-name>. Nenhum alarme foi acionado durante o período de <duration>cozimento de um segundo.
Alarme de tempo de cozimento acionado O período de cozimento falhou para o IG <instance-group-name>in Cluster<cluster-name>. Os alarmes [<alarm-names>] entraram no estado ALARM. Iniciando a reversão automática.
Falha na avaliação do tempo de cozimento <cluster-name>Falha ao avaliar os alarmes durante o período de cozimento do IG <instance-group-name>in Cluster.
Iniciada a reversão de patches de grupos de instâncias UpdateClusterSoftware falhou para IG <instance-group-name>no Cluster<cluster-name>. Iniciando a reversão.
Falha na reversão de patches de grupos de instâncias <cluster-name>Falha na reversão do IG <instance-group-name>no Cluster. Alguns casos podem estar no FailedMaintenance estado.
Iniciada a reversão da correção de instâncias <instance-id><instance-group-name>Falha na atualização da instância no IG. Reversão iniciada.
A reversão da correção de instâncias foi bem-sucedida A instância <instance-id>no IG <instance-group-name>foi revertida com sucesso para a AMI anterior.
Falha na reversão de patches de instância UpdateClusterSoftware <instance-group-name>a reversão falhou, por exemplo, <instance-id>no IG.

Slurm-specific eventos

Os eventos a seguir são emitidos somente para HyperPod clusters orquestrados com o Slurm.

Event Description
Parâmetros de provisionamento encontrados Provisioning_parameters.json encontrado no caminho S3 para o grupo de controladores LifeCycleScript <instance-group-name>
Parâmetros de provisionamento não encontrados Nenhum provisioning_parameters.json foi encontrado no S3 Path para o grupo de controladores LifeCycleScript <instance-group-name>
Chave Slurm munge criada Chave munge criada e armazenada com sucesso
A validação do Slurm Drift foi aprovada A validação do desvio de configuração do Slurm foi aprovada
Detectada deriva de lama Desvio na configuração do Slurm detectado: <drift-details>
Concluída a reversão do cluster Slurm Falha na criação do cluster: os nós do controlador e do login não ficaram prontos dentro do tempo esperado
A reconfiguração do Slurm foi bem-sucedida O Slurm foi reconfigurado com sucesso. Configuração do Slurm atualizada para corresponder ao estado desejado

EventBridge integração

HyperPod envia eventos de cluster para a Amazon EventBridge usando três tipos de detalhes:

Tipo de detalhe Description
SageMaker HyperPod Cluster Event Eventos operacionais para provisionamento, escalabilidade, aplicação de patches e operações específicas do orquestrador. Inclui EventLevel para filtragem de severidade.
SageMaker HyperPod Cluster State Change Cluster-level transições de status (por exemplo, Criando para InService). Inclui configuração completa do cluster.
SageMaker HyperPod Cluster Node Health Event Eventos de monitoramento de saúde do Agente de Monitoramento de HyperPod Saúde (HMA). Inclui estado de saúde, motivo, ação de reparo e recomendação.

Exemplos de padrões de eventos

Todos os eventos HyperPod do cluster:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }

Somente eventos de erro (para alertas):

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }

Eventos para um cluster específico:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }

Eventos de saúde do Node:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }

Referência de API

Consulte também