View a markdown version of this page

SageMaker HyperPod referência de eventos de cluster - SageMaker IA da Amazon

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

SageMaker HyperPod referência de eventos de cluster

Esta página fornece uma referência completa de todos os eventos estruturados emitidos pelos SageMaker HyperPod clusters da Amazon. Os eventos fornecem visibilidade das operações em nível de cluster, grupo de instâncias e instância, incluindo provisionamento, escalabilidade, aplicação de patches e mudanças no ciclo de vida específicas do orquestrador.

Os eventos de cluster estão disponíveis para HyperPod clusters com NodeProvisioningMode definido comoContinuous. Os eventos podem ser acessados por meio das DescribeClusterEvent APIs ListClusterEvents e, da guia Eventos do console de SageMaker IA e da Amazon EventBridge.

Registro de eventos de cluster

Cada evento de cluster é representado como um registro estruturado contendo identificação, tempo, escopo, gravidade e metadados específicos da operação. O exemplo a seguir mostra um registro completo do evento entregue por meio da DescribeClusterEvent API e da Amazon EventBridge:

{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }

Campos de registro de eventos

O objeto detail.EventDetails contém os campos a seguir.

Campo Tipo Obrigatório Description
EventId Cadeia de caracteres (UUID) Sim Identificador exclusivo do evento.
ClusterArn String Sim ARN do cluster. HyperPod
ClusterName String Sim Nome do HyperPod cluster.
EventTime Timestamp Sim Quando o evento ocorreu (milissegundos de época).
ResourceType String Sim Escopo do evento:Cluster,InstanceGroup, ouInstance.
EventLevel String Sim Classificação de severidade: InfoWarn,, ouError.
Description String Não Human-readable resumo do evento.
InstanceGroupName String Não Nome do grupo de instâncias (presente quando ResourceType é InstanceGroup ouInstance).
InstanceId String Não ID da instância EC2 (presente quando ResourceType estáInstance).
EventDetails Objeto Não Metadados adicionais específicos para o tipo de recurso e a operação.

Níveis do evento

Nível Significado
Info A operação foi concluída com sucesso ou está progredindo normalmente.
Warn Operação concluída com um problema não crítico ou uma condição que pode exigir atenção futura.
Error A operação falhou ou requer atenção imediata.

Resource types

ResourceType Escopo Eventos de exemplo
Cluster Whole-cluster operações Cluster creation/update iniciado, falha na operação do cluster
InstanceGroup Operações de grupo de instâncias Dimensionamento started/completed, aplicação de patches programada, ciclo de vida do FSx
Instance Operações de instância individual Provisionamento do EC2, execução do script do ciclo de vida, gerenciamento de ENI, rescisão

EventDetails metadados

Os eventos de cluster incluem um EventMetadata objeto dentro do EventDetails campo que fornece um contexto específico da operação além do que a descrição do evento transmite. O conteúdo do EventMetadata varia de acordo com o tipo de recurso e o tipo de evento. Para ver o esquema completo e os campos compatíveis, consulte EventMetadataa Amazon SageMaker AI API Reference.

EventBridge campos de envelope

Quando entregue pela Amazon EventBridge, o registro do evento é embalado no EventBridge envelope padrão:

Campo Description
version EventBridge versão do esquema (sempre"0").
id ID exclusivo do EventBridge evento.
detail-type SageMaker HyperPod Cluster Event
source aws.sagemaker
account AWS ID da conta que possui o cluster.
time Registro de data e hora ISO 8601 do evento.
region AWS Região em que o cluster reside.
resources Matriz contendo o ARN do cluster.
detail Contém o EventDetails objeto descrito acima.

Eventos comuns (EKS e Slurm)

Os eventos a seguir são emitidos para todos os HyperPod clusters, independentemente do orquestrador. A coluna Descrição mostra o valor do Description campo no registro do evento conforme ele aparece na resposta da API e na guia Eventos do console.

Ciclo de vida do cluster

Event Description
Operação de cluster iniciada Cluster <cluster-name><operation>iniciado com sucesso
Falha no início da operação do cluster Falha ao iniciar o cluster <cluster-name><operation>
Operação de cluster concluída Cluster <cluster-name><operation>concluído com sucesso
Falha na operação do cluster <cluster-name><operation>Falha no cluster

Ciclo de vida do grupo de instâncias

Event Description
Iniciada a operação do grupo de instâncias InstanceGroup <instance-group-name><operation>iniciado com sucesso no Cluster <cluster-name>
Falha no início da operação do grupo de instâncias Falha ao iniciar InstanceGroup <instance-group-name><operation>no cluster <cluster-name>
Operação de grupo de instâncias concluída Grupo de instâncias <instance-group-name><operation>no cluster <cluster-name>concluído com sucesso
Falha na operação do grupo de instâncias <instance-group-name><operation><cluster-name>Falha no grupo de instâncias no cluster

Configuração de rede do grupo de instâncias

Event Description
Configuração de rede encontrada Sub-rede encontrada <subnet-id>em AZ <availability-zone>com SecurityGroupIds <security-group-ids>for IG <instance-group-name>em cluster <cluster-name>
Falha na configuração da rede Falha ao processar os detalhes da configuração de rede do grupo de instâncias para IG <instance-group-name>no cluster <cluster-name>
Foi encontrada uma substituição personalizada da AMI Foi encontrada uma substituição personalizada de AMI <ami-id>para IG <instance-group-name>no cluster <cluster-name>
Falha na substituição personalizada da AMI Falha ao processar detalhes de substituição de AMI personalizada para IG <instance-group-name>no cluster <cluster-name>
Configuração de rede da plataforma usada Usando a configuração de rede fornecida pela HyperPod plataforma para IG <instance-group-name>no cluster <cluster-name>
Configuração de rede determinada Configuração de rede do grupo de instâncias determinada com sucesso para IG <instance-group-name>no cluster <cluster-name>

Criação de instância

Event Description
Operação de instância iniciada Instância <operation>iniciada com sucesso no Cluster <cluster-name>e no IG <instance-group-name>
Falha no início da operação da instância Falha ao iniciar a instância <operation>no cluster <cluster-name>e no IG <instance-group-name>
Reserva de capacidade encontrada CapacityReservation ID encontrada <reservation-id>para Cluster <cluster-name>e IG<instance-group-name>, usando capacidade reservada
Reserva de capacidade não encontrada Não CapacityReservation encontrado para Cluster <cluster-name>e IG<instance-group-name>, usando pool sob demanda
Falha na configuração da carga útil da instância Falha no processamento CapacityReservationDetails para Cluster <cluster-name>e IG <instance-group-name>
Criação da ENI do cliente O Customer ENI foi criado com sucesso, por exemplo, em Cluster <cluster-name>e IG <instance-group-name>
Falha na criação do ENI do cliente Falha ao criar o Customer ENI, por exemplo, no Cluster <cluster-name>e no IG <instance-group-name>
Instância EC2 provisionada <cluster-name>Instância EC2 <instance-id>provisionada com sucesso em Cluster e IG <instance-group-name>
Falha na criação da instância EC2 Falha ao provisionar a instância EC2 no cluster <cluster-name>e no IG <instance-group-name>
Status do script de ciclo de vida atualizado <instance-id>A execução do script do ciclo de vida da instância para a instância EC2 tem <status>
Falha na atualização do status do script de ciclo de vida Falha ao atualizar o status de execução do script do ciclo de vida da instância para EC2InstanceId <instance-id>
A criação da instância falhou com os registros do ciclo de vida <instance-id>A execução do script do ciclo de vida da instância para a instância EC2 falhou. Para ver os registros do script do ciclo de vida, visite o grupo de registros...
A limpeza do ENI não utilizada foi bem-sucedida <cluster-name>Os ENIs de cliente não utilizados foram excluídos com sucesso para a instância EC2 no cluster e <instance-id>no IG <instance-group-name>
Falha na limpeza do ENI não utilizada <cluster-name>Falha ao excluir ENIs de cliente não utilizadas para a instância do EC2 no cluster e <instance-id>no IG <instance-group-name>

Exclusão de instância

Event Description
Encerramento da instância EC2 em andamento O encerramento da instância EC2 <instance-id>está atualmente em andamento no Cluster <cluster-name>e no IG <instance-group-name>
Falha no encerramento da instância EC2 <cluster-name>Falha ao encerrar a instância do EC2 <instance-id>no cluster e no IG <instance-group-name>
ENI do cliente excluída <cluster-name>O ENI do cliente foi excluído com sucesso para a instância do EC2 <instance-id>no cluster e no IG <instance-group-name>
Falha na exclusão do ENI do cliente <cluster-name>Falha ao excluir a ENI do cliente para a instância do EC2 <instance-id>no cluster e no IG <instance-group-name>

Reinicialização da instância

Event Description
Reinicialização da instância EC2 em andamento <cluster-name>A reinicialização da instância EC2 <instance-id>está em andamento no Cluster e no IG <instance-group-name>
Falha na solicitação de reinicialização da instância EC2 <cluster-name>Falha ao enviar a solicitação de reinicialização para a instância EC2 <instance-id>no cluster e no IG <instance-group-name>

Operação de instância (genérica)

Event Description
Operação de instância concluída Instância <operation><instance-id>no cluster <cluster-name>e no IG <instance-group-name>concluída com sucesso
Falha na operação da instância <operation><instance-id><cluster-name><instance-group-name>Falha na instância no cluster e no IG

Substituição de instâncias

Event Description
A substituição da instância foi iniciada <instance-id>A instância está começando como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name>
Falha no início da substituição da instância <instance-id>Falha ao iniciar a instância como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name>
Substituição da instância concluída Instância <instance-id><operation>concluída com sucesso como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name>
Falha na substituição da instância A instância <instance-id><operation>falhou como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name>

Ciclo de vida do sistema de arquivos FSx

Event Description
Começou a criação do FSx <instance-group-name>Começou a criação do FSx para IG in Cluster <cluster-name>
Falha na criação do FSx <instance-group-name>Falha ao criar FSx para IG no cluster <cluster-name>
Criação do FSx concluída <instance-group-name>A criação do FSx foi concluída com sucesso para IG in Cluster <cluster-name>
A exclusão do FSx foi iniciada <instance-group-name>A exclusão do FSx foi iniciada para IG no cluster <cluster-name>
Falha na exclusão do FSx <instance-group-name>Falha ao excluir FSx for IG no cluster <cluster-name>
Exclusão do FSx concluída <instance-group-name>A exclusão do FSx foi concluída com sucesso para IG no cluster <cluster-name>
Atualização do FSx iniciada <instance-group-name>A atualização do FSx foi iniciada para IG in Cluster <cluster-name>
Falha na atualização do FSx <instance-group-name>Falha ao atualizar o FSx para IG no cluster <cluster-name>
Atualização do FSx concluída <instance-group-name>Atualização do FSx concluída com sucesso para IG in Cluster <cluster-name>

Aplicação de patches (etapas comuns)

Esses eventos de patch são emitidos para os clusters EKS e Slurm durante as operações. UpdateClusterSoftware

Event Description
Aplicação de patches de grupos de instâncias agendada InstanceGroup <instance-group-name>in Cluster <cluster-name>foi programado para o mais UpdateClusterSoftware tardar.
Falha no cronograma de patches do grupo de instâncias Falha ao agendar UpdateClusterSoftware o IG <instance-group-name>no Cluster<cluster-name>.
Início da aplicação de patches em grupos de instâncias UpdateClusterSoftware iniciado para IG <instance-group-name>em cluster <cluster-name>usando <strategy>estratégia.
Falha no início do patch do grupo de instâncias <cluster-name>Falha ao iniciar o UpdateClusterSoftware IG <instance-group-name>no cluster.
Próximo lote de patches selecionado Próximo lote de atualização selecionado para IG <instance-group-name>no Cluster<cluster-name>.
Falha na seleção do próximo lote de patches Falha ao selecionar o próximo lote de atualização para o IG <instance-group-name>no cluster<cluster-name>.
Instâncias com falha enfileiradas para substituição Instâncias com falha no IG <instance-group-name>em cluster <cluster-name>enfileiradas para substituição do nó.
Falha no enfileiramento de substituição de instâncias <cluster-name>Falha ao enfileirar instâncias para substituição de nós no IG <instance-group-name>no cluster.
A correção do grupo de instâncias foi concluída UpdateClusterSoftware concluído com sucesso para IG <instance-group-name>in Cluster<cluster-name>.
Falha na conclusão do patch do grupo de instâncias Falha na conclusão UpdateClusterSoftware do IG <instance-group-name>no cluster<cluster-name>.
A substituição do volume raiz foi iniciada A substituição do volume raiz foi iniciada para Instance <instance-id>in IG<instance-group-name>.
Falha na substituição do volume raiz Falha ao iniciar a substituição do volume raiz para Instance <instance-id>no IG<instance-group-name>.
A correção de instâncias foi bem-sucedida Instância <instance-id>no IG <instance-group-name>atualizada com sucesso.

EKS-specific eventos

Os eventos a seguir são emitidos somente para HyperPod clusters orquestrados com o Amazon EKS.

Gerenciamento de entradas de acesso

Event Description
A operação de entrada de acesso SLR foi bem-sucedida Entrada de acesso SLR <operation>bem-sucedida para cluster <cluster-name>
Falha na operação de entrada de acesso SLR <operation>Falha na entrada de acesso SLR para o cluster <cluster-name>
A operação de entradas de acesso ao EKS foi bem-sucedida Entradas de acesso ao EKS <operation>bem-sucedidas para o cluster <cluster-name>
Falha na operação de entradas de acesso ao EKS <operation>Falha nas entradas de acesso do EKS para o cluster <cluster-name>

Atualizações de configuração do Kubernetes

Event Description
A atualização da configuração do Kubernetes foi bem-sucedida <instance-id><cluster-name>Configuração do Kubernetes atualizada com sucesso, por exemplo, em Cluster e IG <instance-group-name>
Falha na atualização da configuração do Kubernetes <instance-id><cluster-name>Falha ao atualizar a configuração do Kubernetes, por exemplo, no Cluster e no IG <instance-group-name>

Escalonamento automático do Karpenter

Event Description
A operação de escalonamento automático foi bem-sucedida AutoScaling <operation><status>com sucesso no Cluster <cluster-name>
Falha na operação de escalonamento automático Falha <operation> AutoScaling no cluster <cluster-name>
A instalação do Karpenter CRD foi bem-sucedida CustomResourceDefinition instalação concluída com sucesso no EKS Cluster <cluster-name>
Falha na instalação do Karpenter CRD CustomResourceDefinition falha na instalação do EKS Cluster <cluster-name>
A atualização da política de acesso do Karpenter SLR foi bem-sucedida <operation>políticas de acesso com entrada de AmazonSageMakerHyperPodServiceRole acesso no cluster EKS <cluster-name>com sucesso
Falha na atualização da política de acesso do Karpenter SLR Falha ao <operation>acessar políticas com entrada de AmazonSageMakerHyperPodServiceRole acesso no cluster EKS <cluster-name>

Aplicação de patches — nível de instância do EKS

Event Description
A preparação do patch de instâncias foi bem-sucedida Instância <instance-id>em IG <instance-group-name>isolada e cápsulas despejadas.
Correção de instâncias ignorada (violação do PDB) UpdateClusterSoftware por exemplo, <instance-id>no IG foi <instance-group-name>ignorado devido a PodDisruptionBudget uma restrição.
Falha na preparação do patch de instância Falha ao preparar a instância <instance-id>no IG <instance-group-name>para UpdateClusterSoftware.
Instância restaurada ao estado programável Instância <instance-id>no IG <instance-group-name>restaurada ao estado programável.
Falha na restauração da instância para programável Falha ao restaurar a instância <instance-id>no IG <instance-group-name>para o estado programável.

Aplicação de patches — reversão do EKS

Event Description
Início da hora de cozedura O período de cozimento começou para o IG <instance-group-name>in Cluster<cluster-name>. Monitorando alarmes [<alarm-names>] por <duration>segundos.
Tempo de cozimento concluído Período de cozimento concluído para o IG <instance-group-name>in Cluster<cluster-name>. Nenhum alarme foi acionado durante o período de <duration>cozimento de 2 segundos.
Alarme de tempo de cozimento acionado O período de cozimento falhou para o IG <instance-group-name>no Cluster<cluster-name>. Os alarmes [<alarm-names>] entraram no estado ALARM. Iniciando a reversão automática.
Falha na avaliação do tempo de cozimento <cluster-name>Falha ao avaliar os alarmes durante o período de cozimento do IG <instance-group-name>no Cluster.
Iniciada a reversão de patches do grupo de instâncias UpdateClusterSoftware falhou para o IG <instance-group-name>no Cluster<cluster-name>. Iniciando a reversão.
Falha na reversão de patches do grupo de instâncias <cluster-name>A reversão falhou para o IG <instance-group-name>no cluster. Alguns casos podem estar no FailedMaintenance estado.
Iniciada a reversão da correção de instâncias <instance-id><instance-group-name>Falha na atualização da instância no IG. Reversão iniciada.
A reversão da correção de instâncias foi bem-sucedida A instância <instance-id>no IG <instance-group-name>foi revertida com sucesso para a AMI anterior.
Falha na reversão do patch de instância UpdateClusterSoftware <instance-group-name>a reversão falhou, por exemplo, <instance-id>no IG.

Slurm-specific eventos

Os eventos a seguir são emitidos somente para HyperPod clusters orquestrados com o Slurm.

Event Description
Parâmetros de provisionamento encontrados Foi encontrado provisioning_parameters.json no caminho S3 para o grupo de controladores LifeCycleScript <instance-group-name>
Parâmetros de provisionamento não encontrados Nenhum provisioning_parameters.json encontrado no caminho S3 para o grupo de controladores LifeCycleScript <instance-group-name>
Criada a chave Slurm munge Chave munge criada e armazenada com sucesso
A validação do Slurm drift foi aprovada A validação do desvio da configuração do Slurm foi aprovada
Desvio de lama detectado Foi detectado um desvio na configuração do Slurm: <drift-details>
A reversão do cluster Slurm foi concluída Falha na criação do cluster: os nós do controlador e do login não ficaram prontos dentro do tempo esperado
A reconfiguração do Slurm foi bem-sucedida O Slurm foi reconfigurado com sucesso. Configuração do Slurm atualizada para corresponder ao estado desejado

EventBridge integração

HyperPod envia eventos de cluster para a Amazon EventBridge usando três tipos de detalhes:

Tipo de detalhe Description
SageMaker HyperPod Cluster Event Eventos operacionais para provisionamento, escalabilidade, aplicação de patches e operações específicas do orquestrador. Inclui EventLevel para filtragem de gravidade.
SageMaker HyperPod Cluster State Change Cluster-level transições de status (por exemplo, Criando para InService). Inclui configuração completa do cluster.
SageMaker HyperPod Cluster Node Health Event Eventos de monitoramento de saúde do HyperPod Health Monitoring Agent (HMA). Inclui estado de saúde, motivo, ação de reparo e recomendação.

Exemplos de padrões de eventos

Todos os eventos HyperPod do cluster:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }

Somente eventos de erro (para alertas):

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }

Eventos para um cluster específico:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }

Eventos de saúde do Node:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }

Referência de API

Consulte também