As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
SageMaker HyperPod referência de eventos de cluster
Esta página fornece uma referência completa de todos os eventos estruturados emitidos pelos SageMaker HyperPod clusters da Amazon. Os eventos fornecem visibilidade das operações em nível de cluster, grupo de instâncias e instância, incluindo provisionamento, escalabilidade, aplicação de patches e mudanças no ciclo de vida específicas do orquestrador.
Os eventos de cluster estão disponíveis para HyperPod clusters com NodeProvisioningMode definido comoContinuous. Os eventos podem ser acessados por meio das DescribeClusterEvent APIs ListClusterEvents e, da guia Eventos do console de SageMaker IA e da Amazon EventBridge.
Registro de eventos de cluster
Cada evento de cluster é representado como um registro estruturado contendo identificação, tempo, escopo, severidade e metadados específicos da operação. O exemplo a seguir mostra um registro completo do evento fornecido por meio da DescribeClusterEvent API e da Amazon EventBridge:
{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }
Campos de registro de eventos
O objeto detail.EventDetails contém os campos a seguir.
| Campo | Tipo | Obrigatório | Description |
|---|---|---|---|
EventId |
Cadeia de caracteres (UUID) | Sim | Identificador exclusivo para o evento. |
ClusterArn |
String | Sim | ARN do HyperPod cluster. |
ClusterName |
String | Sim | Nome do HyperPod cluster. |
EventTime |
Timestamp | Sim | Quando o evento ocorreu (milissegundos de época). |
ResourceType |
String | Sim | Escopo do evento:Cluster,InstanceGroup, ouInstance. |
EventLevel |
String | Sim | Classificação de gravidade:Info,Warn, ouError. |
Description |
String | Não | Human-readable resumo do evento. |
InstanceGroupName |
String | Não | Nome do grupo de instâncias (presente quando ResourceType é InstanceGroup ouInstance). |
InstanceId |
String | Não | ID da instância EC2 (presente quando ResourceType éInstance). |
EventDetails |
Objeto | Não | Metadados adicionais específicos para o tipo e a operação do recurso. |
Níveis de eventos
| Nível | Significado |
|---|---|
Info |
A operação foi concluída com êxito ou está progredindo normalmente. |
Warn |
Operação concluída com um problema não crítico ou uma condição que pode exigir atenção futura. |
Error |
A operação falhou ou requer atenção imediata. |
Resource types
| ResourceType | Escopo | Eventos de exemplo |
|---|---|---|
Cluster |
Whole-cluster operações | Cluster creation/update iniciado, falha na operação do cluster |
InstanceGroup |
Operações de grupos de instâncias | Escalabilidade started/completed, aplicação de patches programada, ciclo de vida do FSx |
Instance |
Operações de instância individual | Provisionamento EC2, execução de scripts de ciclo de vida, gerenciamento de ENI, encerramento |
EventDetails metadados
Os eventos de cluster incluem um EventMetadata objeto dentro do EventDetails campo que fornece um contexto específico da operação além do que a descrição do evento transmite. O conteúdo do EventMetadata varia de acordo com o tipo de recurso e o tipo de evento. Para ver o esquema completo e os campos compatíveis, consulte EventMetadata o Amazon SageMaker AI API Reference.
EventBridge campos de envelope
Quando entregue pela Amazon EventBridge, o registro do evento é embalado em um EventBridge envelope padrão:
| Campo | Description |
|---|---|
version |
EventBridge versão do esquema (sempre"0"). |
id |
ID de EventBridge evento exclusivo. |
detail-type |
SageMaker HyperPod Cluster Event |
source |
aws.sagemaker |
account |
AWS ID da conta que é proprietária do cluster. |
time |
Carimbo de data/hora ISO 8601 do evento. |
region |
AWS Região em que o cluster reside. |
resources |
Matriz contendo o ARN do cluster. |
detail |
Contém o EventDetails objeto descrito acima. |
Eventos comuns (EKS e Slurm)
Os eventos a seguir são emitidos para todos os HyperPod clusters, independentemente do orquestrador. A coluna Descrição mostra o valor do Description campo no registro do evento conforme ele aparece na resposta da API e na guia Eventos do console.
Ciclo de vida do cluster
| Event | Description |
|---|---|
| Operação de cluster iniciada | Cluster <cluster-name><operation>iniciado com sucesso |
| Falha no início da operação do cluster | Falha ao iniciar o cluster <cluster-name><operation> |
| Operação de cluster concluída | Cluster <cluster-name><operation>concluído com sucesso |
| Falha na operação do cluster | <cluster-name><operation>Falha no cluster |
Ciclo de vida do grupo de instâncias
| Event | Description |
|---|---|
| Operação de grupo de instâncias iniciada | InstanceGroup <instance-group-name><operation>iniciado com sucesso no Cluster <cluster-name> |
| Falha no início da operação do grupo de instâncias | Falha ao iniciar InstanceGroup <instance-group-name><operation>no cluster <cluster-name> |
| Operação de grupo de instâncias concluída | Grupo de instâncias <instance-group-name><operation>no cluster <cluster-name>concluído com êxito |
| Falha na operação do grupo de instâncias | <instance-group-name><operation><cluster-name>Falha no grupo de instâncias no cluster |
Configuração de rede de grupos de instâncias
| Event | Description |
|---|---|
| Configuração de rede encontrada | Sub-rede encontrada <subnet-id>em AZ <availability-zone>com SecurityGroupIds <security-group-ids>for IG <instance-group-name>in Cluster <cluster-name> |
| Falha na configuração da rede | Falha ao processar detalhes de configuração de rede do grupo de instâncias para IG <instance-group-name>no cluster <cluster-name> |
| Foi encontrada uma substituição de AMI personalizada | Foi encontrada uma substituição de AMI personalizada <ami-id>para IG <instance-group-name>no cluster <cluster-name> |
| Falha na substituição da AMI personalizada | Falha ao processar detalhes de substituição de AMI personalizada para IG <instance-group-name>no cluster <cluster-name> |
| Configuração de rede da plataforma usada | Usando a configuração de rede fornecida pela HyperPod plataforma para IG <instance-group-name>in Cluster <cluster-name> |
| Configuração de rede determinada | Configuração de rede do grupo de instâncias determinada com sucesso para IG <instance-group-name>in Cluster <cluster-name> |
Criação de instância
| Event | Description |
|---|---|
| Operação de instância iniciada | Instância <operation>iniciada com sucesso no Cluster <cluster-name>e no IG <instance-group-name> |
| Falha no início da operação da instância | Falha ao iniciar a instância <operation>no cluster <cluster-name>e no IG <instance-group-name> |
| Reserva de capacidade encontrada | CapacityReservation ID encontrada <reservation-id>para Cluster <cluster-name>e IG<instance-group-name>, usando capacidade reservada |
| Reserva de capacidade não encontrada | Não CapacityReservation foi encontrado para Cluster <cluster-name>e IG<instance-group-name>, usando pool sob demanda |
| Falha na configuração da carga útil da instância | Falha ao processar CapacityReservationDetails para Cluster <cluster-name>e IG <instance-group-name> |
| Criação da ENI do cliente | Customer ENI criado com sucesso, por exemplo, em Cluster <cluster-name>e IG <instance-group-name> |
| Falha na criação da ENI do cliente | Falha ao criar o Customer ENI, por exemplo, no Cluster <cluster-name>e no IG <instance-group-name> |
| Instância EC2 provisionada | <cluster-name>Instância EC2 <instance-id>provisionada com sucesso no cluster e no IG <instance-group-name> |
| Falha na criação da instância EC2 | Falha ao provisionar a instância do EC2 no cluster <cluster-name>e no IG <instance-group-name> |
| Status do script do ciclo de vida atualizado | <instance-id>A execução do script do ciclo de vida da instância para EC2 Instance tem <status> |
| Falha na atualização do status do script do ciclo de vida | Falha ao atualizar o status de execução do script do ciclo de vida da instância para EC2InstanceId <instance-id> |
| Falha na criação da instância com registros do ciclo de vida | <instance-id>A execução do script do ciclo de vida da instância para a instância do EC2 falhou. Para visualizar os registros do script do ciclo de vida, visite o grupo de registros... |
| A limpeza de ENI não utilizada foi bem-sucedida | <cluster-name>Os ENIs do cliente não utilizados foram excluídos com sucesso para a instância do EC2 no cluster e <instance-id>no IG <instance-group-name> |
| Falha na limpeza de ENI não utilizada | <cluster-name>Falha ao excluir ENIs do cliente não utilizados para a instância do EC2 no cluster e <instance-id>no IG <instance-group-name> |
Exclusão de instância
| Event | Description |
|---|---|
| Encerramento da instância EC2 em andamento | O encerramento da instância do EC2 <instance-id>está atualmente em andamento no Cluster <cluster-name>e no IG <instance-group-name> |
| Falha no encerramento da instância do EC2 | <cluster-name>Falha ao encerrar a instância do EC2 <instance-id>no cluster e no IG <instance-group-name> |
| ENI do cliente excluído | <cluster-name>O ENI do cliente foi excluído com sucesso para a instância do EC2 <instance-id>no cluster e no IG <instance-group-name> |
| Falha na exclusão do ENI do cliente | <cluster-name>Falha ao excluir a ENI do cliente para a instância EC2 <instance-id>no cluster e no IG <instance-group-name> |
Reinicialização da instância
| Event | Description |
|---|---|
| Reinicialização da instância EC2 em andamento | <cluster-name>A reinicialização da instância do EC2 <instance-id>está em andamento no Cluster e no IG <instance-group-name> |
| Falha na solicitação de reinicialização da instância EC2 | <cluster-name>Falha ao enviar a solicitação de reinicialização para a instância do EC2 <instance-id>no cluster e no IG <instance-group-name> |
Operação de instância (genérica)
| Event | Description |
|---|---|
| Operação de instância concluída | Instância <operation><instance-id>no Cluster <cluster-name>e no IG <instance-group-name>concluída com êxito |
| Falha na operação da instância | <operation><instance-id><cluster-name><instance-group-name>Falha na instância no cluster e no IG |
Substituição de instâncias
| Event | Description |
|---|---|
| A substituição da instância foi iniciada | A instância <instance-id>está sendo iniciada como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name> |
| Falha no início da substituição da instância | <instance-id>Falha ao iniciar a instância como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name> |
| Substituição de instância concluída | Instância <instance-id><operation>concluída com sucesso como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name> |
| Falha na substituição da instância | A instância <instance-id><operation>falhou como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name> |
Ciclo de vida do sistema de arquivos FSx
| Event | Description |
|---|---|
| Criação de FSx iniciada | Começou a criação do FSx para o IG <instance-group-name>in Cluster <cluster-name> |
| Falha na criação do FSx | Falha ao criar FSx para IG <instance-group-name>no cluster <cluster-name> |
| Criação do FSx concluída | Criação de FSx concluída com sucesso para IG <instance-group-name>in Cluster <cluster-name> |
| A exclusão do FSx foi iniciada | <instance-group-name>A exclusão de FSx foi iniciada para IG in Cluster <cluster-name> |
| Falha na exclusão do FSx | Falha ao excluir o FSx for IG <instance-group-name>no cluster <cluster-name> |
| Exclusão do FSx concluída | <instance-group-name>Exclusão de FSx concluída com sucesso para IG in Cluster <cluster-name> |
| A atualização do FSx foi iniciada | Atualização FSx iniciada para IG <instance-group-name>in Cluster <cluster-name> |
| Falha na atualização do FSx | Falha ao atualizar o FSx para IG <instance-group-name>no cluster <cluster-name> |
| Atualização do FSx concluída | Atualização do FSx concluída com sucesso para IG <instance-group-name>in Cluster <cluster-name> |
Aplicação de patches (etapas comuns)
Esses eventos de patch são emitidos para clusters EKS e Slurm durante as operações. UpdateClusterSoftware
| Event | Description |
|---|---|
| Aplicação de patches em grupos de instâncias agendada | InstanceGroup <instance-group-name>in Cluster <cluster-name>foi agendado UpdateClusterSoftware para o mais recente. |
| Falha no cronograma de correção do grupo de instâncias | Falha ao agendar UpdateClusterSoftware o IG <instance-group-name>in Cluster<cluster-name>. |
| A correção de grupos de instâncias foi iniciada | UpdateClusterSoftware iniciado para IG <instance-group-name>in Cluster <cluster-name>usando <strategy>estratégia. |
| Falha no início do patch do grupo de instâncias | <cluster-name>Falha ao iniciar o UpdateClusterSoftware IG <instance-group-name>no Cluster. |
| Próximo lote de patches selecionado | Próximo lote de atualização selecionado para IG <instance-group-name>in Cluster<cluster-name>. |
| Falha na seleção do próximo lote de patch | Falha ao selecionar o próximo lote de atualização para IG <instance-group-name>no Cluster<cluster-name>. |
| Instâncias com falha na fila para substituição | Instâncias com falha no IG <instance-group-name>in Cluster em <cluster-name>fila para substituição do nó. |
| Falha no enfileiramento de substituição de instâncias | <cluster-name>Falha ao enfileirar instâncias para substituição de nós no IG <instance-group-name>in Cluster. |
| Aplicação de patches em grupos de instâncias concluída | UpdateClusterSoftware concluído com sucesso para IG <instance-group-name>in Cluster<cluster-name>. |
| Falha na conclusão do patch do grupo de instâncias | Falha na conclusão UpdateClusterSoftware do IG <instance-group-name>in Cluster<cluster-name>. |
| A substituição do volume raiz foi iniciada | A substituição do volume raiz foi iniciada para Instance <instance-id>in IG<instance-group-name>. |
| Falha na substituição do volume raiz | Falha ao iniciar a substituição do volume raiz para Instance <instance-id>in IG<instance-group-name>. |
| A correção de instâncias foi bem-sucedida | Instância <instance-id>no IG <instance-group-name>atualizada com sucesso. |
EKS-specific eventos
Os eventos a seguir são emitidos somente para HyperPod clusters orquestrados com o Amazon EKS.
Gerenciamento de entradas de acesso
| Event | Description |
|---|---|
| Operação de entrada de acesso SLR bem-sucedida | Entrada de acesso SLR <operation>bem-sucedida para cluster <cluster-name> |
| Falha na operação de entrada de acesso à SLR | <operation>Falha na entrada de acesso SLR para o cluster <cluster-name> |
| A operação de entradas de acesso do EKS foi bem-sucedida | Entradas de acesso EKS <operation>bem-sucedidas para o cluster <cluster-name> |
| Falha na operação de entradas de acesso do EKS | <operation>Falha nas entradas de acesso do EKS para o cluster <cluster-name> |
Atualizações de configuração do Kubernetes
| Event | Description |
|---|---|
| A atualização de configuração do Kubernetes foi bem-sucedida | <instance-id><cluster-name>Configuração do Kubernetes atualizada com sucesso, por exemplo, em Cluster e IG <instance-group-name> |
| Falha na atualização da configuração do Kubernetes | <instance-id><cluster-name>Falha ao atualizar a configuração do Kubernetes, por exemplo, no Cluster e no IG <instance-group-name> |
Escalonamento automático Karpenter
| Event | Description |
|---|---|
| A operação de escalonamento automático foi bem-sucedida | AutoScaling <operation><status>com sucesso no Cluster <cluster-name> |
| Falha na operação de escalonamento automático | Falha ao <operation> AutoScaling entrar no cluster <cluster-name> |
| A instalação do Karpenter CRD foi bem-sucedida | CustomResourceDefinition instalação concluída com sucesso no EKS Cluster <cluster-name> |
| Falha na instalação do Karpenter CRD | CustomResourceDefinition falha na instalação do EKS Cluster <cluster-name> |
| A atualização da política de acesso Karpenter SLR foi bem-sucedida | <operation>políticas de acesso com entrada de AmazonSageMakerHyperPodServiceRole acesso no cluster EKS <cluster-name>com sucesso |
| Falha na atualização da política de acesso Karpenter SLR | Falha ao <operation>acessar políticas com entrada de AmazonSageMakerHyperPodServiceRole acesso no cluster EKS <cluster-name> |
Aplicação de patches — nível de instância do EKS
| Event | Description |
|---|---|
| A preparação do patch de instância foi bem-sucedida | Instância <instance-id>no IG <instance-group-name>isolada e cápsulas despejadas. |
| O patch de instância foi ignorado (violação do PDB) | UpdateClusterSoftware por exemplo, <instance-id>no IG <instance-group-name>foi ignorado devido a PodDisruptionBudget restrições. |
| Falha na preparação do patch de instância | Falha ao preparar a instância <instance-id>no IG <instance-group-name>para UpdateClusterSoftware. |
| Instância restaurada ao estado programável | Instância <instance-id>no IG <instance-group-name>restaurada ao estado programável. |
| Falha na restauração da instância para agendável | Falha ao restaurar a instância <instance-id>no IG <instance-group-name>para o estado programável. |
Aplicação de patches — reversão do EKS
| Event | Description |
|---|---|
| Hora de cozedura iniciada | O período de cozimento começou para o IG <instance-group-name>in Cluster<cluster-name>. Monitorando alarmes [<alarm-names>] por <duration>segundos. |
| Tempo de cozimento concluído | Período de cozimento concluído para IG <instance-group-name>in Cluster<cluster-name>. Nenhum alarme foi acionado durante o período de <duration>cozimento de um segundo. |
| Alarme de tempo de cozimento acionado | O período de cozimento falhou para o IG <instance-group-name>in Cluster<cluster-name>. Os alarmes [<alarm-names>] entraram no estado ALARM. Iniciando a reversão automática. |
| Falha na avaliação do tempo de cozimento | <cluster-name>Falha ao avaliar os alarmes durante o período de cozimento do IG <instance-group-name>in Cluster. |
| Iniciada a reversão de patches de grupos de instâncias | UpdateClusterSoftware falhou para IG <instance-group-name>no Cluster<cluster-name>. Iniciando a reversão. |
| Falha na reversão de patches de grupos de instâncias | <cluster-name>Falha na reversão do IG <instance-group-name>no Cluster. Alguns casos podem estar no FailedMaintenance estado. |
| Iniciada a reversão da correção de instâncias | <instance-id><instance-group-name>Falha na atualização da instância no IG. Reversão iniciada. |
| A reversão da correção de instâncias foi bem-sucedida | A instância <instance-id>no IG <instance-group-name>foi revertida com sucesso para a AMI anterior. |
| Falha na reversão de patches de instância | UpdateClusterSoftware <instance-group-name>a reversão falhou, por exemplo, <instance-id>no IG. |
Slurm-specific eventos
Os eventos a seguir são emitidos somente para HyperPod clusters orquestrados com o Slurm.
| Event | Description |
|---|---|
| Parâmetros de provisionamento encontrados | Provisioning_parameters.json encontrado no caminho S3 para o grupo de controladores LifeCycleScript <instance-group-name> |
| Parâmetros de provisionamento não encontrados | Nenhum provisioning_parameters.json foi encontrado no S3 Path para o grupo de controladores LifeCycleScript <instance-group-name> |
| Chave Slurm munge criada | Chave munge criada e armazenada com sucesso |
| A validação do Slurm Drift foi aprovada | A validação do desvio de configuração do Slurm foi aprovada |
| Detectada deriva de lama | Desvio na configuração do Slurm detectado: <drift-details> |
| Concluída a reversão do cluster Slurm | Falha na criação do cluster: os nós do controlador e do login não ficaram prontos dentro do tempo esperado |
| A reconfiguração do Slurm foi bem-sucedida | O Slurm foi reconfigurado com sucesso. Configuração do Slurm atualizada para corresponder ao estado desejado |
EventBridge integração
HyperPod envia eventos de cluster para a Amazon EventBridge usando três tipos de detalhes:
| Tipo de detalhe | Description |
|---|---|
SageMaker HyperPod Cluster Event |
Eventos operacionais para provisionamento, escalabilidade, aplicação de patches e operações específicas do orquestrador. Inclui EventLevel para filtragem de severidade. |
SageMaker HyperPod Cluster State Change |
Cluster-level transições de status (por exemplo, Criando para InService). Inclui configuração completa do cluster. |
SageMaker HyperPod Cluster Node Health
Event |
Eventos de monitoramento de saúde do Agente de Monitoramento de HyperPod Saúde (HMA). Inclui estado de saúde, motivo, ação de reparo e recomendação. |
Exemplos de padrões de eventos
Todos os eventos HyperPod do cluster:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }
Somente eventos de erro (para alertas):
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }
Eventos para um cluster específico:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }
Eventos de saúde do Node:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }
Referência de API
-
ListClusterEvents— Listar eventos com filtragem, classificação e paginação
-
DescribeClusterEvent— Obtenha todos os detalhes de um evento específico
-
ClusterEventSummary— Tipo de dados de resumo do evento
-
ClusterEventDetail— Tipo de dados de detalhes do evento
Consulte também
-
SageMaker HyperPod Eventos do Slurm Cluster— Eventos de cluster Slurm com uso de CLI e cenários comuns
-
SageMaker HyperPod Eventos de cluster EKS— Eventos de cluster EKS com uso de CLI e cenários comuns