As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
SageMaker HyperPod referência de eventos de cluster
Esta página fornece uma referência completa de todos os eventos estruturados emitidos pelos SageMaker HyperPod clusters da Amazon. Os eventos fornecem visibilidade das operações em nível de cluster, grupo de instâncias e instância, incluindo provisionamento, escalabilidade, aplicação de patches e mudanças no ciclo de vida específicas do orquestrador.
Os eventos de cluster estão disponíveis para HyperPod clusters com NodeProvisioningMode definido comoContinuous. Os eventos podem ser acessados por meio das DescribeClusterEvent APIs ListClusterEvents e, da guia Eventos do console de SageMaker IA e da Amazon EventBridge.
Registro de eventos de cluster
Cada evento de cluster é representado como um registro estruturado contendo identificação, tempo, escopo, gravidade e metadados específicos da operação. O exemplo a seguir mostra um registro completo do evento entregue por meio da DescribeClusterEvent API e da Amazon EventBridge:
{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }
Campos de registro de eventos
O objeto detail.EventDetails contém os campos a seguir.
| Campo | Tipo | Obrigatório | Description |
|---|---|---|---|
EventId |
Cadeia de caracteres (UUID) | Sim | Identificador exclusivo do evento. |
ClusterArn |
String | Sim | ARN do cluster. HyperPod |
ClusterName |
String | Sim | Nome do HyperPod cluster. |
EventTime |
Timestamp | Sim | Quando o evento ocorreu (milissegundos de época). |
ResourceType |
String | Sim | Escopo do evento:Cluster,InstanceGroup, ouInstance. |
EventLevel |
String | Sim | Classificação de severidade: InfoWarn,, ouError. |
Description |
String | Não | Human-readable resumo do evento. |
InstanceGroupName |
String | Não | Nome do grupo de instâncias (presente quando ResourceType é InstanceGroup ouInstance). |
InstanceId |
String | Não | ID da instância EC2 (presente quando ResourceType estáInstance). |
EventDetails |
Objeto | Não | Metadados adicionais específicos para o tipo de recurso e a operação. |
Níveis do evento
| Nível | Significado |
|---|---|
Info |
A operação foi concluída com sucesso ou está progredindo normalmente. |
Warn |
Operação concluída com um problema não crítico ou uma condição que pode exigir atenção futura. |
Error |
A operação falhou ou requer atenção imediata. |
Resource types
| ResourceType | Escopo | Eventos de exemplo |
|---|---|---|
Cluster |
Whole-cluster operações | Cluster creation/update iniciado, falha na operação do cluster |
InstanceGroup |
Operações de grupo de instâncias | Dimensionamento started/completed, aplicação de patches programada, ciclo de vida do FSx |
Instance |
Operações de instância individual | Provisionamento do EC2, execução do script do ciclo de vida, gerenciamento de ENI, rescisão |
EventDetails metadados
Os eventos de cluster incluem um EventMetadata objeto dentro do EventDetails campo que fornece um contexto específico da operação além do que a descrição do evento transmite. O conteúdo do EventMetadata varia de acordo com o tipo de recurso e o tipo de evento. Para ver o esquema completo e os campos compatíveis, consulte EventMetadataa Amazon SageMaker AI API Reference.
EventBridge campos de envelope
Quando entregue pela Amazon EventBridge, o registro do evento é embalado no EventBridge envelope padrão:
| Campo | Description |
|---|---|
version |
EventBridge versão do esquema (sempre"0"). |
id |
ID exclusivo do EventBridge evento. |
detail-type |
SageMaker HyperPod Cluster Event |
source |
aws.sagemaker |
account |
AWS ID da conta que possui o cluster. |
time |
Registro de data e hora ISO 8601 do evento. |
region |
AWS Região em que o cluster reside. |
resources |
Matriz contendo o ARN do cluster. |
detail |
Contém o EventDetails objeto descrito acima. |
Eventos comuns (EKS e Slurm)
Os eventos a seguir são emitidos para todos os HyperPod clusters, independentemente do orquestrador. A coluna Descrição mostra o valor do Description campo no registro do evento conforme ele aparece na resposta da API e na guia Eventos do console.
Ciclo de vida do cluster
| Event | Description |
|---|---|
| Operação de cluster iniciada | Cluster <cluster-name><operation>iniciado com sucesso |
| Falha no início da operação do cluster | Falha ao iniciar o cluster <cluster-name><operation> |
| Operação de cluster concluída | Cluster <cluster-name><operation>concluído com sucesso |
| Falha na operação do cluster | <cluster-name><operation>Falha no cluster |
Ciclo de vida do grupo de instâncias
| Event | Description |
|---|---|
| Iniciada a operação do grupo de instâncias | InstanceGroup <instance-group-name><operation>iniciado com sucesso no Cluster <cluster-name> |
| Falha no início da operação do grupo de instâncias | Falha ao iniciar InstanceGroup <instance-group-name><operation>no cluster <cluster-name> |
| Operação de grupo de instâncias concluída | Grupo de instâncias <instance-group-name><operation>no cluster <cluster-name>concluído com sucesso |
| Falha na operação do grupo de instâncias | <instance-group-name><operation><cluster-name>Falha no grupo de instâncias no cluster |
Configuração de rede do grupo de instâncias
| Event | Description |
|---|---|
| Configuração de rede encontrada | Sub-rede encontrada <subnet-id>em AZ <availability-zone>com SecurityGroupIds <security-group-ids>for IG <instance-group-name>em cluster <cluster-name> |
| Falha na configuração da rede | Falha ao processar os detalhes da configuração de rede do grupo de instâncias para IG <instance-group-name>no cluster <cluster-name> |
| Foi encontrada uma substituição personalizada da AMI | Foi encontrada uma substituição personalizada de AMI <ami-id>para IG <instance-group-name>no cluster <cluster-name> |
| Falha na substituição personalizada da AMI | Falha ao processar detalhes de substituição de AMI personalizada para IG <instance-group-name>no cluster <cluster-name> |
| Configuração de rede da plataforma usada | Usando a configuração de rede fornecida pela HyperPod plataforma para IG <instance-group-name>no cluster <cluster-name> |
| Configuração de rede determinada | Configuração de rede do grupo de instâncias determinada com sucesso para IG <instance-group-name>no cluster <cluster-name> |
Criação de instância
| Event | Description |
|---|---|
| Operação de instância iniciada | Instância <operation>iniciada com sucesso no Cluster <cluster-name>e no IG <instance-group-name> |
| Falha no início da operação da instância | Falha ao iniciar a instância <operation>no cluster <cluster-name>e no IG <instance-group-name> |
| Reserva de capacidade encontrada | CapacityReservation ID encontrada <reservation-id>para Cluster <cluster-name>e IG<instance-group-name>, usando capacidade reservada |
| Reserva de capacidade não encontrada | Não CapacityReservation encontrado para Cluster <cluster-name>e IG<instance-group-name>, usando pool sob demanda |
| Falha na configuração da carga útil da instância | Falha no processamento CapacityReservationDetails para Cluster <cluster-name>e IG <instance-group-name> |
| Criação da ENI do cliente | O Customer ENI foi criado com sucesso, por exemplo, em Cluster <cluster-name>e IG <instance-group-name> |
| Falha na criação do ENI do cliente | Falha ao criar o Customer ENI, por exemplo, no Cluster <cluster-name>e no IG <instance-group-name> |
| Instância EC2 provisionada | <cluster-name>Instância EC2 <instance-id>provisionada com sucesso em Cluster e IG <instance-group-name> |
| Falha na criação da instância EC2 | Falha ao provisionar a instância EC2 no cluster <cluster-name>e no IG <instance-group-name> |
| Status do script de ciclo de vida atualizado | <instance-id>A execução do script do ciclo de vida da instância para a instância EC2 tem <status> |
| Falha na atualização do status do script de ciclo de vida | Falha ao atualizar o status de execução do script do ciclo de vida da instância para EC2InstanceId <instance-id> |
| A criação da instância falhou com os registros do ciclo de vida | <instance-id>A execução do script do ciclo de vida da instância para a instância EC2 falhou. Para ver os registros do script do ciclo de vida, visite o grupo de registros... |
| A limpeza do ENI não utilizada foi bem-sucedida | <cluster-name>Os ENIs de cliente não utilizados foram excluídos com sucesso para a instância EC2 no cluster e <instance-id>no IG <instance-group-name> |
| Falha na limpeza do ENI não utilizada | <cluster-name>Falha ao excluir ENIs de cliente não utilizadas para a instância do EC2 no cluster e <instance-id>no IG <instance-group-name> |
Exclusão de instância
| Event | Description |
|---|---|
| Encerramento da instância EC2 em andamento | O encerramento da instância EC2 <instance-id>está atualmente em andamento no Cluster <cluster-name>e no IG <instance-group-name> |
| Falha no encerramento da instância EC2 | <cluster-name>Falha ao encerrar a instância do EC2 <instance-id>no cluster e no IG <instance-group-name> |
| ENI do cliente excluída | <cluster-name>O ENI do cliente foi excluído com sucesso para a instância do EC2 <instance-id>no cluster e no IG <instance-group-name> |
| Falha na exclusão do ENI do cliente | <cluster-name>Falha ao excluir a ENI do cliente para a instância do EC2 <instance-id>no cluster e no IG <instance-group-name> |
Reinicialização da instância
| Event | Description |
|---|---|
| Reinicialização da instância EC2 em andamento | <cluster-name>A reinicialização da instância EC2 <instance-id>está em andamento no Cluster e no IG <instance-group-name> |
| Falha na solicitação de reinicialização da instância EC2 | <cluster-name>Falha ao enviar a solicitação de reinicialização para a instância EC2 <instance-id>no cluster e no IG <instance-group-name> |
Operação de instância (genérica)
| Event | Description |
|---|---|
| Operação de instância concluída | Instância <operation><instance-id>no cluster <cluster-name>e no IG <instance-group-name>concluída com sucesso |
| Falha na operação da instância | <operation><instance-id><cluster-name><instance-group-name>Falha na instância no cluster e no IG |
Substituição de instâncias
| Event | Description |
|---|---|
| A substituição da instância foi iniciada | <instance-id>A instância está começando como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name> |
| Falha no início da substituição da instância | <instance-id>Falha ao iniciar a instância como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name> |
| Substituição da instância concluída | Instância <instance-id><operation>concluída com sucesso como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name> |
| Falha na substituição da instância | A instância <instance-id><operation>falhou como parte da substituição da instância no Cluster <cluster-name>e no IG <instance-group-name> |
Ciclo de vida do sistema de arquivos FSx
| Event | Description |
|---|---|
| Começou a criação do FSx | <instance-group-name>Começou a criação do FSx para IG in Cluster <cluster-name> |
| Falha na criação do FSx | <instance-group-name>Falha ao criar FSx para IG no cluster <cluster-name> |
| Criação do FSx concluída | <instance-group-name>A criação do FSx foi concluída com sucesso para IG in Cluster <cluster-name> |
| A exclusão do FSx foi iniciada | <instance-group-name>A exclusão do FSx foi iniciada para IG no cluster <cluster-name> |
| Falha na exclusão do FSx | <instance-group-name>Falha ao excluir FSx for IG no cluster <cluster-name> |
| Exclusão do FSx concluída | <instance-group-name>A exclusão do FSx foi concluída com sucesso para IG no cluster <cluster-name> |
| Atualização do FSx iniciada | <instance-group-name>A atualização do FSx foi iniciada para IG in Cluster <cluster-name> |
| Falha na atualização do FSx | <instance-group-name>Falha ao atualizar o FSx para IG no cluster <cluster-name> |
| Atualização do FSx concluída | <instance-group-name>Atualização do FSx concluída com sucesso para IG in Cluster <cluster-name> |
Aplicação de patches (etapas comuns)
Esses eventos de patch são emitidos para os clusters EKS e Slurm durante as operações. UpdateClusterSoftware
| Event | Description |
|---|---|
| Aplicação de patches de grupos de instâncias agendada | InstanceGroup <instance-group-name>in Cluster <cluster-name>foi programado para o mais UpdateClusterSoftware tardar. |
| Falha no cronograma de patches do grupo de instâncias | Falha ao agendar UpdateClusterSoftware o IG <instance-group-name>no Cluster<cluster-name>. |
| Início da aplicação de patches em grupos de instâncias | UpdateClusterSoftware iniciado para IG <instance-group-name>em cluster <cluster-name>usando <strategy>estratégia. |
| Falha no início do patch do grupo de instâncias | <cluster-name>Falha ao iniciar o UpdateClusterSoftware IG <instance-group-name>no cluster. |
| Próximo lote de patches selecionado | Próximo lote de atualização selecionado para IG <instance-group-name>no Cluster<cluster-name>. |
| Falha na seleção do próximo lote de patches | Falha ao selecionar o próximo lote de atualização para o IG <instance-group-name>no cluster<cluster-name>. |
| Instâncias com falha enfileiradas para substituição | Instâncias com falha no IG <instance-group-name>em cluster <cluster-name>enfileiradas para substituição do nó. |
| Falha no enfileiramento de substituição de instâncias | <cluster-name>Falha ao enfileirar instâncias para substituição de nós no IG <instance-group-name>no cluster. |
| A correção do grupo de instâncias foi concluída | UpdateClusterSoftware concluído com sucesso para IG <instance-group-name>in Cluster<cluster-name>. |
| Falha na conclusão do patch do grupo de instâncias | Falha na conclusão UpdateClusterSoftware do IG <instance-group-name>no cluster<cluster-name>. |
| A substituição do volume raiz foi iniciada | A substituição do volume raiz foi iniciada para Instance <instance-id>in IG<instance-group-name>. |
| Falha na substituição do volume raiz | Falha ao iniciar a substituição do volume raiz para Instance <instance-id>no IG<instance-group-name>. |
| A correção de instâncias foi bem-sucedida | Instância <instance-id>no IG <instance-group-name>atualizada com sucesso. |
EKS-specific eventos
Os eventos a seguir são emitidos somente para HyperPod clusters orquestrados com o Amazon EKS.
Gerenciamento de entradas de acesso
| Event | Description |
|---|---|
| A operação de entrada de acesso SLR foi bem-sucedida | Entrada de acesso SLR <operation>bem-sucedida para cluster <cluster-name> |
| Falha na operação de entrada de acesso SLR | <operation>Falha na entrada de acesso SLR para o cluster <cluster-name> |
| A operação de entradas de acesso ao EKS foi bem-sucedida | Entradas de acesso ao EKS <operation>bem-sucedidas para o cluster <cluster-name> |
| Falha na operação de entradas de acesso ao EKS | <operation>Falha nas entradas de acesso do EKS para o cluster <cluster-name> |
Atualizações de configuração do Kubernetes
| Event | Description |
|---|---|
| A atualização da configuração do Kubernetes foi bem-sucedida | <instance-id><cluster-name>Configuração do Kubernetes atualizada com sucesso, por exemplo, em Cluster e IG <instance-group-name> |
| Falha na atualização da configuração do Kubernetes | <instance-id><cluster-name>Falha ao atualizar a configuração do Kubernetes, por exemplo, no Cluster e no IG <instance-group-name> |
Escalonamento automático do Karpenter
| Event | Description |
|---|---|
| A operação de escalonamento automático foi bem-sucedida | AutoScaling <operation><status>com sucesso no Cluster <cluster-name> |
| Falha na operação de escalonamento automático | Falha <operation> AutoScaling no cluster <cluster-name> |
| A instalação do Karpenter CRD foi bem-sucedida | CustomResourceDefinition instalação concluída com sucesso no EKS Cluster <cluster-name> |
| Falha na instalação do Karpenter CRD | CustomResourceDefinition falha na instalação do EKS Cluster <cluster-name> |
| A atualização da política de acesso do Karpenter SLR foi bem-sucedida | <operation>políticas de acesso com entrada de AmazonSageMakerHyperPodServiceRole acesso no cluster EKS <cluster-name>com sucesso |
| Falha na atualização da política de acesso do Karpenter SLR | Falha ao <operation>acessar políticas com entrada de AmazonSageMakerHyperPodServiceRole acesso no cluster EKS <cluster-name> |
Aplicação de patches — nível de instância do EKS
| Event | Description |
|---|---|
| A preparação do patch de instâncias foi bem-sucedida | Instância <instance-id>em IG <instance-group-name>isolada e cápsulas despejadas. |
| Correção de instâncias ignorada (violação do PDB) | UpdateClusterSoftware por exemplo, <instance-id>no IG foi <instance-group-name>ignorado devido a PodDisruptionBudget uma restrição. |
| Falha na preparação do patch de instância | Falha ao preparar a instância <instance-id>no IG <instance-group-name>para UpdateClusterSoftware. |
| Instância restaurada ao estado programável | Instância <instance-id>no IG <instance-group-name>restaurada ao estado programável. |
| Falha na restauração da instância para programável | Falha ao restaurar a instância <instance-id>no IG <instance-group-name>para o estado programável. |
Aplicação de patches — reversão do EKS
| Event | Description |
|---|---|
| Início da hora de cozedura | O período de cozimento começou para o IG <instance-group-name>in Cluster<cluster-name>. Monitorando alarmes [<alarm-names>] por <duration>segundos. |
| Tempo de cozimento concluído | Período de cozimento concluído para o IG <instance-group-name>in Cluster<cluster-name>. Nenhum alarme foi acionado durante o período de <duration>cozimento de 2 segundos. |
| Alarme de tempo de cozimento acionado | O período de cozimento falhou para o IG <instance-group-name>no Cluster<cluster-name>. Os alarmes [<alarm-names>] entraram no estado ALARM. Iniciando a reversão automática. |
| Falha na avaliação do tempo de cozimento | <cluster-name>Falha ao avaliar os alarmes durante o período de cozimento do IG <instance-group-name>no Cluster. |
| Iniciada a reversão de patches do grupo de instâncias | UpdateClusterSoftware falhou para o IG <instance-group-name>no Cluster<cluster-name>. Iniciando a reversão. |
| Falha na reversão de patches do grupo de instâncias | <cluster-name>A reversão falhou para o IG <instance-group-name>no cluster. Alguns casos podem estar no FailedMaintenance estado. |
| Iniciada a reversão da correção de instâncias | <instance-id><instance-group-name>Falha na atualização da instância no IG. Reversão iniciada. |
| A reversão da correção de instâncias foi bem-sucedida | A instância <instance-id>no IG <instance-group-name>foi revertida com sucesso para a AMI anterior. |
| Falha na reversão do patch de instância | UpdateClusterSoftware <instance-group-name>a reversão falhou, por exemplo, <instance-id>no IG. |
Slurm-specific eventos
Os eventos a seguir são emitidos somente para HyperPod clusters orquestrados com o Slurm.
| Event | Description |
|---|---|
| Parâmetros de provisionamento encontrados | Foi encontrado provisioning_parameters.json no caminho S3 para o grupo de controladores LifeCycleScript <instance-group-name> |
| Parâmetros de provisionamento não encontrados | Nenhum provisioning_parameters.json encontrado no caminho S3 para o grupo de controladores LifeCycleScript <instance-group-name> |
| Criada a chave Slurm munge | Chave munge criada e armazenada com sucesso |
| A validação do Slurm drift foi aprovada | A validação do desvio da configuração do Slurm foi aprovada |
| Desvio de lama detectado | Foi detectado um desvio na configuração do Slurm: <drift-details> |
| A reversão do cluster Slurm foi concluída | Falha na criação do cluster: os nós do controlador e do login não ficaram prontos dentro do tempo esperado |
| A reconfiguração do Slurm foi bem-sucedida | O Slurm foi reconfigurado com sucesso. Configuração do Slurm atualizada para corresponder ao estado desejado |
EventBridge integração
HyperPod envia eventos de cluster para a Amazon EventBridge usando três tipos de detalhes:
| Tipo de detalhe | Description |
|---|---|
SageMaker HyperPod Cluster Event |
Eventos operacionais para provisionamento, escalabilidade, aplicação de patches e operações específicas do orquestrador. Inclui EventLevel para filtragem de gravidade. |
SageMaker HyperPod Cluster State Change |
Cluster-level transições de status (por exemplo, Criando para InService). Inclui configuração completa do cluster. |
SageMaker HyperPod Cluster Node Health
Event |
Eventos de monitoramento de saúde do HyperPod Health Monitoring Agent (HMA). Inclui estado de saúde, motivo, ação de reparo e recomendação. |
Exemplos de padrões de eventos
Todos os eventos HyperPod do cluster:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }
Somente eventos de erro (para alertas):
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }
Eventos para um cluster específico:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }
Eventos de saúde do Node:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }
Referência de API
-
ListClusterEvents— Listar eventos com filtragem, classificação e paginação
-
DescribeClusterEvent— Obtenha todos os detalhes de um evento específico
-
ClusterEventSummary— Tipo de dados resumidos do evento
-
ClusterEventDetail— Tipo de dados de detalhes do evento
Consulte também
-
SageMaker HyperPod Eventos do cluster Slurm— Slurm eventos de cluster com uso de CLI e cenários comuns
-
SageMaker HyperPod Eventos do cluster EKS— Eventos de cluster EKS com uso de CLI e cenários comuns