View a markdown version of this page

SageMaker HyperPod referencia de eventos del clúster - Amazon SageMaker AI

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

SageMaker HyperPod referencia de eventos del clúster

Esta página proporciona una referencia completa de todos los eventos estructurados emitidos por los SageMaker HyperPod clústeres de Amazon. Los eventos proporcionan visibilidad de las operaciones a nivel de clúster, grupo de instancias e instancia, incluidos el aprovisionamiento, el escalado, la aplicación de parches y los cambios en el ciclo de vida específicos del orquestador.

Los eventos de clúster están disponibles para los clústeres con el valor establecido en. HyperPod NodeProvisioningMode Continuous Se puede acceder a los eventos a través de DescribeClusterEvent las API ListClusterEvents y, la pestaña Eventos de la consola de SageMaker IA y Amazon EventBridge.

Registro de eventos del clúster

Cada evento de clúster se representa como un registro estructurado que contiene metadatos de identificación, tiempo, alcance, gravedad y específicos de la operación. El siguiente ejemplo muestra un registro de eventos completo tal como se entrega a través de la DescribeClusterEvent API y Amazon EventBridge:

{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }

Campos de registro de eventos

El objeto detail.EventDetails contiene los siguientes campos:

Campo Tipo Obligatorio Description (Descripción)
EventId Cadena (UUID) Identificador único del evento.
ClusterArn Cadena ARN del clúster. HyperPod
ClusterName Cadena Nombre del HyperPod clúster.
EventTime Timestamp Cuándo ocurrió el evento (en milisegundos de la época).
ResourceType Cadena Alcance del evento:Cluster,InstanceGroup, oInstance.
EventLevel Cadena Clasificación de gravedad:Info,Warn, oError.
Description Cadena No Human-readable resumen del evento.
InstanceGroupName Cadena No Nombre del grupo de instancias (presente cuando ResourceType es InstanceGroup oInstance).
InstanceId Cadena No ID de instancia EC2 (presente cuando ResourceType estáInstance).
EventDetails Objeto No Metadatos adicionales específicos del tipo y la operación del recurso.

Niveles de eventos

Nivel Significado
Info La operación se ha completado correctamente o se está realizando con normalidad.
Warn La operación se completó con un problema no crítico o una afección que podría requerir atención en el futuro.
Error La operación falló o requiere atención inmediata.

Tipos de recurso

ResourceType Alcance Eventos de ejemplo
Cluster Whole-cluster operaciones El clúster se creation/update inició, la operación del clúster falló
InstanceGroup Operaciones de grupos de instancias Escalado started/completed, aplicación de parches programada, ciclo de vida de FSx
Instance Operaciones de instancias individuales Aprovisionamiento de EC2, ejecución de scripts durante el ciclo de vida, administración de ENI, terminación

EventDetails metadatos

Los eventos del clúster incluyen un EventMetadata objeto dentro del EventDetails campo que proporciona un contexto específico de la operación más allá de lo que indica la descripción del evento. El contenido EventMetadata varía según el tipo de recurso y el tipo de evento. Para ver el esquema completo y los campos admitidos, consulte EventMetadatala referencia de la API de Amazon SageMaker AI.

EventBridge campos de sobres

Cuando se entrega a través de Amazon EventBridge, el registro del evento viene envuelto en EventBridge un sobre estándar:

Campo Description (Descripción)
version EventBridge versión del esquema (siempre"0").
id ID de EventBridge evento único.
detail-type SageMaker HyperPod Cluster Event
source aws.sagemaker
account AWS ID de cuenta propietario del clúster.
time Marca de tiempo ISO 8601 del evento.
region AWS Región en la que reside el clúster.
resources Matriz que contiene el ARN del clúster.
detail Contiene el EventDetails objeto descrito anteriormente.

Eventos comunes (EKS y Slurm)

Los siguientes eventos se emiten para todos los HyperPod clústeres, independientemente del orquestador. La columna Descripción muestra el valor del Description campo en el registro de eventos tal como aparece en la respuesta de la API y en la pestaña Eventos de la consola.

Ciclo de vida del clúster

Event Description (Descripción)
Se inició la operación del clúster El clúster se <cluster-name><operation>inició correctamente
Falló el inicio de la operación del clúster No se pudo iniciar el clúster <cluster-name><operation>
Se completó la operación del clúster El clúster <cluster-name><operation>se completó correctamente
Falló la operación del clúster <cluster-name><operation>Error en el clúster

Ciclo de vida de los grupos

Event Description (Descripción)
Se inició la operación del grupo de instancias InstanceGroup se <instance-group-name><operation>inició correctamente en el clúster <cluster-name>
No se pudo iniciar la operación del grupo de instancias No se pudo iniciar InstanceGroup <instance-group-name><operation>en el clúster <cluster-name>
Se completó la operación del grupo de instancias El grupo de instancias <instance-group-name><operation>del clúster <cluster-name>se completó correctamente
Falló la operación del grupo de instancias <instance-group-name><operation><cluster-name>Falló el grupo de instancias en el clúster

Configuración de red del grupo de instancias

Event Description (Descripción)
Se encontró una configuración de red Se encontró una subred <subnet-id>en Arizona <availability-zone>con SecurityGroupIds <security-group-ids>IG <instance-group-name>en el clúster <cluster-name>
Falló la configuración de la red No se pudieron procesar los detalles de la configuración de red del grupo de instancias para el IG <instance-group-name>en el clúster <cluster-name>
Se encontró una anulación de AMI personalizada Se encontró una anulación de AMI personalizada <ami-id>para IG <instance-group-name>en el clúster <cluster-name>
Falló la anulación de la AMI personalizada No se pudieron procesar los detalles de anulación de AMI personalizados para IG <instance-group-name>en el clúster <cluster-name>
Se utilizó la configuración de red de plataforma Uso de HyperPod la configuración de red proporcionada por la plataforma para IG <instance-group-name>in Cluster <cluster-name>
Se determinó la configuración de red Se determinó correctamente la configuración de red del grupo de instancias para IG <instance-group-name>en el clúster <cluster-name>

Creación de instancias

Event Description (Descripción)
Se inició la operación de la instancia La instancia se <operation>inició correctamente en Cluster <cluster-name>e IG <instance-group-name>
No se pudo iniciar la operación de la instancia No se pudo iniciar la instancia <operation>en el clúster <cluster-name>y en el IG <instance-group-name>
Se encontró una reserva de capacidad Se encontró CapacityReservation un identificador <reservation-id>para el clúster <cluster-name>y el IG<instance-group-name>, utilizando la capacidad reservada
No se encontró la reserva de capacidad No CapacityReservation se encontró nada para Cluster <cluster-name>e IG<instance-group-name>, utilizando el pool bajo demanda
Falló la configuración de la carga útil de la instancia No se pudo procesar el CapacityReservationDetails clúster <cluster-name>y el IG <instance-group-name>
El cliente ENI creó Creó satisfactoriamente el cliente ENI, por ejemplo, en Cluster <cluster-name>e IG <instance-group-name>
No se pudo crear el ENI del cliente No se pudo crear el ENI del cliente, por ejemplo, en Cluster <cluster-name>e IG <instance-group-name>
Instancia EC2 aprovisionada <cluster-name>Instancia EC2 <instance-id>aprovisionada correctamente en el clúster y en el IG <instance-group-name>
Falló la creación de la instancia EC2 <cluster-name>No se pudo aprovisionar la instancia EC2 en el clúster y en el IG <instance-group-name>
Se ha actualizado el estado del script de ciclo <instance-id>La ejecución del script del ciclo de vida de la instancia para la instancia EC2 tiene <status>
Error al actualizar el estado del script de Lifecycle No se pudo actualizar el estado de ejecución del script del ciclo de vida de la instancia para EC2InstanceId <instance-id>
No se pudo crear la instancia con los registros del ciclo de vida No se <instance-id>pudo ejecutar el script del ciclo de vida de la instancia para la instancia EC2. Para ver los registros de los scripts del ciclo de vida, visite el grupo de registros...
La limpieza de ENI no utilizada se realizó correctamente <cluster-name>Se eliminaron correctamente los ENI del cliente no utilizados para la instancia EC2 en el clúster y <instance-id>en el IG <instance-group-name>
No se pudo limpiar el ENI no utilizado <cluster-name>No se pudieron eliminar los ENI del cliente no utilizados para la instancia EC2 en el clúster y <instance-id>en el IG <instance-group-name>

Eliminación de instancias

Event Description (Descripción)
La finalización de la instancia EC2 está en curso <cluster-name>La finalización de la instancia EC2 <instance-id>está actualmente en curso en el clúster y en el IG <instance-group-name>
Falló la finalización de la instancia EC2 <cluster-name>No se pudo terminar la instancia EC2 en el <instance-id>clúster y en el IG <instance-group-name>
Se eliminó el ENI del cliente El ENI del cliente se eliminó correctamente para la instancia EC2 <instance-id>en el clúster <cluster-name>y en el IG <instance-group-name>
No se pudo eliminar el ENI del cliente No se pudo eliminar el ENI del cliente para la instancia EC2 <instance-id>en el clúster <cluster-name>y en el IG <instance-group-name>

Reinicio de la instancia

Event Description (Descripción)
Se está reiniciando la instancia EC2 <instance-id><cluster-name>Actualmente se está reiniciando la instancia EC2 en el clúster y en el IG <instance-group-name>
Falló la solicitud de reinicio de la instancia EC2 <cluster-name>No se pudo enviar la solicitud de reinicio de la instancia EC2 en el <instance-id>clúster y en el IG <instance-group-name>

Operación de instancia (genérica)

Event Description (Descripción)
Operación de instancia completada La instancia <operation><instance-id>en el clúster <cluster-name>y en el IG <instance-group-name>se completó correctamente
Falló la operación de la instancia <operation><instance-id><cluster-name><instance-group-name>Falló la instancia en el clúster y en el IG

Reemplazo de instancias

Event Description (Descripción)
Se inició el reemplazo de la instancia <instance-id>La instancia se está iniciando como parte del reemplazo de una instancia en Cluster <cluster-name>e IG <instance-group-name>
Falló el inicio del reemplazo de la instancia La instancia <instance-id>no se pudo iniciar como parte del reemplazo de una instancia en Cluster <cluster-name>e IG <instance-group-name>
Se completó el reemplazo de la instancia La instancia <instance-id><operation>se completó correctamente como parte del reemplazo de una instancia en Cluster <cluster-name>e IG <instance-group-name>
Falló el reemplazo de la instancia La instancia <instance-id><operation>falló como parte del reemplazo de una instancia en Cluster <cluster-name>e IG <instance-group-name>

Ciclo de vida del sistema de archivos FSx

Event Description (Descripción)
Se ha iniciado la creación de FSx <instance-group-name>Comenzó la creación de FSx para IG in Cluster <cluster-name>
Falló la creación de FSx <instance-group-name>No se pudo crear FSx para IG en el clúster <cluster-name>
Se completó la creación de FSx <instance-group-name>Se completó correctamente la creación de FSx para IG in Cluster <cluster-name>
Se inició la eliminación de FSx <instance-group-name>Se inició la eliminación de FSx para IG en el clúster <cluster-name>
Falló la eliminación de FSx <instance-group-name>No se pudo eliminar FSx para IG en el clúster <cluster-name>
Se completó la eliminación de FSx <instance-group-name>La eliminación de FSx se completó correctamente para IG in Cluster <cluster-name>
Se inició la actualización de FSx <instance-group-name>Comenzó la actualización de FSx para IG in Cluster <cluster-name>
Falló la actualización de FSx <instance-group-name>No se pudo actualizar FSx para IG en el clúster <cluster-name>
Se completó la actualización de FSx <instance-group-name>Se completó correctamente la actualización de FSx para IG in Cluster <cluster-name>

Aplicación de parches (pasos comunes)

Estos eventos de aplicación de parches se emiten para los clústeres EKS y Slurm durante las operaciones. UpdateClusterSoftware

Event Description (Descripción)
Se ha programado la aplicación de parches a grupos de instancias InstanceGroup <instance-group-name>in Cluster <cluster-name>se ha programado UpdateClusterSoftware a más tardar.
Falló el programa de aplicación de parches a los grupos de instancias <cluster-name>No se pudo programar UpdateClusterSoftware la IG <instance-group-name>en el clúster.
Se inició la aplicación de parches a los grupos de instancias UpdateClusterSoftware iniciado para IG <instance-group-name>in Cluster <cluster-name>mediante <strategy>una estrategia.
No se pudo iniciar el parcheo del grupo de instancias <cluster-name>No se pudo iniciar UpdateClusterSoftware para IG <instance-group-name>en el clúster.
Se seleccionó el siguiente lote de parches <cluster-name>Siguiente lote de actualización seleccionado para IG <instance-group-name>in Cluster.
Falló la selección del siguiente lote de parches <cluster-name>No se pudo seleccionar el siguiente lote de actualización para IG <instance-group-name>in Cluster.
Instancias fallidas puestas en cola para ser reemplazadas Las instancias fallidas de IG <instance-group-name>en el clúster se pusieron en <cluster-name>cola para reemplazar el nodo.
Error: no se pudo realizar la cola de reemplazo de instancias <instance-group-name><cluster-name>No se pudieron poner en cola las instancias para reemplazar los nodos en IG in Cluster.
Se completó la aplicación de parches a los grupos de instancias UpdateClusterSoftware <cluster-name>se completó correctamente para IG <instance-group-name>in Cluster.
No se pudo completar la aplicación de parches al grupo de instancias <cluster-name>No se pudo completar UpdateClusterSoftware el IG <instance-group-name>en el clúster.
Se ha iniciado el reemplazo del volumen raíz Se inició el reemplazo del volumen raíz, por ejemplo, <instance-id>en IG<instance-group-name>.
Falló la sustitución del volumen raíz No se pudo iniciar la sustitución del volumen raíz de la instancia <instance-id>en IG<instance-group-name>.
El parcheo de instancias se realizó correctamente La instancia <instance-id>en IG se <instance-group-name>actualizó correctamente.

EKS-specific eventos

Los siguientes eventos se emiten solo para HyperPod los clústeres orquestados con Amazon EKS.

Administración de entradas de acceso

Event Description (Descripción)
La operación de entrada de acceso a la SLR se realizó correctamente La entrada de acceso a la SLR se ha <operation>realizado correctamente en el clúster <cluster-name>
Falló la operación de entrada de acceso a la SLR <operation>Falló la entrada de acceso a la SLR en el clúster <cluster-name>
La operación de entradas de acceso EKS se realizó correctamente Las entradas de acceso a EKS se <operation>realizaron correctamente para el clúster <cluster-name>
Falló la operación de entradas de acceso a EKS <operation>Fallaron las entradas de acceso a EKS para el clúster <cluster-name>

Actualizaciones de configuración de Kubernetes

Event Description (Descripción)
La actualización de configuración de Kubernetes se realizó correctamente <instance-id><cluster-name>Se actualizó correctamente la configuración de Kubernetes, por ejemplo, en Cluster e IG <instance-group-name>
Falló la actualización de la configuración de Kubernetes <instance-id><cluster-name>No se pudo actualizar la configuración de Kubernetes, por ejemplo, en Cluster e IG <instance-group-name>

Escalado automático de Karpenter

Event Description (Descripción)
La operación de escalado automático se realizó correctamente AutoScaling <operation><status>correctamente en el clúster <cluster-name>
Falló la operación de escalado automático No se pudo iniciar <operation> AutoScaling el clúster <cluster-name>
La instalación de Karpenter CRD se realizó correctamente CustomResourceDefinition la instalación se completó correctamente en el clúster EKS <cluster-name>
Falló la instalación de Karpenter CRD CustomResourceDefinition error en la instalación del clúster EKS <cluster-name>
La actualización de la política de acceso a Karpenter SLR se realizó correctamente <operation><cluster-name>políticas de acceso con la entrada de AmazonSageMakerHyperPodServiceRole acceso en el clúster EKS correctamente
Falló la actualización de la política de acceso a Karpenter SLR No se pudo <operation>acceder a las políticas con la entrada de AmazonSageMakerHyperPodServiceRole acceso en el clúster EKS <cluster-name>

Parcheo: a nivel de instancia de EKS

Event Description (Descripción)
La preparación de los parches de instancias se realizó correctamente <instance-id>Se <instance-group-name>acordonó una instancia en IG y se desalojaron las cápsulas.
Se omitió el parche de la instancia (infracción de PDB) UpdateClusterSoftware por ejemplo, <instance-id>en IG se <instance-group-name>omitió debido a una restricción. PodDisruptionBudget
Falló la preparación del parche de la instancia No se pudo preparar la instancia <instance-id>en IG <instance-group-name>para UpdateClusterSoftware.
Instancia restaurada a un estado programable Instancia <instance-id>en IG <instance-group-name>restaurada a un estado programable.
Falló la restauración de la instancia a programable No se pudo restaurar la instancia <instance-id>en IG <instance-group-name>a un estado programable.

Parcheo: reversión de EKS

Event Description (Descripción)
Comenzó la hora de hornear Comenzó el período de cocción para IG <instance-group-name>in Cluster<cluster-name>. Monitorear las alarmas [<alarm-names>] durante <duration>unos segundos.
Tiempo de horneado completado Se completó el período de cocción para IG <instance-group-name>in Cluster<cluster-name>. No se activó ninguna alarma durante el <duration>período de cocción de 1 segundo.
Se activó la alarma de hora de cocción Error en el período de cocción de IG <instance-group-name>in Cluster<cluster-name>. Las alarmas [<alarm-names>] entraron en estado de ALARMA. Iniciando la reversión automática.
Falló la evaluación del tiempo de horneado No se pudieron evaluar las alarmas durante el período de cocción para IG <instance-group-name>in Cluster<cluster-name>.
Se inició la reversión de los parches de grupos de instancias UpdateClusterSoftware <cluster-name>se produjo un error <instance-group-name>en IG in Cluster. Iniciando la reversión.
Falló la reversión de los parches de grupos de instancias <instance-group-name><cluster-name>Error en la reversión de IG en el clúster. Es posible que algunos casos estén en FailedMaintenance estado.
Se ha iniciado la reversión de los parches de instancias La instancia <instance-id>en IG <instance-group-name>no se pudo actualizar. Se ha iniciado la reversión.
La reversión de los parches de instancias se realizó correctamente La instancia <instance-id>de IG <instance-group-name>se revirtió correctamente a la AMI anterior.
Falló la reversión de los parches de la instancia UpdateClusterSoftware <instance-id><instance-group-name>la reversión falló, por ejemplo, en IG.

Slurm-specific eventos

Los siguientes eventos se emiten solo para HyperPod los clústeres orquestados con Slurm.

Event Description (Descripción)
Se encontraron parámetros de aprovisionamiento Se encontró provisioning_parameters.json en la ruta S3 para el grupo de controladores LifeCycleScript <instance-group-name>
No se encontraron los parámetros de aprovisionamiento No se encontró provisioning_parameters.json en la ruta de S3 para el grupo de controladores LifeCycleScript <instance-group-name>
Se creó la clave Slurm munge La clave munge se creó y almacenó correctamente
Se ha superado la validación de Slurm Drift Se aprobó la validación de la desviación de configuración de Slurm
Se detectó una deriva de Slurm Se detectó una desviación en la configuración de Slurm: <drift-details>
Se completó la reversión del clúster de Slurm No se pudo crear el clúster: el controlador y los nodos de inicio de sesión no estaban listos en el tiempo esperado
La reconfiguración de Slurm se realizó correctamente Slurm se reconfiguró correctamente. La configuración de Slurm se actualizó para que coincida con el estado deseado

EventBridge integración

HyperPod envía los eventos del clúster a Amazon EventBridge mediante tres tipos de detalles:

Tipo de detalle Description (Descripción)
SageMaker HyperPod Cluster Event Eventos operativos para el aprovisionamiento, el escalado, la aplicación de parches y las operaciones específicas del orquestador. Incluye filtros de gravedad. EventLevel
SageMaker HyperPod Cluster State Change Cluster-level transiciones de estado (por ejemplo, Crear en InService). Incluye la configuración completa del clúster.
SageMaker HyperPod Cluster Node Health Event Eventos de monitoreo de HyperPod salud del Health Monitoring Agent (HMA). Incluye el estado de salud, el motivo, la acción de reparación y la recomendación.

Ejemplos de patrones de eventos

Todos los eventos HyperPod del clúster:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }

Solo eventos de error (para alertas):

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }

Eventos de un clúster específico:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }

Eventos de salud de los nodos:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }

Referencia de la API

Véase también