Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
SageMaker HyperPod referencia de eventos del clúster
Esta página proporciona una referencia completa de todos los eventos estructurados emitidos por los SageMaker HyperPod clústeres de Amazon. Los eventos proporcionan visibilidad de las operaciones a nivel de clúster, grupo de instancias e instancia, incluidos el aprovisionamiento, el escalado, la aplicación de parches y los cambios en el ciclo de vida específicos del orquestador.
Los eventos de clúster están disponibles para los clústeres con el valor establecido en. HyperPod NodeProvisioningMode Continuous Se puede acceder a los eventos a través de DescribeClusterEvent las API ListClusterEvents y, la pestaña Eventos de la consola de SageMaker IA y Amazon EventBridge.
Registro de eventos del clúster
Cada evento de clúster se representa como un registro estructurado que contiene metadatos de identificación, tiempo, alcance, gravedad y específicos de la operación. El siguiente ejemplo muestra un registro de eventos completo tal como se entrega a través de la DescribeClusterEvent API y Amazon EventBridge:
{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }
Campos de registro de eventos
El objeto detail.EventDetails contiene los siguientes campos:
| Campo | Tipo | Obligatorio | Description (Descripción) |
|---|---|---|---|
EventId |
Cadena (UUID) | Sí | Identificador único del evento. |
ClusterArn |
Cadena | Sí | ARN del clúster. HyperPod |
ClusterName |
Cadena | Sí | Nombre del HyperPod clúster. |
EventTime |
Timestamp | Sí | Cuándo ocurrió el evento (en milisegundos de la época). |
ResourceType |
Cadena | Sí | Alcance del evento:Cluster,InstanceGroup, oInstance. |
EventLevel |
Cadena | Sí | Clasificación de gravedad:Info,Warn, oError. |
Description |
Cadena | No | Human-readable resumen del evento. |
InstanceGroupName |
Cadena | No | Nombre del grupo de instancias (presente cuando ResourceType es InstanceGroup oInstance). |
InstanceId |
Cadena | No | ID de instancia EC2 (presente cuando ResourceType estáInstance). |
EventDetails |
Objeto | No | Metadatos adicionales específicos del tipo y la operación del recurso. |
Niveles de eventos
| Nivel | Significado |
|---|---|
Info |
La operación se ha completado correctamente o se está realizando con normalidad. |
Warn |
La operación se completó con un problema no crítico o una afección que podría requerir atención en el futuro. |
Error |
La operación falló o requiere atención inmediata. |
Tipos de recurso
| ResourceType | Alcance | Eventos de ejemplo |
|---|---|---|
Cluster |
Whole-cluster operaciones | El clúster se creation/update inició, la operación del clúster falló |
InstanceGroup |
Operaciones de grupos de instancias | Escalado started/completed, aplicación de parches programada, ciclo de vida de FSx |
Instance |
Operaciones de instancias individuales | Aprovisionamiento de EC2, ejecución de scripts durante el ciclo de vida, administración de ENI, terminación |
EventDetails metadatos
Los eventos del clúster incluyen un EventMetadata objeto dentro del EventDetails campo que proporciona un contexto específico de la operación más allá de lo que indica la descripción del evento. El contenido EventMetadata varía según el tipo de recurso y el tipo de evento. Para ver el esquema completo y los campos admitidos, consulte EventMetadatala referencia de la API de Amazon SageMaker AI.
EventBridge campos de sobres
Cuando se entrega a través de Amazon EventBridge, el registro del evento viene envuelto en EventBridge un sobre estándar:
| Campo | Description (Descripción) |
|---|---|
version |
EventBridge versión del esquema (siempre"0"). |
id |
ID de EventBridge evento único. |
detail-type |
SageMaker HyperPod Cluster Event |
source |
aws.sagemaker |
account |
AWS ID de cuenta propietario del clúster. |
time |
Marca de tiempo ISO 8601 del evento. |
region |
AWS Región en la que reside el clúster. |
resources |
Matriz que contiene el ARN del clúster. |
detail |
Contiene el EventDetails objeto descrito anteriormente. |
Eventos comunes (EKS y Slurm)
Los siguientes eventos se emiten para todos los HyperPod clústeres, independientemente del orquestador. La columna Descripción muestra el valor del Description campo en el registro de eventos tal como aparece en la respuesta de la API y en la pestaña Eventos de la consola.
Ciclo de vida del clúster
| Event | Description (Descripción) |
|---|---|
| Se inició la operación del clúster | El clúster se <cluster-name><operation>inició correctamente |
| Falló el inicio de la operación del clúster | No se pudo iniciar el clúster <cluster-name><operation> |
| Se completó la operación del clúster | El clúster <cluster-name><operation>se completó correctamente |
| Falló la operación del clúster | <cluster-name><operation>Error en el clúster |
Ciclo de vida de los grupos
| Event | Description (Descripción) |
|---|---|
| Se inició la operación del grupo de instancias | InstanceGroup se <instance-group-name><operation>inició correctamente en el clúster <cluster-name> |
| No se pudo iniciar la operación del grupo de instancias | No se pudo iniciar InstanceGroup <instance-group-name><operation>en el clúster <cluster-name> |
| Se completó la operación del grupo de instancias | El grupo de instancias <instance-group-name><operation>del clúster <cluster-name>se completó correctamente |
| Falló la operación del grupo de instancias | <instance-group-name><operation><cluster-name>Falló el grupo de instancias en el clúster |
Configuración de red del grupo de instancias
| Event | Description (Descripción) |
|---|---|
| Se encontró una configuración de red | Se encontró una subred <subnet-id>en Arizona <availability-zone>con SecurityGroupIds <security-group-ids>IG <instance-group-name>en el clúster <cluster-name> |
| Falló la configuración de la red | No se pudieron procesar los detalles de la configuración de red del grupo de instancias para el IG <instance-group-name>en el clúster <cluster-name> |
| Se encontró una anulación de AMI personalizada | Se encontró una anulación de AMI personalizada <ami-id>para IG <instance-group-name>en el clúster <cluster-name> |
| Falló la anulación de la AMI personalizada | No se pudieron procesar los detalles de anulación de AMI personalizados para IG <instance-group-name>en el clúster <cluster-name> |
| Se utilizó la configuración de red de plataforma | Uso de HyperPod la configuración de red proporcionada por la plataforma para IG <instance-group-name>in Cluster <cluster-name> |
| Se determinó la configuración de red | Se determinó correctamente la configuración de red del grupo de instancias para IG <instance-group-name>en el clúster <cluster-name> |
Creación de instancias
| Event | Description (Descripción) |
|---|---|
| Se inició la operación de la instancia | La instancia se <operation>inició correctamente en Cluster <cluster-name>e IG <instance-group-name> |
| No se pudo iniciar la operación de la instancia | No se pudo iniciar la instancia <operation>en el clúster <cluster-name>y en el IG <instance-group-name> |
| Se encontró una reserva de capacidad | Se encontró CapacityReservation un identificador <reservation-id>para el clúster <cluster-name>y el IG<instance-group-name>, utilizando la capacidad reservada |
| No se encontró la reserva de capacidad | No CapacityReservation se encontró nada para Cluster <cluster-name>e IG<instance-group-name>, utilizando el pool bajo demanda |
| Falló la configuración de la carga útil de la instancia | No se pudo procesar el CapacityReservationDetails clúster <cluster-name>y el IG <instance-group-name> |
| El cliente ENI creó | Creó satisfactoriamente el cliente ENI, por ejemplo, en Cluster <cluster-name>e IG <instance-group-name> |
| No se pudo crear el ENI del cliente | No se pudo crear el ENI del cliente, por ejemplo, en Cluster <cluster-name>e IG <instance-group-name> |
| Instancia EC2 aprovisionada | <cluster-name>Instancia EC2 <instance-id>aprovisionada correctamente en el clúster y en el IG <instance-group-name> |
| Falló la creación de la instancia EC2 | <cluster-name>No se pudo aprovisionar la instancia EC2 en el clúster y en el IG <instance-group-name> |
| Se ha actualizado el estado del script de ciclo | <instance-id>La ejecución del script del ciclo de vida de la instancia para la instancia EC2 tiene <status> |
| Error al actualizar el estado del script de Lifecycle | No se pudo actualizar el estado de ejecución del script del ciclo de vida de la instancia para EC2InstanceId <instance-id> |
| No se pudo crear la instancia con los registros del ciclo de vida | No se <instance-id>pudo ejecutar el script del ciclo de vida de la instancia para la instancia EC2. Para ver los registros de los scripts del ciclo de vida, visite el grupo de registros... |
| La limpieza de ENI no utilizada se realizó correctamente | <cluster-name>Se eliminaron correctamente los ENI del cliente no utilizados para la instancia EC2 en el clúster y <instance-id>en el IG <instance-group-name> |
| No se pudo limpiar el ENI no utilizado | <cluster-name>No se pudieron eliminar los ENI del cliente no utilizados para la instancia EC2 en el clúster y <instance-id>en el IG <instance-group-name> |
Eliminación de instancias
| Event | Description (Descripción) |
|---|---|
| La finalización de la instancia EC2 está en curso | <cluster-name>La finalización de la instancia EC2 <instance-id>está actualmente en curso en el clúster y en el IG <instance-group-name> |
| Falló la finalización de la instancia EC2 | <cluster-name>No se pudo terminar la instancia EC2 en el <instance-id>clúster y en el IG <instance-group-name> |
| Se eliminó el ENI del cliente | El ENI del cliente se eliminó correctamente para la instancia EC2 <instance-id>en el clúster <cluster-name>y en el IG <instance-group-name> |
| No se pudo eliminar el ENI del cliente | No se pudo eliminar el ENI del cliente para la instancia EC2 <instance-id>en el clúster <cluster-name>y en el IG <instance-group-name> |
Reinicio de la instancia
| Event | Description (Descripción) |
|---|---|
| Se está reiniciando la instancia EC2 | <instance-id><cluster-name>Actualmente se está reiniciando la instancia EC2 en el clúster y en el IG <instance-group-name> |
| Falló la solicitud de reinicio de la instancia EC2 | <cluster-name>No se pudo enviar la solicitud de reinicio de la instancia EC2 en el <instance-id>clúster y en el IG <instance-group-name> |
Operación de instancia (genérica)
| Event | Description (Descripción) |
|---|---|
| Operación de instancia completada | La instancia <operation><instance-id>en el clúster <cluster-name>y en el IG <instance-group-name>se completó correctamente |
| Falló la operación de la instancia | <operation><instance-id><cluster-name><instance-group-name>Falló la instancia en el clúster y en el IG |
Reemplazo de instancias
| Event | Description (Descripción) |
|---|---|
| Se inició el reemplazo de la instancia | <instance-id>La instancia se está iniciando como parte del reemplazo de una instancia en Cluster <cluster-name>e IG <instance-group-name> |
| Falló el inicio del reemplazo de la instancia | La instancia <instance-id>no se pudo iniciar como parte del reemplazo de una instancia en Cluster <cluster-name>e IG <instance-group-name> |
| Se completó el reemplazo de la instancia | La instancia <instance-id><operation>se completó correctamente como parte del reemplazo de una instancia en Cluster <cluster-name>e IG <instance-group-name> |
| Falló el reemplazo de la instancia | La instancia <instance-id><operation>falló como parte del reemplazo de una instancia en Cluster <cluster-name>e IG <instance-group-name> |
Ciclo de vida del sistema de archivos FSx
| Event | Description (Descripción) |
|---|---|
| Se ha iniciado la creación de FSx | <instance-group-name>Comenzó la creación de FSx para IG in Cluster <cluster-name> |
| Falló la creación de FSx | <instance-group-name>No se pudo crear FSx para IG en el clúster <cluster-name> |
| Se completó la creación de FSx | <instance-group-name>Se completó correctamente la creación de FSx para IG in Cluster <cluster-name> |
| Se inició la eliminación de FSx | <instance-group-name>Se inició la eliminación de FSx para IG en el clúster <cluster-name> |
| Falló la eliminación de FSx | <instance-group-name>No se pudo eliminar FSx para IG en el clúster <cluster-name> |
| Se completó la eliminación de FSx | <instance-group-name>La eliminación de FSx se completó correctamente para IG in Cluster <cluster-name> |
| Se inició la actualización de FSx | <instance-group-name>Comenzó la actualización de FSx para IG in Cluster <cluster-name> |
| Falló la actualización de FSx | <instance-group-name>No se pudo actualizar FSx para IG en el clúster <cluster-name> |
| Se completó la actualización de FSx | <instance-group-name>Se completó correctamente la actualización de FSx para IG in Cluster <cluster-name> |
Aplicación de parches (pasos comunes)
Estos eventos de aplicación de parches se emiten para los clústeres EKS y Slurm durante las operaciones. UpdateClusterSoftware
| Event | Description (Descripción) |
|---|---|
| Se ha programado la aplicación de parches a grupos de instancias | InstanceGroup <instance-group-name>in Cluster <cluster-name>se ha programado UpdateClusterSoftware a más tardar. |
| Falló el programa de aplicación de parches a los grupos de instancias | <cluster-name>No se pudo programar UpdateClusterSoftware la IG <instance-group-name>en el clúster. |
| Se inició la aplicación de parches a los grupos de instancias | UpdateClusterSoftware iniciado para IG <instance-group-name>in Cluster <cluster-name>mediante <strategy>una estrategia. |
| No se pudo iniciar el parcheo del grupo de instancias | <cluster-name>No se pudo iniciar UpdateClusterSoftware para IG <instance-group-name>en el clúster. |
| Se seleccionó el siguiente lote de parches | <cluster-name>Siguiente lote de actualización seleccionado para IG <instance-group-name>in Cluster. |
| Falló la selección del siguiente lote de parches | <cluster-name>No se pudo seleccionar el siguiente lote de actualización para IG <instance-group-name>in Cluster. |
| Instancias fallidas puestas en cola para ser reemplazadas | Las instancias fallidas de IG <instance-group-name>en el clúster se pusieron en <cluster-name>cola para reemplazar el nodo. |
| Error: no se pudo realizar la cola de reemplazo de instancias | <instance-group-name><cluster-name>No se pudieron poner en cola las instancias para reemplazar los nodos en IG in Cluster. |
| Se completó la aplicación de parches a los grupos de instancias | UpdateClusterSoftware <cluster-name>se completó correctamente para IG <instance-group-name>in Cluster. |
| No se pudo completar la aplicación de parches al grupo de instancias | <cluster-name>No se pudo completar UpdateClusterSoftware el IG <instance-group-name>en el clúster. |
| Se ha iniciado el reemplazo del volumen raíz | Se inició el reemplazo del volumen raíz, por ejemplo, <instance-id>en IG<instance-group-name>. |
| Falló la sustitución del volumen raíz | No se pudo iniciar la sustitución del volumen raíz de la instancia <instance-id>en IG<instance-group-name>. |
| El parcheo de instancias se realizó correctamente | La instancia <instance-id>en IG se <instance-group-name>actualizó correctamente. |
EKS-specific eventos
Los siguientes eventos se emiten solo para HyperPod los clústeres orquestados con Amazon EKS.
Administración de entradas de acceso
| Event | Description (Descripción) |
|---|---|
| La operación de entrada de acceso a la SLR se realizó correctamente | La entrada de acceso a la SLR se ha <operation>realizado correctamente en el clúster <cluster-name> |
| Falló la operación de entrada de acceso a la SLR | <operation>Falló la entrada de acceso a la SLR en el clúster <cluster-name> |
| La operación de entradas de acceso EKS se realizó correctamente | Las entradas de acceso a EKS se <operation>realizaron correctamente para el clúster <cluster-name> |
| Falló la operación de entradas de acceso a EKS | <operation>Fallaron las entradas de acceso a EKS para el clúster <cluster-name> |
Actualizaciones de configuración de Kubernetes
| Event | Description (Descripción) |
|---|---|
| La actualización de configuración de Kubernetes se realizó correctamente | <instance-id><cluster-name>Se actualizó correctamente la configuración de Kubernetes, por ejemplo, en Cluster e IG <instance-group-name> |
| Falló la actualización de la configuración de Kubernetes | <instance-id><cluster-name>No se pudo actualizar la configuración de Kubernetes, por ejemplo, en Cluster e IG <instance-group-name> |
Escalado automático de Karpenter
| Event | Description (Descripción) |
|---|---|
| La operación de escalado automático se realizó correctamente | AutoScaling <operation><status>correctamente en el clúster <cluster-name> |
| Falló la operación de escalado automático | No se pudo iniciar <operation> AutoScaling el clúster <cluster-name> |
| La instalación de Karpenter CRD se realizó correctamente | CustomResourceDefinition la instalación se completó correctamente en el clúster EKS <cluster-name> |
| Falló la instalación de Karpenter CRD | CustomResourceDefinition error en la instalación del clúster EKS <cluster-name> |
| La actualización de la política de acceso a Karpenter SLR se realizó correctamente | <operation><cluster-name>políticas de acceso con la entrada de AmazonSageMakerHyperPodServiceRole acceso en el clúster EKS correctamente |
| Falló la actualización de la política de acceso a Karpenter SLR | No se pudo <operation>acceder a las políticas con la entrada de AmazonSageMakerHyperPodServiceRole acceso en el clúster EKS <cluster-name> |
Parcheo: a nivel de instancia de EKS
| Event | Description (Descripción) |
|---|---|
| La preparación de los parches de instancias se realizó correctamente | <instance-id>Se <instance-group-name>acordonó una instancia en IG y se desalojaron las cápsulas. |
| Se omitió el parche de la instancia (infracción de PDB) | UpdateClusterSoftware por ejemplo, <instance-id>en IG se <instance-group-name>omitió debido a una restricción. PodDisruptionBudget |
| Falló la preparación del parche de la instancia | No se pudo preparar la instancia <instance-id>en IG <instance-group-name>para UpdateClusterSoftware. |
| Instancia restaurada a un estado programable | Instancia <instance-id>en IG <instance-group-name>restaurada a un estado programable. |
| Falló la restauración de la instancia a programable | No se pudo restaurar la instancia <instance-id>en IG <instance-group-name>a un estado programable. |
Parcheo: reversión de EKS
| Event | Description (Descripción) |
|---|---|
| Comenzó la hora de hornear | Comenzó el período de cocción para IG <instance-group-name>in Cluster<cluster-name>. Monitorear las alarmas [<alarm-names>] durante <duration>unos segundos. |
| Tiempo de horneado completado | Se completó el período de cocción para IG <instance-group-name>in Cluster<cluster-name>. No se activó ninguna alarma durante el <duration>período de cocción de 1 segundo. |
| Se activó la alarma de hora de cocción | Error en el período de cocción de IG <instance-group-name>in Cluster<cluster-name>. Las alarmas [<alarm-names>] entraron en estado de ALARMA. Iniciando la reversión automática. |
| Falló la evaluación del tiempo de horneado | No se pudieron evaluar las alarmas durante el período de cocción para IG <instance-group-name>in Cluster<cluster-name>. |
| Se inició la reversión de los parches de grupos de instancias | UpdateClusterSoftware <cluster-name>se produjo un error <instance-group-name>en IG in Cluster. Iniciando la reversión. |
| Falló la reversión de los parches de grupos de instancias | <instance-group-name><cluster-name>Error en la reversión de IG en el clúster. Es posible que algunos casos estén en FailedMaintenance estado. |
| Se ha iniciado la reversión de los parches de instancias | La instancia <instance-id>en IG <instance-group-name>no se pudo actualizar. Se ha iniciado la reversión. |
| La reversión de los parches de instancias se realizó correctamente | La instancia <instance-id>de IG <instance-group-name>se revirtió correctamente a la AMI anterior. |
| Falló la reversión de los parches de la instancia | UpdateClusterSoftware <instance-id><instance-group-name>la reversión falló, por ejemplo, en IG. |
Slurm-specific eventos
Los siguientes eventos se emiten solo para HyperPod los clústeres orquestados con Slurm.
| Event | Description (Descripción) |
|---|---|
| Se encontraron parámetros de aprovisionamiento | Se encontró provisioning_parameters.json en la ruta S3 para el grupo de controladores LifeCycleScript <instance-group-name> |
| No se encontraron los parámetros de aprovisionamiento | No se encontró provisioning_parameters.json en la ruta de S3 para el grupo de controladores LifeCycleScript <instance-group-name> |
| Se creó la clave Slurm munge | La clave munge se creó y almacenó correctamente |
| Se ha superado la validación de Slurm Drift | Se aprobó la validación de la desviación de configuración de Slurm |
| Se detectó una deriva de Slurm | Se detectó una desviación en la configuración de Slurm: <drift-details> |
| Se completó la reversión del clúster de Slurm | No se pudo crear el clúster: el controlador y los nodos de inicio de sesión no estaban listos en el tiempo esperado |
| La reconfiguración de Slurm se realizó correctamente | Slurm se reconfiguró correctamente. La configuración de Slurm se actualizó para que coincida con el estado deseado |
EventBridge integración
HyperPod envía los eventos del clúster a Amazon EventBridge mediante tres tipos de detalles:
| Tipo de detalle | Description (Descripción) |
|---|---|
SageMaker HyperPod Cluster Event |
Eventos operativos para el aprovisionamiento, el escalado, la aplicación de parches y las operaciones específicas del orquestador. Incluye filtros de gravedad. EventLevel |
SageMaker HyperPod Cluster State Change |
Cluster-level transiciones de estado (por ejemplo, Crear en InService). Incluye la configuración completa del clúster. |
SageMaker HyperPod Cluster Node Health
Event |
Eventos de monitoreo de HyperPod salud del Health Monitoring Agent (HMA). Incluye el estado de salud, el motivo, la acción de reparación y la recomendación. |
Ejemplos de patrones de eventos
Todos los eventos HyperPod del clúster:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }
Solo eventos de error (para alertas):
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }
Eventos de un clúster específico:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }
Eventos de salud de los nodos:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }
Referencia de la API
-
ListClusterEvents— Listar los eventos con filtrado, clasificación y paginación
-
DescribeClusterEvent— Obtenga todos los detalles de un evento específico
-
ClusterEventSummary— Tipo de datos resumidos del evento
-
ClusterEventDetail— Tipo de datos detallados del evento
Véase también
-
SageMaker HyperPod Eventos del clúster Slurm— Eventos de clúster de Slurm con uso de CLI y escenarios comunes
-
SageMaker HyperPod Eventos del clúster EKS— Eventos de clúster EKS con uso de CLI y escenarios comunes