Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
SageMaker HyperPod riferimento agli eventi del cluster
Questa pagina fornisce un riferimento completo di tutti gli eventi strutturati emessi dai cluster Amazon. SageMaker HyperPod Gli eventi forniscono visibilità sulle operazioni a livello di cluster, gruppo di istanze e istanza, tra cui provisioning, scalabilità, patching e modifiche al ciclo di vita specifiche dell'orchestratore.
Gli eventi NodeProvisioningMode del cluster HyperPod sono disponibili per i cluster con impostazione su. Continuous Gli eventi sono accessibili tramite le DescribeClusterEvent API ListClusterEvents e, la scheda Eventi della console SageMaker AI e Amazon. EventBridge
Registro degli eventi del cluster
Ogni evento del cluster è rappresentato come un record strutturato contenente metadati di identificazione, tempistica, ambito, gravità e specifici dell'operazione. L'esempio seguente mostra un record completo di eventi fornito tramite l'API e Amazon: DescribeClusterEvent EventBridge
{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }
Campi di registrazione degli eventi
L'oggetto detail.EventDetails include i seguenti campi:
| Campo | Tipo | Campo obbligatorio | Description |
|---|---|---|---|
EventId |
Stringa (UUID) | Sì | Identificatore univoco per l'evento. |
ClusterArn |
Stringa | Sì | ARN del cluster. HyperPod |
ClusterName |
Stringa | Sì | Nome del HyperPod cluster. |
EventTime |
Time stamp | Sì | Quando si è verificato l'evento (millisecondi dell'epoca). |
ResourceType |
Stringa | Sì | Scopo dell'evento:Cluster,InstanceGroup, oInstance. |
EventLevel |
Stringa | Sì | Classificazione della gravità: InfoWarn,, oError. |
Description |
Stringa | No | Human-readable riepilogo dell'evento. |
InstanceGroupName |
Stringa | No | Nome del gruppo di istanze (presente quando ResourceType è InstanceGroup oInstance). |
InstanceId |
Stringa | No | ID dell'istanza EC2 (presente quando ResourceType èInstance). |
EventDetails |
Oggetto | No | Metadati aggiuntivi specifici per il tipo di risorsa e l'operazione. |
Livelli di eventi
| Livello | Significato |
|---|---|
Info |
L'operazione è stata completata con successo o procede normalmente. |
Warn |
Operazione completata con un problema non critico o una condizione che potrebbe richiedere attenzione in futuro. |
Error |
L'operazione non è riuscita o richiede attenzione immediata. |
Tipi di risorse
| ResourceType | Scope | Eventi di esempio |
|---|---|---|
Cluster |
Whole-cluster operazioni | Cluster creation/update avviato, operazione del cluster non riuscita |
InstanceGroup |
Operazioni sui gruppi di istanze | Scalabilità started/completed, applicazione delle patch pianificata, ciclo di vita FSx |
Instance |
Operazioni su singole istanze | Provisioning EC2, esecuzione degli script del ciclo di vita, gestione ENI, terminazione |
EventDetails metadati
Gli eventi del cluster includono un EventMetadata oggetto all'interno del EventDetails campo che fornisce un contesto specifico dell'operazione oltre a ciò che la descrizione dell'evento trasmette. I contenuti di EventMetadata variano in base al tipo di risorsa e al tipo di evento. Per lo schema completo e i campi supportati, EventMetadata consulta Amazon SageMaker AI API Reference.
EventBridge campi envelope
Quando viene consegnato tramite Amazon EventBridge, il record dell'evento è avvolto nella EventBridge busta standard:
| Campo | Description |
|---|---|
version |
EventBridge versione dello schema (sempre"0"). |
id |
ID EventBridge evento univoco. |
detail-type |
SageMaker HyperPod Cluster Event |
source |
aws.sagemaker |
account |
AWS ID dell'account proprietario del cluster. |
time |
Timestamp ISO 8601 dell'evento. |
region |
AWS Regione in cui risiede il cluster. |
resources |
Array contenente l'ARN del cluster. |
detail |
Contiene l'EventDetailsoggetto descritto sopra. |
Eventi comuni (EKS e Slurm)
I seguenti eventi vengono emessi per tutti i HyperPod cluster indipendentemente dall'orchestrator. La colonna Descrizione mostra il valore del Description campo nel record dell'evento così come appare nella risposta API e nella scheda Eventi della console.
Ciclo di vita del cluster
| Event | Description |
|---|---|
| L'operazione del cluster è iniziata | Il cluster <cluster-name><operation>è stato avviato correttamente |
| Avvio dell'operazione del cluster non riuscito | Avvio del cluster non riuscito <cluster-name><operation> |
| Operazione del cluster completata | Cluster <cluster-name><operation>completato con successo |
| Operazione del cluster non riuscita | Cluster <cluster-name><operation>non riuscito |
Ciclo di vita del gruppo di istanze
| Event | Description |
|---|---|
| L'operazione sul gruppo di istanze è iniziata | InstanceGroup <instance-group-name><operation>avviato con successo in Cluster <cluster-name> |
| Avvio dell'operazione del gruppo di istanze non riuscito | Avvio InstanceGroup <instance-group-name><operation>nel cluster non riuscito <cluster-name> |
| Operazione sul gruppo di istanze completata | Il gruppo di istanze <instance-group-name><operation>nel cluster <cluster-name>è stato completato correttamente |
| Operazione sul gruppo di istanze non riuscita | Gruppo di istanze <instance-group-name><operation>nel cluster <cluster-name>non riuscito |
Configurazione della rete del gruppo di istanze
| Event | Description |
|---|---|
| Configurazione di rete trovata | Sottorete trovata <subnet-id>in AZ <availability-zone>con SecurityGroupIds <security-group-ids>per IG <instance-group-name>in Cluster <cluster-name> |
| Configurazione di rete non riuscita | Impossibile elaborare i dettagli di configurazione di rete del gruppo di istanze per IG <instance-group-name>in Cluster <cluster-name> |
| È stata rilevata una sostituzione AMI personalizzata | <instance-group-name>È stato trovato un override AMI personalizzato <ami-id>per IG in Cluster <cluster-name> |
| L'override dell'AMI personalizzato non è riuscito | <instance-group-name>Impossibile elaborare i dettagli dell'override AMI personalizzato per IG in Cluster <cluster-name> |
| Configurazione di rete della piattaforma utilizzata | Utilizzo HyperPod della configurazione di rete fornita dalla piattaforma per IG <instance-group-name>in Cluster <cluster-name> |
| Configurazione di rete determinata | La configurazione di rete del gruppo di istanze è stata determinata con successo per IG <instance-group-name>in Cluster <cluster-name> |
Creazione dell'istanza
| Event | Description |
|---|---|
| Operazione sull'istanza iniziata | L'istanza <operation>è stata avviata correttamente in Cluster <cluster-name>e IG <instance-group-name> |
| Avvio dell'operazione sull'istanza non riuscito | Impossibile avviare l'istanza <operation>in Cluster <cluster-name>e IG <instance-group-name> |
| È stata trovata una prenotazione di capacità | CapacityReservation È stato trovato <reservation-id>l'ID per Cluster <cluster-name>e IG<instance-group-name>, utilizzando la capacità riservata |
| Prenotazione della capacità non trovata | Nessun CapacityReservation risultato trovato per Cluster <cluster-name>e IG<instance-group-name>, utilizzando il pool su richiesta |
| Configurazione del payload dell'istanza non riuscita | Elaborazione non riuscita CapacityReservationDetails per Cluster <cluster-name>e IG <instance-group-name> |
| Cliente creato da ENI | Cliente ENI creato con successo, ad esempio in Cluster <cluster-name>e IG <instance-group-name> |
| Creazione del cliente ENI non riuscita | Creazione del cliente ENI non riuscita, ad esempio in Cluster <cluster-name>e IG <instance-group-name> |
| Istanza EC2 fornita | <cluster-name>Il <instance-id>provisioning dell'istanza EC2 è stato eseguito correttamente in Cluster e IG <instance-group-name> |
| Creazione dell'istanza EC2 non riuscita | <cluster-name>Impossibile eseguire il provisioning dell'istanza EC2 in Cluster e IG <instance-group-name> |
| Stato dello script del ciclo di vita aggiornato | <instance-id>L'esecuzione dello script del ciclo di vita dell'istanza per l'istanza EC2 ha <status> |
| L'aggiornamento dello stato dello script del ciclo di vita non è riuscito | Impossibile aggiornare lo stato di esecuzione dello script del ciclo di vita dell'istanza per EC2InstanceId <instance-id> |
| Creazione dell'istanza non riuscita con i log del ciclo di vita | <instance-id>L'esecuzione dello script del ciclo di vita dell'istanza per l'istanza EC2 non è riuscita. Per visualizzare i log degli script del ciclo di vita, visita il gruppo di log... |
| La pulizia di ENI non utilizzata è riuscita | <instance-id><cluster-name>Gli ENI dei clienti non utilizzati per l'istanza EC2 sono stati eliminati con successo in Cluster e IG <instance-group-name> |
| Pulizia ENI non utilizzata non riuscita | <instance-id><cluster-name>Impossibile eliminare gli ENI dei clienti non utilizzati per l'istanza EC2 in Cluster e IG <instance-group-name> |
Eliminazione dell'istanza
| Event | Description |
|---|---|
| Chiusura dell'istanza EC2 in corso | <cluster-name>La chiusura dell'istanza EC2 <instance-id>è attualmente in corso in Cluster e IG <instance-group-name> |
| Chiusura dell'istanza EC2 non riuscita | <instance-id><cluster-name>Impossibile terminare l'istanza EC2 in Cluster e IG <instance-group-name> |
| Cliente ENI eliminato | Il cliente ENI è stato eliminato con successo per l'istanza EC2 <instance-id>in Cluster <cluster-name>e IG <instance-group-name> |
| Eliminazione ENI del cliente non riuscita | Impossibile eliminare l'istanza ENI del cliente per EC2 <instance-id>in Cluster <cluster-name>e IG <instance-group-name> |
Riavvio dell'istanza
| Event | Description |
|---|---|
| Riavvio dell'istanza EC2 in corso | <cluster-name>Il riavvio dell'istanza EC2 <instance-id>è attualmente in corso su Cluster e IG <instance-group-name> |
| Richiesta di riavvio dell'istanza EC2 non riuscita | <instance-id><cluster-name>Impossibile inviare la richiesta di riavvio per l'istanza EC2 in Cluster e IG <instance-group-name> |
Funzionamento dell'istanza (generico)
| Event | Description |
|---|---|
| Operazione sull'istanza completata | L'istanza <operation><instance-id>in Cluster <cluster-name>e IG è <instance-group-name>stata completata correttamente |
| Operazione sull'istanza non riuscita | Istanza <operation><instance-id>in Cluster <cluster-name>e IG <instance-group-name>non riuscita |
Sostituzione dell'istanza
| Event | Description |
|---|---|
| La sostituzione dell'istanza è iniziata | <instance-id>L'istanza viene avviata come parte della sostituzione dell'istanza in Cluster <cluster-name>e IG <instance-group-name> |
| Avvio della sostituzione dell'istanza non riuscito | L'istanza <instance-id>non è stata avviata come parte della sostituzione dell'istanza in Cluster <cluster-name>e IG <instance-group-name> |
| Sostituzione dell'istanza completata | Istanza <instance-id><operation>completata con successo come parte della sostituzione dell'istanza in Cluster <cluster-name>e IG <instance-group-name> |
| Sostituzione dell'istanza non riuscita | L'istanza <instance-id><operation>non è riuscita come parte della sostituzione dell'istanza in Cluster <cluster-name>e IG <instance-group-name> |
Ciclo di vita del file system FSx
| Event | Description |
|---|---|
| La creazione di FSx è iniziata | <instance-group-name>È iniziata la creazione di FSx per IG in Cluster <cluster-name> |
| Creazione di FSx non riuscita | <instance-group-name>Creazione di FSx per IG in Cluster non riuscita <cluster-name> |
| Creazione di FSx completata | <instance-group-name>Creazione di FSx completata con successo per IG in Cluster <cluster-name> |
| L'eliminazione di FSx è iniziata | <instance-group-name>L'eliminazione di FSx è iniziata per IG in Cluster <cluster-name> |
| Eliminazione FSx non riuscita | <instance-group-name>Impossibile eliminare FSx for IG in Cluster <cluster-name> |
| Eliminazione di FSx completata | <instance-group-name>Eliminazione FSx completata con successo per IG in Cluster <cluster-name> |
| L'aggiornamento di FSx è iniziato | <instance-group-name>L'aggiornamento di FSx è iniziato per IG in Cluster <cluster-name> |
| Aggiornamento FSx non riuscito | <instance-group-name>Aggiornamento di FSx for IG in Cluster non riuscito <cluster-name> |
| Aggiornamento FSx completato | <instance-group-name>Aggiornamento FSx completato con successo per IG in Cluster <cluster-name> |
Applicazione delle patch (passaggi comuni)
Questi eventi di patching vengono emessi sia per i cluster EKS che per Slurm durante le operazioni. UpdateClusterSoftware
| Event | Description |
|---|---|
| È prevista l'applicazione delle patch ai gruppi di istanze | InstanceGroup <instance-group-name>in Cluster <cluster-name>è stato pianificato UpdateClusterSoftware per l'ultima volta. |
| Pianificazione dell'applicazione delle patch al gruppo di istanze non riuscita | <cluster-name>Pianificazione di IG UpdateClusterSoftware <instance-group-name>in Cluster non riuscita. |
| È iniziata l'applicazione delle patch al gruppo di istanze | UpdateClusterSoftware <strategy>avviato per IG <instance-group-name>in Cluster <cluster-name>utilizzando la strategia. |
| Avvio dell'applicazione delle patch al gruppo di istanze non riuscito | <cluster-name>Avvio di IG <instance-group-name>in UpdateClusterSoftware Cluster non riuscito. |
| È stato selezionato il successivo batch di patch | <cluster-name>Il prossimo batch di aggiornamento selezionato per IG <instance-group-name>in Cluster. |
| La selezione del batch di patch successivo non è riuscita | <cluster-name>Impossibile selezionare il batch di aggiornamento successivo per IG <instance-group-name>in Cluster. |
| Istanze non riuscite messe in coda per la sostituzione | Istanze non riuscite in IG in <instance-group-name>Cluster in <cluster-name>coda per la sostituzione del nodo. |
| Impossibile eseguire l'accodamento per la sostituzione delle istanze non riuscito | <instance-group-name><cluster-name>Impossibile mettere in coda le istanze per la sostituzione dei nodi in IG in Cluster. |
| Applicazione della patch al gruppo di istanze completata | UpdateClusterSoftware <cluster-name>completato con successo per IG <instance-group-name>in Cluster. |
| Completamento del patching del gruppo di istanze non riuscito | <cluster-name>Completamento UpdateClusterSoftware per IG <instance-group-name>in Cluster non riuscito. |
| È iniziata la sostituzione del volume principale | La sostituzione del volume root è iniziata per Instance <instance-id>in IG<instance-group-name>. |
| Sostituzione del volume principale non riuscita | Impossibile avviare la sostituzione del volume root per Instance <instance-id>in IG<instance-group-name>. |
| L'applicazione della patch all'istanza è riuscita | L'istanza <instance-id>in IG è <instance-group-name>stata aggiornata correttamente. |
EKS-specific eventi
I seguenti eventi vengono emessi solo per HyperPod i cluster orchestrati con Amazon EKS.
Gestione degli accessi
| Event | Description |
|---|---|
| L'operazione di accesso SLR è riuscita | <operation>Inserimento di accesso SLR riuscito per Cluster <cluster-name> |
| Operazione di immissione di accesso SLR non riuscita | Inserimento di accesso SLR <operation>non riuscito per il cluster <cluster-name> |
| L'operazione di accesso EKS è riuscita | Inserimenti di accesso EKS completati con <operation>successo per Cluster <cluster-name> |
| Operazione relativa alle voci di accesso EKS non riuscita | Inserimenti di accesso EKS <operation>non riusciti per il cluster <cluster-name> |
Aggiornamenti della configurazione di Kubernetes
| Event | Description |
|---|---|
| L'aggiornamento della configurazione di Kubernetes è riuscito | <instance-id><cluster-name>Configurazione Kubernetes aggiornata con successo, ad esempio in Cluster e IG <instance-group-name> |
| L'aggiornamento della configurazione di Kubernetes non è riuscito | <instance-id><cluster-name>Impossibile aggiornare la configurazione di Kubernetes, ad esempio in Cluster e IG <instance-group-name> |
Scalabilità automatica di Karpenter
| Event | Description |
|---|---|
| L'operazione di scalabilità automatica è riuscita | AutoScaling <operation><status>correttamente in Cluster <cluster-name> |
| Operazione di scalabilità automatica non riuscita | <operation>Impossibile accedere al cluster AutoScaling <cluster-name> |
| L'installazione di Karpenter CRD è riuscita | CustomResourceDefinition l'installazione è stata completata con successo in EKS Cluster <cluster-name> |
| L'installazione di Karpenter CRD non è riuscita | CustomResourceDefinition installazione non riuscita per EKS Cluster <cluster-name> |
| L'aggiornamento della politica di accesso di Karpenter SLR è riuscito | <operation><cluster-name>politiche di accesso con immissione di AmazonSageMakerHyperPodServiceRole accesso nel cluster EKS con successo |
| aggiornamento della politica di accesso di Karpenter SLR non riuscito | Impossibile <operation>accedere alle politiche con immissione di AmazonSageMakerHyperPodServiceRole accesso nel cluster EKS <cluster-name> |
Applicazione di patch: a livello di istanza EKS
| Event | Description |
|---|---|
| La preparazione dell'applicazione delle patch all'istanza è avvenuta con successo | L'istanza <instance-id>in IG è stata isolata e i pod sono stati <instance-group-name>sfrattati. |
| Applicazione della patch all'istanza ignorata (violazione PDB) | UpdateClusterSoftware ad esempio <instance-id>in IG <instance-group-name>saltato a causa di un vincolo. PodDisruptionBudget |
| Preparazione dell'applicazione delle patch all'istanza non riuscita | Impossibile preparare l'istanza <instance-id>in IG <instance-group-name>per UpdateClusterSoftware. |
| Istanza ripristinata allo stato programmabile | Istanza <instance-id>in IG <instance-group-name>ripristinata allo stato programmabile. |
| Il ripristino dell'istanza allo stato programmabile non è riuscito | Impossibile ripristinare l'istanza <instance-id>in IG <instance-group-name>allo stato programmabile. |
Applicazione di patch: rollback EKS
| Event | Description |
|---|---|
| È iniziato il tempo di cottura | È iniziato il periodo di cottura per IG <instance-group-name>in Cluster<cluster-name>. Monitoraggio degli allarmi [<alarm-names>] per <duration>secondi. |
| Tempo di cottura completato | Periodo di cottura completato per IG <instance-group-name>in Cluster<cluster-name>. Nessun allarme attivato durante il periodo di cottura <duration>di 1 secondo. |
| È scattato l'allarme relativo al tempo di cottura | <cluster-name>Periodo di cottura non riuscito per IG <instance-group-name>in Cluster. Gli allarmi [<alarm-names>] sono entrati nello stato ALARM. Avvio del rollback automatico. |
| Valutazione del tempo di cottura non riuscita | <cluster-name>Impossibile valutare gli allarmi durante il periodo di cottura per IG <instance-group-name>in Cluster. |
| È stato avviato il rollback del patching del gruppo di istanze | UpdateClusterSoftware <instance-group-name><cluster-name>errore per IG in Cluster. Avvio del rollback. |
| Rollback dell'applicazione delle patch al gruppo di istanze non riuscito | <instance-group-name><cluster-name>Rollback non riuscito per IG in Cluster. Alcune istanze potrebbero essere in FailedMaintenance stato. |
| È stato avviato il rollback del patching dell'istanza | L'aggiornamento dell'istanza <instance-id>in IG <instance-group-name>non è riuscito. Rollback avviato. |
| Il rollback dell'istanza è riuscito | L'istanza <instance-id>in IG è <instance-group-name>stata ripristinata correttamente all'AMI precedente. |
| Il rollback dell'istanza non è riuscito | UpdateClusterSoftware <instance-id><instance-group-name>il rollback non è riuscito, ad esempio in IG. |
Slurm-specific eventi
I seguenti eventi vengono emessi solo per i HyperPod cluster orchestrati con Slurm.
| Event | Description |
|---|---|
| Parametri di provisioning trovati | Trovato provisioning_parameters.json nel percorso S3 per il gruppo di controller LifeCycleScript <instance-group-name> |
| Parametri di provisioning non trovati | Nessun provisioning_parameters.json trovato nel percorso S3 per il gruppo di controller LifeCycleScript <instance-group-name> |
| È stata creata la chiave Slurm munge | Chiave munge creata e archiviata con successo |
| La convalida di Slurm drift è stata superata | La convalida della deriva della configurazione Slurm è stata superata |
| È stata rilevata una deriva dello slurm | È stata rilevata una deriva nella configurazione dello slurm: <drift-details> |
| Rollback del cluster Slurm completato | Creazione del cluster non riuscita: il controller e i nodi di accesso non sono stati pronti entro il tempo previsto |
| La riconfigurazione di Slurm è riuscita | Slurm è stato riconfigurato con successo. La configurazione di Slurm è stata aggiornata in modo che corrisponda allo stato desiderato |
EventBridge integrazione
HyperPod invia eventi di cluster ad Amazon EventBridge utilizzando tre tipi di dettagli:
| Tipo di dettaglio | Description |
|---|---|
SageMaker HyperPod Cluster Event |
Eventi operativi per il provisioning, la scalabilità, l'applicazione di patch e le operazioni specifiche dell'orchestratore. EventLevelInclude il filtro della gravità. |
SageMaker HyperPod Cluster State Change |
Cluster-level transizioni di stato (ad esempio, Creazione in InService). Include la configurazione completa del cluster. |
SageMaker HyperPod Cluster Node Health
Event |
Eventi di monitoraggio dello stato di salute da parte dell' HyperPod Health Monitoring Agent (HMA). Include lo stato di salute, il motivo, l'azione di riparazione e la raccomandazione. |
Esempi di modelli di eventi
Tutti gli eventi HyperPod del cluster:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }
Solo eventi di errore (per avvisi):
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }
Eventi per un cluster specifico:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }
Eventi sullo stato dei nodi:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }
Guida di riferimento alle API
-
ListClusterEvents— Elenca gli eventi con filtraggio, ordinamento e impaginazione
-
DescribeClusterEvent— Ottieni tutti i dettagli per un evento specifico
-
ClusterEventSummary— Tipo di dati di riepilogo dell'evento
-
ClusterEventDetail— Tipo di dati relativi ai dettagli dell'evento
Consulta anche
-
SageMaker HyperPod eventi del cluster Slurm— Eventi del cluster Slurm con utilizzo della CLI e scenari comuni
-
SageMaker HyperPod Eventi del cluster EKS— Eventi del cluster EKS con utilizzo della CLI e scenari comuni