View a markdown version of this page

SageMaker HyperPod riferimento agli eventi del cluster - Amazon SageMaker AI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

SageMaker HyperPod riferimento agli eventi del cluster

Questa pagina fornisce un riferimento completo di tutti gli eventi strutturati emessi dai cluster Amazon. SageMaker HyperPod Gli eventi forniscono visibilità sulle operazioni a livello di cluster, gruppo di istanze e istanza, tra cui provisioning, scalabilità, patching e modifiche al ciclo di vita specifiche dell'orchestratore.

Gli eventi NodeProvisioningMode del cluster HyperPod sono disponibili per i cluster con impostazione su. Continuous Gli eventi sono accessibili tramite le DescribeClusterEvent API ListClusterEvents e, la scheda Eventi della console SageMaker AI e Amazon. EventBridge

Registro degli eventi del cluster

Ogni evento del cluster è rappresentato come un record strutturato contenente metadati di identificazione, tempistica, ambito, gravità e specifici dell'operazione. L'esempio seguente mostra un record completo di eventi fornito tramite l'API e Amazon: DescribeClusterEvent EventBridge

{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }

Campi di registrazione degli eventi

L'oggetto detail.EventDetails include i seguenti campi:

Campo Tipo Campo obbligatorio Description
EventId Stringa (UUID) Identificatore univoco per l'evento.
ClusterArn Stringa ARN del cluster. HyperPod
ClusterName Stringa Nome del HyperPod cluster.
EventTime Time stamp Quando si è verificato l'evento (millisecondi dell'epoca).
ResourceType Stringa Scopo dell'evento:Cluster,InstanceGroup, oInstance.
EventLevel Stringa Classificazione della gravità: InfoWarn,, oError.
Description Stringa No Human-readable riepilogo dell'evento.
InstanceGroupName Stringa No Nome del gruppo di istanze (presente quando ResourceType è InstanceGroup oInstance).
InstanceId Stringa No ID dell'istanza EC2 (presente quando ResourceType èInstance).
EventDetails Oggetto No Metadati aggiuntivi specifici per il tipo di risorsa e l'operazione.

Livelli di eventi

Livello Significato
Info L'operazione è stata completata con successo o procede normalmente.
Warn Operazione completata con un problema non critico o una condizione che potrebbe richiedere attenzione in futuro.
Error L'operazione non è riuscita o richiede attenzione immediata.

Tipi di risorse

ResourceType Scope Eventi di esempio
Cluster Whole-cluster operazioni Cluster creation/update avviato, operazione del cluster non riuscita
InstanceGroup Operazioni sui gruppi di istanze Scalabilità started/completed, applicazione delle patch pianificata, ciclo di vita FSx
Instance Operazioni su singole istanze Provisioning EC2, esecuzione degli script del ciclo di vita, gestione ENI, terminazione

EventDetails metadati

Gli eventi del cluster includono un EventMetadata oggetto all'interno del EventDetails campo che fornisce un contesto specifico dell'operazione oltre a ciò che la descrizione dell'evento trasmette. I contenuti di EventMetadata variano in base al tipo di risorsa e al tipo di evento. Per lo schema completo e i campi supportati, EventMetadata consulta Amazon SageMaker AI API Reference.

EventBridge campi envelope

Quando viene consegnato tramite Amazon EventBridge, il record dell'evento è avvolto nella EventBridge busta standard:

Campo Description
version EventBridge versione dello schema (sempre"0").
id ID EventBridge evento univoco.
detail-type SageMaker HyperPod Cluster Event
source aws.sagemaker
account AWS ID dell'account proprietario del cluster.
time Timestamp ISO 8601 dell'evento.
region AWS Regione in cui risiede il cluster.
resources Array contenente l'ARN del cluster.
detail Contiene l'EventDetailsoggetto descritto sopra.

Eventi comuni (EKS e Slurm)

I seguenti eventi vengono emessi per tutti i HyperPod cluster indipendentemente dall'orchestrator. La colonna Descrizione mostra il valore del Description campo nel record dell'evento così come appare nella risposta API e nella scheda Eventi della console.

Ciclo di vita del cluster

Event Description
L'operazione del cluster è iniziata Il cluster <cluster-name><operation>è stato avviato correttamente
Avvio dell'operazione del cluster non riuscito Avvio del cluster non riuscito <cluster-name><operation>
Operazione del cluster completata Cluster <cluster-name><operation>completato con successo
Operazione del cluster non riuscita Cluster <cluster-name><operation>non riuscito

Ciclo di vita del gruppo di istanze

Event Description
L'operazione sul gruppo di istanze è iniziata InstanceGroup <instance-group-name><operation>avviato con successo in Cluster <cluster-name>
Avvio dell'operazione del gruppo di istanze non riuscito Avvio InstanceGroup <instance-group-name><operation>nel cluster non riuscito <cluster-name>
Operazione sul gruppo di istanze completata Il gruppo di istanze <instance-group-name><operation>nel cluster <cluster-name>è stato completato correttamente
Operazione sul gruppo di istanze non riuscita Gruppo di istanze <instance-group-name><operation>nel cluster <cluster-name>non riuscito

Configurazione della rete del gruppo di istanze

Event Description
Configurazione di rete trovata Sottorete trovata <subnet-id>in AZ <availability-zone>con SecurityGroupIds <security-group-ids>per IG <instance-group-name>in Cluster <cluster-name>
Configurazione di rete non riuscita Impossibile elaborare i dettagli di configurazione di rete del gruppo di istanze per IG <instance-group-name>in Cluster <cluster-name>
È stata rilevata una sostituzione AMI personalizzata <instance-group-name>È stato trovato un override AMI personalizzato <ami-id>per IG in Cluster <cluster-name>
L'override dell'AMI personalizzato non è riuscito <instance-group-name>Impossibile elaborare i dettagli dell'override AMI personalizzato per IG in Cluster <cluster-name>
Configurazione di rete della piattaforma utilizzata Utilizzo HyperPod della configurazione di rete fornita dalla piattaforma per IG <instance-group-name>in Cluster <cluster-name>
Configurazione di rete determinata La configurazione di rete del gruppo di istanze è stata determinata con successo per IG <instance-group-name>in Cluster <cluster-name>

Creazione dell'istanza

Event Description
Operazione sull'istanza iniziata L'istanza <operation>è stata avviata correttamente in Cluster <cluster-name>e IG <instance-group-name>
Avvio dell'operazione sull'istanza non riuscito Impossibile avviare l'istanza <operation>in Cluster <cluster-name>e IG <instance-group-name>
È stata trovata una prenotazione di capacità CapacityReservation È stato trovato <reservation-id>l'ID per Cluster <cluster-name>e IG<instance-group-name>, utilizzando la capacità riservata
Prenotazione della capacità non trovata Nessun CapacityReservation risultato trovato per Cluster <cluster-name>e IG<instance-group-name>, utilizzando il pool su richiesta
Configurazione del payload dell'istanza non riuscita Elaborazione non riuscita CapacityReservationDetails per Cluster <cluster-name>e IG <instance-group-name>
Cliente creato da ENI Cliente ENI creato con successo, ad esempio in Cluster <cluster-name>e IG <instance-group-name>
Creazione del cliente ENI non riuscita Creazione del cliente ENI non riuscita, ad esempio in Cluster <cluster-name>e IG <instance-group-name>
Istanza EC2 fornita <cluster-name>Il <instance-id>provisioning dell'istanza EC2 è stato eseguito correttamente in Cluster e IG <instance-group-name>
Creazione dell'istanza EC2 non riuscita <cluster-name>Impossibile eseguire il provisioning dell'istanza EC2 in Cluster e IG <instance-group-name>
Stato dello script del ciclo di vita aggiornato <instance-id>L'esecuzione dello script del ciclo di vita dell'istanza per l'istanza EC2 ha <status>
L'aggiornamento dello stato dello script del ciclo di vita non è riuscito Impossibile aggiornare lo stato di esecuzione dello script del ciclo di vita dell'istanza per EC2InstanceId <instance-id>
Creazione dell'istanza non riuscita con i log del ciclo di vita <instance-id>L'esecuzione dello script del ciclo di vita dell'istanza per l'istanza EC2 non è riuscita. Per visualizzare i log degli script del ciclo di vita, visita il gruppo di log...
La pulizia di ENI non utilizzata è riuscita <instance-id><cluster-name>Gli ENI dei clienti non utilizzati per l'istanza EC2 sono stati eliminati con successo in Cluster e IG <instance-group-name>
Pulizia ENI non utilizzata non riuscita <instance-id><cluster-name>Impossibile eliminare gli ENI dei clienti non utilizzati per l'istanza EC2 in Cluster e IG <instance-group-name>

Eliminazione dell'istanza

Event Description
Chiusura dell'istanza EC2 in corso <cluster-name>La chiusura dell'istanza EC2 <instance-id>è attualmente in corso in Cluster e IG <instance-group-name>
Chiusura dell'istanza EC2 non riuscita <instance-id><cluster-name>Impossibile terminare l'istanza EC2 in Cluster e IG <instance-group-name>
Cliente ENI eliminato Il cliente ENI è stato eliminato con successo per l'istanza EC2 <instance-id>in Cluster <cluster-name>e IG <instance-group-name>
Eliminazione ENI del cliente non riuscita Impossibile eliminare l'istanza ENI del cliente per EC2 <instance-id>in Cluster <cluster-name>e IG <instance-group-name>

Riavvio dell'istanza

Event Description
Riavvio dell'istanza EC2 in corso <cluster-name>Il riavvio dell'istanza EC2 <instance-id>è attualmente in corso su Cluster e IG <instance-group-name>
Richiesta di riavvio dell'istanza EC2 non riuscita <instance-id><cluster-name>Impossibile inviare la richiesta di riavvio per l'istanza EC2 in Cluster e IG <instance-group-name>

Funzionamento dell'istanza (generico)

Event Description
Operazione sull'istanza completata L'istanza <operation><instance-id>in Cluster <cluster-name>e IG è <instance-group-name>stata completata correttamente
Operazione sull'istanza non riuscita Istanza <operation><instance-id>in Cluster <cluster-name>e IG <instance-group-name>non riuscita

Sostituzione dell'istanza

Event Description
La sostituzione dell'istanza è iniziata <instance-id>L'istanza viene avviata come parte della sostituzione dell'istanza in Cluster <cluster-name>e IG <instance-group-name>
Avvio della sostituzione dell'istanza non riuscito L'istanza <instance-id>non è stata avviata come parte della sostituzione dell'istanza in Cluster <cluster-name>e IG <instance-group-name>
Sostituzione dell'istanza completata Istanza <instance-id><operation>completata con successo come parte della sostituzione dell'istanza in Cluster <cluster-name>e IG <instance-group-name>
Sostituzione dell'istanza non riuscita L'istanza <instance-id><operation>non è riuscita come parte della sostituzione dell'istanza in Cluster <cluster-name>e IG <instance-group-name>

Ciclo di vita del file system FSx

Event Description
La creazione di FSx è iniziata <instance-group-name>È iniziata la creazione di FSx per IG in Cluster <cluster-name>
Creazione di FSx non riuscita <instance-group-name>Creazione di FSx per IG in Cluster non riuscita <cluster-name>
Creazione di FSx completata <instance-group-name>Creazione di FSx completata con successo per IG in Cluster <cluster-name>
L'eliminazione di FSx è iniziata <instance-group-name>L'eliminazione di FSx è iniziata per IG in Cluster <cluster-name>
Eliminazione FSx non riuscita <instance-group-name>Impossibile eliminare FSx for IG in Cluster <cluster-name>
Eliminazione di FSx completata <instance-group-name>Eliminazione FSx completata con successo per IG in Cluster <cluster-name>
L'aggiornamento di FSx è iniziato <instance-group-name>L'aggiornamento di FSx è iniziato per IG in Cluster <cluster-name>
Aggiornamento FSx non riuscito <instance-group-name>Aggiornamento di FSx for IG in Cluster non riuscito <cluster-name>
Aggiornamento FSx completato <instance-group-name>Aggiornamento FSx completato con successo per IG in Cluster <cluster-name>

Applicazione delle patch (passaggi comuni)

Questi eventi di patching vengono emessi sia per i cluster EKS che per Slurm durante le operazioni. UpdateClusterSoftware

Event Description
È prevista l'applicazione delle patch ai gruppi di istanze InstanceGroup <instance-group-name>in Cluster <cluster-name>è stato pianificato UpdateClusterSoftware per l'ultima volta.
Pianificazione dell'applicazione delle patch al gruppo di istanze non riuscita <cluster-name>Pianificazione di IG UpdateClusterSoftware <instance-group-name>in Cluster non riuscita.
È iniziata l'applicazione delle patch al gruppo di istanze UpdateClusterSoftware <strategy>avviato per IG <instance-group-name>in Cluster <cluster-name>utilizzando la strategia.
Avvio dell'applicazione delle patch al gruppo di istanze non riuscito <cluster-name>Avvio di IG <instance-group-name>in UpdateClusterSoftware Cluster non riuscito.
È stato selezionato il successivo batch di patch <cluster-name>Il prossimo batch di aggiornamento selezionato per IG <instance-group-name>in Cluster.
La selezione del batch di patch successivo non è riuscita <cluster-name>Impossibile selezionare il batch di aggiornamento successivo per IG <instance-group-name>in Cluster.
Istanze non riuscite messe in coda per la sostituzione Istanze non riuscite in IG in <instance-group-name>Cluster in <cluster-name>coda per la sostituzione del nodo.
Impossibile eseguire l'accodamento per la sostituzione delle istanze non riuscito <instance-group-name><cluster-name>Impossibile mettere in coda le istanze per la sostituzione dei nodi in IG in Cluster.
Applicazione della patch al gruppo di istanze completata UpdateClusterSoftware <cluster-name>completato con successo per IG <instance-group-name>in Cluster.
Completamento del patching del gruppo di istanze non riuscito <cluster-name>Completamento UpdateClusterSoftware per IG <instance-group-name>in Cluster non riuscito.
È iniziata la sostituzione del volume principale La sostituzione del volume root è iniziata per Instance <instance-id>in IG<instance-group-name>.
Sostituzione del volume principale non riuscita Impossibile avviare la sostituzione del volume root per Instance <instance-id>in IG<instance-group-name>.
L'applicazione della patch all'istanza è riuscita L'istanza <instance-id>in IG è <instance-group-name>stata aggiornata correttamente.

EKS-specific eventi

I seguenti eventi vengono emessi solo per HyperPod i cluster orchestrati con Amazon EKS.

Gestione degli accessi

Event Description
L'operazione di accesso SLR è riuscita <operation>Inserimento di accesso SLR riuscito per Cluster <cluster-name>
Operazione di immissione di accesso SLR non riuscita Inserimento di accesso SLR <operation>non riuscito per il cluster <cluster-name>
L'operazione di accesso EKS è riuscita Inserimenti di accesso EKS completati con <operation>successo per Cluster <cluster-name>
Operazione relativa alle voci di accesso EKS non riuscita Inserimenti di accesso EKS <operation>non riusciti per il cluster <cluster-name>

Aggiornamenti della configurazione di Kubernetes

Event Description
L'aggiornamento della configurazione di Kubernetes è riuscito <instance-id><cluster-name>Configurazione Kubernetes aggiornata con successo, ad esempio in Cluster e IG <instance-group-name>
L'aggiornamento della configurazione di Kubernetes non è riuscito <instance-id><cluster-name>Impossibile aggiornare la configurazione di Kubernetes, ad esempio in Cluster e IG <instance-group-name>

Scalabilità automatica di Karpenter

Event Description
L'operazione di scalabilità automatica è riuscita AutoScaling <operation><status>correttamente in Cluster <cluster-name>
Operazione di scalabilità automatica non riuscita <operation>Impossibile accedere al cluster AutoScaling <cluster-name>
L'installazione di Karpenter CRD è riuscita CustomResourceDefinition l'installazione è stata completata con successo in EKS Cluster <cluster-name>
L'installazione di Karpenter CRD non è riuscita CustomResourceDefinition installazione non riuscita per EKS Cluster <cluster-name>
L'aggiornamento della politica di accesso di Karpenter SLR è riuscito <operation><cluster-name>politiche di accesso con immissione di AmazonSageMakerHyperPodServiceRole accesso nel cluster EKS con successo
aggiornamento della politica di accesso di Karpenter SLR non riuscito Impossibile <operation>accedere alle politiche con immissione di AmazonSageMakerHyperPodServiceRole accesso nel cluster EKS <cluster-name>

Applicazione di patch: a livello di istanza EKS

Event Description
La preparazione dell'applicazione delle patch all'istanza è avvenuta con successo L'istanza <instance-id>in IG è stata isolata e i pod sono stati <instance-group-name>sfrattati.
Applicazione della patch all'istanza ignorata (violazione PDB) UpdateClusterSoftware ad esempio <instance-id>in IG <instance-group-name>saltato a causa di un vincolo. PodDisruptionBudget
Preparazione dell'applicazione delle patch all'istanza non riuscita Impossibile preparare l'istanza <instance-id>in IG <instance-group-name>per UpdateClusterSoftware.
Istanza ripristinata allo stato programmabile Istanza <instance-id>in IG <instance-group-name>ripristinata allo stato programmabile.
Il ripristino dell'istanza allo stato programmabile non è riuscito Impossibile ripristinare l'istanza <instance-id>in IG <instance-group-name>allo stato programmabile.

Applicazione di patch: rollback EKS

Event Description
È iniziato il tempo di cottura È iniziato il periodo di cottura per IG <instance-group-name>in Cluster<cluster-name>. Monitoraggio degli allarmi [<alarm-names>] per <duration>secondi.
Tempo di cottura completato Periodo di cottura completato per IG <instance-group-name>in Cluster<cluster-name>. Nessun allarme attivato durante il periodo di cottura <duration>di 1 secondo.
È scattato l'allarme relativo al tempo di cottura <cluster-name>Periodo di cottura non riuscito per IG <instance-group-name>in Cluster. Gli allarmi [<alarm-names>] sono entrati nello stato ALARM. Avvio del rollback automatico.
Valutazione del tempo di cottura non riuscita <cluster-name>Impossibile valutare gli allarmi durante il periodo di cottura per IG <instance-group-name>in Cluster.
È stato avviato il rollback del patching del gruppo di istanze UpdateClusterSoftware <instance-group-name><cluster-name>errore per IG in Cluster. Avvio del rollback.
Rollback dell'applicazione delle patch al gruppo di istanze non riuscito <instance-group-name><cluster-name>Rollback non riuscito per IG in Cluster. Alcune istanze potrebbero essere in FailedMaintenance stato.
È stato avviato il rollback del patching dell'istanza L'aggiornamento dell'istanza <instance-id>in IG <instance-group-name>non è riuscito. Rollback avviato.
Il rollback dell'istanza è riuscito L'istanza <instance-id>in IG è <instance-group-name>stata ripristinata correttamente all'AMI precedente.
Il rollback dell'istanza non è riuscito UpdateClusterSoftware <instance-id><instance-group-name>il rollback non è riuscito, ad esempio in IG.

Slurm-specific eventi

I seguenti eventi vengono emessi solo per i HyperPod cluster orchestrati con Slurm.

Event Description
Parametri di provisioning trovati Trovato provisioning_parameters.json nel percorso S3 per il gruppo di controller LifeCycleScript <instance-group-name>
Parametri di provisioning non trovati Nessun provisioning_parameters.json trovato nel percorso S3 per il gruppo di controller LifeCycleScript <instance-group-name>
È stata creata la chiave Slurm munge Chiave munge creata e archiviata con successo
La convalida di Slurm drift è stata superata La convalida della deriva della configurazione Slurm è stata superata
È stata rilevata una deriva dello slurm È stata rilevata una deriva nella configurazione dello slurm: <drift-details>
Rollback del cluster Slurm completato Creazione del cluster non riuscita: il controller e i nodi di accesso non sono stati pronti entro il tempo previsto
La riconfigurazione di Slurm è riuscita Slurm è stato riconfigurato con successo. La configurazione di Slurm è stata aggiornata in modo che corrisponda allo stato desiderato

EventBridge integrazione

HyperPod invia eventi di cluster ad Amazon EventBridge utilizzando tre tipi di dettagli:

Tipo di dettaglio Description
SageMaker HyperPod Cluster Event Eventi operativi per il provisioning, la scalabilità, l'applicazione di patch e le operazioni specifiche dell'orchestratore. EventLevelInclude il filtro della gravità.
SageMaker HyperPod Cluster State Change Cluster-level transizioni di stato (ad esempio, Creazione in InService). Include la configurazione completa del cluster.
SageMaker HyperPod Cluster Node Health Event Eventi di monitoraggio dello stato di salute da parte dell' HyperPod Health Monitoring Agent (HMA). Include lo stato di salute, il motivo, l'azione di riparazione e la raccomandazione.

Esempi di modelli di eventi

Tutti gli eventi HyperPod del cluster:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }

Solo eventi di errore (per avvisi):

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }

Eventi per un cluster specifico:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }

Eventi sullo stato dei nodi:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }

Guida di riferimento alle API

Consulta anche