Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
SageMaker HyperPod riferimento agli eventi del cluster
Questa pagina fornisce un riferimento completo di tutti gli eventi strutturati emessi dai SageMaker HyperPod cluster Amazon. Gli eventi forniscono visibilità sulle operazioni a livello di cluster, gruppi di istanze e istanze, tra cui il provisioning, la scalabilità, l'applicazione di patch e le modifiche del ciclo di vita specifiche dell'orchestratore.
Gli eventi di NodeProvisioningMode cluster HyperPod sono disponibili per i cluster con set to. Continuous Gli eventi sono accessibili tramite le DescribeClusterEvent API ListClusterEvents e, la scheda Eventi della console SageMaker AI e Amazon EventBridge.
Registro degli eventi del cluster
Ogni evento del cluster è rappresentato come un record strutturato contenente l'identificazione, la tempistica, l'ambito, la gravità e i metadati specifici dell'operazione. L'esempio seguente mostra un record completo dell'evento fornito tramite l'DescribeClusterEventAPI e Amazon EventBridge:
{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }
Campi di registrazione degli eventi
L'oggetto detail.EventDetails include i seguenti campi:
| Campo | Tipo | Campo obbligatorio | Description |
|---|---|---|---|
EventId |
Stringa (UUID) | Sì | Identificatore univoco dell'evento. |
ClusterArn |
Stringa | Sì | ARN del cluster. HyperPod |
ClusterName |
Stringa | Sì | Nome del HyperPod cluster. |
EventTime |
Time stamp | Sì | Quando si è verificato l'evento (millisecondi di epoca). |
ResourceType |
Stringa | Sì | Ambito dell'evento:Cluster, o. InstanceGroup Instance |
EventLevel |
Stringa | Sì | Classificazione della gravità: InfoWarn, oError. |
Description |
Stringa | No | Human-readable riepilogo dell'evento. |
InstanceGroupName |
Stringa | No | Nome del gruppo di istanze (presente quando ResourceType è InstanceGroup oInstance). |
InstanceId |
Stringa | No | ID dell'istanza EC2 (presente quando ResourceType èInstance). |
EventDetails |
Oggetto | No | Metadati aggiuntivi specifici per il tipo e il funzionamento della risorsa. |
Livelli di evento
| Livello | Significato |
|---|---|
Info |
L'operazione è stata completata correttamente o sta procedendo normalmente. |
Warn |
Operazione completata con un problema non critico o una condizione che potrebbe richiedere future attenzioni. |
Error |
Operazione non riuscita o richiede attenzione immediata. |
Tipi di risorse
| ResourceType | Scope | Eventi di esempio |
|---|---|---|
Cluster |
Whole-cluster operazioni | Cluster creation/update avviato, operazione cluster non riuscita |
InstanceGroup |
Operazioni sul gruppo di istanze | Scalabilità started/completed, patching pianificato, ciclo di vita FSx |
Instance |
Operazioni su singole istanze | Provisioning EC2, esecuzione degli script del ciclo di vita, gestione ENI, cessazione |
EventDetails metadati
Gli eventi del cluster includono un EventMetadata oggetto all'interno del EventDetails campo che fornisce un contesto specifico dell'operazione oltre a quanto indicato nella descrizione dell'evento. Il contenuto di EventMetadata varia in base al tipo di risorsa e al tipo di evento. Per lo schema completo e i campi supportati, EventMetadataconsulta Amazon SageMaker AI API Reference.
EventBridge campi della busta
Quando viene spedito tramite Amazon EventBridge, il record dell'evento viene racchiuso in una EventBridge busta standard:
| Campo | Description |
|---|---|
version |
EventBridge versione dello schema (sempre"0"). |
id |
ID EventBridge evento univoco. |
detail-type |
SageMaker HyperPod Cluster Event |
source |
aws.sagemaker |
account |
AWS ID dell'account proprietario del cluster. |
time |
Timestamp ISO 8601 dell'evento. |
region |
AWS Regione in cui risiede il cluster. |
resources |
Array contenente l'ARN del cluster. |
detail |
Contiene l'EventDetailsoggetto descritto sopra. |
Eventi comuni (EKS e Slurm)
I seguenti eventi vengono emessi per tutti i HyperPod cluster indipendentemente dall'orchestrator. La colonna Descrizione mostra il valore del Description campo nel record dell'evento così come appare nella risposta API e nella scheda Eventi della console.
Ciclo di vita del cluster
| Event | Description |
|---|---|
| L'operazione del cluster è iniziata | Il cluster <cluster-name><operation>è stato avviato con successo |
| Avvio dell'operazione del cluster non riuscito | Avvio del cluster non riuscito <cluster-name><operation> |
| Operazione del cluster completata | Cluster <cluster-name><operation>completato con successo |
| Operazione del cluster non riuscita | Cluster <cluster-name><operation>non riuscito |
Ciclo di vita del gruppo di istanze
| Event | Description |
|---|---|
| L'operazione sul gruppo di istanze è iniziata | InstanceGroup <instance-group-name><operation>avviato con successo in Cluster <cluster-name> |
| Avvio dell'operazione sul gruppo di istanze non riuscito | Avvio InstanceGroup <instance-group-name><operation>in Cluster non riuscito <cluster-name> |
| Operazione sul gruppo di istanze completata | Gruppo di istanze <instance-group-name><operation>nel cluster <cluster-name>completato correttamente |
| Operazione del gruppo di istanze non riuscita | Gruppo di istanze <instance-group-name><operation>nel cluster <cluster-name>non riuscito |
Configurazione della rete del gruppo di istanze
| Event | Description |
|---|---|
| È stata trovata una configurazione di rete | Trovata sottorete <subnet-id>in AZ <availability-zone>con SecurityGroupIds <security-group-ids>for IG <instance-group-name>in Cluster <cluster-name> |
| Configurazione di rete non riuscita | Impossibile elaborare i dettagli della configurazione di rete del gruppo di istanze per IG <instance-group-name>in Cluster <cluster-name> |
| È stata trovata una sovrascrittura AMI personalizzata | Trovato un override AMI personalizzato <ami-id>per IG <instance-group-name>nel cluster <cluster-name> |
| Sovrascrittura AMI personalizzata non riuscita | Impossibile elaborare i dettagli di sostituzione AMI personalizzata per IG <instance-group-name>in Cluster <cluster-name> |
| Configurazione di rete della piattaforma utilizzata | Utilizzo HyperPod della configurazione di rete fornita dalla piattaforma per IG <instance-group-name>in Cluster <cluster-name> |
| Configurazione di rete determinata | Configurazione di rete del gruppo di istanze determinata con successo per IG <instance-group-name>in Cluster <cluster-name> |
Creazione di istanze
| Event | Description |
|---|---|
| Operazione dell'istanza iniziata | L'istanza <operation>è stata avviata correttamente in Cluster <cluster-name>e IG <instance-group-name> |
| Avvio dell'operazione dell'istanza non riuscito | Impossibile avviare l'istanza <operation>in Cluster <cluster-name>e IG <instance-group-name> |
| È stata trovata una prenotazione di capacità | CapacityReservation ID trovato <reservation-id>per Cluster <cluster-name>e IG<instance-group-name>, utilizzando la capacità riservata |
| Prenotazione di capacità non trovata | Nessun CapacityReservation risultato trovato per Cluster <cluster-name>e IG<instance-group-name>, utilizzando il pool su richiesta |
| Configurazione del payload dell'istanza non riuscita | Elaborazione non riuscita CapacityReservationDetails per Cluster <cluster-name>e IG <instance-group-name> |
| Cliente ENI creato | Customer ENI creato con successo, ad esempio in Cluster <cluster-name>e IG <instance-group-name> |
| Creazione dell'ENI per il cliente non riuscita | Impossibile creare Customer ENI, ad esempio in Cluster <cluster-name>e IG <instance-group-name> |
| Istanza EC2 fornita | <cluster-name>Istanza EC2 <instance-id>fornita con successo in Cluster e IG <instance-group-name> |
| Creazione dell'istanza EC2 non riuscita | <cluster-name>Impossibile effettuare il provisioning dell'istanza EC2 in Cluster e IG <instance-group-name> |
| Stato dello script del ciclo di vita aggiornato | <instance-id>L'esecuzione dello script del ciclo di vita dell'istanza per EC2 Instance ha <status> |
| L'aggiornamento dello stato dello script del ciclo di vita non è riuscito | Impossibile aggiornare lo stato di esecuzione dello script del ciclo di vita dell'istanza per EC2InstanceId <instance-id> |
| Creazione dell'istanza non riuscita con i log del ciclo di vita | <instance-id>L'esecuzione dello script del ciclo di vita dell'istanza EC2 non è riuscita. Per visualizzare i log degli script del ciclo di vita, visita il gruppo di log... |
| La bonifica ENI non utilizzata è riuscita | <instance-id><cluster-name>I Customer ENI inutilizzati per EC2 Instance in Cluster e IG sono stati eliminati con successo <instance-group-name> |
| La pulizia ENI non utilizzata non è riuscita | <instance-id><cluster-name>Impossibile eliminare Customer ENIS for EC2 Instance non utilizzate in Cluster e IG <instance-group-name> |
Eliminazione dell'istanza
| Event | Description |
|---|---|
| Chiusura dell'istanza EC2 in corso | <cluster-name>La chiusura dell'istanza EC2 <instance-id>è attualmente in corso in Cluster e IG <instance-group-name> |
| Chiusura dell'istanza EC2 non riuscita | <instance-id><cluster-name>Impossibile terminare l'istanza EC2 in Cluster e IG <instance-group-name> |
| Cliente ENI eliminato | L'ENI del cliente è stato eliminato con successo per l'istanza EC2 <instance-id>in Cluster <cluster-name>e IG <instance-group-name> |
| Eliminazione dell'ENI del cliente non riuscita | Impossibile eliminare Customer ENI for EC2 Instance <instance-id>in Cluster <cluster-name>e IG <instance-group-name> |
Riavvio dell'istanza
| Event | Description |
|---|---|
| Riavvio dell'istanza EC2 in corso | <cluster-name>Il riavvio dell'istanza EC2 <instance-id>è attualmente in corso su Cluster e IG <instance-group-name> |
| La richiesta di riavvio dell'istanza EC2 non è riuscita | <instance-id><cluster-name>Impossibile inviare la richiesta di riavvio per l'istanza EC2 in Cluster e IG <instance-group-name> |
Funzionamento dell'istanza (generico)
| Event | Description |
|---|---|
| Operazione dell'istanza completata | Istanza <operation><instance-id>in Cluster <cluster-name>e IG <instance-group-name>completata correttamente |
| Operazione dell'istanza non riuscita | Istanza <operation><instance-id>in Cluster <cluster-name>e IG <instance-group-name>non riuscita |
Sostituzione dell'istanza
| Event | Description |
|---|---|
| La sostituzione dell'istanza è iniziata | <instance-id>L'istanza viene avviata come parte della sostituzione dell'istanza in Cluster <cluster-name>e IG <instance-group-name> |
| Avvio della sostituzione dell'istanza non riuscito | L'<instance-id>avvio dell'istanza non è riuscito come parte della sostituzione dell'istanza in Cluster <cluster-name>e IG <instance-group-name> |
| Sostituzione dell'istanza completata | Istanza <instance-id><operation>completata correttamente nell'ambito della sostituzione dell'istanza in Cluster <cluster-name>e IG <instance-group-name> |
| Sostituzione dell'istanza non riuscita | Istanza <instance-id><operation>non riuscita come parte della sostituzione dell'istanza in Cluster <cluster-name>e IG <instance-group-name> |
Ciclo di vita del file system FSx
| Event | Description |
|---|---|
| La creazione di FSx è iniziata | <instance-group-name>La creazione di FSx è iniziata per IG in Cluster <cluster-name> |
| Creazione FSx non riuscita | <instance-group-name>Impossibile creare FSx per IG nel cluster <cluster-name> |
| Creazione FSx completata | <instance-group-name>Creazione di FSx completata con successo per IG in Cluster <cluster-name> |
| L'eliminazione di FSx è iniziata | <instance-group-name>L'eliminazione di FSx è iniziata per IG in Cluster <cluster-name> |
| Eliminazione FSx non riuscita | <instance-group-name>Impossibile eliminare FSx for IG nel cluster <cluster-name> |
| Eliminazione FSx completata | <instance-group-name>Eliminazione FSx completata con successo per IG in Cluster <cluster-name> |
| Aggiornamento FSx avviato | <instance-group-name>Aggiornamento FSx avviato per IG in Cluster <cluster-name> |
| Aggiornamento FSx non riuscito | <instance-group-name>Impossibile aggiornare FSx for IG in Cluster <cluster-name> |
| Aggiornamento FSx completato | <instance-group-name>Aggiornamento FSx completato con successo per IG in Cluster <cluster-name> |
Applicazione di patch (passaggi comuni)
Questi eventi di patching vengono emessi sia per i cluster EKS che per quelli Slurm durante le operazioni. UpdateClusterSoftware
| Event | Description |
|---|---|
| Patch pianificato per gruppi di istanze | InstanceGroup <instance-group-name>in Cluster <cluster-name>è stato pianificato UpdateClusterSoftware per la versione più recente. |
| La pianificazione delle patch del gruppo di istanze non è riuscita | <cluster-name>Pianificazione di IG UpdateClusterSoftware <instance-group-name>in Cluster non riuscita. |
| È iniziata l'applicazione di patch al gruppo di istanze | UpdateClusterSoftware <strategy>avviato per IG <instance-group-name>in Cluster <cluster-name>utilizzando la strategia. |
| Avvio della patch del gruppo di istanze non riuscito | <cluster-name>Avvio di IG <instance-group-name>in UpdateClusterSoftware Cluster non riuscito. |
| Successivo batch di patch selezionato | <cluster-name>Batch di aggiornamento successivo selezionato per IG <instance-group-name>in Cluster. |
| La selezione del batch di aggiornamento successivo non è riuscita | <cluster-name>Impossibile selezionare il batch di aggiornamento successivo per IG <instance-group-name>in Cluster. |
| Istanze non riuscite messe in coda per la sostituzione | <cluster-name>Istanze non riuscite in IG in <instance-group-name>Cluster messe in coda per la sostituzione dei nodi. |
| Sostituzione delle istanze non riuscita (accodamento fallito) | <instance-group-name><cluster-name>Impossibile mettere in coda le istanze per la sostituzione dei nodi in IG in Cluster. |
| Applicazione della patch al gruppo di istanze completata | UpdateClusterSoftware <cluster-name>completato con successo per IG <instance-group-name>in Cluster. |
| Il completamento della patch al gruppo di istanze non è riuscito | <cluster-name>Completamento non riuscito UpdateClusterSoftware per IG <instance-group-name>in Cluster. |
| È iniziata la sostituzione del volume root | La sostituzione del volume root è iniziata per esempio <instance-id>in IG<instance-group-name>. |
| La sostituzione del volume root non è riuscita | Impossibile avviare la sostituzione del volume root per Instance <instance-id>in IG<instance-group-name>. |
| L'applicazione della patch all'istanza è riuscita | Istanza <instance-id>in IG <instance-group-name>aggiornata correttamente. |
EKS-specific eventi
I seguenti eventi vengono emessi solo per HyperPod i cluster orchestrati con Amazon EKS.
Gestione degli accessi
| Event | Description |
|---|---|
| L'operazione di immissione dell'accesso SLR è riuscita | <operation>Inserimento dell'accesso SLR riuscito per Cluster <cluster-name> |
| Operazione di immissione dell'accesso SLR non riuscita | Inserimento dell'accesso SLR <operation>non riuscito per Cluster <cluster-name> |
| Operazione EKS access entry riuscita | EKS Access Entries <operation>ha avuto successo per Cluster <cluster-name> |
| Operazione EKS Access Entries non riuscita | EKS Access Entries <operation>non riuscita per Cluster <cluster-name> |
Aggiornamenti della configurazione di Kubernetes
| Event | Description |
|---|---|
| L'aggiornamento della configurazione di Kubernetes è riuscito | <instance-id><cluster-name>Configurazione di Kubernetes aggiornata correttamente, ad esempio in Cluster e IG <instance-group-name> |
| Aggiornamento della configurazione di Kubernetes non riuscito | <instance-id><cluster-name>Impossibile aggiornare la configurazione di Kubernetes, ad esempio in Cluster e IG <instance-group-name> |
Scalabilità automatica di Karpenter
| Event | Description |
|---|---|
| Operazione di scalabilità automatica riuscita | AutoScaling <operation><status>correttamente in Cluster <cluster-name> |
| Operazione di scalabilità automatica non riuscita | <operation>Accesso al cluster non riuscito AutoScaling <cluster-name> |
| L'installazione di Karpenter CRD è riuscita | CustomResourceDefinition installazione completata con successo in EKS Cluster <cluster-name> |
| L'installazione di Karpenter CRD non è riuscita | CustomResourceDefinition installazione non riuscita per EKS Cluster <cluster-name> |
| L'aggiornamento della politica di accesso di Karpenter SLR è riuscito | <operation><cluster-name>politiche di accesso con immissione dell' AmazonSageMakerHyperPodServiceRole accesso nel cluster EKS con successo |
| L'aggiornamento della politica di accesso di Karpenter SLR non è riuscito | Impossibile <operation>accedere alle politiche con immissione dell' AmazonSageMakerHyperPodServiceRole accesso nel cluster EKS <cluster-name> |
Applicazione di patch: a livello di istanza EKS
| Event | Description |
|---|---|
| La preparazione dell'applicazione delle patch all'istanza è riuscita | L'istanza <instance-id>in IG è stata <instance-group-name>isolata e i pod rimossi. |
| L'applicazione della patch all'istanza è stata ignorata (violazione del PDB) | UpdateClusterSoftware ad esempio <instance-id>in IG <instance-group-name>ignorata a causa di un vincolo. PodDisruptionBudget |
| La preparazione della patch dell'istanza non è riuscita | Impossibile preparare l'istanza <instance-id>in IG <instance-group-name>per UpdateClusterSoftware. |
| Istanza ripristinata allo stato programmabile | Istanza <instance-id>in IG <instance-group-name>ripristinata allo stato programmabile. |
| Ripristino dell'istanza allo stato di pianificazione non riuscito | Impossibile ripristinare l'istanza <instance-id>in IG <instance-group-name>allo stato programmabile. |
Applicazione di patch: rollback EKS
| Event | Description |
|---|---|
| È iniziato il tempo di cottura | È iniziato il periodo di cottura per IG <instance-group-name>in Cluster<cluster-name>. Monitoraggio degli allarmi [<alarm-names>] per <duration>secondi. |
| Tempo di cottura completato | Periodo di cottura completato per IG <instance-group-name>in Cluster<cluster-name>. Nessun allarme si è attivato durante il periodo di cottura <duration>di 2 secondi. |
| Allarme del tempo di cottura attivato | <cluster-name>Il periodo di cottura non è riuscito per IG <instance-group-name>in Cluster. Alarms [<alarm-names>] è entrato nello stato ALARM. Avvio del rollback automatico. |
| Valutazione del tempo di cottura non riuscita | <cluster-name>Impossibile valutare gli allarmi durante il periodo di cottura per IG <instance-group-name>in Cluster. |
| È stato avviato il rollback dell'applicazione di patch al gruppo di istanze | UpdateClusterSoftware <instance-group-name><cluster-name>non riuscito per IG in Cluster. Avvio del rollback. |
| Il rollback dell'applicazione delle patch al gruppo di istanze non è riuscito | <instance-group-name><cluster-name>Il rollback non è riuscito per IG in Cluster. Alcune istanze potrebbero essere in FailedMaintenance stato. |
| È stato avviato il rollback dell'applicazione delle patch alle istanze | Aggiornamento dell'istanza <instance-id>in IG <instance-group-name>non riuscito. Rollback avviato. |
| Il rollback della patch dell'istanza è riuscito | L'istanza <instance-id>in IG è <instance-group-name>stata ripristinata correttamente all'AMI precedente. |
| Il rollback della patch dell'istanza non è riuscito | UpdateClusterSoftware <instance-id><instance-group-name>Il rollback non è riuscito, ad esempio, in IG. |
Slurm-specific eventi
I seguenti eventi vengono emessi solo per i HyperPod cluster orchestrati con Slurm.
| Event | Description |
|---|---|
| Parametri di provisioning trovati | Trovato provisioning_parameters.json in S3 Path per il gruppo di controller LifeCycleScript <instance-group-name> |
| Parametri di provisioning non trovati | Nessun provisioning_parameters.json trovato in S3 Path per il gruppo di controller LifeCycleScript <instance-group-name> |
| Creata la chiave Slurm munge | Chiave munge creata e memorizzata con successo |
| La convalida di Slurm drift è stata superata | La convalida della deriva della configurazione di Slurm è stata superata |
| Rilevata deriva dello slurm | È stata rilevata una deriva nella configurazione di Slurm: <drift-details> |
| Il rollback del cluster Slurm è stato completato | Creazione del cluster non riuscita: il controller e i nodi di accesso non sono stati pronti entro il tempo previsto |
| La riconfigurazione di Slurm è riuscita | Slurm è stato riconfigurato correttamente. La configurazione di Slurm è stata aggiornata per corrispondere allo stato desiderato |
EventBridge integrazione
HyperPod invia eventi del cluster ad Amazon EventBridge utilizzando tre tipi di dettagli:
| Tipo di dettaglio | Description |
|---|---|
SageMaker HyperPod Cluster Event |
Eventi operativi per il provisioning, la scalabilità, l'applicazione di patch e operazioni specifiche dell'orchestratore. EventLevelInclude il filtraggio della gravità. |
SageMaker HyperPod Cluster State Change |
Cluster-level transizioni di stato (ad esempio, Creazione in InService). Include la configurazione completa del cluster. |
SageMaker HyperPod Cluster Node Health
Event |
Eventi di monitoraggio della salute forniti dall' HyperPod Health Monitoring Agent (HMA). Include lo stato di salute, il motivo, l'azione di riparazione e la raccomandazione. |
Esempi di pattern di eventi
Tutti gli eventi HyperPod del cluster:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }
Solo eventi di errore (per avvisi):
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }
Eventi per un cluster specifico:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }
Eventi relativi allo stato dei nodi:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }
Guida di riferimento alle API
-
ListClusterEvents— Elenca gli eventi con filtraggio, ordinamento e impaginazione
-
DescribeClusterEvent— Ottieni tutti i dettagli per un evento specifico
-
ClusterEventSummary— Tipo di dati di riepilogo dell'evento
-
ClusterEventDetail— Tipo di dati relativi ai dettagli dell'evento
Consulta anche
-
SageMaker HyperPod eventi del cluster Slurm— Eventi del cluster Slurm con utilizzo della CLI e scenari comuni
-
SageMaker HyperPod Eventi del cluster EKS— Eventi del cluster EKS con utilizzo della CLI e scenari comuni