View a markdown version of this page

SageMaker HyperPod Referenz zu Cluster-Ereignissen - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

SageMaker HyperPod Referenz zu Cluster-Ereignissen

Diese Seite bietet eine vollständige Referenz aller strukturierten Ereignisse, die von SageMaker HyperPod Amazon-Clustern ausgelöst werden. Ereignisse bieten Einblick in Abläufe auf Cluster-, Instanzgruppen- und Instanzebene, einschließlich Bereitstellung, Skalierung, Patching und orchestratorspezifischen Lebenszyklusänderungen.

Cluster-Ereignisse sind für Cluster mit der Einstellung auf verfügbar. HyperPod NodeProvisioningMode Continuous Auf Ereignisse kann über die DescribeClusterEvent APIs ListClusterEvents und, die Registerkarte Ereignisse der SageMaker AI-Konsole und Amazon zugegriffen EventBridge werden.

Aufzeichnung der Cluster-Ereignisse

Jedes Clusterereignis wird als strukturierter Datensatz dargestellt, der Identifikation, Zeitpunkt, Umfang, Schweregrad und betriebsspezifische Metadaten enthält. Das folgende Beispiel zeigt einen vollständigen Ereignisdatensatz, wie er über die DescribeClusterEvent API und Amazon bereitgestellt wurde EventBridge:

{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }

Felder für Ereignisdatensätze

Das detail.EventDetails-Objekt enthält die folgenden Felder:

Feld Typ Erforderlich Description
EventId Zeichenfolge (UUID) Ja Eindeutiger Bezeichner für das Ereignis.
ClusterArn Zeichenfolge Ja ARN des HyperPod Clusters.
ClusterName Zeichenfolge Ja Name des HyperPod Clusters.
EventTime Zeitstempel Ja Wann das Ereignis eingetreten ist (Epochen-Millisekunden).
ResourceType Zeichenfolge Ja Umfang des Ereignisses:Cluster,, oder. InstanceGroup Instance
EventLevel Zeichenfolge Ja Klassifizierung des Schweregrads: InfoWarn,, oderError.
Description Zeichenfolge Nein Human-readable Zusammenfassung des Ereignisses.
InstanceGroupName Zeichenfolge Nein Name der Instanzgruppe (vorhanden, wenn InstanceGroup oder ResourceType istInstance).
InstanceId Zeichenfolge Nein EC2-Instanz-ID (vorhanden, wenn sie ResourceType istInstance).
EventDetails Objekt Nein Zusätzliche Metadaten, die für den Ressourcentyp und den Vorgang spezifisch sind.

Ebenen der Ereignisse

Level Bedeutung
Info Der Vorgang wurde erfolgreich abgeschlossen oder läuft normal.
Warn Der Vorgang wurde mit einem nicht kritischen Problem oder einem Zustand abgeschlossen, der möglicherweise in future behoben werden muss.
Error Der Vorgang ist fehlgeschlagen oder erfordert sofortige Maßnahmen.

Ressourcentypen

ResourceType Scope Beispielereignisse
Cluster Whole-cluster Operationen Der Cluster creation/update wurde gestartet, der Clustervorgang ist fehlgeschlagen
InstanceGroup Operationen für Instanzgruppen Skalierung started/completed, geplantes Patchen, FSx-Lebenszyklus
Instance Operationen einzelner Instanzen EC2-Bereitstellung, Ausführung von Lifecycle-Skripten, ENI-Management, Kündigung

EventDetails Metadaten

Clusterereignisse enthalten ein EventMetadata Objekt innerhalb des EventDetails Felds, das einen betriebsspezifischen Kontext bietet, der über das hinausgeht, was die Ereignisbeschreibung vermittelt. Der Inhalt von EventMetadata variiert je nach Ressourcentyp und Ereignistyp. Das vollständige Schema und die unterstützten Felder finden Sie EventMetadatain der Amazon SageMaker AI API-Referenz.

EventBridge Umschlagfelder

Bei der Lieferung über Amazon EventBridge ist die Veranstaltungsaufzeichnung in einem EventBridge Standardumschlag verpackt:

Feld Description
version EventBridge Schemaversion (immer"0").
id Eindeutige EventBridge Ereignis-ID.
detail-type SageMaker HyperPod Cluster Event
source aws.sagemaker
account AWS Konto-ID, der der Cluster gehört.
time ISO 8601-Zeitstempel des Ereignisses.
region AWS Region, in der sich der Cluster befindet.
resources Array, das den Cluster-ARN enthält.
detail Enthält das oben beschriebene EventDetails Objekt.

Allgemeine Ereignisse (EKS und Slurm)

Die folgenden Ereignisse werden für alle HyperPod Cluster unabhängig vom Orchestrator ausgelöst. In der Spalte Beschreibung wird der Wert des Description Felds im Ereignisdatensatz so angezeigt, wie er in der API-Antwort und auf der Registerkarte Ereignisse der Konsole angezeigt wird.

Cluster-Lebenszyklus

Veranstaltung Description
Der Clusterbetrieb wurde gestartet Der Cluster <cluster-name><operation>wurde erfolgreich gestartet
Der Start des Clustervorgangs ist fehlgeschlagen Cluster konnte nicht gestartet werden <cluster-name><operation>
Der Clustervorgang wurde abgeschlossen Der Cluster <cluster-name><operation>wurde erfolgreich abgeschlossen
Der Clustervorgang ist fehlgeschlagen Der Cluster <cluster-name><operation>ist fehlgeschlagen

Lebenszyklus der Instanzgruppe

Veranstaltung Description
Der Vorgang der Instanzgruppe wurde gestartet InstanceGroup <instance-group-name><operation>wurde erfolgreich im Cluster gestartet <cluster-name>
Der Start des Instanzgruppenvorgangs ist fehlgeschlagen Der Start InstanceGroup <instance-group-name><operation>im Cluster ist fehlgeschlagen <cluster-name>
Der Vorgang der Instanzgruppe wurde abgeschlossen Die Instanzgruppe <instance-group-name><operation>im Cluster <cluster-name>wurde erfolgreich abgeschlossen
Der Vorgang der Instanzgruppe ist fehlgeschlagen Die Instanzgruppe <instance-group-name><operation>im Cluster <cluster-name>ist fehlgeschlagen

Netzwerkkonfiguration der Instanzgruppe

Veranstaltung Description
Netzwerkkonfiguration gefunden Subnetz <subnet-id>in AZ <availability-zone>mit SecurityGroupIds <security-group-ids>für IG <instance-group-name>im Cluster gefunden <cluster-name>
Die Netzwerkkonfiguration ist fehlgeschlagen Die Netzwerkkonfigurationsdetails der Instanzgruppe für IG <instance-group-name>im Cluster konnten nicht verarbeitet werden <cluster-name>
Benutzerdefinierte AMI-Überschreibung gefunden Benutzerdefinierte AMI-Überschreibung <ami-id>für IG <instance-group-name>im Cluster gefunden <cluster-name>
Benutzerdefiniertes AMI-Override ist fehlgeschlagen Fehler beim Verarbeiten der benutzerdefinierten AMI-Override-Details für IG <instance-group-name>im Cluster <cluster-name>
Die verwendete Plattform-Netzwerkkonfiguration Verwendung der von der HyperPod Plattform bereitgestellten Netzwerkkonfiguration für IG <instance-group-name>im Cluster <cluster-name>
Die Netzwerkkonfiguration wurde ermittelt Die Netzwerkkonfiguration der Instanzgruppe für IG <instance-group-name>im Cluster wurde erfolgreich ermittelt <cluster-name>

Instanzerstellung

Veranstaltung Description
Der Instanzvorgang wurde gestartet Die Instanz <operation>wurde erfolgreich in Cluster <cluster-name>und IG gestartet <instance-group-name>
Der Start des Instanzvorgangs ist fehlgeschlagen Die Instanz konnte nicht <operation>in Cluster <cluster-name>und IG gestartet werden <instance-group-name>
Kapazitätsreservierung gefunden CapacityReservation ID <reservation-id>für Cluster <cluster-name>und IG gefunden<instance-group-name>, wobei reservierte Kapazität verwendet wird
Die Kapazitätsreservierung wurde nicht gefunden Für Cluster <cluster-name>und IG<instance-group-name>, die den On-Demand-Pool verwenden, wurde nichts CapacityReservation gefunden
Die Einrichtung der Instanz-Payload ist fehlgeschlagen Die Verarbeitung CapacityReservationDetails für Cluster <cluster-name>und IG konnte nicht durchgeführt werden <instance-group-name>
Der Kunde wurde von ENI erstellt Der Kunde ENI wurde erfolgreich erstellt, zum Beispiel in Cluster <cluster-name>und IG <instance-group-name>
Die Erstellung des Kunden-ENI ist fehlgeschlagen Kunden-ENI konnte beispielsweise nicht in Cluster <cluster-name>und IG erstellt werden <instance-group-name>
EC2-Instanz wurde bereitgestellt <cluster-name>Die EC2-Instance <instance-id>wurde erfolgreich in Cluster und IG bereitgestellt <instance-group-name>
Die Erstellung der EC2-Instanz ist fehlgeschlagen <cluster-name>Die EC2-Instance konnte nicht in Cluster und IG bereitgestellt werden <instance-group-name>
Status des Lebenszyklus-Skripts aktualisiert <instance-id>Die Ausführung des Instanzlebenszyklus-Skripts für die EC2-Instance hat <status>
Die Aktualisierung des Lebenszyklus-Skripts ist fehlgeschlagen Der Ausführungsstatus des Instanzlebenszyklus-Skripts für konnte nicht aktualisiert werden EC2InstanceId <instance-id>
Fehler bei der Instanzerstellung mit Lebenszyklusprotokollen Die Ausführung des Instanzlebenszyklus-Skripts für die EC2-Instance <instance-id>ist fehlgeschlagen. Um Lifecycle-Skriptprotokolle einzusehen, besuchen Sie die Protokollgruppe...
Die Säuberung ungenutzter ENI war erfolgreich <cluster-name>Ungenutzte Kunden-ENIs für EC2-Instance <instance-id>in Cluster und IG wurden erfolgreich gelöscht <instance-group-name>
Die Säuberung ungenutzter ENI ist fehlgeschlagen <cluster-name>Ungenutzte Kunden-ENIs für EC2-Instance <instance-id>in Cluster und IG konnten nicht gelöscht werden <instance-group-name>

Löschen der Instanz

Veranstaltung Description
Die EC2-Instance wird gerade beendet <cluster-name>Die Kündigung der EC2-Instance <instance-id>wird derzeit in Cluster und IG ausgeführt <instance-group-name>
Die Kündigung der EC2-Instance ist fehlgeschlagen <cluster-name>Die EC2-Instance <instance-id>in Cluster und IG konnte nicht beendet werden <instance-group-name>
Kunden-ENI wurde gelöscht Kunde ENI wurde erfolgreich für EC2-Instance <instance-id>in Cluster <cluster-name>und IG gelöscht <instance-group-name>
Das Löschen der Kunden-ENI ist fehlgeschlagen Kunden-ENI für EC2-Instance <instance-id>in Cluster <cluster-name>und IG konnte nicht gelöscht werden <instance-group-name>

Instance-Neustart

Veranstaltung Description
Der Neustart der EC2-Instance ist im Gange <cluster-name>Der Neustart der EC2-Instance <instance-id>wird derzeit auf Cluster und IG durchgeführt <instance-group-name>
Die Anfrage zum Neustart der EC2-Instance ist fehlgeschlagen <cluster-name>Die Neustartanfrage für die EC2-Instance <instance-id>in Cluster und IG konnte nicht gesendet werden <instance-group-name>

Instanzbetrieb (generisch)

Veranstaltung Description
Der Instanzvorgang wurde abgeschlossen Die Instanz <operation><instance-id>in Cluster <cluster-name>und IG <instance-group-name>wurde erfolgreich abgeschlossen
Der Instanzvorgang ist fehlgeschlagen Die Instanz <operation><instance-id>in Cluster <cluster-name>und IG ist <instance-group-name>fehlgeschlagen

Ersatz der Instanz

Veranstaltung Description
Der Austausch der Instanz wurde gestartet <instance-id>Die Instanz wird im Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG gestartet <instance-group-name>
Der Start des Instanzaustauschs ist fehlgeschlagen Die Instanz <instance-id>konnte im Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG nicht gestartet werden <instance-group-name>
Der Austausch der Instanz wurde abgeschlossen Die Instanz wurde im <instance-id><operation>Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG erfolgreich abgeschlossen <instance-group-name>
Der Austausch der Instanz ist fehlgeschlagen Die Instanz <instance-id><operation>ist im Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG ausgefallen <instance-group-name>

Lebenszyklus FSx FSx-Dateisystems

Veranstaltung Description
Die FSx-Erstellung wurde gestartet Die FSx-Erstellung für IG <instance-group-name>im Cluster wurde gestartet <cluster-name>
FSx-Erstellung ist fehlgeschlagen FSx für IG konnte nicht <instance-group-name>im Cluster erstellt werden <cluster-name>
FSx-Erstellung abgeschlossen FSx-Erstellung für IG <instance-group-name>im Cluster erfolgreich abgeschlossen <cluster-name>
Das Löschen von FSx wurde gestartet Das Löschen von FSx wurde für IG <instance-group-name>im Cluster gestartet <cluster-name>
Das Löschen von FSx ist fehlgeschlagen FSx für IG <instance-group-name>im Cluster konnte nicht gelöscht werden <cluster-name>
FSx-Löschung abgeschlossen FSx-Löschung für IG <instance-group-name>im Cluster erfolgreich abgeschlossen <cluster-name>
FSx-Update gestartet FSx-Update für IG <instance-group-name>im Cluster gestartet <cluster-name>
FSx-Update ist fehlgeschlagen FSx für IG <instance-group-name>im Cluster konnte nicht aktualisiert werden <cluster-name>
FSx-Update abgeschlossen FSx-Update für IG <instance-group-name>im Cluster erfolgreich abgeschlossen <cluster-name>

Patchen (allgemeine Schritte)

Diese Patching-Ereignisse werden während des Betriebs sowohl für EKS- als auch für Slurm-Cluster ausgelöst. UpdateClusterSoftware

Veranstaltung Description
Patches für Instanzgruppen sind geplant InstanceGroup <instance-group-name>im Cluster <cluster-name>wurde auf den neuesten Stand UpdateClusterSoftware gebracht.
Der Zeitplan für das Patchen der Instanzgruppe ist fehlgeschlagen <cluster-name>Fehler beim Planen UpdateClusterSoftware für IG <instance-group-name>im Cluster.
Das Patchen der Instanzgruppe wurde gestartet UpdateClusterSoftware wurde <instance-group-name><cluster-name>mithilfe der <strategy>Strategie für IG im Cluster initiiert.
Der Start des Instanzgruppen-Patches ist fehlgeschlagen <cluster-name>Fehler beim UpdateClusterSoftware Initiieren von IG <instance-group-name>im Cluster.
Nächster Patch-Batch ausgewählt <cluster-name>Der nächste Update-Batch wurde für IG <instance-group-name>im Cluster ausgewählt.
Die Auswahl des nächsten Patch-Batches ist fehlgeschlagen <cluster-name>Der nächste Update-Batch für IG <instance-group-name>im Cluster konnte nicht ausgewählt werden.
Fehlgeschlagene Instanzen wurden in die Warteschlange für den Austausch Fehlgeschlagene Instanzen in IG <instance-group-name>im Cluster <cluster-name>stehen in der Warteschlange für den Knotenaustausch.
Fehlgeschlagener Instanzaustausch in der Warteschlange ist fehlgeschlagen <cluster-name>Instanzen für den Knotenersatz in IG im <instance-group-name>Cluster konnten nicht in die Warteschlange gestellt werden.
Das Patchen der Instanzgruppe wurde abgeschlossen UpdateClusterSoftware <cluster-name>wurde für IG <instance-group-name>im Cluster erfolgreich abgeschlossen.
Der Abschluss des Patches für die Instanzgruppe ist fehlgeschlagen <cluster-name>Fehler beim Abschluss UpdateClusterSoftware für IG <instance-group-name>im Cluster.
Der Austausch des Root-Volumes wurde gestartet Der Austausch des Root-Volumes für Instance <instance-id>in IG wurde gestartet<instance-group-name>.
Der Austausch des Root-Volumes ist fehlgeschlagen Der Austausch des Root-Volumes für die Instance <instance-id>in IG konnte nicht gestartet <instance-group-name>werden.
Das Patchen der Instanz war erfolgreich Die Instanz <instance-id>in IG <instance-group-name>wurde erfolgreich aktualisiert.

EKS-specific Ereignisse

Die folgenden Ereignisse werden nur für HyperPod Cluster ausgegeben, die mit Amazon EKS orchestriert wurden.

Verwaltung von Zugangseinträgen

Veranstaltung Description
Der Vorgang zur Eingabe des SLR-Zugriffs war erfolgreich Der SLR-Zugriffseintrag für den Cluster <operation>war erfolgreich <cluster-name>
Der Vorgang zur Eingabe des SLR-Zugriffs ist fehlgeschlagen Der SLR-Zugriffseintrag ist für den Cluster <operation>fehlgeschlagen <cluster-name>
Der Vorgang mit den EKS-Zugriffseinträgen war erfolgreich Die EKS-Zugriffseinträge <operation>für den Cluster waren erfolgreich <cluster-name>
Der Vorgang mit den EKS-Zugriffseinträgen ist fehlgeschlagen Die EKS-Zugriffseinträge <operation>sind für den Cluster fehlgeschlagen <cluster-name>

Aktualisierungen der Kubernetes-Konfiguration

Veranstaltung Description
Das Kubernetes-Konfigurationsupdate war erfolgreich <instance-id><cluster-name>Die Kubernetes-Konfiguration wurde erfolgreich aktualisiert, zum Beispiel in Cluster und IG <instance-group-name>
Das Update der Kubernetes-Konfiguration ist fehlgeschlagen <instance-id><cluster-name>Die Kubernetes-Konfiguration konnte zum Beispiel in Cluster und IG nicht aktualisiert werden <instance-group-name>

Automatische Skalierung von Karpenter

Veranstaltung Description
Der Autoscaling-Vorgang war erfolgreich AutoScaling <operation><status>erfolgreich im Cluster <cluster-name>
Der Autoscaling-Vorgang ist fehlgeschlagen Fehler <operation> AutoScaling im Cluster <cluster-name>
Die Installation von Karpenter CRD war erfolgreich CustomResourceDefinition Die Installation im EKS-Cluster wurde erfolgreich abgeschlossen <cluster-name>
Die Installation von Karpenter CRD ist fehlgeschlagen CustomResourceDefinition Die Installation für EKS-Cluster ist fehlgeschlagen <cluster-name>
Die Aktualisierung der Karpenter SLR-Zugriffsrichtlinie war erfolgreich <operation><cluster-name>Zugriffsrichtlinien mit AmazonSageMakerHyperPodServiceRole Zugriffseintrag im EKS-Cluster erfolgreich
Die Aktualisierung der Karpenter SLR-Zugriffsrichtlinie ist fehlgeschlagen Fehler beim Zugriff <operation>auf Richtlinien mit AmazonSageMakerHyperPodServiceRole Zugriffseintrag im EKS-Cluster <cluster-name>

Patchen — EKS-Instanzebene

Veranstaltung Description
Die Vorbereitung des Instanz-Patches war erfolgreich Instanz <instance-id>in IG <instance-group-name>abgesperrt und Pods geräumt.
Instanz-Patching wurde übersprungen (PDB-Verstoß) UpdateClusterSoftware Zum Beispiel wurde <instance-id>in IG aufgrund von Einschränkungen <instance-group-name>übersprungen. PodDisruptionBudget
Die Vorbereitung des Instanz-Patches ist fehlgeschlagen Die Instanz konnte <instance-id>in IG <instance-group-name>für UpdateClusterSoftware nicht vorbereitet werden.
Die Instanz wurde in den planbaren Zustand zurückversetzt Die Instanz <instance-id>in IG <instance-group-name>wurde in den planbaren Zustand zurückversetzt.
Die Wiederherstellung der Instanz in den planbaren Zustand ist fehlgeschlagen Die Instanz <instance-id>in IG konnte nicht in den <instance-group-name>planbaren Zustand zurückversetzt werden.

Patchen — EKS-Rollback

Veranstaltung Description
Die Backzeit hat begonnen Die Backphase für IG <instance-group-name>im Cluster hat begonnen<cluster-name>. Alarme [<alarm-names>] werden <duration>sekundenlang überwacht.
Die Backzeit ist abgeschlossen Die Backzeit für IG <instance-group-name>im Cluster ist abgeschlossen<cluster-name>. Während der <duration>Backzeit von einer Sekunde wurden keine Alarme ausgelöst.
Der Backzeitalarm wurde ausgelöst Die Backphase für IG <instance-group-name>im Cluster ist fehlgeschlagen<cluster-name>. Alarms [<alarm-names>] ist in den ALARM-Status übergegangen. Automatisches Rollback wird initiiert.
Die Auswertung der Backzeit ist fehlgeschlagen Die Alarme konnten während der Backphase für IG <instance-group-name>im Cluster nicht ausgewertet <cluster-name>werden.
Das Rollback des Instanzgruppen-Patches wurde eingeleitet UpdateClusterSoftware <cluster-name>ist für IG <instance-group-name>im Cluster fehlgeschlagen. Rollback wird initiiert.
Das Rollback beim Patchen der Instanzgruppe ist fehlgeschlagen <instance-group-name><cluster-name>Das Rollback für IG im Cluster ist fehlgeschlagen. Einige Instanzen befinden sich möglicherweise im FailedMaintenance Status.
Das Rollback des Instanz-Patches wurde eingeleitet Die Instanz <instance-id>in IG <instance-group-name>konnte nicht aktualisiert werden. Rollback wurde eingeleitet.
Das Rollback für das Patchen der Instanz war erfolgreich. Die Instance <instance-id>in IG <instance-group-name>wurde erfolgreich auf das vorherige AMI zurückgesetzt.
Das Rollback beim Patchen der Instanz ist fehlgeschlagen. UpdateClusterSoftware <instance-id><instance-group-name>Das Rollback ist beispielsweise in IG fehlgeschlagen.

Slurm-specific Ereignisse

Die folgenden Ereignisse werden nur für HyperPod Cluster ausgegeben, die mit Slurm orchestriert wurden.

Veranstaltung Description
Bereitstellungsparameter gefunden Die Datei provisioning_parameters.json wurde im S3-Pfad für die Controller-Gruppe gefunden LifeCycleScript <instance-group-name>
Bereitstellungsparameter wurden nicht gefunden Im S3-Pfad für die Controller-Gruppe wurde kein provisioning_parameters.json gefunden LifeCycleScript <instance-group-name>
Slurm-Munge-Schlüssel erstellt Der Munge-Schlüssel wurde erfolgreich erstellt und gespeichert
Die Slurm-Drift-Validierung wurde bestanden Die Drift-Validierung der Slurm-Konfiguration wurde bestanden
Slurm-Drift erkannt Abweichung der Slurm-Konfiguration festgestellt: <drift-details>
Das Rollback des Slurm-Clusters ist abgeschlossen Die Clustererstellung ist fehlgeschlagen: Controller- und Anmeldeknoten wurden nicht innerhalb der erwarteten Zeit betriebsbereit
Die Neukonfiguration von Slurm war erfolgreich Slurm wurde erfolgreich rekonfiguriert. Die Slurm-Konfiguration wurde aktualisiert, sodass sie dem gewünschten Status entspricht

EventBridge Integration

HyperPod sendet Cluster-Ereignisse EventBridge mit drei Detailtypen an Amazon:

Art der Details Description
SageMaker HyperPod Cluster Event Betriebsereignisse für Bereitstellung, Skalierung, Patching und orchestratorspezifische Operationen. Beinhaltet die Filterung nach Schweregrad. EventLevel
SageMaker HyperPod Cluster State Change Cluster-level Statusübergänge (z. B. Erstellen zu InService). Beinhaltet die vollständige Cluster-Konfiguration.
SageMaker HyperPod Cluster Node Health Event Ereignisse zur Gesundheitsüberwachung vom HyperPod Health Monitoring Agent (HMA). Beinhaltet den Gesundheitsstatus, den Grund, die Reparaturmaßnahme und die Empfehlung.

Beispiele für Ereignismuster

Alle HyperPod Cluster-Ereignisse:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }

Nur Fehlerereignisse (zur Warnung):

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }

Ereignisse für einen bestimmten Cluster:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }

Ereignisse zum Zustand des Knotens:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }

API-Referenz

Weitere Informationen finden Sie auch unter