Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
SageMaker HyperPod Referenz zu Cluster-Ereignissen
Diese Seite bietet eine vollständige Referenz aller strukturierten Ereignisse, die von SageMaker HyperPod Amazon-Clustern ausgelöst werden. Ereignisse bieten Einblick in Abläufe auf Cluster-, Instanzgruppen- und Instanzebene, einschließlich Bereitstellung, Skalierung, Patching und orchestratorspezifischen Lebenszyklusänderungen.
Cluster-Ereignisse sind für Cluster mit der Einstellung auf verfügbar. HyperPod NodeProvisioningMode Continuous Auf Ereignisse kann über die DescribeClusterEvent APIs ListClusterEvents und, die Registerkarte Ereignisse der SageMaker AI-Konsole und Amazon zugegriffen EventBridge werden.
Aufzeichnung der Cluster-Ereignisse
Jedes Clusterereignis wird als strukturierter Datensatz dargestellt, der Identifikation, Zeitpunkt, Umfang, Schweregrad und betriebsspezifische Metadaten enthält. Das folgende Beispiel zeigt einen vollständigen Ereignisdatensatz, wie er über die DescribeClusterEvent API und Amazon bereitgestellt wurde EventBridge:
{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }
Felder für Ereignisdatensätze
Das detail.EventDetails-Objekt enthält die folgenden Felder:
| Feld | Typ | Erforderlich | Description |
|---|---|---|---|
EventId |
Zeichenfolge (UUID) | Ja | Eindeutiger Bezeichner für das Ereignis. |
ClusterArn |
Zeichenfolge | Ja | ARN des HyperPod Clusters. |
ClusterName |
Zeichenfolge | Ja | Name des HyperPod Clusters. |
EventTime |
Zeitstempel | Ja | Wann das Ereignis eingetreten ist (Epochen-Millisekunden). |
ResourceType |
Zeichenfolge | Ja | Umfang des Ereignisses:Cluster,, oder. InstanceGroup Instance |
EventLevel |
Zeichenfolge | Ja | Klassifizierung des Schweregrads: InfoWarn,, oderError. |
Description |
Zeichenfolge | Nein | Human-readable Zusammenfassung des Ereignisses. |
InstanceGroupName |
Zeichenfolge | Nein | Name der Instanzgruppe (vorhanden, wenn InstanceGroup oder ResourceType istInstance). |
InstanceId |
Zeichenfolge | Nein | EC2-Instanz-ID (vorhanden, wenn sie ResourceType istInstance). |
EventDetails |
Objekt | Nein | Zusätzliche Metadaten, die für den Ressourcentyp und den Vorgang spezifisch sind. |
Ebenen der Ereignisse
| Level | Bedeutung |
|---|---|
Info |
Der Vorgang wurde erfolgreich abgeschlossen oder läuft normal. |
Warn |
Der Vorgang wurde mit einem nicht kritischen Problem oder einem Zustand abgeschlossen, der möglicherweise in future behoben werden muss. |
Error |
Der Vorgang ist fehlgeschlagen oder erfordert sofortige Maßnahmen. |
Ressourcentypen
| ResourceType | Scope | Beispielereignisse |
|---|---|---|
Cluster |
Whole-cluster Operationen | Der Cluster creation/update wurde gestartet, der Clustervorgang ist fehlgeschlagen |
InstanceGroup |
Operationen für Instanzgruppen | Skalierung started/completed, geplantes Patchen, FSx-Lebenszyklus |
Instance |
Operationen einzelner Instanzen | EC2-Bereitstellung, Ausführung von Lifecycle-Skripten, ENI-Management, Kündigung |
EventDetails Metadaten
Clusterereignisse enthalten ein EventMetadata Objekt innerhalb des EventDetails Felds, das einen betriebsspezifischen Kontext bietet, der über das hinausgeht, was die Ereignisbeschreibung vermittelt. Der Inhalt von EventMetadata variiert je nach Ressourcentyp und Ereignistyp. Das vollständige Schema und die unterstützten Felder finden Sie EventMetadatain der Amazon SageMaker AI API-Referenz.
EventBridge Umschlagfelder
Bei der Lieferung über Amazon EventBridge ist die Veranstaltungsaufzeichnung in einem EventBridge Standardumschlag verpackt:
| Feld | Description |
|---|---|
version |
EventBridge Schemaversion (immer"0"). |
id |
Eindeutige EventBridge Ereignis-ID. |
detail-type |
SageMaker HyperPod Cluster Event |
source |
aws.sagemaker |
account |
AWS Konto-ID, der der Cluster gehört. |
time |
ISO 8601-Zeitstempel des Ereignisses. |
region |
AWS Region, in der sich der Cluster befindet. |
resources |
Array, das den Cluster-ARN enthält. |
detail |
Enthält das oben beschriebene EventDetails Objekt. |
Allgemeine Ereignisse (EKS und Slurm)
Die folgenden Ereignisse werden für alle HyperPod Cluster unabhängig vom Orchestrator ausgelöst. In der Spalte Beschreibung wird der Wert des Description Felds im Ereignisdatensatz so angezeigt, wie er in der API-Antwort und auf der Registerkarte Ereignisse der Konsole angezeigt wird.
Cluster-Lebenszyklus
| Veranstaltung | Description |
|---|---|
| Der Clusterbetrieb wurde gestartet | Der Cluster <cluster-name><operation>wurde erfolgreich gestartet |
| Der Start des Clustervorgangs ist fehlgeschlagen | Cluster konnte nicht gestartet werden <cluster-name><operation> |
| Der Clustervorgang wurde abgeschlossen | Der Cluster <cluster-name><operation>wurde erfolgreich abgeschlossen |
| Der Clustervorgang ist fehlgeschlagen | Der Cluster <cluster-name><operation>ist fehlgeschlagen |
Lebenszyklus der Instanzgruppe
| Veranstaltung | Description |
|---|---|
| Der Vorgang der Instanzgruppe wurde gestartet | InstanceGroup <instance-group-name><operation>wurde erfolgreich im Cluster gestartet <cluster-name> |
| Der Start des Instanzgruppenvorgangs ist fehlgeschlagen | Der Start InstanceGroup <instance-group-name><operation>im Cluster ist fehlgeschlagen <cluster-name> |
| Der Vorgang der Instanzgruppe wurde abgeschlossen | Die Instanzgruppe <instance-group-name><operation>im Cluster <cluster-name>wurde erfolgreich abgeschlossen |
| Der Vorgang der Instanzgruppe ist fehlgeschlagen | Die Instanzgruppe <instance-group-name><operation>im Cluster <cluster-name>ist fehlgeschlagen |
Netzwerkkonfiguration der Instanzgruppe
| Veranstaltung | Description |
|---|---|
| Netzwerkkonfiguration gefunden | Subnetz <subnet-id>in AZ <availability-zone>mit SecurityGroupIds <security-group-ids>für IG <instance-group-name>im Cluster gefunden <cluster-name> |
| Die Netzwerkkonfiguration ist fehlgeschlagen | Die Netzwerkkonfigurationsdetails der Instanzgruppe für IG <instance-group-name>im Cluster konnten nicht verarbeitet werden <cluster-name> |
| Benutzerdefinierte AMI-Überschreibung gefunden | Benutzerdefinierte AMI-Überschreibung <ami-id>für IG <instance-group-name>im Cluster gefunden <cluster-name> |
| Benutzerdefiniertes AMI-Override ist fehlgeschlagen | Fehler beim Verarbeiten der benutzerdefinierten AMI-Override-Details für IG <instance-group-name>im Cluster <cluster-name> |
| Die verwendete Plattform-Netzwerkkonfiguration | Verwendung der von der HyperPod Plattform bereitgestellten Netzwerkkonfiguration für IG <instance-group-name>im Cluster <cluster-name> |
| Die Netzwerkkonfiguration wurde ermittelt | Die Netzwerkkonfiguration der Instanzgruppe für IG <instance-group-name>im Cluster wurde erfolgreich ermittelt <cluster-name> |
Instanzerstellung
| Veranstaltung | Description |
|---|---|
| Der Instanzvorgang wurde gestartet | Die Instanz <operation>wurde erfolgreich in Cluster <cluster-name>und IG gestartet <instance-group-name> |
| Der Start des Instanzvorgangs ist fehlgeschlagen | Die Instanz konnte nicht <operation>in Cluster <cluster-name>und IG gestartet werden <instance-group-name> |
| Kapazitätsreservierung gefunden | CapacityReservation ID <reservation-id>für Cluster <cluster-name>und IG gefunden<instance-group-name>, wobei reservierte Kapazität verwendet wird |
| Die Kapazitätsreservierung wurde nicht gefunden | Für Cluster <cluster-name>und IG<instance-group-name>, die den On-Demand-Pool verwenden, wurde nichts CapacityReservation gefunden |
| Die Einrichtung der Instanz-Payload ist fehlgeschlagen | Die Verarbeitung CapacityReservationDetails für Cluster <cluster-name>und IG konnte nicht durchgeführt werden <instance-group-name> |
| Der Kunde wurde von ENI erstellt | Der Kunde ENI wurde erfolgreich erstellt, zum Beispiel in Cluster <cluster-name>und IG <instance-group-name> |
| Die Erstellung des Kunden-ENI ist fehlgeschlagen | Kunden-ENI konnte beispielsweise nicht in Cluster <cluster-name>und IG erstellt werden <instance-group-name> |
| EC2-Instanz wurde bereitgestellt | <cluster-name>Die EC2-Instance <instance-id>wurde erfolgreich in Cluster und IG bereitgestellt <instance-group-name> |
| Die Erstellung der EC2-Instanz ist fehlgeschlagen | <cluster-name>Die EC2-Instance konnte nicht in Cluster und IG bereitgestellt werden <instance-group-name> |
| Status des Lebenszyklus-Skripts aktualisiert | <instance-id>Die Ausführung des Instanzlebenszyklus-Skripts für die EC2-Instance hat <status> |
| Die Aktualisierung des Lebenszyklus-Skripts ist fehlgeschlagen | Der Ausführungsstatus des Instanzlebenszyklus-Skripts für konnte nicht aktualisiert werden EC2InstanceId <instance-id> |
| Fehler bei der Instanzerstellung mit Lebenszyklusprotokollen | Die Ausführung des Instanzlebenszyklus-Skripts für die EC2-Instance <instance-id>ist fehlgeschlagen. Um Lifecycle-Skriptprotokolle einzusehen, besuchen Sie die Protokollgruppe... |
| Die Säuberung ungenutzter ENI war erfolgreich | <cluster-name>Ungenutzte Kunden-ENIs für EC2-Instance <instance-id>in Cluster und IG wurden erfolgreich gelöscht <instance-group-name> |
| Die Säuberung ungenutzter ENI ist fehlgeschlagen | <cluster-name>Ungenutzte Kunden-ENIs für EC2-Instance <instance-id>in Cluster und IG konnten nicht gelöscht werden <instance-group-name> |
Löschen der Instanz
| Veranstaltung | Description |
|---|---|
| Die EC2-Instance wird gerade beendet | <cluster-name>Die Kündigung der EC2-Instance <instance-id>wird derzeit in Cluster und IG ausgeführt <instance-group-name> |
| Die Kündigung der EC2-Instance ist fehlgeschlagen | <cluster-name>Die EC2-Instance <instance-id>in Cluster und IG konnte nicht beendet werden <instance-group-name> |
| Kunden-ENI wurde gelöscht | Kunde ENI wurde erfolgreich für EC2-Instance <instance-id>in Cluster <cluster-name>und IG gelöscht <instance-group-name> |
| Das Löschen der Kunden-ENI ist fehlgeschlagen | Kunden-ENI für EC2-Instance <instance-id>in Cluster <cluster-name>und IG konnte nicht gelöscht werden <instance-group-name> |
Instance-Neustart
| Veranstaltung | Description |
|---|---|
| Der Neustart der EC2-Instance ist im Gange | <cluster-name>Der Neustart der EC2-Instance <instance-id>wird derzeit auf Cluster und IG durchgeführt <instance-group-name> |
| Die Anfrage zum Neustart der EC2-Instance ist fehlgeschlagen | <cluster-name>Die Neustartanfrage für die EC2-Instance <instance-id>in Cluster und IG konnte nicht gesendet werden <instance-group-name> |
Instanzbetrieb (generisch)
| Veranstaltung | Description |
|---|---|
| Der Instanzvorgang wurde abgeschlossen | Die Instanz <operation><instance-id>in Cluster <cluster-name>und IG <instance-group-name>wurde erfolgreich abgeschlossen |
| Der Instanzvorgang ist fehlgeschlagen | Die Instanz <operation><instance-id>in Cluster <cluster-name>und IG ist <instance-group-name>fehlgeschlagen |
Ersatz der Instanz
| Veranstaltung | Description |
|---|---|
| Der Austausch der Instanz wurde gestartet | <instance-id>Die Instanz wird im Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG gestartet <instance-group-name> |
| Der Start des Instanzaustauschs ist fehlgeschlagen | Die Instanz <instance-id>konnte im Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG nicht gestartet werden <instance-group-name> |
| Der Austausch der Instanz wurde abgeschlossen | Die Instanz wurde im <instance-id><operation>Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG erfolgreich abgeschlossen <instance-group-name> |
| Der Austausch der Instanz ist fehlgeschlagen | Die Instanz <instance-id><operation>ist im Rahmen des Instanzaustauschs in Cluster <cluster-name>und IG ausgefallen <instance-group-name> |
Lebenszyklus FSx FSx-Dateisystems
| Veranstaltung | Description |
|---|---|
| Die FSx-Erstellung wurde gestartet | Die FSx-Erstellung für IG <instance-group-name>im Cluster wurde gestartet <cluster-name> |
| FSx-Erstellung ist fehlgeschlagen | FSx für IG konnte nicht <instance-group-name>im Cluster erstellt werden <cluster-name> |
| FSx-Erstellung abgeschlossen | FSx-Erstellung für IG <instance-group-name>im Cluster erfolgreich abgeschlossen <cluster-name> |
| Das Löschen von FSx wurde gestartet | Das Löschen von FSx wurde für IG <instance-group-name>im Cluster gestartet <cluster-name> |
| Das Löschen von FSx ist fehlgeschlagen | FSx für IG <instance-group-name>im Cluster konnte nicht gelöscht werden <cluster-name> |
| FSx-Löschung abgeschlossen | FSx-Löschung für IG <instance-group-name>im Cluster erfolgreich abgeschlossen <cluster-name> |
| FSx-Update gestartet | FSx-Update für IG <instance-group-name>im Cluster gestartet <cluster-name> |
| FSx-Update ist fehlgeschlagen | FSx für IG <instance-group-name>im Cluster konnte nicht aktualisiert werden <cluster-name> |
| FSx-Update abgeschlossen | FSx-Update für IG <instance-group-name>im Cluster erfolgreich abgeschlossen <cluster-name> |
Patchen (allgemeine Schritte)
Diese Patching-Ereignisse werden während des Betriebs sowohl für EKS- als auch für Slurm-Cluster ausgelöst. UpdateClusterSoftware
| Veranstaltung | Description |
|---|---|
| Patches für Instanzgruppen sind geplant | InstanceGroup <instance-group-name>im Cluster <cluster-name>wurde auf den neuesten Stand UpdateClusterSoftware gebracht. |
| Der Zeitplan für das Patchen der Instanzgruppe ist fehlgeschlagen | <cluster-name>Fehler beim Planen UpdateClusterSoftware für IG <instance-group-name>im Cluster. |
| Das Patchen der Instanzgruppe wurde gestartet | UpdateClusterSoftware wurde <instance-group-name><cluster-name>mithilfe der <strategy>Strategie für IG im Cluster initiiert. |
| Der Start des Instanzgruppen-Patches ist fehlgeschlagen | <cluster-name>Fehler beim UpdateClusterSoftware Initiieren von IG <instance-group-name>im Cluster. |
| Nächster Patch-Batch ausgewählt | <cluster-name>Der nächste Update-Batch wurde für IG <instance-group-name>im Cluster ausgewählt. |
| Die Auswahl des nächsten Patch-Batches ist fehlgeschlagen | <cluster-name>Der nächste Update-Batch für IG <instance-group-name>im Cluster konnte nicht ausgewählt werden. |
| Fehlgeschlagene Instanzen wurden in die Warteschlange für den Austausch | Fehlgeschlagene Instanzen in IG <instance-group-name>im Cluster <cluster-name>stehen in der Warteschlange für den Knotenaustausch. |
| Fehlgeschlagener Instanzaustausch in der Warteschlange ist fehlgeschlagen | <cluster-name>Instanzen für den Knotenersatz in IG im <instance-group-name>Cluster konnten nicht in die Warteschlange gestellt werden. |
| Das Patchen der Instanzgruppe wurde abgeschlossen | UpdateClusterSoftware <cluster-name>wurde für IG <instance-group-name>im Cluster erfolgreich abgeschlossen. |
| Der Abschluss des Patches für die Instanzgruppe ist fehlgeschlagen | <cluster-name>Fehler beim Abschluss UpdateClusterSoftware für IG <instance-group-name>im Cluster. |
| Der Austausch des Root-Volumes wurde gestartet | Der Austausch des Root-Volumes für Instance <instance-id>in IG wurde gestartet<instance-group-name>. |
| Der Austausch des Root-Volumes ist fehlgeschlagen | Der Austausch des Root-Volumes für die Instance <instance-id>in IG konnte nicht gestartet <instance-group-name>werden. |
| Das Patchen der Instanz war erfolgreich | Die Instanz <instance-id>in IG <instance-group-name>wurde erfolgreich aktualisiert. |
EKS-specific Ereignisse
Die folgenden Ereignisse werden nur für HyperPod Cluster ausgegeben, die mit Amazon EKS orchestriert wurden.
Verwaltung von Zugangseinträgen
| Veranstaltung | Description |
|---|---|
| Der Vorgang zur Eingabe des SLR-Zugriffs war erfolgreich | Der SLR-Zugriffseintrag für den Cluster <operation>war erfolgreich <cluster-name> |
| Der Vorgang zur Eingabe des SLR-Zugriffs ist fehlgeschlagen | Der SLR-Zugriffseintrag ist für den Cluster <operation>fehlgeschlagen <cluster-name> |
| Der Vorgang mit den EKS-Zugriffseinträgen war erfolgreich | Die EKS-Zugriffseinträge <operation>für den Cluster waren erfolgreich <cluster-name> |
| Der Vorgang mit den EKS-Zugriffseinträgen ist fehlgeschlagen | Die EKS-Zugriffseinträge <operation>sind für den Cluster fehlgeschlagen <cluster-name> |
Aktualisierungen der Kubernetes-Konfiguration
| Veranstaltung | Description |
|---|---|
| Das Kubernetes-Konfigurationsupdate war erfolgreich | <instance-id><cluster-name>Die Kubernetes-Konfiguration wurde erfolgreich aktualisiert, zum Beispiel in Cluster und IG <instance-group-name> |
| Das Update der Kubernetes-Konfiguration ist fehlgeschlagen | <instance-id><cluster-name>Die Kubernetes-Konfiguration konnte zum Beispiel in Cluster und IG nicht aktualisiert werden <instance-group-name> |
Automatische Skalierung von Karpenter
| Veranstaltung | Description |
|---|---|
| Der Autoscaling-Vorgang war erfolgreich | AutoScaling <operation><status>erfolgreich im Cluster <cluster-name> |
| Der Autoscaling-Vorgang ist fehlgeschlagen | Fehler <operation> AutoScaling im Cluster <cluster-name> |
| Die Installation von Karpenter CRD war erfolgreich | CustomResourceDefinition Die Installation im EKS-Cluster wurde erfolgreich abgeschlossen <cluster-name> |
| Die Installation von Karpenter CRD ist fehlgeschlagen | CustomResourceDefinition Die Installation für EKS-Cluster ist fehlgeschlagen <cluster-name> |
| Die Aktualisierung der Karpenter SLR-Zugriffsrichtlinie war erfolgreich | <operation><cluster-name>Zugriffsrichtlinien mit AmazonSageMakerHyperPodServiceRole Zugriffseintrag im EKS-Cluster erfolgreich |
| Die Aktualisierung der Karpenter SLR-Zugriffsrichtlinie ist fehlgeschlagen | Fehler beim Zugriff <operation>auf Richtlinien mit AmazonSageMakerHyperPodServiceRole Zugriffseintrag im EKS-Cluster <cluster-name> |
Patchen — EKS-Instanzebene
| Veranstaltung | Description |
|---|---|
| Die Vorbereitung des Instanz-Patches war erfolgreich | Instanz <instance-id>in IG <instance-group-name>abgesperrt und Pods geräumt. |
| Instanz-Patching wurde übersprungen (PDB-Verstoß) | UpdateClusterSoftware Zum Beispiel wurde <instance-id>in IG aufgrund von Einschränkungen <instance-group-name>übersprungen. PodDisruptionBudget |
| Die Vorbereitung des Instanz-Patches ist fehlgeschlagen | Die Instanz konnte <instance-id>in IG <instance-group-name>für UpdateClusterSoftware nicht vorbereitet werden. |
| Die Instanz wurde in den planbaren Zustand zurückversetzt | Die Instanz <instance-id>in IG <instance-group-name>wurde in den planbaren Zustand zurückversetzt. |
| Die Wiederherstellung der Instanz in den planbaren Zustand ist fehlgeschlagen | Die Instanz <instance-id>in IG konnte nicht in den <instance-group-name>planbaren Zustand zurückversetzt werden. |
Patchen — EKS-Rollback
| Veranstaltung | Description |
|---|---|
| Die Backzeit hat begonnen | Die Backphase für IG <instance-group-name>im Cluster hat begonnen<cluster-name>. Alarme [<alarm-names>] werden <duration>sekundenlang überwacht. |
| Die Backzeit ist abgeschlossen | Die Backzeit für IG <instance-group-name>im Cluster ist abgeschlossen<cluster-name>. Während der <duration>Backzeit von einer Sekunde wurden keine Alarme ausgelöst. |
| Der Backzeitalarm wurde ausgelöst | Die Backphase für IG <instance-group-name>im Cluster ist fehlgeschlagen<cluster-name>. Alarms [<alarm-names>] ist in den ALARM-Status übergegangen. Automatisches Rollback wird initiiert. |
| Die Auswertung der Backzeit ist fehlgeschlagen | Die Alarme konnten während der Backphase für IG <instance-group-name>im Cluster nicht ausgewertet <cluster-name>werden. |
| Das Rollback des Instanzgruppen-Patches wurde eingeleitet | UpdateClusterSoftware <cluster-name>ist für IG <instance-group-name>im Cluster fehlgeschlagen. Rollback wird initiiert. |
| Das Rollback beim Patchen der Instanzgruppe ist fehlgeschlagen | <instance-group-name><cluster-name>Das Rollback für IG im Cluster ist fehlgeschlagen. Einige Instanzen befinden sich möglicherweise im FailedMaintenance Status. |
| Das Rollback des Instanz-Patches wurde eingeleitet | Die Instanz <instance-id>in IG <instance-group-name>konnte nicht aktualisiert werden. Rollback wurde eingeleitet. |
| Das Rollback für das Patchen der Instanz war erfolgreich. | Die Instance <instance-id>in IG <instance-group-name>wurde erfolgreich auf das vorherige AMI zurückgesetzt. |
| Das Rollback beim Patchen der Instanz ist fehlgeschlagen. | UpdateClusterSoftware <instance-id><instance-group-name>Das Rollback ist beispielsweise in IG fehlgeschlagen. |
Slurm-specific Ereignisse
Die folgenden Ereignisse werden nur für HyperPod Cluster ausgegeben, die mit Slurm orchestriert wurden.
| Veranstaltung | Description |
|---|---|
| Bereitstellungsparameter gefunden | Die Datei provisioning_parameters.json wurde im S3-Pfad für die Controller-Gruppe gefunden LifeCycleScript <instance-group-name> |
| Bereitstellungsparameter wurden nicht gefunden | Im S3-Pfad für die Controller-Gruppe wurde kein provisioning_parameters.json gefunden LifeCycleScript <instance-group-name> |
| Slurm-Munge-Schlüssel erstellt | Der Munge-Schlüssel wurde erfolgreich erstellt und gespeichert |
| Die Slurm-Drift-Validierung wurde bestanden | Die Drift-Validierung der Slurm-Konfiguration wurde bestanden |
| Slurm-Drift erkannt | Abweichung der Slurm-Konfiguration festgestellt: <drift-details> |
| Das Rollback des Slurm-Clusters ist abgeschlossen | Die Clustererstellung ist fehlgeschlagen: Controller- und Anmeldeknoten wurden nicht innerhalb der erwarteten Zeit betriebsbereit |
| Die Neukonfiguration von Slurm war erfolgreich | Slurm wurde erfolgreich rekonfiguriert. Die Slurm-Konfiguration wurde aktualisiert, sodass sie dem gewünschten Status entspricht |
EventBridge Integration
HyperPod sendet Cluster-Ereignisse EventBridge mit drei Detailtypen an Amazon:
| Art der Details | Description |
|---|---|
SageMaker HyperPod Cluster Event |
Betriebsereignisse für Bereitstellung, Skalierung, Patching und orchestratorspezifische Operationen. Beinhaltet die Filterung nach Schweregrad. EventLevel |
SageMaker HyperPod Cluster State Change |
Cluster-level Statusübergänge (z. B. Erstellen zu InService). Beinhaltet die vollständige Cluster-Konfiguration. |
SageMaker HyperPod Cluster Node Health
Event |
Ereignisse zur Gesundheitsüberwachung vom HyperPod Health Monitoring Agent (HMA). Beinhaltet den Gesundheitsstatus, den Grund, die Reparaturmaßnahme und die Empfehlung. |
Beispiele für Ereignismuster
Alle HyperPod Cluster-Ereignisse:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }
Nur Fehlerereignisse (zur Warnung):
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }
Ereignisse für einen bestimmten Cluster:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }
Ereignisse zum Zustand des Knotens:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }
API-Referenz
-
ListClusterEvents— Ereignisse mit Filterung, Sortierung und Paginierung auflisten
-
DescribeClusterEvent— Holen Sie sich alle Informationen zu einem bestimmten Ereignis
-
ClusterEventSummary— Datentyp „Zusammenfassung der Ereignisse“
-
ClusterEventDetail— Datentyp für Ereignisdetails
Weitere Informationen finden Sie auch unter
-
SageMaker HyperPod Slurm-Cluster-Ereignisse— Slurm-Cluster-Ereignisse mit CLI-Nutzung und gängigen Szenarien
-
SageMaker HyperPod EKS-Cluster-Ereignisse— EKS-Cluster-Ereignisse mit CLI-Nutzung und gängigen Szenarien