View a markdown version of this page

SageMaker HyperPod 叢集事件參考 - Amazon SageMaker AI

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

SageMaker HyperPod 叢集事件參考

此頁面提供 Amazon SageMaker HyperPod 叢集發出之所有結構化事件的完整參考。事件提供叢集、執行個體群組和執行個體層級操作的可見性,包括佈建、擴展、修補和協調器特定的生命週期變更。

叢集事件適用於將 NodeProvisioningMode 設為 的 HyperPod 叢集Continuous。事件可透過 ListClusterEventsDescribeClusterEvent APIs、SageMaker AI 主控台事件索引標籤和 Amazon EventBridge 存取。

叢集事件記錄

每個叢集事件都以包含識別、時間、範圍、嚴重性和操作特定中繼資料的結構化記錄表示。下列範例顯示透過 DescribeClusterEvent API 和 Amazon EventBridge 交付的完整事件記錄:

{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }

事件記錄欄位

detail.EventDetails 物件包含下列欄位:

欄位 類型 必要 說明
EventId 字串 (UUID) 事件的唯一識別符。
ClusterArn String HyperPod 叢集的 ARN。
ClusterName String HyperPod 叢集的名稱。
EventTime 時間戳記 事件發生的時間 (epoch 毫秒)。
ResourceType String 事件的範圍:ClusterInstanceGroupInstance
EventLevel String 嚴重性分類:WarnInfoError
Description String 事件的人類可讀取摘要。
InstanceGroupName String 執行個體群組名稱 (當 ResourceTypeInstanceGroup或 時顯示Instance)。
InstanceId String EC2 執行個體 ID (當 ResourceType為 時顯示Instance)。
EventDetails 物件 資源類型和操作特有的其他中繼資料。

事件層級

Level 意義
Info 操作已成功完成或正常進行。
Warn 操作以非關鍵問題或可能需要未來注意的條件完成。
Error 操作失敗或需要立即注意。

資源類型

ResourceType Scope (範圍) 範例事件
Cluster 整個叢集操作 叢集建立/更新已啟動,叢集操作失敗
InstanceGroup 執行個體群組操作 擴展已開始/已完成、修補已排程、FSx 生命週期
Instance 個別執行個體操作 EC2 佈建、生命週期指令碼執行、ENI 管理、終止

EventDetails 中繼資料

叢集事件包含 EventDetails 欄位內的EventMetadata物件,可提供超出事件描述所傳達的操作特定內容。的內容會因資源類型和事件類型EventMetadata而有所不同。如需完整的結構描述和支援的欄位,請參閱《Amazon SageMaker AI API 參考》中的 EventMetadata

EventBridge 信封欄位

透過 Amazon EventBridge 交付時,事件記錄會包裝在標準 EventBridge 信封中:

欄位 說明
version EventBridge 結構描述版本 (一律為 "0")。
id 唯一 EventBridge 事件 ID。
detail-type SageMaker HyperPod Cluster Event
source aws.sagemaker
account AWS 擁有叢集的帳戶 ID。
time 事件的 ISO 8601 時間戳記。
region AWS 叢集所在的區域。
resources 包含叢集 ARN 的陣列。
detail 包含上述的EventDetails物件。

常見事件 (EKS 和 Slurm)

無論協調器為何,所有 HyperPod 叢集都會發出下列事件。描述欄會顯示事件記錄中Description欄位的值,如 API 回應和主控台事件索引標籤所示。

叢集生命週期

事件 說明
叢集操作已啟動 叢集 <cluster-name> <operation> 已成功啟動
叢集操作啟動失敗 無法啟動 Cluster <cluster-name> <operation>
叢集操作已完成 叢集 <cluster-name> <operation> 已成功完成
叢集操作失敗 叢集 <cluster-name> <operation> 失敗

執行個體群組生命週期

事件 說明
執行個體群組操作已啟動 InstanceGroup <instance-group-name> <operation> 在 Cluster <cluster-name> 中成功啟動
執行個體群組操作啟動失敗 無法在叢集 <cluster-name> 中啟動 InstanceGroup <instance-group-name> <operation>instance-group-name
執行個體群組操作已完成 叢集 <cluster-name> 中的執行個體群組 <instance-group-name> <operation> 已成功完成
執行個體群組操作失敗 叢集 <cluster-name> 中的執行個體群組 <instance-group-name> <operation> 失敗

執行個體群組網路組態

事件 說明
找到網路組態 在 AZ <availability-zone> 中找到子網路 <subnet-id>,在叢集 <cluster-name> 中找到 IG <instance-group-name> 的 SecurityGroupIds <security-group-ids>
網路組態失敗 無法處理叢集 <cluster-name> 中 IG <instance-group-name> 的執行個體群組網路組態詳細資訊
找到自訂 AMI 覆寫 在叢集 <cluster-name> 中找到 IG <instance-group-name> 的自訂 AMI 覆寫 <ami-id>
自訂 AMI 覆寫失敗 無法處理叢集 <cluster-name> 中 IG <instance-group-name> 的自訂 AMI 覆寫詳細資訊
使用的平台網路組態 使用 HyperPod 平台為叢集 <cluster-name> 中的 IG <instance-group-name> 提供網路組態
網路組態已決定 已成功判斷叢集 <cluster-name> 中 IG <instance-group-name> 的執行個體群組網路組態

執行個體建立

事件 說明
執行個體操作已啟動 執行個體 <operation> 在叢集 <cluster-name> 和 IG <instance-group-name> 中成功啟動
執行個體操作啟動失敗 無法在叢集 <cluster-name> 和 IG <instance-group-name> 中啟動執行個體 <operation>
找到容量保留 找到叢集 <cluster-name> 和 IG <instance-group-name> 的CapacityReservation ID <reservation-id>,使用預留容量
找不到容量保留 找不到叢集 <cluster-name> 和 IG <instance-group-name> 的CapacityReservation,請使用隨需集區
執行個體承載設定失敗 無法處理叢集 <cluster-name> 和 IG <instance-group-name> 的 CapacityReservationDetails
已建立客戶 ENI 在 Cluster <cluster-name> 和 IG <instance-group-name> 中成功為執行個體建立客戶 ENI
客戶 ENI 建立失敗 無法在 Cluster <cluster-name> 和 IG <instance-group-name> 中為執行個體建立客戶 ENI
EC2 執行個體已佈建 EC2 執行個體 <instance-id> 已成功佈建於叢集 <cluster-name> 和 IG <instance-group-name>
EC2 執行個體建立失敗 無法在叢集 <cluster-name> 和 IG <instance-group-name> 中佈建 EC2 執行個體
生命週期指令碼狀態已更新 EC2 執行個體 <instance-id> 的執行個體生命週期指令碼執行具有 <status>
生命週期指令碼狀態更新失敗 無法更新 EC2InstanceId <instance-id> 的執行個體生命週期指令碼執行狀態
使用生命週期日誌建立執行個體失敗 EC2 執行個體 <instance-id> 的執行個體生命週期指令碼執行失敗。若要檢視生命週期指令碼日誌,請造訪日誌群組...
未使用的 ENI 清除成功 成功刪除叢集 <cluster-name> 和 IG <instance-group-name> 中 EC2 執行個體 <instance-id> 的未使用客戶 ENIs
未使用的 ENI 清除失敗 無法刪除叢集 <cluster-name> 和 IG <instance-group-name> 中 EC2 執行個體 <instance-id> 的未使用客戶 ENIs instance-group-name

執行個體刪除

事件 說明
EC2 執行個體終止進行中 叢集 <cluster-name> 和 IG <instance-group-name> 中目前正在終止 EC2 執行個體 <instance-id>instance-group-name
EC2 執行個體終止失敗 無法在叢集 <cluster-name> 和 IG <instance-group-name> 中終止 EC2 執行個體 <instance-id>instance-group-name
已刪除客戶 ENI 已成功刪除叢集 <cluster-name> 和 IG <instance-group-name> 中 EC2 執行個體 <instance-id> 的客戶 ENI instance-group-name
客戶 ENI 刪除失敗 無法刪除叢集 <cluster-name> 和 IG <instance-group-name> 中的 EC2 執行個體 <instance-id> 的客戶 ENI instance-group-name

重新啟動執行個體

事件 說明
EC2 執行個體重新開機進行中 叢集 <cluster-name> 和 IG <instance-group-name> 上目前正在重新啟動 EC2 執行個體 <instance-id>instance-group-name
EC2 執行個體重新啟動請求失敗 無法在叢集 <cluster-name> 和 IG <instance-group-name> 中提交 EC2 執行個體 <instance-id> 的重新啟動請求 instance-group-name

執行個體操作 (一般)

事件 說明
執行個體操作已完成 叢集 <cluster-name> 和 IG <instance-group-name> 中的執行個體 <operation> <instance-id> 已成功完成
執行個體操作失敗 叢集 <cluster-name> 和 IG <instance-group-name> 中的執行個體 <operation> <instance-id> 失敗

執行個體替換

事件 說明
執行個體替換已開始 執行個體 <instance-id> 開始作為叢集 <cluster-name> 和 IG <instance-group-name> 中執行個體取代的一部分
執行個體替換啟動失敗 在 Cluster <cluster-name> 和 IG <instance-group-name> 中,執行個體 <instance-id> 無法作為執行個體替換的一部分啟動
執行個體替換已完成 執行個體 <instance-id> <operation> 在叢集 <cluster-name> 和 IG <instance-group-name> 中作為執行個體取代的一部分成功完成
執行個體替換失敗 在 Cluster <cluster-name> 和 IG <instance-group-name> 中,執行個體 <instance-id> <operation> 作為執行個體取代的一部分失敗

FSx 檔案系統生命週期

事件 說明
FSx 建立已開始 已針對叢集 <cluster-name> 中的 IG <instance-group-name> 開始建立 FSx
FSx 建立失敗 無法在叢集 <cluster-name> 中建立 FSx for IG <instance-group-name>instance-group-name
已完成 FSx 建立 已成功完成叢集 <cluster-name> 中 IG <instance-group-name> 的 FSx 建立
FSx 刪除已開始 已針對叢集 <cluster-name> 中的 IG <instance-group-name> 啟動 FSx 刪除
FSx 刪除失敗 無法刪除叢集 <cluster-name> 中適用於 IG <instance-group-name> 的 FSx
已完成 FSx 刪除 已成功完成叢集 <cluster-name> 中 IG <instance-group-name> 的 FSx 刪除
FSx 更新已啟動 已針對叢集 <cluster-name> 中的 IG <instance-group-name> 啟動 FSx 更新
FSx 更新失敗 無法在叢集 <cluster-name> 中更新 FSx for IG <instance-group-name>instance-group-name
已完成 FSx 更新 已成功完成叢集 <cluster-name> 中 IG <instance-group-name> 的 FSx 更新

修補 (常見步驟)

這些修補事件會在UpdateClusterSoftware操作期間針對 EKS 和 Slurm 叢集發出。

事件 說明
已排程執行個體群組修補 叢集 <cluster-name> 中的 InstanceGroup <instance-group-name> 已排定讓 UpdateClusterSoftware 更新。 instance-group-name
執行個體群組修補排程失敗 無法在叢集 <cluster-name> 中排程 IG <instance-group-name> 的 UpdateClusterSoftware。 instance-group-name
執行個體群組修補已開始 使用 <strategy> 策略,針對叢集 <cluster-name> 中的 IG <instance-group-name> 啟動 UpdateClusterSoftware。
執行個體群組修補啟動失敗 無法在叢集 <cluster-name> 中為 IG <instance-group-name> 啟動 UpdateClusterSoftware。 instance-group-name
已選取下一個修補批次 在叢集 <cluster-name> 中為 IG <instance-group-name> 選取的下一個更新批次。
下一個修補批次選取失敗 無法在叢集 <cluster-name> 中選取 IG <instance-group-name> 的下一個更新批次。
排入替換佇列的失敗執行個體 已排入節點取代佇列的叢集 <cluster-name> 中 IG <instance-group-name> 中的失敗執行個體。
失敗的執行個體取代佇列失敗 無法在叢集 <cluster-name> 的 IG <instance-group-name> 中將節點替換的執行個體排入佇列。
執行個體群組修補已完成 UpdateClusterSoftware 已成功完成。 instance-group-name
執行個體群組修補完成失敗 無法完成 Cluster <cluster-name> 中 IG <instance-group-name> 的 UpdateClusterSoftware。 instance-group-name
根磁碟區取代已啟動 IG <instance-group-name> 中執行個體 <instance-id> 的根磁碟區替換已開始。
根磁碟區取代失敗 無法啟動 IG <instance-group-name> 中執行個體 <instance-id> 的根磁碟區替換。
執行個體修補成功 IG <instance-group-name> 中的執行個體 <instance-id> 已成功更新。

EKS 特定事件

只有與 Amazon EKS 協調的 HyperPod 叢集才會發出下列事件。

存取項目管理

事件 說明
SLR 存取項目操作成功 叢集 <cluster-name> 的 SLR 存取項目 <operation> 成功
SLR 存取項目操作失敗 叢集 <cluster-name> 的 SLR 存取項目 <operation> 失敗
EKS 存取項目操作成功 叢集 <cluster-name> 的 EKS 存取項目 <operation> 成功
EKS 存取項目操作失敗 叢集 <cluster-name> 的 EKS 存取項目 <operation> 失敗

Kubernetes 組態更新

事件 說明
Kubernetes 組態更新成功 已成功更新 Cluster <cluster-name> 和 IG <instance-group-name> 中執行個體 <instance-id> 的 Kubernetes 組態
Kubernetes 組態更新失敗 無法更新 Cluster <cluster-name> 和 IG <instance-group-name> 中執行個體 <instance-id> 的 Kubernetes 組態

Karpenter 自動擴展

事件 說明
自動擴展操作成功 AutoScaling <operation> <status> 在叢集中成功 <cluster-name>
Autoscaling 操作失敗 無法 <operation> AutoScaling in Cluster <cluster-name>
Karpenter CRD 安裝成功 在 EKS 叢集 <cluster-name> 中成功完成 CustomResourceDefinition 安裝
Karpenter CRD 安裝失敗 EKS 叢集 <cluster-name> 的 CustomResourceDefinition 安裝失敗
Karpenter SLR 存取政策更新成功 EKS 叢集 <cluster-name> 中具有 AmazonSageMakerHyperPodServiceRole 存取項目的 <operation> 存取政策成功
Karpenter SLR 存取政策更新失敗 無法在 EKS 叢集 <cluster-name> 中使用 AmazonSageMakerHyperPodServiceRole 存取項目 <operation> 存取政策

修補 — EKS 執行個體層級

事件 說明
執行個體修補準備成功 IG <instance-group-name> 中的執行個體 <instance-id> 已封鎖並移出 Pod。
執行個體修補已略過 (PDB 違規) 由於 PodDisruptionBudget 限制,IG <instance-group-name> 中執行個體 <instance-id> 的 UpdateClusterSoftware 已略過。
執行個體修補準備失敗 無法為 UpdateClusterSoftware 在 IG <instance-group-name> 中準備執行個體 <instance-id>。
執行個體還原至可排程狀態 IG <instance-group-name> 中的執行個體 <instance-id> 已還原為可排程狀態。
執行個體還原至可排程失敗 無法將 IG <instance-group-name> 中的執行個體 <instance-id> 還原為可排程狀態。

修補 — EKS 轉返

事件 說明
開始的製作時間 在 Cluster <cluster-name> 中,IG <instance-group-name> 的製作期間已開始。監控警示 【<alarm-names>】 達 <duration> 秒。
已完成的製作時間 叢集 <cluster-name> 中 IG <instance-group-name> 的製作期間已完成。在 <duration>-second 製作期間沒有觸發的警示。
觸發的製作時間警示 叢集 <cluster-name> 中 IG <instance-group-name> 的製作期間失敗。警示 【<alarm-names>】 進入 ALARM 狀態。啟動自動轉返。
製作時間評估失敗 無法在叢集 <cluster-name> 中評估 IG <instance-group-name> 的製作期間警示。
執行個體群組修補復原已啟動 叢集 <cluster-name> 中 IG <instance-group-name> 的 UpdateClusterSoftware 失敗。 instance-group-name 啟動轉返。
執行個體群組修補復原失敗 叢集 <cluster-name> 中 IG <instance-group-name> 的轉返失敗。有些執行個體可能處於 FailedMaintenance 狀態。
執行個體修補復原已啟動 IG <instance-group-name> 中的執行個體 <instance-id> 無法更新。已啟動轉返。
執行個體修補復原成功 IG <instance-group-name> 中的執行個體 <instance-id> 已成功復原至先前的 AMI。
執行個體修補復原失敗 IG <instance-group-name> 中執行個體 <instance-id> 的 UpdateClusterSoftware 復原失敗。

Slurm 特定事件

只有與 Slurm 協調的 HyperPod 叢集才會發出下列事件。

事件 說明
找到佈建參數 在控制器群組 <instance-group-name> 的 LifeCycleScript S3 路徑中找到 provisioning_parameters.json
找不到佈建參數 在控制器群組 <instance-group-name> 的 LifeCycleScript S3 路徑中找不到 provisioning_parameters.json
已建立 Slurm munge 金鑰 已成功建立和存放 munge 金鑰
通過 Slurm 漂移驗證 通過 Slurm 組態偏離驗證
偵測到碎片漂移 偵測到 Slurm 組態偏離:<drift-details>
Slurm 叢集復原已完成 叢集建立失敗:控制器和登入節點未在預期時間內就緒
Slurm 重新設定成功 已成功重新設定 Slurm。已更新 Slurm 組態以符合所需的狀態

EventBridge 整合

HyperPod 使用三種詳細資訊類型將叢集事件傳送至 Amazon EventBridge:

詳細資訊類型 說明
SageMaker HyperPod Cluster Event 佈建、擴展、修補和協調器特定操作的操作事件。包含 EventLevel以進行嚴重性篩選。
SageMaker HyperPod Cluster State Change 叢集層級狀態轉換 (例如,建立至 InService)。包括完整的叢集組態。
SageMaker HyperPod Cluster Node Health Event 來自 HyperPod 運作狀態監控代理程式 (HMA) 的運作狀態監控事件。包括運作狀態、原因、修復動作和建議。

事件模式範例

所有 HyperPod 叢集事件:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }

僅限錯誤事件 (用於提醒):

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }

特定叢集的事件:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }

節點運作狀態事件:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }

API 參考

另請參閱