本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
SageMaker HyperPod 叢集事件參考
此頁面提供 Amazon SageMaker HyperPod 叢集發出之所有結構化事件的完整參考。事件提供叢集、執行個體群組和執行個體層級操作的可見性,包括佈建、擴展、修補和協調器特定的生命週期變更。
叢集事件適用於將 NodeProvisioningMode 設為 的 HyperPod 叢集Continuous。事件可透過 ListClusterEvents和 DescribeClusterEvent APIs、SageMaker AI 主控台事件索引標籤和 Amazon EventBridge 存取。
叢集事件記錄
每個叢集事件都以包含識別、時間、範圍、嚴重性和操作特定中繼資料的結構化記錄表示。下列範例顯示透過 DescribeClusterEvent API 和 Amazon EventBridge 交付的完整事件記錄:
{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }
事件記錄欄位
detail.EventDetails 物件包含下列欄位:
| 欄位 | 類型 | 必要 | 說明 |
|---|---|---|---|
EventId |
字串 (UUID) | 是 | 事件的唯一識別符。 |
ClusterArn |
String | 是 | HyperPod 叢集的 ARN。 |
ClusterName |
String | 是 | HyperPod 叢集的名稱。 |
EventTime |
時間戳記 | 是 | 事件發生的時間 (epoch 毫秒)。 |
ResourceType |
String | 是 | 事件的範圍:Cluster、 InstanceGroup或 Instance。 |
EventLevel |
String | 是 | 嚴重性分類:Warn、 Info或 Error。 |
Description |
String | 否 | 事件的人類可讀取摘要。 |
InstanceGroupName |
String | 否 | 執行個體群組名稱 (當 ResourceType為 InstanceGroup或 時顯示Instance)。 |
InstanceId |
String | 否 | EC2 執行個體 ID (當 ResourceType為 時顯示Instance)。 |
EventDetails |
物件 | 否 | 資源類型和操作特有的其他中繼資料。 |
事件層級
| Level | 意義 |
|---|---|
Info |
操作已成功完成或正常進行。 |
Warn |
操作以非關鍵問題或可能需要未來注意的條件完成。 |
Error |
操作失敗或需要立即注意。 |
資源類型
| ResourceType | Scope (範圍) | 範例事件 |
|---|---|---|
Cluster |
整個叢集操作 | 叢集建立/更新已啟動,叢集操作失敗 |
InstanceGroup |
執行個體群組操作 | 擴展已開始/已完成、修補已排程、FSx 生命週期 |
Instance |
個別執行個體操作 | EC2 佈建、生命週期指令碼執行、ENI 管理、終止 |
EventDetails 中繼資料
叢集事件包含 EventDetails 欄位內的EventMetadata物件,可提供超出事件描述所傳達的操作特定內容。的內容會因資源類型和事件類型EventMetadata而有所不同。如需完整的結構描述和支援的欄位,請參閱《Amazon SageMaker AI API 參考》中的 EventMetadata。
EventBridge 信封欄位
透過 Amazon EventBridge 交付時,事件記錄會包裝在標準 EventBridge 信封中:
| 欄位 | 說明 |
|---|---|
version |
EventBridge 結構描述版本 (一律為 "0")。 |
id |
唯一 EventBridge 事件 ID。 |
detail-type |
SageMaker HyperPod Cluster Event |
source |
aws.sagemaker |
account |
AWS 擁有叢集的帳戶 ID。 |
time |
事件的 ISO 8601 時間戳記。 |
region |
AWS 叢集所在的區域。 |
resources |
包含叢集 ARN 的陣列。 |
detail |
包含上述的EventDetails物件。 |
常見事件 (EKS 和 Slurm)
無論協調器為何,所有 HyperPod 叢集都會發出下列事件。描述欄會顯示事件記錄中Description欄位的值,如 API 回應和主控台事件索引標籤所示。
叢集生命週期
| 事件 | 說明 |
|---|---|
| 叢集操作已啟動 | 叢集 <cluster-name> <operation> 已成功啟動 |
| 叢集操作啟動失敗 | 無法啟動 Cluster <cluster-name> <operation> |
| 叢集操作已完成 | 叢集 <cluster-name> <operation> 已成功完成 |
| 叢集操作失敗 | 叢集 <cluster-name> <operation> 失敗 |
執行個體群組生命週期
| 事件 | 說明 |
|---|---|
| 執行個體群組操作已啟動 | InstanceGroup <instance-group-name> <operation> 在 Cluster <cluster-name> 中成功啟動 |
| 執行個體群組操作啟動失敗 | 無法在叢集 <cluster-name> 中啟動 InstanceGroup <instance-group-name> <operation>instance-group-name |
| 執行個體群組操作已完成 | 叢集 <cluster-name> 中的執行個體群組 <instance-group-name> <operation> 已成功完成 |
| 執行個體群組操作失敗 | 叢集 <cluster-name> 中的執行個體群組 <instance-group-name> <operation> 失敗 |
執行個體群組網路組態
| 事件 | 說明 |
|---|---|
| 找到網路組態 | 在 AZ <availability-zone> 中找到子網路 <subnet-id>,在叢集 <cluster-name> 中找到 IG <instance-group-name> 的 SecurityGroupIds <security-group-ids> |
| 網路組態失敗 | 無法處理叢集 <cluster-name> 中 IG <instance-group-name> 的執行個體群組網路組態詳細資訊 |
| 找到自訂 AMI 覆寫 | 在叢集 <cluster-name> 中找到 IG <instance-group-name> 的自訂 AMI 覆寫 <ami-id> |
| 自訂 AMI 覆寫失敗 | 無法處理叢集 <cluster-name> 中 IG <instance-group-name> 的自訂 AMI 覆寫詳細資訊 |
| 使用的平台網路組態 | 使用 HyperPod 平台為叢集 <cluster-name> 中的 IG <instance-group-name> 提供網路組態 |
| 網路組態已決定 | 已成功判斷叢集 <cluster-name> 中 IG <instance-group-name> 的執行個體群組網路組態 |
執行個體建立
| 事件 | 說明 |
|---|---|
| 執行個體操作已啟動 | 執行個體 <operation> 在叢集 <cluster-name> 和 IG <instance-group-name> 中成功啟動 |
| 執行個體操作啟動失敗 | 無法在叢集 <cluster-name> 和 IG <instance-group-name> 中啟動執行個體 <operation> |
| 找到容量保留 | 找到叢集 <cluster-name> 和 IG <instance-group-name> 的CapacityReservation ID <reservation-id>,使用預留容量 |
| 找不到容量保留 | 找不到叢集 <cluster-name> 和 IG <instance-group-name> 的CapacityReservation,請使用隨需集區 |
| 執行個體承載設定失敗 | 無法處理叢集 <cluster-name> 和 IG <instance-group-name> 的 CapacityReservationDetails |
| 已建立客戶 ENI | 在 Cluster <cluster-name> 和 IG <instance-group-name> 中成功為執行個體建立客戶 ENI |
| 客戶 ENI 建立失敗 | 無法在 Cluster <cluster-name> 和 IG <instance-group-name> 中為執行個體建立客戶 ENI |
| EC2 執行個體已佈建 | EC2 執行個體 <instance-id> 已成功佈建於叢集 <cluster-name> 和 IG <instance-group-name> |
| EC2 執行個體建立失敗 | 無法在叢集 <cluster-name> 和 IG <instance-group-name> 中佈建 EC2 執行個體 |
| 生命週期指令碼狀態已更新 | EC2 執行個體 <instance-id> 的執行個體生命週期指令碼執行具有 <status> |
| 生命週期指令碼狀態更新失敗 | 無法更新 EC2InstanceId <instance-id> 的執行個體生命週期指令碼執行狀態 |
| 使用生命週期日誌建立執行個體失敗 | EC2 執行個體 <instance-id> 的執行個體生命週期指令碼執行失敗。若要檢視生命週期指令碼日誌,請造訪日誌群組... |
| 未使用的 ENI 清除成功 | 成功刪除叢集 <cluster-name> 和 IG <instance-group-name> 中 EC2 執行個體 <instance-id> 的未使用客戶 ENIs |
| 未使用的 ENI 清除失敗 | 無法刪除叢集 <cluster-name> 和 IG <instance-group-name> 中 EC2 執行個體 <instance-id> 的未使用客戶 ENIs instance-group-name |
執行個體刪除
| 事件 | 說明 |
|---|---|
| EC2 執行個體終止進行中 | 叢集 <cluster-name> 和 IG <instance-group-name> 中目前正在終止 EC2 執行個體 <instance-id>instance-group-name |
| EC2 執行個體終止失敗 | 無法在叢集 <cluster-name> 和 IG <instance-group-name> 中終止 EC2 執行個體 <instance-id>instance-group-name |
| 已刪除客戶 ENI | 已成功刪除叢集 <cluster-name> 和 IG <instance-group-name> 中 EC2 執行個體 <instance-id> 的客戶 ENI instance-group-name |
| 客戶 ENI 刪除失敗 | 無法刪除叢集 <cluster-name> 和 IG <instance-group-name> 中的 EC2 執行個體 <instance-id> 的客戶 ENI instance-group-name |
重新啟動執行個體
| 事件 | 說明 |
|---|---|
| EC2 執行個體重新開機進行中 | 叢集 <cluster-name> 和 IG <instance-group-name> 上目前正在重新啟動 EC2 執行個體 <instance-id>instance-group-name |
| EC2 執行個體重新啟動請求失敗 | 無法在叢集 <cluster-name> 和 IG <instance-group-name> 中提交 EC2 執行個體 <instance-id> 的重新啟動請求 instance-group-name |
執行個體操作 (一般)
| 事件 | 說明 |
|---|---|
| 執行個體操作已完成 | 叢集 <cluster-name> 和 IG <instance-group-name> 中的執行個體 <operation> <instance-id> 已成功完成 |
| 執行個體操作失敗 | 叢集 <cluster-name> 和 IG <instance-group-name> 中的執行個體 <operation> <instance-id> 失敗 |
執行個體替換
| 事件 | 說明 |
|---|---|
| 執行個體替換已開始 | 執行個體 <instance-id> 開始作為叢集 <cluster-name> 和 IG <instance-group-name> 中執行個體取代的一部分 |
| 執行個體替換啟動失敗 | 在 Cluster <cluster-name> 和 IG <instance-group-name> 中,執行個體 <instance-id> 無法作為執行個體替換的一部分啟動 |
| 執行個體替換已完成 | 執行個體 <instance-id> <operation> 在叢集 <cluster-name> 和 IG <instance-group-name> 中作為執行個體取代的一部分成功完成 |
| 執行個體替換失敗 | 在 Cluster <cluster-name> 和 IG <instance-group-name> 中,執行個體 <instance-id> <operation> 作為執行個體取代的一部分失敗 |
FSx 檔案系統生命週期
| 事件 | 說明 |
|---|---|
| FSx 建立已開始 | 已針對叢集 <cluster-name> 中的 IG <instance-group-name> 開始建立 FSx |
| FSx 建立失敗 | 無法在叢集 <cluster-name> 中建立 FSx for IG <instance-group-name>instance-group-name |
| 已完成 FSx 建立 | 已成功完成叢集 <cluster-name> 中 IG <instance-group-name> 的 FSx 建立 |
| FSx 刪除已開始 | 已針對叢集 <cluster-name> 中的 IG <instance-group-name> 啟動 FSx 刪除 |
| FSx 刪除失敗 | 無法刪除叢集 <cluster-name> 中適用於 IG <instance-group-name> 的 FSx |
| 已完成 FSx 刪除 | 已成功完成叢集 <cluster-name> 中 IG <instance-group-name> 的 FSx 刪除 |
| FSx 更新已啟動 | 已針對叢集 <cluster-name> 中的 IG <instance-group-name> 啟動 FSx 更新 |
| FSx 更新失敗 | 無法在叢集 <cluster-name> 中更新 FSx for IG <instance-group-name>instance-group-name |
| 已完成 FSx 更新 | 已成功完成叢集 <cluster-name> 中 IG <instance-group-name> 的 FSx 更新 |
修補 (常見步驟)
這些修補事件會在UpdateClusterSoftware操作期間針對 EKS 和 Slurm 叢集發出。
| 事件 | 說明 |
|---|---|
| 已排程執行個體群組修補 | 叢集 <cluster-name> 中的 InstanceGroup <instance-group-name> 已排定讓 UpdateClusterSoftware 更新。 instance-group-name |
| 執行個體群組修補排程失敗 | 無法在叢集 <cluster-name> 中排程 IG <instance-group-name> 的 UpdateClusterSoftware。 instance-group-name |
| 執行個體群組修補已開始 | 使用 <strategy> 策略,針對叢集 <cluster-name> 中的 IG <instance-group-name> 啟動 UpdateClusterSoftware。 |
| 執行個體群組修補啟動失敗 | 無法在叢集 <cluster-name> 中為 IG <instance-group-name> 啟動 UpdateClusterSoftware。 instance-group-name |
| 已選取下一個修補批次 | 在叢集 <cluster-name> 中為 IG <instance-group-name> 選取的下一個更新批次。 |
| 下一個修補批次選取失敗 | 無法在叢集 <cluster-name> 中選取 IG <instance-group-name> 的下一個更新批次。 |
| 排入替換佇列的失敗執行個體 | 已排入節點取代佇列的叢集 <cluster-name> 中 IG <instance-group-name> 中的失敗執行個體。 |
| 失敗的執行個體取代佇列失敗 | 無法在叢集 <cluster-name> 的 IG <instance-group-name> 中將節點替換的執行個體排入佇列。 |
| 執行個體群組修補已完成 | UpdateClusterSoftware 已成功完成。 instance-group-name |
| 執行個體群組修補完成失敗 | 無法完成 Cluster <cluster-name> 中 IG <instance-group-name> 的 UpdateClusterSoftware。 instance-group-name |
| 根磁碟區取代已啟動 | IG <instance-group-name> 中執行個體 <instance-id> 的根磁碟區替換已開始。 |
| 根磁碟區取代失敗 | 無法啟動 IG <instance-group-name> 中執行個體 <instance-id> 的根磁碟區替換。 |
| 執行個體修補成功 | IG <instance-group-name> 中的執行個體 <instance-id> 已成功更新。 |
EKS 特定事件
只有與 Amazon EKS 協調的 HyperPod 叢集才會發出下列事件。
存取項目管理
| 事件 | 說明 |
|---|---|
| SLR 存取項目操作成功 | 叢集 <cluster-name> 的 SLR 存取項目 <operation> 成功 |
| SLR 存取項目操作失敗 | 叢集 <cluster-name> 的 SLR 存取項目 <operation> 失敗 |
| EKS 存取項目操作成功 | 叢集 <cluster-name> 的 EKS 存取項目 <operation> 成功 |
| EKS 存取項目操作失敗 | 叢集 <cluster-name> 的 EKS 存取項目 <operation> 失敗 |
Kubernetes 組態更新
| 事件 | 說明 |
|---|---|
| Kubernetes 組態更新成功 | 已成功更新 Cluster <cluster-name> 和 IG <instance-group-name> 中執行個體 <instance-id> 的 Kubernetes 組態 |
| Kubernetes 組態更新失敗 | 無法更新 Cluster <cluster-name> 和 IG <instance-group-name> 中執行個體 <instance-id> 的 Kubernetes 組態 |
Karpenter 自動擴展
| 事件 | 說明 |
|---|---|
| 自動擴展操作成功 | AutoScaling <operation> <status> 在叢集中成功 <cluster-name> |
| Autoscaling 操作失敗 | 無法 <operation> AutoScaling in Cluster <cluster-name> |
| Karpenter CRD 安裝成功 | 在 EKS 叢集 <cluster-name> 中成功完成 CustomResourceDefinition 安裝 |
| Karpenter CRD 安裝失敗 | EKS 叢集 <cluster-name> 的 CustomResourceDefinition 安裝失敗 |
| Karpenter SLR 存取政策更新成功 | EKS 叢集 <cluster-name> 中具有 AmazonSageMakerHyperPodServiceRole 存取項目的 <operation> 存取政策成功 |
| Karpenter SLR 存取政策更新失敗 | 無法在 EKS 叢集 <cluster-name> 中使用 AmazonSageMakerHyperPodServiceRole 存取項目 <operation> 存取政策 |
修補 — EKS 執行個體層級
| 事件 | 說明 |
|---|---|
| 執行個體修補準備成功 | IG <instance-group-name> 中的執行個體 <instance-id> 已封鎖並移出 Pod。 |
| 執行個體修補已略過 (PDB 違規) | 由於 PodDisruptionBudget 限制,IG <instance-group-name> 中執行個體 <instance-id> 的 UpdateClusterSoftware 已略過。 |
| 執行個體修補準備失敗 | 無法為 UpdateClusterSoftware 在 IG <instance-group-name> 中準備執行個體 <instance-id>。 |
| 執行個體還原至可排程狀態 | IG <instance-group-name> 中的執行個體 <instance-id> 已還原為可排程狀態。 |
| 執行個體還原至可排程失敗 | 無法將 IG <instance-group-name> 中的執行個體 <instance-id> 還原為可排程狀態。 |
修補 — EKS 轉返
| 事件 | 說明 |
|---|---|
| 開始的製作時間 | 在 Cluster <cluster-name> 中,IG <instance-group-name> 的製作期間已開始。監控警示 【<alarm-names>】 達 <duration> 秒。 |
| 已完成的製作時間 | 叢集 <cluster-name> 中 IG <instance-group-name> 的製作期間已完成。在 <duration>-second 製作期間沒有觸發的警示。 |
| 觸發的製作時間警示 | 叢集 <cluster-name> 中 IG <instance-group-name> 的製作期間失敗。警示 【<alarm-names>】 進入 ALARM 狀態。啟動自動轉返。 |
| 製作時間評估失敗 | 無法在叢集 <cluster-name> 中評估 IG <instance-group-name> 的製作期間警示。 |
| 執行個體群組修補復原已啟動 | 叢集 <cluster-name> 中 IG <instance-group-name> 的 UpdateClusterSoftware 失敗。 instance-group-name 啟動轉返。 |
| 執行個體群組修補復原失敗 | 叢集 <cluster-name> 中 IG <instance-group-name> 的轉返失敗。有些執行個體可能處於 FailedMaintenance 狀態。 |
| 執行個體修補復原已啟動 | IG <instance-group-name> 中的執行個體 <instance-id> 無法更新。已啟動轉返。 |
| 執行個體修補復原成功 | IG <instance-group-name> 中的執行個體 <instance-id> 已成功復原至先前的 AMI。 |
| 執行個體修補復原失敗 | IG <instance-group-name> 中執行個體 <instance-id> 的 UpdateClusterSoftware 復原失敗。 |
Slurm 特定事件
只有與 Slurm 協調的 HyperPod 叢集才會發出下列事件。
| 事件 | 說明 |
|---|---|
| 找到佈建參數 | 在控制器群組 <instance-group-name> 的 LifeCycleScript S3 路徑中找到 provisioning_parameters.json |
| 找不到佈建參數 | 在控制器群組 <instance-group-name> 的 LifeCycleScript S3 路徑中找不到 provisioning_parameters.json |
| 已建立 Slurm munge 金鑰 | 已成功建立和存放 munge 金鑰 |
| 通過 Slurm 漂移驗證 | 通過 Slurm 組態偏離驗證 |
| 偵測到碎片漂移 | 偵測到 Slurm 組態偏離:<drift-details> |
| Slurm 叢集復原已完成 | 叢集建立失敗:控制器和登入節點未在預期時間內就緒 |
| Slurm 重新設定成功 | 已成功重新設定 Slurm。已更新 Slurm 組態以符合所需的狀態 |
EventBridge 整合
HyperPod 使用三種詳細資訊類型將叢集事件傳送至 Amazon EventBridge:
| 詳細資訊類型 | 說明 |
|---|---|
SageMaker HyperPod Cluster Event |
佈建、擴展、修補和協調器特定操作的操作事件。包含 EventLevel以進行嚴重性篩選。 |
SageMaker HyperPod Cluster State Change |
叢集層級狀態轉換 (例如,建立至 InService)。包括完整的叢集組態。 |
SageMaker HyperPod Cluster Node Health
Event |
來自 HyperPod 運作狀態監控代理程式 (HMA) 的運作狀態監控事件。包括運作狀態、原因、修復動作和建議。 |
事件模式範例
所有 HyperPod 叢集事件:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }
僅限錯誤事件 (用於提醒):
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }
特定叢集的事件:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }
節點運作狀態事件:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }
API 參考
-
ListClusterEvents — 列出具有篩選、排序和分頁的事件
-
DescribeClusterEvent — 取得特定事件的完整詳細資訊
-
ClusterEventSummary — 事件摘要資料類型
-
ClusterEventDetail — 事件詳細資訊資料類型
另請參閱
-
SageMaker HyperPod Slurm 叢集事件 — 具有 CLI 用量和常見案例的 Slurm 叢集事件
-
SageMaker HyperPod EKS 叢集事件 — 具有 CLI 用量和常見案例的 EKS 叢集事件