

本文為英文版的機器翻譯版本，如內容有任何歧義或不一致之處，概以英文版為準。

# SageMaker HyperPod 叢集事件參考
<a name="sagemaker-hyperpod-cluster-events-reference"></a>

此頁面提供 Amazon SageMaker HyperPod 叢集發出之所有結構化事件的完整參考。事件提供叢集、執行個體群組和執行個體層級操作的可見性，包括佈建、擴展、修補和協調器特定的生命週期變更。

叢集事件適用於將 `NodeProvisioningMode` 設為 的 HyperPod 叢集`Continuous`。事件可透過 `ListClusterEvents`和 `DescribeClusterEvent` APIs、SageMaker AI 主控台**事件**索引標籤和 Amazon EventBridge 存取。

## 叢集事件記錄
<a name="sagemaker-hyperpod-cluster-events-record"></a>

每個叢集事件都以包含識別、時間、範圍、嚴重性和操作特定中繼資料的結構化記錄表示。下列範例顯示透過 `DescribeClusterEvent` API 和 Amazon EventBridge 交付的完整事件記錄：

```
{
  "version": "0",
  "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c",
  "detail-type": "SageMaker HyperPod Cluster Event",
  "source": "aws.sagemaker",
  "account": "111122223333",
  "time": "2026-06-01T17:20:25Z",
  "region": "us-west-2",
  "resources": [
    "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster"
  ],
  "detail": {
    "EventDetails": {
      "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205",
      "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster",
      "ClusterName": "sample-cluster",
      "InstanceGroupName": "p5Inst",
      "InstanceId": "i-0391f86fa0fe0d465",
      "ResourceType": "Instance",
      "EventTime": 1748794825350,
      "EventLevel": "Error",
      "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed",
      "EventDetails": {
        "EventMetadata": {
          "Instance": {
            "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.",
            "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e"
          }
        }
      }
    }
  }
}
```

### 事件記錄欄位
<a name="sagemaker-hyperpod-cluster-events-record-fields"></a>

`detail.EventDetails` 物件包含下列欄位：


| 欄位 | 類型 | 必要 | 說明 | 
| --- | --- | --- | --- | 
| EventId | 字串 (UUID) | 是 | 事件的唯一識別符。 | 
| ClusterArn | String | 是 | HyperPod 叢集的 ARN。 | 
| ClusterName | String | 是 | HyperPod 叢集的名稱。 | 
| EventTime | 時間戳記 | 是 | 事件發生的時間 (epoch 毫秒）。 | 
| ResourceType | String | 是 | 事件的範圍：Cluster、 InstanceGroup或 Instance。 | 
| EventLevel | String | 是 | 嚴重性分類：Warn、 Info或 Error。 | 
| Description | String | 否 | 事件的人類可讀取摘要。 | 
| InstanceGroupName | String | 否 | 執行個體群組名稱 （當 ResourceType為 InstanceGroup或 時顯示Instance)。 | 
| InstanceId | String | 否 | EC2 執行個體 ID （當 ResourceType為 時顯示Instance)。 | 
| EventDetails | 物件 | 否 | 資源類型和操作特有的其他中繼資料。 | 

### 事件層級
<a name="sagemaker-hyperpod-cluster-events-levels"></a>


| Level | 意義 | 
| --- | --- | 
| Info | 操作已成功完成或正常進行。 | 
| Warn | 操作以非關鍵問題或可能需要未來注意的條件完成。 | 
| Error | 操作失敗或需要立即注意。 | 

### 資源類型
<a name="sagemaker-hyperpod-cluster-events-resource-types"></a>


| ResourceType | Scope (範圍) | 範例事件 | 
| --- | --- | --- | 
| Cluster | 整個叢集操作 | 叢集建立/更新已啟動，叢集操作失敗 | 
| InstanceGroup | 執行個體群組操作 | 擴展已開始/已完成、修補已排程、FSx 生命週期 | 
| Instance | 個別執行個體操作 | EC2 佈建、生命週期指令碼執行、ENI 管理、終止 | 

### EventDetails 中繼資料
<a name="sagemaker-hyperpod-cluster-events-metadata"></a>

叢集事件包含 `EventDetails` 欄位內的`EventMetadata`物件，可提供超出事件描述所傳達的操作特定內容。的內容會因資源類型和事件類型`EventMetadata`而有所不同。如需完整的結構描述和支援的欄位，請參閱《Amazon SageMaker AI API 參考》中的 [EventMetadata](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_EventMetadata.html)。

### EventBridge 信封欄位
<a name="sagemaker-hyperpod-cluster-events-eventbridge-envelope"></a>

透過 Amazon EventBridge 交付時，事件記錄會包裝在標準 EventBridge 信封中：


| 欄位 | 說明 | 
| --- | --- | 
| version | EventBridge 結構描述版本 （一律為 "0")。 | 
| id | 唯一 EventBridge 事件 ID。 | 
| detail-type | SageMaker HyperPod Cluster Event | 
| source | aws.sagemaker | 
| account | AWS 擁有叢集的帳戶 ID。 | 
| time | 事件的 ISO 8601 時間戳記。 | 
| region | AWS 叢集所在的區域。 | 
| resources | 包含叢集 ARN 的陣列。 | 
| detail | 包含上述的EventDetails物件。 | 

## 常見事件 (EKS 和 Slurm)
<a name="sagemaker-hyperpod-cluster-events-common"></a>

無論協調器為何，所有 HyperPod 叢集都會發出下列事件。**描述**欄會顯示事件記錄中`Description`欄位的值，如 API 回應和主控台**事件**索引標籤所示。

### 叢集生命週期
<a name="sagemaker-hyperpod-cluster-events-common-cluster"></a>


| 事件 | 說明 | 
| --- | --- | 
| 叢集操作已啟動 | 叢集 <cluster-name> <operation> 已成功啟動 | 
| 叢集操作啟動失敗 | 無法啟動 Cluster <cluster-name> <operation> | 
| 叢集操作已完成 | 叢集 <cluster-name> <operation> 已成功完成 | 
| 叢集操作失敗 | 叢集 <cluster-name> <operation> 失敗 | 

### 執行個體群組生命週期
<a name="sagemaker-hyperpod-cluster-events-common-ig"></a>


| 事件 | 說明 | 
| --- | --- | 
| 執行個體群組操作已啟動 | InstanceGroup <instance-group-name> <operation> 在 Cluster <cluster-name> 中成功啟動 | 
| 執行個體群組操作啟動失敗 | 無法在叢集 <cluster-name> 中啟動 InstanceGroup <instance-group-name> <operation>instance-group-name | 
| 執行個體群組操作已完成 | 叢集 <cluster-name> 中的執行個體群組 <instance-group-name> <operation> 已成功完成 | 
| 執行個體群組操作失敗 | 叢集 <cluster-name> 中的執行個體群組 <instance-group-name> <operation> 失敗 | 

### 執行個體群組網路組態
<a name="sagemaker-hyperpod-cluster-events-common-network"></a>


| 事件 | 說明 | 
| --- | --- | 
| 找到網路組態 | 在 AZ <availability-zone> 中找到子網路 <subnet-id>，在叢集 <cluster-name> 中找到 IG <instance-group-name> 的 SecurityGroupIds <security-group-ids> | 
| 網路組態失敗 | 無法處理叢集 <cluster-name> 中 IG <instance-group-name> 的執行個體群組網路組態詳細資訊 | 
| 找到自訂 AMI 覆寫 | 在叢集 <cluster-name> 中找到 IG <instance-group-name> 的自訂 AMI 覆寫 <ami-id> | 
| 自訂 AMI 覆寫失敗 | 無法處理叢集 <cluster-name> 中 IG <instance-group-name> 的自訂 AMI 覆寫詳細資訊 | 
| 使用的平台網路組態 | 使用 HyperPod 平台為叢集 <cluster-name> 中的 IG <instance-group-name> 提供網路組態 | 
| 網路組態已決定 | 已成功判斷叢集 <cluster-name> 中 IG <instance-group-name> 的執行個體群組網路組態 | 

### 執行個體建立
<a name="sagemaker-hyperpod-cluster-events-common-instance-creation"></a>


| 事件 | 說明 | 
| --- | --- | 
| 執行個體操作已啟動 | 執行個體 <operation> 在叢集 <cluster-name> 和 IG <instance-group-name> 中成功啟動 | 
| 執行個體操作啟動失敗 | 無法在叢集 <cluster-name> 和 IG <instance-group-name> 中啟動執行個體 <operation> | 
| 找到容量保留 | 找到叢集 <cluster-name> 和 IG <instance-group-name> 的CapacityReservation ID <reservation-id>，使用預留容量 | 
| 找不到容量保留 | 找不到叢集 <cluster-name> 和 IG <instance-group-name> 的CapacityReservation，請使用隨需集區 | 
| 執行個體承載設定失敗 | 無法處理叢集 <cluster-name> 和 IG <instance-group-name> 的 CapacityReservationDetails  | 
| 已建立客戶 ENI | 在 Cluster <cluster-name> 和 IG <instance-group-name> 中成功為執行個體建立客戶 ENI | 
| 客戶 ENI 建立失敗 | 無法在 Cluster <cluster-name> 和 IG <instance-group-name> 中為執行個體建立客戶 ENI | 
| EC2 執行個體已佈建 | EC2 執行個體 <instance-id> 已成功佈建於叢集 <cluster-name> 和 IG <instance-group-name> | 
| EC2 執行個體建立失敗 | 無法在叢集 <cluster-name> 和 IG <instance-group-name> 中佈建 EC2 執行個體 | 
| 生命週期指令碼狀態已更新 | EC2 執行個體 <instance-id> 的執行個體生命週期指令碼執行具有 <status> | 
| 生命週期指令碼狀態更新失敗 | 無法更新 EC2InstanceId <instance-id> 的執行個體生命週期指令碼執行狀態 | 
| 使用生命週期日誌建立執行個體失敗 | EC2 執行個體 <instance-id> 的執行個體生命週期指令碼執行失敗。若要檢視生命週期指令碼日誌，請造訪日誌群組... | 
| 未使用的 ENI 清除成功 | 成功刪除叢集 <cluster-name> 和 IG <instance-group-name> 中 EC2 執行個體 <instance-id> 的未使用客戶 ENIs  | 
| 未使用的 ENI 清除失敗 | 無法刪除叢集 <cluster-name> 和 IG <instance-group-name> 中 EC2 執行個體 <instance-id> 的未使用客戶 ENIs instance-group-name | 

### 執行個體刪除
<a name="sagemaker-hyperpod-cluster-events-common-instance-deletion"></a>


| 事件 | 說明 | 
| --- | --- | 
| EC2 執行個體終止進行中 | 叢集 <cluster-name> 和 IG <instance-group-name> 中目前正在終止 EC2 執行個體 <instance-id>instance-group-name | 
| EC2 執行個體終止失敗 | 無法在叢集 <cluster-name> 和 IG <instance-group-name> 中終止 EC2 執行個體 <instance-id>instance-group-name | 
| 已刪除客戶 ENI | 已成功刪除叢集 <cluster-name> 和 IG <instance-group-name> 中 EC2 執行個體 <instance-id> 的客戶 ENI instance-group-name | 
| 客戶 ENI 刪除失敗 | 無法刪除叢集 <cluster-name> 和 IG <instance-group-name> 中的 EC2 執行個體 <instance-id> 的客戶 ENI instance-group-name | 

### 重新啟動執行個體
<a name="sagemaker-hyperpod-cluster-events-common-instance-reboot"></a>


| 事件 | 說明 | 
| --- | --- | 
| EC2 執行個體重新開機進行中 | 叢集 <cluster-name> 和 IG <instance-group-name> 上目前正在重新啟動 EC2 執行個體 <instance-id>instance-group-name | 
| EC2 執行個體重新啟動請求失敗 | 無法在叢集 <cluster-name> 和 IG <instance-group-name> 中提交 EC2 執行個體 <instance-id> 的重新啟動請求 instance-group-name | 

### 執行個體操作 （一般）
<a name="sagemaker-hyperpod-cluster-events-common-instance-operation"></a>


| 事件 | 說明 | 
| --- | --- | 
| 執行個體操作已完成 | 叢集 <cluster-name> 和 IG <instance-group-name> 中的執行個體 <operation> <instance-id> 已成功完成 | 
| 執行個體操作失敗 | 叢集 <cluster-name> 和 IG <instance-group-name> 中的執行個體 <operation> <instance-id> 失敗 | 

### 執行個體替換
<a name="sagemaker-hyperpod-cluster-events-common-instance-replacement"></a>


| 事件 | 說明 | 
| --- | --- | 
| 執行個體替換已開始 | 執行個體 <instance-id> 開始作為叢集 <cluster-name> 和 IG <instance-group-name> 中執行個體取代的一部分 | 
| 執行個體替換啟動失敗 | 在 Cluster <cluster-name> 和 IG <instance-group-name> 中，執行個體 <instance-id> 無法作為執行個體替換的一部分啟動 | 
| 執行個體替換已完成 | 執行個體 <instance-id> <operation> 在叢集 <cluster-name> 和 IG <instance-group-name> 中作為執行個體取代的一部分成功完成 | 
| 執行個體替換失敗 | 在 Cluster <cluster-name> 和 IG <instance-group-name> 中，執行個體 <instance-id> <operation> 作為執行個體取代的一部分失敗 | 

### FSx 檔案系統生命週期
<a name="sagemaker-hyperpod-cluster-events-common-fsx"></a>


| 事件 | 說明 | 
| --- | --- | 
| FSx 建立已開始 | 已針對叢集 <cluster-name> 中的 IG <instance-group-name> 開始建立 FSx  | 
| FSx 建立失敗 | 無法在叢集 <cluster-name> 中建立 FSx for IG <instance-group-name>instance-group-name | 
| 已完成 FSx 建立 | 已成功完成叢集 <cluster-name> 中 IG <instance-group-name> 的 FSx 建立 | 
| FSx 刪除已開始 | 已針對叢集 <cluster-name> 中的 IG <instance-group-name> 啟動 FSx 刪除 | 
| FSx 刪除失敗 | 無法刪除叢集 <cluster-name> 中適用於 IG <instance-group-name> 的 FSx  | 
| 已完成 FSx 刪除 | 已成功完成叢集 <cluster-name> 中 IG <instance-group-name> 的 FSx 刪除 | 
| FSx 更新已啟動 | 已針對叢集 <cluster-name> 中的 IG <instance-group-name> 啟動 FSx 更新 | 
| FSx 更新失敗 | 無法在叢集 <cluster-name> 中更新 FSx for IG <instance-group-name>instance-group-name | 
| 已完成 FSx 更新 | 已成功完成叢集 <cluster-name> 中 IG <instance-group-name> 的 FSx 更新 | 

### 修補 （常見步驟）
<a name="sagemaker-hyperpod-cluster-events-common-patching"></a>

這些修補事件會在`UpdateClusterSoftware`操作期間針對 EKS 和 Slurm 叢集發出。


| 事件 | 說明 | 
| --- | --- | 
| 已排程執行個體群組修補 | 叢集 <cluster-name> 中的 InstanceGroup <instance-group-name> 已排定讓 UpdateClusterSoftware 更新。 instance-group-name | 
| 執行個體群組修補排程失敗 | 無法在叢集 <cluster-name> 中排程 IG <instance-group-name> 的 UpdateClusterSoftware。 instance-group-name | 
| 執行個體群組修補已開始 | 使用 <strategy> 策略，針對叢集 <cluster-name> 中的 IG <instance-group-name> 啟動 UpdateClusterSoftware。 | 
| 執行個體群組修補啟動失敗 | 無法在叢集 <cluster-name> 中為 IG <instance-group-name> 啟動 UpdateClusterSoftware。 instance-group-name | 
| 已選取下一個修補批次 | 在叢集 <cluster-name> 中為 IG <instance-group-name> 選取的下一個更新批次。 | 
| 下一個修補批次選取失敗 | 無法在叢集 <cluster-name> 中選取 IG <instance-group-name> 的下一個更新批次。 | 
| 排入替換佇列的失敗執行個體 | 已排入節點取代佇列的叢集 <cluster-name> 中 IG <instance-group-name> 中的失敗執行個體。 | 
| 失敗的執行個體取代佇列失敗 | 無法在叢集 <cluster-name> 的 IG <instance-group-name> 中將節點替換的執行個體排入佇列。 | 
| 執行個體群組修補已完成 | UpdateClusterSoftware 已成功完成。 instance-group-name | 
| 執行個體群組修補完成失敗 | 無法完成 Cluster <cluster-name> 中 IG <instance-group-name> 的 UpdateClusterSoftware。 instance-group-name | 
| 根磁碟區取代已啟動 | IG <instance-group-name> 中執行個體 <instance-id> 的根磁碟區替換已開始。 | 
| 根磁碟區取代失敗 | 無法啟動 IG <instance-group-name> 中執行個體 <instance-id> 的根磁碟區替換。 | 
| 執行個體修補成功 | IG <instance-group-name> 中的執行個體 <instance-id> 已成功更新。 | 

## EKS 特定事件
<a name="sagemaker-hyperpod-cluster-events-eks"></a>

只有與 Amazon EKS 協調的 HyperPod 叢集才會發出下列事件。

### 存取項目管理
<a name="sagemaker-hyperpod-cluster-events-eks-access"></a>


| 事件 | 說明 | 
| --- | --- | 
| SLR 存取項目操作成功 | 叢集 <cluster-name> 的 SLR 存取項目 <operation> 成功 | 
| SLR 存取項目操作失敗 | 叢集 <cluster-name> 的 SLR 存取項目 <operation> 失敗 | 
| EKS 存取項目操作成功 | 叢集 <cluster-name> 的 EKS 存取項目 <operation> 成功 | 
| EKS 存取項目操作失敗 | 叢集 <cluster-name> 的 EKS 存取項目 <operation> 失敗 | 

### Kubernetes 組態更新
<a name="sagemaker-hyperpod-cluster-events-eks-k8s"></a>


| 事件 | 說明 | 
| --- | --- | 
| Kubernetes 組態更新成功 | 已成功更新 Cluster <cluster-name> 和 IG <instance-group-name> 中執行個體 <instance-id> 的 Kubernetes 組態 | 
| Kubernetes 組態更新失敗 | 無法更新 Cluster <cluster-name> 和 IG <instance-group-name> 中執行個體 <instance-id> 的 Kubernetes 組態 | 

### Karpenter 自動擴展
<a name="sagemaker-hyperpod-cluster-events-eks-karpenter"></a>


| 事件 | 說明 | 
| --- | --- | 
| 自動擴展操作成功 | AutoScaling <operation> <status> 在叢集中成功 <cluster-name> | 
| Autoscaling 操作失敗 | 無法 <operation> AutoScaling in Cluster <cluster-name> | 
| Karpenter CRD 安裝成功 | 在 EKS 叢集 <cluster-name> 中成功完成 CustomResourceDefinition 安裝 | 
| Karpenter CRD 安裝失敗 | EKS 叢集 <cluster-name> 的 CustomResourceDefinition 安裝失敗 | 
| Karpenter SLR 存取政策更新成功 | EKS 叢集 <cluster-name> 中具有 AmazonSageMakerHyperPodServiceRole 存取項目的 <operation> 存取政策成功 | 
| Karpenter SLR 存取政策更新失敗 | 無法在 EKS 叢集 <cluster-name> 中使用 AmazonSageMakerHyperPodServiceRole 存取項目 <operation> 存取政策 | 

### 修補 — EKS 執行個體層級
<a name="sagemaker-hyperpod-cluster-events-eks-patching-instance"></a>


| 事件 | 說明 | 
| --- | --- | 
| 執行個體修補準備成功 | IG <instance-group-name> 中的執行個體 <instance-id> 已封鎖並移出 Pod。 | 
| 執行個體修補已略過 (PDB 違規） | 由於 PodDisruptionBudget 限制，IG <instance-group-name> 中執行個體 <instance-id> 的 UpdateClusterSoftware 已略過。 | 
| 執行個體修補準備失敗 | 無法為 UpdateClusterSoftware 在 IG <instance-group-name> 中準備執行個體 <instance-id>。 | 
| 執行個體還原至可排程狀態 | IG <instance-group-name> 中的執行個體 <instance-id> 已還原為可排程狀態。 | 
| 執行個體還原至可排程失敗 | 無法將 IG <instance-group-name> 中的執行個體 <instance-id> 還原為可排程狀態。 | 

### 修補 — EKS 轉返
<a name="sagemaker-hyperpod-cluster-events-eks-patching-rollback"></a>


| 事件 | 說明 | 
| --- | --- | 
| 開始的製作時間 | 在 Cluster <cluster-name> 中，IG <instance-group-name> 的製作期間已開始。監控警示 【<alarm-names>】 達 <duration> 秒。 | 
| 已完成的製作時間 | 叢集 <cluster-name> 中 IG <instance-group-name> 的製作期間已完成。在 <duration>-second 製作期間沒有觸發的警示。 | 
| 觸發的製作時間警示 | 叢集 <cluster-name> 中 IG <instance-group-name> 的製作期間失敗。警示 【<alarm-names>】 進入 ALARM 狀態。啟動自動轉返。 | 
| 製作時間評估失敗 | 無法在叢集 <cluster-name> 中評估 IG <instance-group-name> 的製作期間警示。 | 
| 執行個體群組修補復原已啟動 | 叢集 <cluster-name> 中 IG <instance-group-name> 的 UpdateClusterSoftware 失敗。 instance-group-name 啟動轉返。 | 
| 執行個體群組修補復原失敗 | 叢集 <cluster-name> 中 IG <instance-group-name> 的轉返失敗。有些執行個體可能處於 FailedMaintenance 狀態。 | 
| 執行個體修補復原已啟動 | IG <instance-group-name> 中的執行個體 <instance-id> 無法更新。已啟動轉返。 | 
| 執行個體修補復原成功 | IG <instance-group-name> 中的執行個體 <instance-id> 已成功復原至先前的 AMI。 | 
| 執行個體修補復原失敗 | IG <instance-group-name> 中執行個體 <instance-id> 的 UpdateClusterSoftware 復原失敗。 | 

## Slurm 特定事件
<a name="sagemaker-hyperpod-cluster-events-slurm"></a>

只有與 Slurm 協調的 HyperPod 叢集才會發出下列事件。


| 事件 | 說明 | 
| --- | --- | 
| 找到佈建參數 | 在控制器群組 <instance-group-name> 的 LifeCycleScript S3 路徑中找到 provisioning\_parameters.json | 
| 找不到佈建參數 | 在控制器群組 <instance-group-name> 的 LifeCycleScript S3 路徑中找不到 provisioning\_parameters.json | 
| 已建立 Slurm munge 金鑰 | 已成功建立和存放 munge 金鑰 | 
| 通過 Slurm 漂移驗證 | 通過 Slurm 組態偏離驗證 | 
| 偵測到碎片漂移 | 偵測到 Slurm 組態偏離：<drift-details> | 
| Slurm 叢集復原已完成 | 叢集建立失敗：控制器和登入節點未在預期時間內就緒 | 
| Slurm 重新設定成功 | 已成功重新設定 Slurm。已更新 Slurm 組態以符合所需的狀態 | 

## EventBridge 整合
<a name="sagemaker-hyperpod-cluster-events-eventbridge"></a>

HyperPod 使用三種詳細資訊類型將叢集事件傳送至 Amazon EventBridge：


| 詳細資訊類型 | 說明 | 
| --- | --- | 
| SageMaker HyperPod Cluster Event | 佈建、擴展、修補和協調器特定操作的操作事件。包含 EventLevel以進行嚴重性篩選。 | 
| SageMaker HyperPod Cluster State Change | 叢集層級狀態轉換 （例如，建立至 InService)。包括完整的叢集組態。 | 
| SageMaker HyperPod Cluster Node Health Event | 來自 HyperPod 運作狀態監控代理程式 (HMA) 的運作狀態監控事件。包括運作狀態、原因、修復動作和建議。 | 

### 事件模式範例
<a name="sagemaker-hyperpod-cluster-events-eventbridge-patterns"></a>

**所有 HyperPod 叢集事件：**

```
{
  "source": ["aws.sagemaker"],
  "detail-type": ["SageMaker HyperPod Cluster Event"]
}
```

**僅限錯誤事件 （用於提醒）：**

```
{
  "source": ["aws.sagemaker"],
  "detail-type": ["SageMaker HyperPod Cluster Event"],
  "detail": {
    "EventDetails": {
      "EventLevel": ["Error"]
    }
  }
}
```

**特定叢集的事件：**

```
{
  "source": ["aws.sagemaker"],
  "detail-type": ["SageMaker HyperPod Cluster Event"],
  "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"]
}
```

**節點運作狀態事件：**

```
{
  "source": ["aws.sagemaker"],
  "detail-type": ["SageMaker HyperPod Cluster Node Health Event"]
}
```

## API 參考
<a name="sagemaker-hyperpod-cluster-events-api-reference"></a>
+ [ListClusterEvents](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_ListClusterEvents.html) — 列出具有篩選、排序和分頁的事件
+ [DescribeClusterEvent](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_DescribeClusterEvent.html) — 取得特定事件的完整詳細資訊
+ [ClusterEventSummary](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_ClusterEventSummary.html) — 事件摘要資料類型
+ [ClusterEventDetail](https://docs.aws.amazon.com/sagemaker/latest/APIReference/API_ClusterEventDetail.html) — 事件詳細資訊資料類型

## 另請參閱
<a name="sagemaker-hyperpod-cluster-events-see-also"></a>
+ [SageMaker HyperPod Slurm 叢集事件](sagemaker-hyperpod-cluster-events-slurm-page.md) — 具有 CLI 用量和常見案例的 Slurm 叢集事件
+ [SageMaker HyperPod EKS 叢集事件](sagemaker-hyperpod-cluster-events-eks-page.md) — 具有 CLI 用量和常見案例的 EKS 叢集事件