View a markdown version of this page

SageMaker HyperPod クラスターイベントリファレンス - Amazon SageMaker AI

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

SageMaker HyperPod クラスターイベントリファレンス

このページでは、Amazon SageMaker HyperPod クラスターによって出力されるすべての構造化イベントの完全なリファレンスを提供します。イベントは、プロビジョニング、スケーリング、パッチ適用、オーケストレーター固有のライフサイクル変更など、クラスター、インスタンスグループ、インスタンスレベルのオペレーションを可視化します。

クラスターイベントは、 が NodeProvisioningModeに設定されている HyperPod クラスターで使用できますContinuous。イベントには、 ListClusterEventsおよび DescribeClusterEvent APIs、SageMaker AI コンソールのイベントタブ、Amazon EventBridge からアクセスできます。

クラスターイベントレコード

各クラスターイベントは、識別、タイミング、範囲、重要度、およびオペレーション固有のメタデータを含む構造化レコードとして表されます。次の例は、 DescribeClusterEvent API と Amazon EventBridge を介して配信される完全なイベントレコードを示しています。

{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }

イベントレコードフィールド

detail.EventDetails オブジェクトには、以下のフィールドが含まれています。

フィールド Type 必須 説明
EventId 文字列 (UUID) はい イベントの一意の識別子。
ClusterArn String はい HyperPod クラスターの ARN。
ClusterName String はい HyperPod クラスターの名前。
EventTime タイムスタンプ はい イベントが発生した日時 (エポックミリ秒)。
ResourceType String はい イベントの範囲: ClusterInstanceGroup、または Instance
EventLevel String はい 重要度分類: InfoWarn、または Error
Description String いいえ 人間が読めるイベントの概要。
InstanceGroupName String いいえ インスタンスグループ名 ( ResourceTypeInstanceGroupまたは の場合に表示されますInstance)。
InstanceId String いいえ EC2 インスタンス ID ( ResourceType が の場合に存在しますInstance)。
EventDetails オブジェクト いいえ リソースタイプとオペレーションに固有の追加のメタデータ。

イベントレベル

レベル 意味
Info オペレーションが正常に完了したか、正常に進行しています。
Warn 重要ではない問題または将来の注意を必要とする可能性のある条件で完了したオペレーション。
Error オペレーションが失敗したか、すぐに対応する必要があります。

リソースタイプ:

ResourceType スコープ イベントの例
Cluster クラスター全体のオペレーション クラスターの作成/更新が開始されました。クラスターオペレーションに失敗しました
InstanceGroup インスタンスグループのオペレーション スケーリングの開始/完了、パッチ適用スケジュール、FSx ライフサイクル
Instance 個々のインスタンスオペレーション EC2 プロビジョニング、ライフサイクルスクリプト実行、ENI 管理、終了

EventDetails メタデータ

クラスターイベントには、 EventDetailsフィールド内のEventMetadataオブジェクトが含まれ、イベントの説明が伝える内容を超えるオペレーション固有のコンテキストを提供します。の内容は、リソースタイプとイベントタイプEventMetadataによって異なります。完全なスキーマとサポートされているフィールドについては、Amazon SageMaker AI API リファレンス」のEventMetadata」を参照してください。

EventBridge エンベロープフィールド

Amazon EventBridge 経由で配信されると、イベントレコードは標準の EventBridge エンベロープでラップされます。

フィールド 説明
version EventBridge スキーマバージョン (常に "0")。
id 一意の EventBridge イベント ID。
detail-type SageMaker HyperPod Cluster Event
source aws.sagemaker
account AWS クラスターを所有する アカウント ID。
time イベントの ISO 8601 タイムスタンプ。
region AWS クラスターが存在するリージョン。
resources クラスター ARN を含む配列。
detail 上記の EventDetails オブジェクトが含まれます。

一般的なイベント (EKS および Slurm)

オーケストレーターに関係なく、すべての HyperPod クラスターに対して次のイベントが出力されます。Description 列には、API レスポンスとコンソールの Events タブに表示されるイベントレコードの Descriptionフィールドの値が表示されます。

クラスターのライフサイクル

[Event] (イベント) 説明
クラスターオペレーションが開始されました クラスター <cluster-name> <operation> が正常に開始されました
クラスターオペレーションの開始に失敗しました クラスター <cluster-name> <operation> の開始に失敗しました
クラスターオペレーションが完了しました クラスター <cluster-name> <operation> が正常に完了しました
クラスターオペレーションに失敗しました クラスター <cluster-name> <operation> に失敗しました

インスタンスグループのライフサイクル

[Event] (イベント) 説明
インスタンスグループのオペレーションが開始されました InstanceGroup <instance-group-name> <operation> がクラスター <cluster-name> で正常に開始されました
インスタンスグループオペレーションの開始に失敗しました クラスター <cluster-name> で InstanceGroup <instance-group-name> <operation> を起動できませんでした instance-group-name
インスタンスグループのオペレーションが完了しました クラスター <cluster-name> のインスタンスグループ <instance-group-name> <operation> が正常に完了しました
インスタンスグループのオペレーションに失敗しました クラスター <cluster-name> のインスタンスグループ <instance-group-name> <operation> が失敗しました

インスタンスグループのネットワーク設定

[Event] (イベント) 説明
ネットワーク設定が見つかりました AZ <availability-zone> でサブネット <subnet-id>、クラスター <cluster-name> で IG <instance-group-name> で SecurityGroupIds <security-group-ids> が見つかりました security-group-ids instance-group-name
ネットワーク設定に失敗しました クラスター <cluster-name> で IG <instance-group-name> のインスタンスグループネットワーク設定の詳細を処理できませんでした
カスタム AMI オーバーライドが見つかりました クラスター <cluster-name> で IG <instance-group-name> のカスタム AMI オーバーライド <ami-id> が見つかりました
カスタム AMI オーバーライドに失敗しました クラスター <cluster-name> で IG <instance-group-name> のカスタム AMI オーバーライドの詳細を処理できませんでした
使用されるプラットフォームネットワーク設定 クラスター <cluster-name> で IG <instance-group-name> に HyperPod Platform が提供するネットワーク設定を使用する
ネットワーク設定の決定 クラスター <cluster-name> の IG <instance-group-name> に対してインスタンスグループのネットワーク設定が正常に決定されました

インスタンスの作成

[Event] (イベント) 説明
インスタンスオペレーションが開始されました インスタンス <operation> がクラスター <cluster-name> および IG <instance-group-name> で正常に開始されました
インスタンスオペレーションの開始に失敗しました クラスター <cluster-name> および IG <instance-group-name> でインスタンス <operation> を開始できませんでした
キャパシティ予約が見つかりました リザーブドキャパシティを使用したクラスター <cluster-name> および IG <instance-group-name> の CapacityReservation ID <reservation-id> が見つかりました instance-group-name
キャパシティ予約が見つかりません オンデマンドプールを使用したクラスター <cluster-name> および IG <instance-group-name> の CapacityReservation が見つかりませんでした
インスタンスペイロードの設定に失敗しました クラスター <cluster-name> および IG <instance-group-name> の CapacityReservationDetails の処理に失敗しました
お客様の ENI が作成されました クラスター <cluster-name> および IG <instance-group-name> のインスタンスの Customer ENI が正常に作成されました
カスタマー ENI の作成に失敗しました クラスター <cluster-name> および IG <instance-group-name> のインスタンスの Customer ENI を作成できませんでした
EC2 インスタンスのプロビジョニング クラスター <cluster-name> および IG <instance-group-name> で EC2 インスタンス <instance-id> が正常にプロビジョニングされました instance-group-name
EC2 インスタンスの作成に失敗しました クラスター <cluster-name> および IG <instance-group-name> で EC2 インスタンスをプロビジョニングできませんでした
ライフサイクルスクリプトのステータスが更新されました EC2 インスタンス <instance-id> のインスタンスライフサイクルスクリプト実行には <status> があります
ライフサイクルスクリプトのステータスの更新に失敗しました EC2InstanceId <instance-id> のインスタンスライフサイクルスクリプト実行ステータスを更新できませんでした
ライフサイクルログでインスタンスの作成に失敗しました EC2 インスタンス <instance-id> のインスタンスライフサイクルスクリプトの実行に失敗しました。ライフサイクルスクリプトログを表示するには、ロググループにアクセスしてください。
未使用の ENI のクリーンアップに成功しました クラスター <cluster-name> および IG <instance-group-name> の EC2 インスタンス <instance-id> の未使用の Customer ENIs が正常に削除されました instance-group-name
未使用の ENI クリーンアップに失敗しました クラスター <cluster-name> および IG <instance-group-name> で EC2 インスタンス <instance-id> の未使用のカスタマー ENIs を削除できませんでした instance-group-name

インスタンスの削除

[Event] (イベント) 説明
EC2 インスタンスの終了中 EC2 インスタンス <instance-id> の終了は、クラスター <cluster-name> および IG <instance-group-name> で現在進行中です
EC2 インスタンスの終了に失敗しました クラスター <cluster-name> および IG <instance-group-name> の EC2 インスタンス <instance-id> を終了できませんでした instance-group-name
お客様の ENI を削除しました クラスター <cluster-name> および IG <instance-group-name> の EC2 インスタンス <instance-id> のお客様の ENI が正常に削除されました instance-group-name
お客様の ENI 削除に失敗しました クラスター <cluster-name> および IG <instance-group-name> で EC2 インスタンス <instance-id> の Customer ENI を削除できませんでした instance-group-name

インスタンスの再起動

[Event] (イベント) 説明
EC2 インスタンスの再起動中 EC2 インスタンスの再起動 <instance-id> は、クラスター <cluster-name> および IG <instance-group-name> で現在進行中です
EC2 インスタンスの再起動リクエストに失敗しました クラスター <cluster-name> および IG <instance-group-name> で EC2 インスタンス <instance-id> の再起動リクエストを送信できませんでした instance-group-name

インスタンスオペレーション (汎用)

[Event] (イベント) 説明
インスタンスオペレーションが完了しました クラスター <cluster-name> および IG <instance-group-name> のインスタンス <operation> <instance-id> が正常に完了しました
インスタンスオペレーションに失敗しました クラスター <cluster-name> および IG <instance-group-name> のインスタンス <operation> <instance-id> が失敗しました

インスタンスの置き換え

[Event] (イベント) 説明
インスタンス置換が開始されました インスタンス <instance-id> は、クラスター <cluster-name> および IG <instance-group-name> のインスタンス置換の一部として開始されます
インスタンス置換の開始に失敗しました インスタンス <instance-id> が、クラスター <cluster-name> および IG <instance-group-name> のインスタンス置換の一部として起動できませんでした
インスタンスの置き換えが完了しました インスタンス <instance-id> <operation> は、クラスター <cluster-name> および IG <instance-group-name> のインスタンス置換の一部として正常に完了しました
インスタンスの置き換えに失敗しました インスタンス <instance-id> <operation> が、クラスター <cluster-name> および IG <instance-group-name> のインスタンス置換の一部として失敗しました

FSx ファイルシステムのライフサイクル

[Event] (イベント) 説明
FSx の作成が開始されました クラスター <cluster-name> で IG <instance-group-name> の FSx 作成が開始されました
FSx の作成に失敗しました クラスター <cluster-name> で IG <instance-group-name> 用の FSx を作成できませんでした
FSx の作成が完了しました クラスター <cluster-name> の IG <instance-group-name> の FSx 作成が正常に完了しました
FSx 削除が開始されました クラスター <cluster-name> で IG <instance-group-name> に対して FSx 削除が開始されました
FSx 削除に失敗しました クラスター <cluster-name> で IG <instance-group-name> の FSx を削除できませんでした
FSx 削除が完了しました クラスター <cluster-name> の IG <instance-group-name> の FSx 削除が正常に完了しました
FSx 更新が開始されました クラスター <cluster-name> で IG <instance-group-name> の FSx 更新が開始されました
FSx 更新に失敗しました クラスター <cluster-name> で IG <instance-group-name> の FSx を更新できませんでした
FSx 更新が完了しました クラスター <cluster-name> の IG <instance-group-name> の FSx 更新が正常に完了しました

パッチ適用 (一般的なステップ)

これらのパッチ適用イベントは、UpdateClusterSoftwareオペレーション中に EKS クラスターと Slurm クラスターの両方に対して出力されます。

[Event] (イベント) 説明
スケジュールされたインスタンスグループのパッチ適用 クラスター <cluster-name> の InstanceGroup <instance-group-name> は、UpdateClusterSoftware が最新になるようにスケジュールされています。 instance-group-name
インスタンスグループのパッチ適用スケジュールが失敗しました クラスター <cluster-name> で IG <instance-group-name> の UpdateClusterSoftware をスケジュールできませんでした。 instance-group-name
インスタンスグループのパッチ適用が開始されました UpdateClusterSoftware は、<strategy> 戦略を使用して、クラスター <cluster-name> で IG <instance-group-name> に対して開始されました。
インスタンスグループのパッチ適用の開始に失敗しました クラスター <cluster-name> で IG <instance-group-name> の UpdateClusterSoftware を開始できませんでした。 instance-group-name
次のパッチ適用バッチが選択されました クラスター <cluster-name> で IG <instance-group-name> 用に選択された次の更新バッチ。
次のパッチ適用バッチ選択に失敗しました クラスター <cluster-name> で IG <instance-group-name> の次の更新バッチを選択できませんでした。
置き換えのためにキューに入れられた失敗したインスタンス ノード置換のためにキューに入れられたクラスター <cluster-name> の IG <instance-group-name> で失敗したインスタンス。
失敗したインスタンス置換キューイングに失敗しました クラスター <cluster-name> の IG <instance-group-name> でノード置換のためにインスタンスをキューに入れられませんでした。
インスタンスグループのパッチ適用が完了しました UpdateClusterSoftware は、クラスター <cluster-name> の IG <instance-group-name> に対して正常に完了しました。
インスタンスグループのパッチ適用の完了に失敗しました クラスター <cluster-name> で IG <instance-group-name> の UpdateClusterSoftware を完了できませんでした。 instance-group-name
ルートボリューム置換が開始されました IG <instance-group-name> のインスタンス <instance-id> でルートボリュームの置換が開始されました。
ルートボリュームの交換に失敗しました IG <instance-group-name> でインスタンス <instance-id> のルートボリューム置換を開始できませんでした。
インスタンスのパッチ適用に成功しました IG <instance-group-name> のインスタンス <instance-id> が正常に更新されました。

EKS 固有のイベント

次のイベントは、Amazon EKS とオーケストレーションされた HyperPod クラスターに対してのみ出力されます。

アクセスエントリ管理

[Event] (イベント) 説明
SLR アクセスエントリオペレーションが成功しました クラスター <cluster-name> の SLR アクセスエントリ <operation> が成功しました
SLR アクセスエントリオペレーションに失敗しました クラスター <cluster-name> の SLR アクセスエントリ <operation> に失敗しました
EKS アクセスエントリオペレーションが成功しました クラスター <cluster-name> の EKS アクセスエントリ <operation> が成功しました
EKS アクセスエントリオペレーションに失敗しました クラスター <cluster-name> の EKS アクセスエントリ <operation> に失敗しました

Kubernetes 設定の更新

[Event] (イベント) 説明
Kubernetes 設定の更新に成功しました クラスター <cluster-name> および IG <instance-group-name> のインスタンス <instance-id> の Kubernetes 設定が正常に更新されました
Kubernetes 設定の更新に失敗しました クラスター <cluster-name> および IG <instance-group-name> のインスタンス <instance-id> の Kubernetes 設定を更新できませんでした

Karpenter 自動スケーリング

[Event] (イベント) 説明
Auto Scaling オペレーションが成功しました クラスター <cluster-name> での AutoScaling <operation> <status> の成功
Auto Scaling オペレーションが失敗しました クラスター <cluster-name> で <operation> AutoScaling に失敗しました
Karpenter CRD のインストールに成功しました CustomResourceDefinition のインストールが EKS クラスター <cluster-name> で正常に完了しました
Karpenter CRD のインストールに失敗しました EKS クラスター <cluster-name> の CustomResourceDefinition のインストールに失敗しました
Karpenter SLR アクセスポリシーの更新に成功しました EKS クラスター <cluster-name> の AmazonSageMakerHyperPodServiceRole アクセスエントリを使用した <operation> アクセスポリシー
Karpenter SLR アクセスポリシーの更新に失敗しました EKS クラスター <cluster-name> の AmazonSageMakerHyperPodServiceRole アクセスエントリを使用した <operation> アクセスポリシーに失敗しました

パッチ適用 — EKS インスタンスレベル

[Event] (イベント) 説明
インスタンスのパッチ適用の準備に成功しました IG <instance-group-name> のインスタンス <instance-id> が接続され、ポッドが削除されます。
インスタンスのパッチ適用がスキップされました (PDB 違反) PodDisruptionBudget 制約のため、IG <instance-group-name> のインスタンス <instance-id> の UpdateClusterSoftware がスキップされました。
インスタンスのパッチ適用の準備に失敗しました UpdateClusterSoftware の IG <instance-group-name> でインスタンス <instance-id> の準備に失敗しました。
スケジュール可能な状態に復元されたインスタンス IG <instance-group-name> のインスタンス <instance-id> がスケジュール可能な状態に復元されました。
スケジュール可能なインスタンスへの復元に失敗しました IG <instance-group-name> のインスタンス <instance-id> をスケジュール可能な状態に復元できませんでした。

パッチ適用 — EKS ロールバック

[Event] (イベント) 説明
ベイク開始時刻 クラスター <cluster-name> で IG <instance-group-name> のベーキング期間が開始されました。<duration> 秒間のアラーム [<alarm-names>] のモニタリング。
ベイク時間の完了 クラスター <cluster-name> の IG <instance-group-name> のベーキング期間が完了しました。<duration>-second ベーキング期間中にトリガーされるアラームはありません。
ベイク時間アラームがトリガーされました クラスター <cluster-name> の IG <instance-group-name> のベーキング期間に失敗しました。アラーム [<alarm-names>] が ALARM 状態になりました。自動ロールバックを開始します。
ベーク時間の評価に失敗しました クラスター <cluster-name> の IG <instance-group-name> のベーキング期間中にアラームの評価に失敗しました。
インスタンスグループのパッチ適用のロールバックが開始されました クラスター <cluster-name> の IG <instance-group-name> で UpdateClusterSoftware が失敗しました。 instance-group-name ロールバックを開始します。
インスタンスグループのパッチ適用のロールバックに失敗しました クラスター <cluster-name> の IG <instance-group-name> のロールバックに失敗しました。一部のインスタンスは FailedMaintenance 状態である場合があります。
インスタンスパッチ適用のロールバックが開始されました IG <instance-group-name> のインスタンス <instance-id> の更新に失敗しました。ロールバックが開始されました。
インスタンスのパッチ適用のロールバックに成功しました IG <instance-group-name> のインスタンス <instance-id> は、以前の AMI に正常にロールバックされました。
インスタンスのパッチ適用のロールバックに失敗しました IG <instance-group-name> のインスタンス <instance-id> で UpdateClusterSoftware のロールバックに失敗しました。

Slurm 固有のイベント

次のイベントは、Slurm とオーケストレーションされた HyperPod クラスターに対してのみ出力されます。

[Event] (イベント) 説明
プロビジョニングパラメータが見つかりました コントローラーグループ <instance-group-name> の LifeCycleScript S3 パスに provisioning_parameters.json が見つかりました
プロビジョニングパラメータが見つかりません コントローラーグループ <instance-group-name> の LifeCycleScript S3 パスに provisioning_parameters.json が見つかりません
Slurm munge キーが作成されました 正常に作成され、保存された munge キー
Slurm ドリフト検証に合格しました Slurm 設定ドリフトの検証に合格しました
スラムドリフトが検出されました Slurm 設定ドリフトが検出されました: <drift-details>
Slurm クラスターのロールバックが完了しました クラスターの作成に失敗しました: コントローラーノードとログインノードが想定時間内に準備できませんでした
Slurm の再設定に成功しました Slurm が正常に再設定されました。目的の状態と一致するように更新された Slurm 設定

EventBridge 統合

HyperPod は、3 つの詳細タイプを使用してクラスターイベントを Amazon EventBridge に送信します。

Detail-type 説明
SageMaker HyperPod Cluster Event プロビジョニング、スケーリング、パッチ適用、オーケストレーター固有のオペレーションのオペレーションイベント。重要度フィルタリングEventLevelに が含まれます。
SageMaker HyperPod Cluster State Change クラスターレベルのステータス遷移 (Creating to InService など)。完全なクラスター設定が含まれます。
SageMaker HyperPod Cluster Node Health Event HyperPod Health Monitoring Agent (HMA) からのヘルスモニタリングイベント。ヘルスステータス、理由、修復アクション、レコメンデーションが含まれます。

イベントパターンの例

すべての HyperPod クラスターイベント:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }

エラーイベントのみ (アラート用):

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }

特定のクラスターのイベント:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }

ノードヘルスイベント:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }

API リファレンス

関連情報