翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
SageMaker HyperPod クラスターイベントリファレンス
このページでは、Amazon SageMaker HyperPod クラスターによって出力されるすべての構造化イベントの完全なリファレンスを提供します。イベントは、プロビジョニング、スケーリング、パッチ適用、オーケストレーター固有のライフサイクル変更など、クラスター、インスタンスグループ、インスタンスレベルのオペレーションを可視化します。
クラスターイベントは、 が NodeProvisioningModeに設定されている HyperPod クラスターで使用できますContinuous。イベントには、 ListClusterEventsおよび DescribeClusterEvent APIs、SageMaker AI コンソールのイベントタブ、Amazon EventBridge からアクセスできます。
クラスターイベントレコード
各クラスターイベントは、識別、タイミング、範囲、重要度、およびオペレーション固有のメタデータを含む構造化レコードとして表されます。次の例は、 DescribeClusterEvent API と Amazon EventBridge を介して配信される完全なイベントレコードを示しています。
{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }
イベントレコードフィールド
detail.EventDetails オブジェクトには、以下のフィールドが含まれています。
| フィールド | Type | 必須 | 説明 |
|---|---|---|---|
EventId |
文字列 (UUID) | はい | イベントの一意の識別子。 |
ClusterArn |
String | はい | HyperPod クラスターの ARN。 |
ClusterName |
String | はい | HyperPod クラスターの名前。 |
EventTime |
タイムスタンプ | はい | イベントが発生した日時 (エポックミリ秒)。 |
ResourceType |
String | はい | イベントの範囲: Cluster、InstanceGroup、または Instance。 |
EventLevel |
String | はい | 重要度分類: Info、Warn、または Error。 |
Description |
String | いいえ | 人間が読めるイベントの概要。 |
InstanceGroupName |
String | いいえ | インスタンスグループ名 ( ResourceTypeが InstanceGroupまたは の場合に表示されますInstance)。 |
InstanceId |
String | いいえ | EC2 インスタンス ID ( ResourceType が の場合に存在しますInstance)。 |
EventDetails |
オブジェクト | いいえ | リソースタイプとオペレーションに固有の追加のメタデータ。 |
イベントレベル
| レベル | 意味 |
|---|---|
Info |
オペレーションが正常に完了したか、正常に進行しています。 |
Warn |
重要ではない問題または将来の注意を必要とする可能性のある条件で完了したオペレーション。 |
Error |
オペレーションが失敗したか、すぐに対応する必要があります。 |
リソースタイプ:
| ResourceType | スコープ | イベントの例 |
|---|---|---|
Cluster |
クラスター全体のオペレーション | クラスターの作成/更新が開始されました。クラスターオペレーションに失敗しました |
InstanceGroup |
インスタンスグループのオペレーション | スケーリングの開始/完了、パッチ適用スケジュール、FSx ライフサイクル |
Instance |
個々のインスタンスオペレーション | EC2 プロビジョニング、ライフサイクルスクリプト実行、ENI 管理、終了 |
EventDetails メタデータ
クラスターイベントには、 EventDetailsフィールド内のEventMetadataオブジェクトが含まれ、イベントの説明が伝える内容を超えるオペレーション固有のコンテキストを提供します。の内容は、リソースタイプとイベントタイプEventMetadataによって異なります。完全なスキーマとサポートされているフィールドについては、Amazon SageMaker AI API リファレンス」のEventMetadata」を参照してください。
EventBridge エンベロープフィールド
Amazon EventBridge 経由で配信されると、イベントレコードは標準の EventBridge エンベロープでラップされます。
| フィールド | 説明 |
|---|---|
version |
EventBridge スキーマバージョン (常に "0")。 |
id |
一意の EventBridge イベント ID。 |
detail-type |
SageMaker HyperPod Cluster Event |
source |
aws.sagemaker |
account |
AWS クラスターを所有する アカウント ID。 |
time |
イベントの ISO 8601 タイムスタンプ。 |
region |
AWS クラスターが存在するリージョン。 |
resources |
クラスター ARN を含む配列。 |
detail |
上記の EventDetails オブジェクトが含まれます。 |
一般的なイベント (EKS および Slurm)
オーケストレーターに関係なく、すべての HyperPod クラスターに対して次のイベントが出力されます。Description 列には、API レスポンスとコンソールの Events タブに表示されるイベントレコードの Descriptionフィールドの値が表示されます。
クラスターのライフサイクル
| [Event] (イベント) | 説明 |
|---|---|
| クラスターオペレーションが開始されました | クラスター <cluster-name> <operation> が正常に開始されました |
| クラスターオペレーションの開始に失敗しました | クラスター <cluster-name> <operation> の開始に失敗しました |
| クラスターオペレーションが完了しました | クラスター <cluster-name> <operation> が正常に完了しました |
| クラスターオペレーションに失敗しました | クラスター <cluster-name> <operation> に失敗しました |
インスタンスグループのライフサイクル
| [Event] (イベント) | 説明 |
|---|---|
| インスタンスグループのオペレーションが開始されました | InstanceGroup <instance-group-name> <operation> がクラスター <cluster-name> で正常に開始されました |
| インスタンスグループオペレーションの開始に失敗しました | クラスター <cluster-name> で InstanceGroup <instance-group-name> <operation> を起動できませんでした instance-group-name |
| インスタンスグループのオペレーションが完了しました | クラスター <cluster-name> のインスタンスグループ <instance-group-name> <operation> が正常に完了しました |
| インスタンスグループのオペレーションに失敗しました | クラスター <cluster-name> のインスタンスグループ <instance-group-name> <operation> が失敗しました |
インスタンスグループのネットワーク設定
| [Event] (イベント) | 説明 |
|---|---|
| ネットワーク設定が見つかりました | AZ <availability-zone> でサブネット <subnet-id>、クラスター <cluster-name> で IG <instance-group-name> で SecurityGroupIds <security-group-ids> が見つかりました security-group-ids instance-group-name |
| ネットワーク設定に失敗しました | クラスター <cluster-name> で IG <instance-group-name> のインスタンスグループネットワーク設定の詳細を処理できませんでした |
| カスタム AMI オーバーライドが見つかりました | クラスター <cluster-name> で IG <instance-group-name> のカスタム AMI オーバーライド <ami-id> が見つかりました |
| カスタム AMI オーバーライドに失敗しました | クラスター <cluster-name> で IG <instance-group-name> のカスタム AMI オーバーライドの詳細を処理できませんでした |
| 使用されるプラットフォームネットワーク設定 | クラスター <cluster-name> で IG <instance-group-name> に HyperPod Platform が提供するネットワーク設定を使用する |
| ネットワーク設定の決定 | クラスター <cluster-name> の IG <instance-group-name> に対してインスタンスグループのネットワーク設定が正常に決定されました |
インスタンスの作成
| [Event] (イベント) | 説明 |
|---|---|
| インスタンスオペレーションが開始されました | インスタンス <operation> がクラスター <cluster-name> および IG <instance-group-name> で正常に開始されました |
| インスタンスオペレーションの開始に失敗しました | クラスター <cluster-name> および IG <instance-group-name> でインスタンス <operation> を開始できませんでした |
| キャパシティ予約が見つかりました | リザーブドキャパシティを使用したクラスター <cluster-name> および IG <instance-group-name> の CapacityReservation ID <reservation-id> が見つかりました instance-group-name |
| キャパシティ予約が見つかりません | オンデマンドプールを使用したクラスター <cluster-name> および IG <instance-group-name> の CapacityReservation が見つかりませんでした |
| インスタンスペイロードの設定に失敗しました | クラスター <cluster-name> および IG <instance-group-name> の CapacityReservationDetails の処理に失敗しました |
| お客様の ENI が作成されました | クラスター <cluster-name> および IG <instance-group-name> のインスタンスの Customer ENI が正常に作成されました |
| カスタマー ENI の作成に失敗しました | クラスター <cluster-name> および IG <instance-group-name> のインスタンスの Customer ENI を作成できませんでした |
| EC2 インスタンスのプロビジョニング | クラスター <cluster-name> および IG <instance-group-name> で EC2 インスタンス <instance-id> が正常にプロビジョニングされました instance-group-name |
| EC2 インスタンスの作成に失敗しました | クラスター <cluster-name> および IG <instance-group-name> で EC2 インスタンスをプロビジョニングできませんでした |
| ライフサイクルスクリプトのステータスが更新されました | EC2 インスタンス <instance-id> のインスタンスライフサイクルスクリプト実行には <status> があります |
| ライフサイクルスクリプトのステータスの更新に失敗しました | EC2InstanceId <instance-id> のインスタンスライフサイクルスクリプト実行ステータスを更新できませんでした |
| ライフサイクルログでインスタンスの作成に失敗しました | EC2 インスタンス <instance-id> のインスタンスライフサイクルスクリプトの実行に失敗しました。ライフサイクルスクリプトログを表示するには、ロググループにアクセスしてください。 |
| 未使用の ENI のクリーンアップに成功しました | クラスター <cluster-name> および IG <instance-group-name> の EC2 インスタンス <instance-id> の未使用の Customer ENIs が正常に削除されました instance-group-name |
| 未使用の ENI クリーンアップに失敗しました | クラスター <cluster-name> および IG <instance-group-name> で EC2 インスタンス <instance-id> の未使用のカスタマー ENIs を削除できませんでした instance-group-name |
インスタンスの削除
| [Event] (イベント) | 説明 |
|---|---|
| EC2 インスタンスの終了中 | EC2 インスタンス <instance-id> の終了は、クラスター <cluster-name> および IG <instance-group-name> で現在進行中です |
| EC2 インスタンスの終了に失敗しました | クラスター <cluster-name> および IG <instance-group-name> の EC2 インスタンス <instance-id> を終了できませんでした instance-group-name |
| お客様の ENI を削除しました | クラスター <cluster-name> および IG <instance-group-name> の EC2 インスタンス <instance-id> のお客様の ENI が正常に削除されました instance-group-name |
| お客様の ENI 削除に失敗しました | クラスター <cluster-name> および IG <instance-group-name> で EC2 インスタンス <instance-id> の Customer ENI を削除できませんでした instance-group-name |
インスタンスの再起動
| [Event] (イベント) | 説明 |
|---|---|
| EC2 インスタンスの再起動中 | EC2 インスタンスの再起動 <instance-id> は、クラスター <cluster-name> および IG <instance-group-name> で現在進行中です |
| EC2 インスタンスの再起動リクエストに失敗しました | クラスター <cluster-name> および IG <instance-group-name> で EC2 インスタンス <instance-id> の再起動リクエストを送信できませんでした instance-group-name |
インスタンスオペレーション (汎用)
| [Event] (イベント) | 説明 |
|---|---|
| インスタンスオペレーションが完了しました | クラスター <cluster-name> および IG <instance-group-name> のインスタンス <operation> <instance-id> が正常に完了しました |
| インスタンスオペレーションに失敗しました | クラスター <cluster-name> および IG <instance-group-name> のインスタンス <operation> <instance-id> が失敗しました |
インスタンスの置き換え
| [Event] (イベント) | 説明 |
|---|---|
| インスタンス置換が開始されました | インスタンス <instance-id> は、クラスター <cluster-name> および IG <instance-group-name> のインスタンス置換の一部として開始されます |
| インスタンス置換の開始に失敗しました | インスタンス <instance-id> が、クラスター <cluster-name> および IG <instance-group-name> のインスタンス置換の一部として起動できませんでした |
| インスタンスの置き換えが完了しました | インスタンス <instance-id> <operation> は、クラスター <cluster-name> および IG <instance-group-name> のインスタンス置換の一部として正常に完了しました |
| インスタンスの置き換えに失敗しました | インスタンス <instance-id> <operation> が、クラスター <cluster-name> および IG <instance-group-name> のインスタンス置換の一部として失敗しました |
FSx ファイルシステムのライフサイクル
| [Event] (イベント) | 説明 |
|---|---|
| FSx の作成が開始されました | クラスター <cluster-name> で IG <instance-group-name> の FSx 作成が開始されました |
| FSx の作成に失敗しました | クラスター <cluster-name> で IG <instance-group-name> 用の FSx を作成できませんでした |
| FSx の作成が完了しました | クラスター <cluster-name> の IG <instance-group-name> の FSx 作成が正常に完了しました |
| FSx 削除が開始されました | クラスター <cluster-name> で IG <instance-group-name> に対して FSx 削除が開始されました |
| FSx 削除に失敗しました | クラスター <cluster-name> で IG <instance-group-name> の FSx を削除できませんでした |
| FSx 削除が完了しました | クラスター <cluster-name> の IG <instance-group-name> の FSx 削除が正常に完了しました |
| FSx 更新が開始されました | クラスター <cluster-name> で IG <instance-group-name> の FSx 更新が開始されました |
| FSx 更新に失敗しました | クラスター <cluster-name> で IG <instance-group-name> の FSx を更新できませんでした |
| FSx 更新が完了しました | クラスター <cluster-name> の IG <instance-group-name> の FSx 更新が正常に完了しました |
パッチ適用 (一般的なステップ)
これらのパッチ適用イベントは、UpdateClusterSoftwareオペレーション中に EKS クラスターと Slurm クラスターの両方に対して出力されます。
| [Event] (イベント) | 説明 |
|---|---|
| スケジュールされたインスタンスグループのパッチ適用 | クラスター <cluster-name> の InstanceGroup <instance-group-name> は、UpdateClusterSoftware が最新になるようにスケジュールされています。 instance-group-name |
| インスタンスグループのパッチ適用スケジュールが失敗しました | クラスター <cluster-name> で IG <instance-group-name> の UpdateClusterSoftware をスケジュールできませんでした。 instance-group-name |
| インスタンスグループのパッチ適用が開始されました | UpdateClusterSoftware は、<strategy> 戦略を使用して、クラスター <cluster-name> で IG <instance-group-name> に対して開始されました。 |
| インスタンスグループのパッチ適用の開始に失敗しました | クラスター <cluster-name> で IG <instance-group-name> の UpdateClusterSoftware を開始できませんでした。 instance-group-name |
| 次のパッチ適用バッチが選択されました | クラスター <cluster-name> で IG <instance-group-name> 用に選択された次の更新バッチ。 |
| 次のパッチ適用バッチ選択に失敗しました | クラスター <cluster-name> で IG <instance-group-name> の次の更新バッチを選択できませんでした。 |
| 置き換えのためにキューに入れられた失敗したインスタンス | ノード置換のためにキューに入れられたクラスター <cluster-name> の IG <instance-group-name> で失敗したインスタンス。 |
| 失敗したインスタンス置換キューイングに失敗しました | クラスター <cluster-name> の IG <instance-group-name> でノード置換のためにインスタンスをキューに入れられませんでした。 |
| インスタンスグループのパッチ適用が完了しました | UpdateClusterSoftware は、クラスター <cluster-name> の IG <instance-group-name> に対して正常に完了しました。 |
| インスタンスグループのパッチ適用の完了に失敗しました | クラスター <cluster-name> で IG <instance-group-name> の UpdateClusterSoftware を完了できませんでした。 instance-group-name |
| ルートボリューム置換が開始されました | IG <instance-group-name> のインスタンス <instance-id> でルートボリュームの置換が開始されました。 |
| ルートボリュームの交換に失敗しました | IG <instance-group-name> でインスタンス <instance-id> のルートボリューム置換を開始できませんでした。 |
| インスタンスのパッチ適用に成功しました | IG <instance-group-name> のインスタンス <instance-id> が正常に更新されました。 |
EKS 固有のイベント
次のイベントは、Amazon EKS とオーケストレーションされた HyperPod クラスターに対してのみ出力されます。
アクセスエントリ管理
| [Event] (イベント) | 説明 |
|---|---|
| SLR アクセスエントリオペレーションが成功しました | クラスター <cluster-name> の SLR アクセスエントリ <operation> が成功しました |
| SLR アクセスエントリオペレーションに失敗しました | クラスター <cluster-name> の SLR アクセスエントリ <operation> に失敗しました |
| EKS アクセスエントリオペレーションが成功しました | クラスター <cluster-name> の EKS アクセスエントリ <operation> が成功しました |
| EKS アクセスエントリオペレーションに失敗しました | クラスター <cluster-name> の EKS アクセスエントリ <operation> に失敗しました |
Kubernetes 設定の更新
| [Event] (イベント) | 説明 |
|---|---|
| Kubernetes 設定の更新に成功しました | クラスター <cluster-name> および IG <instance-group-name> のインスタンス <instance-id> の Kubernetes 設定が正常に更新されました |
| Kubernetes 設定の更新に失敗しました | クラスター <cluster-name> および IG <instance-group-name> のインスタンス <instance-id> の Kubernetes 設定を更新できませんでした |
Karpenter 自動スケーリング
| [Event] (イベント) | 説明 |
|---|---|
| Auto Scaling オペレーションが成功しました | クラスター <cluster-name> での AutoScaling <operation> <status> の成功 |
| Auto Scaling オペレーションが失敗しました | クラスター <cluster-name> で <operation> AutoScaling に失敗しました |
| Karpenter CRD のインストールに成功しました | CustomResourceDefinition のインストールが EKS クラスター <cluster-name> で正常に完了しました |
| Karpenter CRD のインストールに失敗しました | EKS クラスター <cluster-name> の CustomResourceDefinition のインストールに失敗しました |
| Karpenter SLR アクセスポリシーの更新に成功しました | EKS クラスター <cluster-name> の AmazonSageMakerHyperPodServiceRole アクセスエントリを使用した <operation> アクセスポリシー |
| Karpenter SLR アクセスポリシーの更新に失敗しました | EKS クラスター <cluster-name> の AmazonSageMakerHyperPodServiceRole アクセスエントリを使用した <operation> アクセスポリシーに失敗しました |
パッチ適用 — EKS インスタンスレベル
| [Event] (イベント) | 説明 |
|---|---|
| インスタンスのパッチ適用の準備に成功しました | IG <instance-group-name> のインスタンス <instance-id> が接続され、ポッドが削除されます。 |
| インスタンスのパッチ適用がスキップされました (PDB 違反) | PodDisruptionBudget 制約のため、IG <instance-group-name> のインスタンス <instance-id> の UpdateClusterSoftware がスキップされました。 |
| インスタンスのパッチ適用の準備に失敗しました | UpdateClusterSoftware の IG <instance-group-name> でインスタンス <instance-id> の準備に失敗しました。 |
| スケジュール可能な状態に復元されたインスタンス | IG <instance-group-name> のインスタンス <instance-id> がスケジュール可能な状態に復元されました。 |
| スケジュール可能なインスタンスへの復元に失敗しました | IG <instance-group-name> のインスタンス <instance-id> をスケジュール可能な状態に復元できませんでした。 |
パッチ適用 — EKS ロールバック
| [Event] (イベント) | 説明 |
|---|---|
| ベイク開始時刻 | クラスター <cluster-name> で IG <instance-group-name> のベーキング期間が開始されました。<duration> 秒間のアラーム [<alarm-names>] のモニタリング。 |
| ベイク時間の完了 | クラスター <cluster-name> の IG <instance-group-name> のベーキング期間が完了しました。<duration>-second ベーキング期間中にトリガーされるアラームはありません。 |
| ベイク時間アラームがトリガーされました | クラスター <cluster-name> の IG <instance-group-name> のベーキング期間に失敗しました。アラーム [<alarm-names>] が ALARM 状態になりました。自動ロールバックを開始します。 |
| ベーク時間の評価に失敗しました | クラスター <cluster-name> の IG <instance-group-name> のベーキング期間中にアラームの評価に失敗しました。 |
| インスタンスグループのパッチ適用のロールバックが開始されました | クラスター <cluster-name> の IG <instance-group-name> で UpdateClusterSoftware が失敗しました。 instance-group-name ロールバックを開始します。 |
| インスタンスグループのパッチ適用のロールバックに失敗しました | クラスター <cluster-name> の IG <instance-group-name> のロールバックに失敗しました。一部のインスタンスは FailedMaintenance 状態である場合があります。 |
| インスタンスパッチ適用のロールバックが開始されました | IG <instance-group-name> のインスタンス <instance-id> の更新に失敗しました。ロールバックが開始されました。 |
| インスタンスのパッチ適用のロールバックに成功しました | IG <instance-group-name> のインスタンス <instance-id> は、以前の AMI に正常にロールバックされました。 |
| インスタンスのパッチ適用のロールバックに失敗しました | IG <instance-group-name> のインスタンス <instance-id> で UpdateClusterSoftware のロールバックに失敗しました。 |
Slurm 固有のイベント
次のイベントは、Slurm とオーケストレーションされた HyperPod クラスターに対してのみ出力されます。
| [Event] (イベント) | 説明 |
|---|---|
| プロビジョニングパラメータが見つかりました | コントローラーグループ <instance-group-name> の LifeCycleScript S3 パスに provisioning_parameters.json が見つかりました |
| プロビジョニングパラメータが見つかりません | コントローラーグループ <instance-group-name> の LifeCycleScript S3 パスに provisioning_parameters.json が見つかりません |
| Slurm munge キーが作成されました | 正常に作成され、保存された munge キー |
| Slurm ドリフト検証に合格しました | Slurm 設定ドリフトの検証に合格しました |
| スラムドリフトが検出されました | Slurm 設定ドリフトが検出されました: <drift-details> |
| Slurm クラスターのロールバックが完了しました | クラスターの作成に失敗しました: コントローラーノードとログインノードが想定時間内に準備できませんでした |
| Slurm の再設定に成功しました | Slurm が正常に再設定されました。目的の状態と一致するように更新された Slurm 設定 |
EventBridge 統合
HyperPod は、3 つの詳細タイプを使用してクラスターイベントを Amazon EventBridge に送信します。
| Detail-type | 説明 |
|---|---|
SageMaker HyperPod Cluster Event |
プロビジョニング、スケーリング、パッチ適用、オーケストレーター固有のオペレーションのオペレーションイベント。重要度フィルタリングEventLevelに が含まれます。 |
SageMaker HyperPod Cluster State Change |
クラスターレベルのステータス遷移 (Creating to InService など)。完全なクラスター設定が含まれます。 |
SageMaker HyperPod Cluster Node Health
Event |
HyperPod Health Monitoring Agent (HMA) からのヘルスモニタリングイベント。ヘルスステータス、理由、修復アクション、レコメンデーションが含まれます。 |
イベントパターンの例
すべての HyperPod クラスターイベント:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }
エラーイベントのみ (アラート用):
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }
特定のクラスターのイベント:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }
ノードヘルスイベント:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }
API リファレンス
-
ListClusterEvents — フィルタリング、ソート、ページ分割を含むイベントを一覧表示する
-
DescribeClusterEvent — 特定のイベントの詳細を取得する
-
ClusterEventSummary — イベント概要データ型
-
ClusterEventDetail — イベント詳細データ型
関連情報
-
SageMaker HyperPod Slurm クラスターイベント — CLI の使用と一般的なシナリオを含む Slurm クラスターイベント
-
SageMaker HyperPod EKS クラスターイベント — CLI の使用状況と一般的なシナリオを含む EKS クラスターイベント