Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
SageMaker HyperPod referensi acara cluster
Halaman ini memberikan referensi lengkap dari semua peristiwa terstruktur yang dipancarkan oleh kluster Amazon SageMaker HyperPod . Peristiwa memberikan visibilitas ke dalam operasi klaster, grup instans, dan tingkat instans termasuk penyediaan, penskalaan, penambalan, dan perubahan siklus hidup khusus orkestra.
Acara cluster tersedia untuk HyperPod cluster dengan NodeProvisioningMode set keContinuous. Acara dapat diakses melalui DescribeClusterEvent API ListClusterEvents dan, tab Acara konsol SageMaker AI, dan Amazon EventBridge.
Catatan acara cluster
Setiap peristiwa cluster direpresentasikan sebagai catatan terstruktur yang berisi identifikasi, waktu, ruang lingkup, keparahan, dan metadata spesifik operasi. Contoh berikut menunjukkan catatan peristiwa lengkap seperti yang dikirimkan melalui DescribeClusterEvent API dan Amazon EventBridge:
{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }
Bidang catatan acara
Objek detail.EventDetails berisi kolom-kolom berikut:
| Bidang | Tipe | Diperlukan | Deskripsi |
|---|---|---|---|
EventId |
Tali (UUID) | Ya | Pengenal unik untuk acara tersebut. |
ClusterArn |
Tali | Ya | ARN dari cluster. HyperPod |
ClusterName |
Tali | Ya | Nama HyperPod cluster. |
EventTime |
Stempel waktu | Ya | Ketika peristiwa itu terjadi (epoch milidetik). |
ResourceType |
Tali | Ya | Lingkup acara:Cluster,InstanceGroup, atauInstance. |
EventLevel |
Tali | Ya | Klasifikasi keparahan: InfoWarn,, atauError. |
Description |
String | Tidak | Human-readable ringkasan acara. |
InstanceGroupName |
String | Tidak | Nama grup instance (hadir saat ResourceType ada InstanceGroup atauInstance). |
InstanceId |
String | Tidak | ID instans EC2 (hadir kapan ResourceTypeInstance). |
EventDetails |
Objek | Tidak | Metadata tambahan khusus untuk jenis sumber daya dan operasi. |
Tingkat acara
| Tingkat | Arti |
|---|---|
Info |
Operasi selesai dengan sukses atau berjalan normal. |
Warn |
Operasi diselesaikan dengan masalah non-kritis atau kondisi yang mungkin memerlukan perhatian di masa depan. |
Error |
Operasi gagal atau membutuhkan perhatian segera. |
Jenis sumber daya
| ResourceType | Lingkup | Contoh peristiwa |
|---|---|---|
Cluster |
Whole-cluster operasi | Cluster creation/update dimulai, operasi cluster gagal |
InstanceGroup |
Operasi grup instans | Penskalaan started/completed, penambalan terjadwal, siklus hidup fsX |
Instance |
Operasi instans individu | Penyediaan EC2, eksekusi skrip siklus hidup, manajemen ENI, penghentian |
EventDetails metadata
Peristiwa cluster mencakup EventMetadata objek dalam EventDetails bidang yang menyediakan konteks operasi-spesifik di luar apa yang disampaikan oleh deskripsi peristiwa. Isi EventMetadata bervariasi menurut jenis sumber daya dan jenis acara. Untuk skema lengkap dan bidang yang didukung, lihat EventMetadatadi Referensi API Amazon SageMaker AI.
EventBridge bidang amplop
Saat dikirim melalui Amazon EventBridge, catatan acara dibungkus dalam EventBridge amplop standar:
| Bidang | Deskripsi |
|---|---|
version |
EventBridge versi skema (selalu"0"). |
id |
ID EventBridge acara unik. |
detail-type |
SageMaker HyperPod Cluster Event |
source |
aws.sagemaker |
account |
AWS ID akun yang memiliki cluster. |
time |
Stempel waktu acara ISO 8601. |
region |
AWS Wilayah tempat cluster berada. |
resources |
Array yang berisi ARN cluster. |
detail |
Berisi EventDetails objek yang dijelaskan di atas. |
Peristiwa umum (EKS dan Slurm)
Peristiwa berikut dipancarkan untuk semua HyperPod cluster terlepas dari orkestrator. Kolom Deskripsi menunjukkan nilai Description bidang dalam catatan peristiwa seperti yang muncul di respons API dan tab Acara konsol.
Siklus hidup cluster
| Peristiwa | Deskripsi |
|---|---|
| Operasi cluster dimulai | Cluster <cluster-name><operation>dimulai dengan sukses |
| Operasi cluster mulai gagal | Gagal memulai Cluster <cluster-name><operation> |
| Operasi cluster selesai | Cluster <cluster-name><operation>berhasil diselesaikan |
| Operasi cluster gagal | Cluster <cluster-name><operation>gagal |
Siklus hidup grup instans
| Peristiwa | Deskripsi |
|---|---|
| Operasi grup instans dimulai | InstanceGroup <instance-group-name><operation>dimulai dengan sukses di Cluster <cluster-name> |
| Operasi grup instans mulai gagal | Gagal memulai InstanceGroup <instance-group-name><operation>di Cluster <cluster-name> |
| Operasi grup instans selesai | Grup Instance <instance-group-name><operation>di Cluster <cluster-name>berhasil diselesaikan |
| Operasi grup instans gagal | Grup Instance <instance-group-name><operation>di Cluster <cluster-name>gagal |
Konfigurasi jaringan grup instans
| Peristiwa | Deskripsi |
|---|---|
| Konfigurasi jaringan ditemukan | Menemukan Subnet <subnet-id>di AZ <availability-zone>dengan SecurityGroupIds <security-group-ids>untuk IG <instance-group-name>di Cluster <cluster-name> |
| Konfigurasi jaringan gagal | Gagal memproses detail Konfigurasi Jaringan Grup Instance untuk IG <instance-group-name>di Cluster <cluster-name> |
| Override AMI kustom ditemukan | Menemukan Penggantian AMI Kustom <ami-id>untuk IG <instance-group-name>di Cluster <cluster-name> |
| Pengesampingan AMI kustom gagal | Gagal memproses detail Penggantian AMI Kustom untuk IG <instance-group-name>di Cluster <cluster-name> |
| Konfigurasi jaringan platform yang digunakan | Menggunakan konfigurasi jaringan yang disediakan HyperPod Platform untuk IG <instance-group-name>di Cluster <cluster-name> |
| Konfigurasi jaringan ditentukan | Konfigurasi jaringan Grup Instance berhasil ditentukan untuk IG <instance-group-name>di Cluster <cluster-name> |
Pembuatan instans
| Peristiwa | Deskripsi |
|---|---|
| Operasi instans dimulai | Instance <operation>berhasil dimulai di Cluster <cluster-name>dan IG <instance-group-name> |
| Operasi instans mulai gagal | Gagal memulai Instance <operation>di Cluster <cluster-name>dan IG <instance-group-name> |
| Reservasi kapasitas ditemukan | Ditemukan CapacityReservation ID <reservation-id>untuk Cluster <cluster-name>dan IG<instance-group-name>, menggunakan kapasitas cadangan |
| Reservasi kapasitas tidak ditemukan | Tidak CapacityReservation ditemukan untuk Cluster <cluster-name>dan IG<instance-group-name>, menggunakan on-demand pool |
| Penyiapan muatan instans gagal | Gagal memproses CapacityReservationDetails untuk Cluster <cluster-name>dan IG <instance-group-name> |
| Pelanggan ENI dibuat | Berhasil membuat ENI Pelanggan misalnya di Cluster <cluster-name>dan IG <instance-group-name> |
| Pembuatan ENI pelanggan gagal | Gagal membuat ENI Pelanggan misalnya di Cluster <cluster-name>dan IG <instance-group-name> |
| Instans EC2 disediakan | <cluster-name>Instans EC2 <instance-id>berhasil disediakan di Cluster dan IG <instance-group-name> |
| Pembuatan instans EC2 gagal | Gagal menyediakan Instans EC2 di Cluster <cluster-name>dan IG <instance-group-name> |
| Status skrip siklus hidup diperbarui | <instance-id>Eksekusi skrip siklus hidup instans untuk Instans EC2 memiliki <status> |
| Pembaruan status skrip siklus hidup gagal | Gagal memperbarui status eksekusi skrip siklus hidup Instance untuk EC2InstanceId <instance-id> |
| Pembuatan instans gagal dengan log siklus hidup | <instance-id>Eksekusi skrip siklus hidup instans untuk Instans EC2 telah Gagal. Untuk melihat log skrip siklus hidup, kunjungi grup log... |
| Pembersihan ENI yang tidak terpakai berhasil | <cluster-name>Berhasil menghapus ENI Pelanggan yang tidak digunakan untuk Instans EC2 <instance-id>di Cluster dan IG <instance-group-name> |
| Pembersihan ENI yang tidak digunakan gagal | <cluster-name>Gagal menghapus ENI Pelanggan yang tidak digunakan untuk Instans EC2 <instance-id>di Cluster dan IG <instance-group-name> |
Penghapusan instans
| Peristiwa | Deskripsi |
|---|---|
| Pengakhiran instans EC2 sedang berlangsung | Pengakhiran Instans EC2 <instance-id>saat ini sedang berlangsung di Cluster <cluster-name>dan IG <instance-group-name> |
| Pengakhiran instans EC2 gagal | <cluster-name>Gagal mengakhiri Instans EC2 <instance-id>di Cluster dan IG <instance-group-name> |
| ENI pelanggan dihapus | ENI pelanggan berhasil dihapus untuk Instans EC2 <instance-id>di Cluster <cluster-name>dan IG <instance-group-name> |
| Penghapusan ENI pelanggan gagal | Gagal menghapus ENI Pelanggan untuk Instans EC2 <instance-id>di Cluster <cluster-name>dan IG <instance-group-name> |
Mulai ulang instans
| Peristiwa | Deskripsi |
|---|---|
| Instans EC2 reboot sedang berlangsung | Reboot Instans EC2 <instance-id>saat ini sedang berlangsung di Cluster <cluster-name>dan IG <instance-group-name> |
| Permintaan reboot instans EC2 gagal | Gagal mengirimkan permintaan reboot untuk Instans EC2 <instance-id>di Cluster <cluster-name>dan IG <instance-group-name> |
Operasi instance (generik)
| Peristiwa | Deskripsi |
|---|---|
| Operasi instans selesai | Instance <operation><instance-id>di Cluster <cluster-name>dan IG <instance-group-name>berhasil diselesaikan |
| Operasi instans gagal | Instance <operation><instance-id>di Cluster <cluster-name>dan IG <instance-group-name>gagal |
Penggantian instans
| Peristiwa | Deskripsi |
|---|---|
| Penggantian instans dimulai | Instance <instance-id>dimulai sebagai bagian dari penggantian instance di Cluster <cluster-name>dan IG <instance-group-name> |
| Penggantian instans mulai gagal | Instance <instance-id>gagal dimulai sebagai bagian dari penggantian instance di Cluster <cluster-name>dan IG <instance-group-name> |
| Penggantian instans selesai | Instance <instance-id><operation>berhasil diselesaikan sebagai bagian dari penggantian instance di Cluster <cluster-name>dan IG <instance-group-name> |
| Penggantian instans gagal | Instance <instance-id><operation>gagal sebagai bagian dari penggantian instance di Cluster <cluster-name>dan IG <instance-group-name> |
Siklus hidup sistem file fsX
| Peristiwa | Deskripsi |
|---|---|
| Pembuatan FSx dimulai | <instance-group-name>Pembuatan FSx dimulai untuk IG di Cluster <cluster-name> |
| Pembuatan FSx gagal | <instance-group-name>Gagal membuat fsX untuk IG di Cluster <cluster-name> |
| Pembuatan FSx selesai | <instance-group-name>Pembuatan FSx berhasil diselesaikan untuk IG di Cluster <cluster-name> |
| Penghapusan FSx dimulai | <instance-group-name>Penghapusan FSx dimulai untuk IG di Cluster <cluster-name> |
| Penghapusan FSx gagal | <instance-group-name>Gagal menghapus fsX untuk IG di Cluster <cluster-name> |
| Penghapusan FSx selesai | <instance-group-name>Penghapusan FSx berhasil diselesaikan untuk IG di Cluster <cluster-name> |
| Pembaruan FSx dimulai | <instance-group-name>Pembaruan fsX dimulai untuk IG di Cluster <cluster-name> |
| Pembaruan fsX gagal | <instance-group-name>Gagal memperbarui fsX untuk IG di Cluster <cluster-name> |
| Pembaruan FSx selesai | <instance-group-name>Pembaruan fsX berhasil diselesaikan untuk IG di Cluster <cluster-name> |
Menambal (langkah umum)
Peristiwa penambalan ini dipancarkan untuk kluster EKS dan Slurm selama operasi. UpdateClusterSoftware
| Peristiwa | Deskripsi |
|---|---|
| Penambalan grup instans dijadwalkan | InstanceGroup <instance-group-name>di Cluster <cluster-name>telah dijadwalkan UpdateClusterSoftware untuk yang terbaru. |
| Jadwal penambalan grup instans gagal | Gagal UpdateClusterSoftware menjadwalkan IG <instance-group-name>di Cluster<cluster-name>. |
| Penambalan grup instans dimulai | UpdateClusterSoftware dimulai untuk IG <instance-group-name>di Cluster <cluster-name>menggunakan <strategy>strategi. |
| Penambalan grup instans mulai gagal | <cluster-name>Gagal memulai UpdateClusterSoftware untuk IG <instance-group-name>di Cluster. |
| Batch patching berikutnya dipilih | Batch pembaruan berikutnya dipilih untuk IG <instance-group-name>di Cluster<cluster-name>. |
| Pemilihan batch patch berikutnya gagal | Gagal memilih batch pembaruan berikutnya untuk IG <instance-group-name>di Cluster<cluster-name>. |
| Instance gagal antri untuk penggantian | Instance gagal di IG <instance-group-name>di Cluster <cluster-name>mengantri untuk penggantian node. |
| Antrian penggantian instans yang gagal gagal | <cluster-name>Gagal mengantri instance untuk penggantian node di IG <instance-group-name>di Cluster. |
| Penambalan grup instans selesai | UpdateClusterSoftware berhasil diselesaikan untuk IG <instance-group-name>di Cluster<cluster-name>. |
| Penyelesaian penambalan grup instans gagal | Gagal menyelesaikan UpdateClusterSoftware IG <instance-group-name>di Cluster<cluster-name>. |
| Penggantian volume root dimulai | Penggantian volume root dimulai untuk Instance <instance-id>di IG<instance-group-name>. |
| Penggantian volume root gagal | Gagal memulai penggantian volume root untuk Instance <instance-id>di IG<instance-group-name>. |
| Penambalan instance berhasil | Instance <instance-id>di IG <instance-group-name>berhasil diperbarui. |
EKS-specific acara
Peristiwa berikut dipancarkan hanya untuk HyperPod cluster yang diatur dengan Amazon EKS.
Manajemen entri akses
| Peristiwa | Deskripsi |
|---|---|
| Operasi entri akses SLR berhasil | Entri Akses SLR <operation>berhasil untuk Cluster <cluster-name> |
| Operasi entri akses SLR gagal | Entri Akses SLR <operation>gagal untuk Cluster <cluster-name> |
| Operasi entri akses EKS berhasil | Entri Akses EKS <operation>berhasil untuk Cluster <cluster-name> |
| Operasi entri akses EKS gagal | Entri Akses EKS <operation>gagal untuk Cluster <cluster-name> |
Pembaruan konfigurasi Kubernetes
| Peristiwa | Deskripsi |
|---|---|
| Pembaruan konfigurasi Kubernetes berhasil | <instance-id><cluster-name>Berhasil memperbarui konfigurasi Kubernetes misalnya di Cluster dan IG <instance-group-name> |
| Pembaruan konfigurasi Kubernetes gagal | <instance-id><cluster-name>Gagal memperbarui konfigurasi Kubernetes misalnya di Cluster dan IG <instance-group-name> |
Penskalaan otomatis Karpenter
| Peristiwa | Deskripsi |
|---|---|
| Operasi penskalaan otomatis berhasil | AutoScaling <operation><status>berhasil di Cluster <cluster-name> |
| Operasi penskalaan otomatis gagal | Gagal <operation> AutoScaling di Cluster <cluster-name> |
| Instalasi CRD Karpenter berhasil | CustomResourceDefinition instalasi berhasil diselesaikan di EKS Cluster <cluster-name> |
| Instalasi Karpenter CRD gagal | CustomResourceDefinition instalasi gagal untuk EKS Cluster <cluster-name> |
| Pembaruan kebijakan akses Karpenter SLR berhasil | <operation>kebijakan akses dengan entri AmazonSageMakerHyperPodServiceRole akses di kluster EKS <cluster-name>berhasil |
| Pembaruan kebijakan akses Karpenter SLR gagal | Gagal <operation>mengakses kebijakan dengan entri AmazonSageMakerHyperPodServiceRole akses di kluster EKS <cluster-name> |
Penambalan — Tingkat instans EKS
| Peristiwa | Deskripsi |
|---|---|
| Persiapan penambalan instance berhasil | Instance <instance-id>di IG <instance-group-name>dikepung dan pod diusir. |
| Penambalan instance dilewati (pelanggaran PDB) | UpdateClusterSoftware misalnya <instance-id>di IG <instance-group-name>dilewati karena PodDisruptionBudget kendala. |
| Persiapan penambalan instance gagal | Gagal menyiapkan instance <instance-id>di IG <instance-group-name>untuk UpdateClusterSoftware. |
| Instance dikembalikan ke status yang dapat dijadwalkan | Instance <instance-id>di IG <instance-group-name>dikembalikan ke status yang dapat dijadwalkan. |
| Pemulihan instans ke penjadwalan gagal | Gagal memulihkan instance <instance-id>di IG <instance-group-name>ke status yang dapat dijadwalkan. |
Penambalan — EKS rollback
| Peristiwa | Deskripsi |
|---|---|
| Waktu memanggang dimulai | Periode memanggang dimulai untuk IG <instance-group-name>di Cluster<cluster-name>. Memantau alarm [<alarm-names>] selama <duration>beberapa detik. |
| Waktu panggang selesai | Periode pemanggangan selesai untuk IG <instance-group-name>di Cluster<cluster-name>. Tidak ada alarm yang dipicu selama periode <duration>pemanggangan -detik. |
| Alarm waktu panggang dipicu | Periode memanggang gagal untuk IG <instance-group-name>di Cluster<cluster-name>. Alarm [<alarm-names>] memasuki status ALARM. Memulai auto-rollback. |
| Evaluasi waktu panggang gagal | <cluster-name>Gagal mengevaluasi alarm selama periode pemanggangan untuk IG <instance-group-name>di Cluster. |
| Rollback patch grup instans dimulai | UpdateClusterSoftware gagal untuk IG <instance-group-name>di Cluster<cluster-name>. Memulai rollback. |
| Rollback patch grup instans gagal | <cluster-name>Rollback gagal untuk IG <instance-group-name>di Cluster. Beberapa contoh mungkin dalam FailedMaintenance keadaan. |
| Instans patching rollback dimulai | Instance <instance-id>di IG <instance-group-name>gagal diperbarui. Rollback dimulai. |
| Instans patching rollback berhasil | Instance <instance-id>di IG <instance-group-name>berhasil diputar kembali ke AMI sebelumnya. |
| Rollback patching instance gagal | UpdateClusterSoftware <instance-group-name>rollback gagal misalnya <instance-id>di IG. |
Slurm-specific acara
Peristiwa berikut dipancarkan hanya untuk HyperPod cluster yang diatur dengan Slurm.
| Peristiwa | Deskripsi |
|---|---|
| Parameter penyediaan ditemukan | Menemukan provisioning_parameters.json di Jalur S3 untuk grup pengontrol LifeCycleScript <instance-group-name> |
| Parameter penyediaan tidak ditemukan | Tidak ada provisioning_parameters.json yang ditemukan di Jalur S3 untuk grup pengontrol LifeCycleScript <instance-group-name> |
| Tombol slurm munge dibuat | Kunci munge berhasil dibuat dan disimpan |
| Validasi drift slurm lulus | Validasi drift konfigurasi slurm lulus |
| Slurm drift terdeteksi | Penyimpangan konfigurasi slurm terdeteksi: <drift-details> |
| Rollback cluster slurm selesai | Pembuatan cluster gagal: pengontrol dan node login tidak siap dalam waktu yang diharapkan |
| Konfigurasi ulang slurm berhasil | Slurm berhasil dikonfigurasi ulang. Konfigurasi slurm diperbarui agar sesuai dengan status yang diinginkan |
EventBridge integrasi
HyperPod mengirimkan peristiwa cluster ke Amazon EventBridge menggunakan tiga jenis detail:
| Jenis detail | Deskripsi |
|---|---|
SageMaker HyperPod Cluster Event |
Acara operasional untuk penyediaan, penskalaan, penambalan, dan operasi khusus orkestra. Termasuk EventLevel untuk penyaringan keparahan. |
SageMaker HyperPod Cluster State Change |
Cluster-level transisi status (misalnya, Membuat ke InService). Termasuk konfigurasi cluster penuh. |
SageMaker HyperPod Cluster Node Health
Event |
Peristiwa pemantauan kesehatan dari HyperPod Health Monitoring Agent (HMA). Termasuk status kesehatan, alasan, tindakan perbaikan, dan rekomendasi. |
Contoh pola acara
Semua acara HyperPod cluster:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }
Hanya peristiwa kesalahan (untuk peringatan):
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }
Acara untuk klaster tertentu:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }
Acara kesehatan simpul:
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }
Referensi API
-
ListClusterEvents— Daftar acara dengan penyaringan, penyortiran, dan pagination
-
DescribeClusterEvent— Dapatkan detail lengkap untuk acara tertentu
-
ClusterEventSummary— Tipe data ringkasan acara
-
ClusterEventDetail— Tipe data detail acara
Lihat juga
-
SageMaker HyperPod Acara klaster slurm— Acara cluster slurm dengan penggunaan CLI dan skenario umum
-
SageMaker HyperPod Acara cluster EKS— Acara cluster EKS dengan penggunaan CLI dan skenario umum