View a markdown version of this page

SageMaker HyperPod referensi acara cluster - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

SageMaker HyperPod referensi acara cluster

Halaman ini memberikan referensi lengkap dari semua peristiwa terstruktur yang dipancarkan oleh kluster Amazon SageMaker HyperPod . Peristiwa memberikan visibilitas ke dalam operasi klaster, grup instans, dan tingkat instans termasuk penyediaan, penskalaan, penambalan, dan perubahan siklus hidup khusus orkestra.

Acara cluster tersedia untuk HyperPod cluster dengan NodeProvisioningMode set keContinuous. Acara dapat diakses melalui DescribeClusterEvent API ListClusterEvents dan, tab Acara konsol SageMaker AI, dan Amazon EventBridge.

Catatan acara cluster

Setiap peristiwa cluster direpresentasikan sebagai catatan terstruktur yang berisi identifikasi, waktu, ruang lingkup, keparahan, dan metadata spesifik operasi. Contoh berikut menunjukkan catatan peristiwa lengkap seperti yang dikirimkan melalui DescribeClusterEvent API dan Amazon EventBridge:

{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }

Bidang catatan acara

Objek detail.EventDetails berisi kolom-kolom berikut:

Bidang Tipe Diperlukan Deskripsi
EventId Tali (UUID) Ya Pengenal unik untuk acara tersebut.
ClusterArn Tali Ya ARN dari cluster. HyperPod
ClusterName Tali Ya Nama HyperPod cluster.
EventTime Stempel waktu Ya Ketika peristiwa itu terjadi (epoch milidetik).
ResourceType Tali Ya Lingkup acara:Cluster,InstanceGroup, atauInstance.
EventLevel Tali Ya Klasifikasi keparahan: InfoWarn,, atauError.
Description String Tidak Human-readable ringkasan acara.
InstanceGroupName String Tidak Nama grup instance (hadir saat ResourceType ada InstanceGroup atauInstance).
InstanceId String Tidak ID instans EC2 (hadir kapan ResourceTypeInstance).
EventDetails Objek Tidak Metadata tambahan khusus untuk jenis sumber daya dan operasi.

Tingkat acara

Tingkat Arti
Info Operasi selesai dengan sukses atau berjalan normal.
Warn Operasi diselesaikan dengan masalah non-kritis atau kondisi yang mungkin memerlukan perhatian di masa depan.
Error Operasi gagal atau membutuhkan perhatian segera.

Jenis sumber daya

ResourceType Lingkup Contoh peristiwa
Cluster Whole-cluster operasi Cluster creation/update dimulai, operasi cluster gagal
InstanceGroup Operasi grup instans Penskalaan started/completed, penambalan terjadwal, siklus hidup fsX
Instance Operasi instans individu Penyediaan EC2, eksekusi skrip siklus hidup, manajemen ENI, penghentian

EventDetails metadata

Peristiwa cluster mencakup EventMetadata objek dalam EventDetails bidang yang menyediakan konteks operasi-spesifik di luar apa yang disampaikan oleh deskripsi peristiwa. Isi EventMetadata bervariasi menurut jenis sumber daya dan jenis acara. Untuk skema lengkap dan bidang yang didukung, lihat EventMetadatadi Referensi API Amazon SageMaker AI.

EventBridge bidang amplop

Saat dikirim melalui Amazon EventBridge, catatan acara dibungkus dalam EventBridge amplop standar:

Bidang Deskripsi
version EventBridge versi skema (selalu"0").
id ID EventBridge acara unik.
detail-type SageMaker HyperPod Cluster Event
source aws.sagemaker
account AWS ID akun yang memiliki cluster.
time Stempel waktu acara ISO 8601.
region AWS Wilayah tempat cluster berada.
resources Array yang berisi ARN cluster.
detail Berisi EventDetails objek yang dijelaskan di atas.

Peristiwa umum (EKS dan Slurm)

Peristiwa berikut dipancarkan untuk semua HyperPod cluster terlepas dari orkestrator. Kolom Deskripsi menunjukkan nilai Description bidang dalam catatan peristiwa seperti yang muncul di respons API dan tab Acara konsol.

Siklus hidup cluster

Peristiwa Deskripsi
Operasi cluster dimulai Cluster <cluster-name><operation>dimulai dengan sukses
Operasi cluster mulai gagal Gagal memulai Cluster <cluster-name><operation>
Operasi cluster selesai Cluster <cluster-name><operation>berhasil diselesaikan
Operasi cluster gagal Cluster <cluster-name><operation>gagal

Siklus hidup grup instans

Peristiwa Deskripsi
Operasi grup instans dimulai InstanceGroup <instance-group-name><operation>dimulai dengan sukses di Cluster <cluster-name>
Operasi grup instans mulai gagal Gagal memulai InstanceGroup <instance-group-name><operation>di Cluster <cluster-name>
Operasi grup instans selesai Grup Instance <instance-group-name><operation>di Cluster <cluster-name>berhasil diselesaikan
Operasi grup instans gagal Grup Instance <instance-group-name><operation>di Cluster <cluster-name>gagal

Konfigurasi jaringan grup instans

Peristiwa Deskripsi
Konfigurasi jaringan ditemukan Menemukan Subnet <subnet-id>di AZ <availability-zone>dengan SecurityGroupIds <security-group-ids>untuk IG <instance-group-name>di Cluster <cluster-name>
Konfigurasi jaringan gagal Gagal memproses detail Konfigurasi Jaringan Grup Instance untuk IG <instance-group-name>di Cluster <cluster-name>
Override AMI kustom ditemukan Menemukan Penggantian AMI Kustom <ami-id>untuk IG <instance-group-name>di Cluster <cluster-name>
Pengesampingan AMI kustom gagal Gagal memproses detail Penggantian AMI Kustom untuk IG <instance-group-name>di Cluster <cluster-name>
Konfigurasi jaringan platform yang digunakan Menggunakan konfigurasi jaringan yang disediakan HyperPod Platform untuk IG <instance-group-name>di Cluster <cluster-name>
Konfigurasi jaringan ditentukan Konfigurasi jaringan Grup Instance berhasil ditentukan untuk IG <instance-group-name>di Cluster <cluster-name>

Pembuatan instans

Peristiwa Deskripsi
Operasi instans dimulai Instance <operation>berhasil dimulai di Cluster <cluster-name>dan IG <instance-group-name>
Operasi instans mulai gagal Gagal memulai Instance <operation>di Cluster <cluster-name>dan IG <instance-group-name>
Reservasi kapasitas ditemukan Ditemukan CapacityReservation ID <reservation-id>untuk Cluster <cluster-name>dan IG<instance-group-name>, menggunakan kapasitas cadangan
Reservasi kapasitas tidak ditemukan Tidak CapacityReservation ditemukan untuk Cluster <cluster-name>dan IG<instance-group-name>, menggunakan on-demand pool
Penyiapan muatan instans gagal Gagal memproses CapacityReservationDetails untuk Cluster <cluster-name>dan IG <instance-group-name>
Pelanggan ENI dibuat Berhasil membuat ENI Pelanggan misalnya di Cluster <cluster-name>dan IG <instance-group-name>
Pembuatan ENI pelanggan gagal Gagal membuat ENI Pelanggan misalnya di Cluster <cluster-name>dan IG <instance-group-name>
Instans EC2 disediakan <cluster-name>Instans EC2 <instance-id>berhasil disediakan di Cluster dan IG <instance-group-name>
Pembuatan instans EC2 gagal Gagal menyediakan Instans EC2 di Cluster <cluster-name>dan IG <instance-group-name>
Status skrip siklus hidup diperbarui <instance-id>Eksekusi skrip siklus hidup instans untuk Instans EC2 memiliki <status>
Pembaruan status skrip siklus hidup gagal Gagal memperbarui status eksekusi skrip siklus hidup Instance untuk EC2InstanceId <instance-id>
Pembuatan instans gagal dengan log siklus hidup <instance-id>Eksekusi skrip siklus hidup instans untuk Instans EC2 telah Gagal. Untuk melihat log skrip siklus hidup, kunjungi grup log...
Pembersihan ENI yang tidak terpakai berhasil <cluster-name>Berhasil menghapus ENI Pelanggan yang tidak digunakan untuk Instans EC2 <instance-id>di Cluster dan IG <instance-group-name>
Pembersihan ENI yang tidak digunakan gagal <cluster-name>Gagal menghapus ENI Pelanggan yang tidak digunakan untuk Instans EC2 <instance-id>di Cluster dan IG <instance-group-name>

Penghapusan instans

Peristiwa Deskripsi
Pengakhiran instans EC2 sedang berlangsung Pengakhiran Instans EC2 <instance-id>saat ini sedang berlangsung di Cluster <cluster-name>dan IG <instance-group-name>
Pengakhiran instans EC2 gagal <cluster-name>Gagal mengakhiri Instans EC2 <instance-id>di Cluster dan IG <instance-group-name>
ENI pelanggan dihapus ENI pelanggan berhasil dihapus untuk Instans EC2 <instance-id>di Cluster <cluster-name>dan IG <instance-group-name>
Penghapusan ENI pelanggan gagal Gagal menghapus ENI Pelanggan untuk Instans EC2 <instance-id>di Cluster <cluster-name>dan IG <instance-group-name>

Mulai ulang instans

Peristiwa Deskripsi
Instans EC2 reboot sedang berlangsung Reboot Instans EC2 <instance-id>saat ini sedang berlangsung di Cluster <cluster-name>dan IG <instance-group-name>
Permintaan reboot instans EC2 gagal Gagal mengirimkan permintaan reboot untuk Instans EC2 <instance-id>di Cluster <cluster-name>dan IG <instance-group-name>

Operasi instance (generik)

Peristiwa Deskripsi
Operasi instans selesai Instance <operation><instance-id>di Cluster <cluster-name>dan IG <instance-group-name>berhasil diselesaikan
Operasi instans gagal Instance <operation><instance-id>di Cluster <cluster-name>dan IG <instance-group-name>gagal

Penggantian instans

Peristiwa Deskripsi
Penggantian instans dimulai Instance <instance-id>dimulai sebagai bagian dari penggantian instance di Cluster <cluster-name>dan IG <instance-group-name>
Penggantian instans mulai gagal Instance <instance-id>gagal dimulai sebagai bagian dari penggantian instance di Cluster <cluster-name>dan IG <instance-group-name>
Penggantian instans selesai Instance <instance-id><operation>berhasil diselesaikan sebagai bagian dari penggantian instance di Cluster <cluster-name>dan IG <instance-group-name>
Penggantian instans gagal Instance <instance-id><operation>gagal sebagai bagian dari penggantian instance di Cluster <cluster-name>dan IG <instance-group-name>

Siklus hidup sistem file fsX

Peristiwa Deskripsi
Pembuatan FSx dimulai <instance-group-name>Pembuatan FSx dimulai untuk IG di Cluster <cluster-name>
Pembuatan FSx gagal <instance-group-name>Gagal membuat fsX untuk IG di Cluster <cluster-name>
Pembuatan FSx selesai <instance-group-name>Pembuatan FSx berhasil diselesaikan untuk IG di Cluster <cluster-name>
Penghapusan FSx dimulai <instance-group-name>Penghapusan FSx dimulai untuk IG di Cluster <cluster-name>
Penghapusan FSx gagal <instance-group-name>Gagal menghapus fsX untuk IG di Cluster <cluster-name>
Penghapusan FSx selesai <instance-group-name>Penghapusan FSx berhasil diselesaikan untuk IG di Cluster <cluster-name>
Pembaruan FSx dimulai <instance-group-name>Pembaruan fsX dimulai untuk IG di Cluster <cluster-name>
Pembaruan fsX gagal <instance-group-name>Gagal memperbarui fsX untuk IG di Cluster <cluster-name>
Pembaruan FSx selesai <instance-group-name>Pembaruan fsX berhasil diselesaikan untuk IG di Cluster <cluster-name>

Menambal (langkah umum)

Peristiwa penambalan ini dipancarkan untuk kluster EKS dan Slurm selama operasi. UpdateClusterSoftware

Peristiwa Deskripsi
Penambalan grup instans dijadwalkan InstanceGroup <instance-group-name>di Cluster <cluster-name>telah dijadwalkan UpdateClusterSoftware untuk yang terbaru.
Jadwal penambalan grup instans gagal Gagal UpdateClusterSoftware menjadwalkan IG <instance-group-name>di Cluster<cluster-name>.
Penambalan grup instans dimulai UpdateClusterSoftware dimulai untuk IG <instance-group-name>di Cluster <cluster-name>menggunakan <strategy>strategi.
Penambalan grup instans mulai gagal <cluster-name>Gagal memulai UpdateClusterSoftware untuk IG <instance-group-name>di Cluster.
Batch patching berikutnya dipilih Batch pembaruan berikutnya dipilih untuk IG <instance-group-name>di Cluster<cluster-name>.
Pemilihan batch patch berikutnya gagal Gagal memilih batch pembaruan berikutnya untuk IG <instance-group-name>di Cluster<cluster-name>.
Instance gagal antri untuk penggantian Instance gagal di IG <instance-group-name>di Cluster <cluster-name>mengantri untuk penggantian node.
Antrian penggantian instans yang gagal gagal <cluster-name>Gagal mengantri instance untuk penggantian node di IG <instance-group-name>di Cluster.
Penambalan grup instans selesai UpdateClusterSoftware berhasil diselesaikan untuk IG <instance-group-name>di Cluster<cluster-name>.
Penyelesaian penambalan grup instans gagal Gagal menyelesaikan UpdateClusterSoftware IG <instance-group-name>di Cluster<cluster-name>.
Penggantian volume root dimulai Penggantian volume root dimulai untuk Instance <instance-id>di IG<instance-group-name>.
Penggantian volume root gagal Gagal memulai penggantian volume root untuk Instance <instance-id>di IG<instance-group-name>.
Penambalan instance berhasil Instance <instance-id>di IG <instance-group-name>berhasil diperbarui.

EKS-specific acara

Peristiwa berikut dipancarkan hanya untuk HyperPod cluster yang diatur dengan Amazon EKS.

Manajemen entri akses

Peristiwa Deskripsi
Operasi entri akses SLR berhasil Entri Akses SLR <operation>berhasil untuk Cluster <cluster-name>
Operasi entri akses SLR gagal Entri Akses SLR <operation>gagal untuk Cluster <cluster-name>
Operasi entri akses EKS berhasil Entri Akses EKS <operation>berhasil untuk Cluster <cluster-name>
Operasi entri akses EKS gagal Entri Akses EKS <operation>gagal untuk Cluster <cluster-name>

Pembaruan konfigurasi Kubernetes

Peristiwa Deskripsi
Pembaruan konfigurasi Kubernetes berhasil <instance-id><cluster-name>Berhasil memperbarui konfigurasi Kubernetes misalnya di Cluster dan IG <instance-group-name>
Pembaruan konfigurasi Kubernetes gagal <instance-id><cluster-name>Gagal memperbarui konfigurasi Kubernetes misalnya di Cluster dan IG <instance-group-name>

Penskalaan otomatis Karpenter

Peristiwa Deskripsi
Operasi penskalaan otomatis berhasil AutoScaling <operation><status>berhasil di Cluster <cluster-name>
Operasi penskalaan otomatis gagal Gagal <operation> AutoScaling di Cluster <cluster-name>
Instalasi CRD Karpenter berhasil CustomResourceDefinition instalasi berhasil diselesaikan di EKS Cluster <cluster-name>
Instalasi Karpenter CRD gagal CustomResourceDefinition instalasi gagal untuk EKS Cluster <cluster-name>
Pembaruan kebijakan akses Karpenter SLR berhasil <operation>kebijakan akses dengan entri AmazonSageMakerHyperPodServiceRole akses di kluster EKS <cluster-name>berhasil
Pembaruan kebijakan akses Karpenter SLR gagal Gagal <operation>mengakses kebijakan dengan entri AmazonSageMakerHyperPodServiceRole akses di kluster EKS <cluster-name>

Penambalan — Tingkat instans EKS

Peristiwa Deskripsi
Persiapan penambalan instance berhasil Instance <instance-id>di IG <instance-group-name>dikepung dan pod diusir.
Penambalan instance dilewati (pelanggaran PDB) UpdateClusterSoftware misalnya <instance-id>di IG <instance-group-name>dilewati karena PodDisruptionBudget kendala.
Persiapan penambalan instance gagal Gagal menyiapkan instance <instance-id>di IG <instance-group-name>untuk UpdateClusterSoftware.
Instance dikembalikan ke status yang dapat dijadwalkan Instance <instance-id>di IG <instance-group-name>dikembalikan ke status yang dapat dijadwalkan.
Pemulihan instans ke penjadwalan gagal Gagal memulihkan instance <instance-id>di IG <instance-group-name>ke status yang dapat dijadwalkan.

Penambalan — EKS rollback

Peristiwa Deskripsi
Waktu memanggang dimulai Periode memanggang dimulai untuk IG <instance-group-name>di Cluster<cluster-name>. Memantau alarm [<alarm-names>] selama <duration>beberapa detik.
Waktu panggang selesai Periode pemanggangan selesai untuk IG <instance-group-name>di Cluster<cluster-name>. Tidak ada alarm yang dipicu selama periode <duration>pemanggangan -detik.
Alarm waktu panggang dipicu Periode memanggang gagal untuk IG <instance-group-name>di Cluster<cluster-name>. Alarm [<alarm-names>] memasuki status ALARM. Memulai auto-rollback.
Evaluasi waktu panggang gagal <cluster-name>Gagal mengevaluasi alarm selama periode pemanggangan untuk IG <instance-group-name>di Cluster.
Rollback patch grup instans dimulai UpdateClusterSoftware gagal untuk IG <instance-group-name>di Cluster<cluster-name>. Memulai rollback.
Rollback patch grup instans gagal <cluster-name>Rollback gagal untuk IG <instance-group-name>di Cluster. Beberapa contoh mungkin dalam FailedMaintenance keadaan.
Instans patching rollback dimulai Instance <instance-id>di IG <instance-group-name>gagal diperbarui. Rollback dimulai.
Instans patching rollback berhasil Instance <instance-id>di IG <instance-group-name>berhasil diputar kembali ke AMI sebelumnya.
Rollback patching instance gagal UpdateClusterSoftware <instance-group-name>rollback gagal misalnya <instance-id>di IG.

Slurm-specific acara

Peristiwa berikut dipancarkan hanya untuk HyperPod cluster yang diatur dengan Slurm.

Peristiwa Deskripsi
Parameter penyediaan ditemukan Menemukan provisioning_parameters.json di Jalur S3 untuk grup pengontrol LifeCycleScript <instance-group-name>
Parameter penyediaan tidak ditemukan Tidak ada provisioning_parameters.json yang ditemukan di Jalur S3 untuk grup pengontrol LifeCycleScript <instance-group-name>
Tombol slurm munge dibuat Kunci munge berhasil dibuat dan disimpan
Validasi drift slurm lulus Validasi drift konfigurasi slurm lulus
Slurm drift terdeteksi Penyimpangan konfigurasi slurm terdeteksi: <drift-details>
Rollback cluster slurm selesai Pembuatan cluster gagal: pengontrol dan node login tidak siap dalam waktu yang diharapkan
Konfigurasi ulang slurm berhasil Slurm berhasil dikonfigurasi ulang. Konfigurasi slurm diperbarui agar sesuai dengan status yang diinginkan

EventBridge integrasi

HyperPod mengirimkan peristiwa cluster ke Amazon EventBridge menggunakan tiga jenis detail:

Jenis detail Deskripsi
SageMaker HyperPod Cluster Event Acara operasional untuk penyediaan, penskalaan, penambalan, dan operasi khusus orkestra. Termasuk EventLevel untuk penyaringan keparahan.
SageMaker HyperPod Cluster State Change Cluster-level transisi status (misalnya, Membuat ke InService). Termasuk konfigurasi cluster penuh.
SageMaker HyperPod Cluster Node Health Event Peristiwa pemantauan kesehatan dari HyperPod Health Monitoring Agent (HMA). Termasuk status kesehatan, alasan, tindakan perbaikan, dan rekomendasi.

Contoh pola acara

Semua acara HyperPod cluster:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }

Hanya peristiwa kesalahan (untuk peringatan):

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }

Acara untuk klaster tertentu:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }

Acara kesehatan simpul:

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }

Referensi API

Lihat juga