Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Jelajahi dasbor Amazon SageMaker Debugger Insights
catatan
Pemberitahuan akhir dukungan: Pada 30 Juni 2027, dukungan untuk Amazon SageMaker Profiler AWS akan berakhir. Setelah 30 Juni 2027, Anda tidak akan lagi dapat mengakses konsol Profiler atau sumber daya Profiler. Untuk informasi selengkapnya, lihat Perubahan ketersediaan profiler.
Saat Anda memulai pekerjaan SageMaker pelatihan, SageMaker Debugger mulai memantau pemanfaatan sumber daya instans Amazon EC2 secara default. Anda dapat melacak tingkat pemanfaatan sistem, ikhtisar statistik, dan analisis aturan bawaan melalui dasbor Wawasan. Panduan ini memandu Anda melalui konten dasbor SageMaker Debugger Insights di bawah tab berikut: Metrik dan Aturan Sistem.
catatan
Dasbor SageMaker Debugger Insights menjalankan aplikasi Studio Classic pada ml.m5.4xlarge instance untuk memproses dan merender visualisasi. Setiap tab SageMaker Debugger Insights menjalankan satu sesi kernel Studio Classic. Beberapa sesi kernel untuk beberapa tab SageMaker Debugger Insights berjalan pada satu instance. Saat Anda menutup tab SageMaker Debugger Insights, sesi kernel yang sesuai juga ditutup. Aplikasi Studio Classic tetap aktif dan dikenakan biaya untuk penggunaan ml.m5.4xlarge instans. Untuk informasi tentang harga, lihat halaman SageMaker Harga
penting
Setelah selesai menggunakan dasbor SageMaker Debugger Insights, matikan ml.m5.4xlarge instance untuk menghindari biaya yang timbul. Untuk petunjuk tentang cara mematikan instance, lihatMatikan instance Amazon SageMaker Debugger Insights.
penting
Dalam laporan, plot dan rekomendasi disediakan untuk tujuan informasi dan tidak definitif. Anda bertanggung jawab untuk membuat penilaian independen Anda sendiri terhadap informasi tersebut.
Topik
Metrik sistem
Di tab Metrik Sistem, Anda dapat menggunakan tabel ringkasan dan plot deret waktu untuk memahami pemanfaatan sumber daya.
Ringkasan pemanfaatan sumber daya
Tabel ringkasan ini menunjukkan statistik metrik pemanfaatan sumber daya komputasi dari semua node (dilambangkan sebagai algo- n). Metrik pemanfaatan sumber daya termasuk total pemanfaatan CPU, total pemanfaatan GPU, total pemanfaatan memori CPU, total pemanfaatan memori GPU, total waktu I/O tunggu, dan total jaringan dalam byte. Tabel menunjukkan nilai minimum dan maksimum, dan persentil p99, p90, dan p50.
Plot deret waktu pemanfaatan sumber daya
Gunakan grafik deret waktu untuk melihat detail lebih lanjut tentang pemanfaatan sumber daya dan mengidentifikasi pada interval waktu apa setiap instance menunjukkan tingkat pemanfaatan yang tidak diinginkan, seperti pemanfaatan GPU rendah dan hambatan CPU yang dapat menyebabkan pemborosan instans mahal.
UI pengontrol grafik deret waktu
Tangkapan layar berikut menunjukkan pengontrol UI untuk menyesuaikan grafik deret waktu.
-
algo-1: Gunakan menu dropdown ini untuk memilih node yang ingin Anda lihat.
-
Perbesar: Gunakan tombol ini untuk memperbesar grafik deret waktu dan melihat interval waktu yang lebih pendek.
-
Perkecil: Gunakan tombol ini untuk memperkecil grafik deret waktu dan melihat interval waktu yang lebih luas.
-
Pan Lef t: Pindahkan grafik deret waktu ke interval waktu sebelumnya.
-
Pan Kanan: Pindahkan grafik deret waktu ke interval waktu berikutnya.
-
Perbaiki Ker angka Waktu: Gunakan kotak centang ini untuk memperbaiki atau mengembalikan grafik deret waktu untuk menampilkan keseluruhan tampilan dari titik data pertama ke titik data terakhir.
Pemanfaatan CPU dan waktu I/O tunggu
Dua grafik pertama menunjukkan pemanfaatan CPU dan waktu I/O tunggu dari waktu ke waktu. Secara default, grafik menunjukkan rata-rata tingkat pemanfaatan CPU dan waktu I/O tunggu yang dihabiskan pada inti CPU. Anda dapat memilih satu atau lebih inti CPU dengan memilih label untuk membuat grafik pada bagan tunggal dan membandingkan pemanfaatan di seluruh inti. Anda dapat menyeret dan memperbesar dan memperkecil untuk melihat lebih dekat pada interval waktu tertentu.
Pemanfaatan GPU dan pemanfaatan memori GPU
Grafik berikut menunjukkan pemanfaatan GPU dan pemanfaatan memori GPU dari waktu ke waktu. Secara default, grafik menunjukkan tingkat pemanfaatan rata-rata dari waktu ke waktu. Anda dapat memilih label inti GPU untuk melihat tingkat pemanfaatan setiap inti. Mengambil rata-rata tingkat pemanfaatan di atas jumlah total inti GPU menunjukkan pemanfaatan rata-rata dari seluruh sumber daya sistem perangkat keras. Dengan melihat tingkat pemanfaatan rata-rata, Anda dapat memeriksa penggunaan sumber daya sistem secara keseluruhan dari instans Amazon EC2. Gambar berikut menunjukkan contoh pekerjaan pelatihan pada ml.p3.16xlarge instance dengan 8 inti GPU. Anda dapat memantau apakah pekerjaan pelatihan didistribusikan dengan baik, sepenuhnya memanfaatkan semua GPU.
Pemanfaatan sistem secara keseluruhan dari waktu ke waktu
Peta panas berikut menunjukkan contoh seluruh pemanfaatan sistem dari suatu ml.p3.16xlarge instance dari waktu ke waktu, diproyeksikan ke plot dua dimensi. Setiap inti CPU dan GPU terdaftar dalam sumbu vertikal, dan pemanfaatannya dicatat dari waktu ke waktu dengan skema warna, di mana warna-warna cerah mewakili pemanfaatan rendah dan warna yang lebih gelap mewakili pemanfaatan tinggi. Lihat bilah warna berlabel di sisi kanan plot untuk mengetahui tingkat warna mana yang sesuai dengan tingkat pemanfaatan mana.
Aturan
Gunakan tab Aturan untuk menemukan ringkasan analisis aturan pembuatan profil pada pekerjaan pelatihan Anda. Jika aturan pembuatan profil diaktifkan dengan pekerjaan pelatihan, teks akan muncul disorot dengan teks putih solid. Aturan tidak aktif diredupkan dalam teks abu-abu. Untuk mengaktifkan aturan ini, ikuti instruksi diGunakan aturan profiler bawaan yang dikelola oleh Amazon SageMaker Debugger.