View a markdown version of this page

Profil dan optimalkan kinerja komputasi - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Profil dan optimalkan kinerja komputasi

catatan

Pemberitahuan akhir dukungan: Pada 30 Juni 2027, dukungan untuk Amazon SageMaker Profiler AWS akan berakhir. Setelah 30 Juni 2027, Anda tidak akan lagi dapat mengakses konsol Profiler atau sumber daya Profiler. Untuk informasi selengkapnya, lihat Perubahan ketersediaan profiler.

Ketika melatih model pembelajaran mendalam canggih yang ukurannya berkembang pesat, meningkatkan pekerjaan pelatihan model tersebut ke cluster GPU besar dan mengidentifikasi masalah kinerja komputasi dari miliaran dan triliunan operasi dan komunikasi dalam setiap iterasi proses penurunan gradien menjadi tantangan.

SageMaker AI menyediakan alat pembuatan profil untuk memvisualisasikan dan mendiagnosis masalah komputasi kompleks yang timbul dari menjalankan pekerjaan pelatihan pada sumber daya komputasi AWS awan. Ada dua opsi pembuatan profil yang ditawarkan SageMaker AI: Amazon SageMaker Profiler dan monitor pemanfaatan sumber daya di Amazon SageMaker Studio Classic. Lihat pengenalan dua fungsi berikut untuk mendapatkan wawasan cepat dan pelajari mana yang akan digunakan tergantung pada kebutuhan Anda.

SageMaker Profiler Amazon

Amazon SageMaker Profiler adalah kemampuan pembuatan profil SageMaker AI yang dengannya Anda dapat mempelajari lebih dalam sumber daya komputasi yang disediakan sambil melatih model pembelajaran mendalam, dan mendapatkan visibilitas ke detail tingkat operasi. SageMaker Profiler menyediakan modul Python untuk menambahkan anotasi di seluruh PyTorch atau skrip TensorFlow pelatihan dan mengaktifkan SageMaker Profiler. Anda dapat mengakses modul melalui SageMaker Python SDK dan AWS Deep Learning Containers.

Dengan SageMaker Profiler, Anda dapat melacak semua aktivitas pada CPU dan GPU, seperti penggunaan CPU dan GPU, kernel berjalan pada GPU, peluncuran kernel pada CPU, operasi sinkronisasi, operasi memori di seluruh CPU dan GPU, latensi antara peluncuran kernel dan proses yang sesuai, dan transfer data antara CPU dan GPU.

SageMaker Profiler juga menawarkan antarmuka pengguna (UI) yang memvisualisasikan profil, ringkasan statistik peristiwa yang diprofilkan, dan garis waktu pekerjaan pelatihan untuk melacak dan memahami hubungan waktu peristiwa antara GPU dan CPU.

Untuk mempelajari lebih lanjut tentang SageMaker Profiler, lihatSageMaker Profiler Amazon.

Memantau sumber AWS daya komputasi di Amazon SageMaker Studio Classic

SageMaker AI juga menyediakan antarmuka pengguna di Studio Classic untuk memantau pemanfaatan sumber daya pada tingkat tinggi, tetapi dengan perincian lebih banyak dibandingkan dengan metrik pemanfaatan default yang dikumpulkan dari SageMaker AI ke CloudWatch.

Untuk pekerjaan pelatihan apa pun yang Anda jalankan di SageMaker AI menggunakan SageMaker Python SDK, SageMaker AI mulai membuat profil metrik pemanfaatan sumber daya dasar, seperti pemanfaatan CPU, pemanfaatan GPU, pemanfaatan memori GPU, jaringan, dan waktu I/O tunggu. Ini mengumpulkan metrik pemanfaatan sumber daya ini setiap 500 milidetik.

Dibandingkan dengan CloudWatch metrik Amazon, yang mengumpulkan metrik pada interval 1 detik, fungsionalitas pemantauan SageMaker AI memberikan perincian yang lebih baik ke dalam metrik pemanfaatan sumber daya hingga interval 100 milidetik (0,1 detik), sehingga Anda dapat menyelami metrik secara mendalam pada tingkat operasi atau langkah.

Untuk mengakses dasbor untuk memantau metrik pemanfaatan sumber daya dari pekerjaan pelatihan, lihat UI Debugger SageMaker AI di SageMaker Studio Experim ents.