Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Meluncurkan pekerjaan pelatihan terdistribusi dengan SMDDP menggunakan Python SDK SageMaker
Untuk menjalankan pekerjaan pelatihan terdistribusi dengan skrip yang Anda adaptasi dariMengadaptasi skrip pelatihan Anda untuk menggunakan operasi kolektif SMDDP, gunakan kerangka kerja SageMaker Python SDK atau estimator generik dengan menentukan skrip pelatihan yang disiapkan sebagai skrip titik masuk dan konfigurasi pelatihan terdistribusi.
Halaman ini memandu Anda melalui cara menggunakan SageMaker AI Python SDK
-
Jika Anda ingin mencapai adopsi cepat dari pekerjaan pelatihan terdistribusi Anda di SageMaker AI, konfigurasikan kelas estimator SageMaker AI PyTorch
atau TensorFlow kerangka kerja. Penaksir kerangka kerja mengambil skrip pelatihan Anda dan secara otomatis mencocokkan URI gambar yang tepat dari Kontainer Pem belajaran PyTorch Men TensorFlow dalam (DLC) yang telah dibuat sebelumnya , dengan nilai yang ditentukan untuk parameter. framework_version -
Jika Anda ingin memperluas salah satu wadah yang sudah dibuat sebelumnya atau membuat wadah khusus untuk membuat lingkungan ML Anda sendiri dengan SageMaker AI, gunakan
Estimatorkelas generik SageMaker AI dan tentukan URI gambar dari wadah Docker khusus yang dihosting di Amazon Elastic Container Registry (Amazon ECR) Anda.
Kumpulan data pelatihan Anda harus disimpan di Amazon S3 atau Amazon FSx for Lustre Wilayah AWS di mana Anda meluncurkan pekerjaan pelatihan Anda. Jika Anda menggunakan buku catatan Jupyter, Anda harus memiliki instance SageMaker notebook atau aplikasi SageMaker Studio Classic yang berjalan dalam hal yang sama. Wilayah AWS Untuk informasi selengkapnya tentang menyimpan data pelatihan Anda, lihat dokumentasi input data
Tip
Kami menyarankan Anda menggunakan Amazon FSx for Lustre, bukan Amazon S3 untuk meningkatkan kinerja pelatihan. Amazon FSx memiliki throughput yang lebih tinggi dan latensi yang lebih rendah daripada Amazon S3.
Tip
Untuk menjalankan pelatihan terdistribusi dengan benar pada jenis EFA-enabled instans, Anda harus mengaktifkan lalu lintas antar instans dengan mengatur grup keamanan VPC Anda untuk mengizinkan semua lalu lintas masuk dan keluar ke dan dari grup keamanan itu sendiri. Untuk mempelajari cara mengatur aturan grup keamanan, lihat Langkah 1: Mempersiapkan grup EFA-enabled keamanan di Panduan Pengguna Amazon EC2.
Pilih salah satu topik berikut untuk petunjuk tentang cara menjalankan tugas pelatihan terdistribusi dari skrip pelatihan Anda. Setelah meluncurkan pekerjaan pelatihan, Anda dapat memantau pemanfaatan sistem dan kinerja model menggunakan SageMaker Debugger Amazon atau Amazon CloudWatch.
Sementara Anda mengikuti petunjuk dalam topik berikut untuk mempelajari lebih lanjut tentang detail teknis, kami juga menyarankan Anda mencoba Contoh perpustakaan paralelisme data Amazon SageMaker AI untuk memulai.