View a markdown version of this page

Dapatkan kapasitas komputasi untuk Pekerjaan Pel SageMaker atihan - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Dapatkan kapasitas komputasi untuk Pekerjaan Pel SageMaker atihan

Sebelum meminta kapasitas komputasi, konfirmasikan bahwa AWS akun Anda memenuhi prasyarat berikut. Mengatasi persyaratan ini secara berurutan membantu Anda menghindari kegagalan penyediaan umum.

Langkah 1: Verifikasi ketersediaan instans di Wilayah Anda

Tidak semua jenis instans tersedia di setiap Wil AWS ayah. Sebelum memilih jenis instans untuk beban kerja pelatihan Anda, verifikasi apakah itu tersedia di Wilayah target Anda.

  • Untuk melihat ketersediaan instans dan harga per Wilayah, lihat SageMaker Harga AI. Pilih tab Pel atihan dan pilih Wilayah Anda untuk melihat jenis instans yang tersedia, spesifikasi, dan harga per jam.

Jika jenis instans tidak tersedia di Wilayah Anda:

  • Pilih jenis instans alternatif yang tersedia di Wilayah Anda. Untuk GPU-accelerated pelatihan, identifikasi keluarga instance dengan memori GPU dan kemampuan jaringan yang sebanding.

  • Jika beban kerja Anda memerlukan jenis instans tertentu dan persyaratan tempat tinggal dan kepatuhan data memungkinkan, pertimbangkan untuk menjalankan pekerjaan pelatihan di Wilayah lain tempat jenis instans tersebut tersedia. Pastikan data pelatihan Anda dapat diakses dari Wilayah target, atau rencanakan transfer data lintas wilayah.

Verifikasi ketersediaan instans per Zona Ketersediaan

Ketersediaan instans juga bervariasi menurut Zona Ketersediaan dalam Wilayah. Jenis instans yang ditawarkan di Wilayah Anda belum tentu ditawarkan di setiap Zona Ketersediaan di Wilayah tersebut. Ini penting ketika Anda menjalankan tugas pelatihan di VPC pribadi, karena subnet yang Anda tentukan menentukan Zona Ketersediaan yang dapat digunakan SageMaker AI untuk menyediakan instans. Untuk informasi selengkapnya, lihat Langkah 3: Konfigurasikan VPC dan subnet Anda (opsional).

Untuk mencantumkan Zona Ketersediaan yang menawarkan jenis instans di Wilayah, gunakan Amazon Elastic Compute Cloud DescribeInstanceTypeOfferings API:

aws ec2 describe-instance-type-offerings \ --location-type availability-zone \ --filters Name=instance-type,Values=p5.48xlarge \ --region us-east-1 \ --query 'InstanceTypeOfferings[].Location' \ --output table
catatan

Tentukan jenis instans Amazon Elastic Compute Cloud (p5.48xlarge), bukan tipe instans SageMaker AI (ml.p5.48xlarge). SageMaker Jenis instans pelatihan AI dipetakan ke jenis instans Amazon Elastic Compute Cloud yang setara dengan ml. awalan dihapus.

Langkah 2: Periksa dan minta kuota layanan

AWS Akun Anda memiliki kuota default yang membatasi jumlah instance yang dapat Anda gunakan secara bersamaan untuk Pekerjaan Pel SageMaker atihan. Setiap jenis instans memiliki kuota sendiri.

  • Untuk melihat kuota Anda saat ini, buka konsol Kuota Layanan dan filter untuk jenis instans yang akan Anda gunakan.

  • Jika kuota Anda tidak mencukupi untuk jumlah contoh yang dibutuhkan pekerjaan pelatihan Anda, minta kenaikan kuota. Kenaikan kuota tidak langsung — kirimkan permintaan Anda sebelum pelatihan yang direncanakan.

Tip

Untuk Rencana Pelatihan Fleksibel, kuota layanan Anda harus sama atau lebih besar dari jumlah instans dalam paket Anda. Untuk informasi selengkapnya, lihat Lihat kuota rencana SageMaker pelatihan menggunakan AWS konsol manajemen.

Langkah 3: Konfigurasikan VPC dan subnet Anda (opsional)

Langkah ini hanya berlaku jika Anda menjalankan pekerjaan pelatihan di VPC pribadi. Secara default, SageMaker Pekerjaan Pelatihan berjalan di lingkungan SageMaker AI-managed jaringan dan tidak memerlukan konfigurasi VPC. Jika organisasi Anda memerlukan pekerjaan pelatihan untuk mengakses sumber daya di VPC pribadi — misalnya, data yang disimpan di Amazon S3 melalui titik akhir VPC, atau sistem file — Anda harus menentukan Subnets dan SecurityGroupIds dalam VpcConfig parameter API. CreateTrainingJob

Saat Anda mengonfigurasi VPC, subnet yang Anda tentukan menentukan Zona Ketersediaan yang dapat digunakan SageMaker AI untuk menyediakan instans.

  • Menyediakan subnet di beberapa Zona Ketersediaan. SageMaker AI menyediakan contoh pelatihan dari kumpulan per Availability-Zone kapasitas. Menyertakan subnet di lebih banyak Zona Ketersediaan meningkatkan kumpulan kapasitas yang dapat diambil SageMaker AI, yang meningkatkan kemungkinan penyediaan instans berhasil dan mengurangi waktu tunggu. Tentukan subnet di setidaknya tiga Zona Ketersediaan jika memungkinkan.

    SageMaker AI masih meluncurkan semua instans untuk pekerjaan tertentu dalam satu subnet (Zona Ketersediaan tunggal) untuk menjaga mereka tetap dekat secara fisik dan meminimalkan latensi antar node. Subnet tambahan hanya memperluas opsi yang dapat SageMaker dipilih AI. Mereka tidak menyebarkan instans satu pekerjaan di seluruh Zona Ketersediaan.

  • Untuk Rencana Pelatihan Fleksibel, sejajarkan subnet dengan Kapasitas Cadangan Anda. Setiap blok Kapasitas Cadangan disediakan di Zona Ketersediaan tertentu. Di Subnets dalam Anda VpcConfig harus menyertakan Zona Ketersediaan tempat blok Kapasitas Cadangan Anda disediakan. Untuk paket dengan beberapa blok yang menjangkau Zona Ketersediaan yang berbeda, sertakan subnet di semua zona yang relevan.

  • Sejajarkan sumber data dengan Zona Ketersediaan instans pelatihan. Jika data pelatihan Anda berada di layanan Availability-Zone-specific penyimpanan seperti atau Amazon EFS, verifikasi bahwa sistem file dapat diakses dari Zona Ketersediaan yang sama tempat instans pelatihan Anda akan berjalan.

Pilih opsi kapasitas

On-Demand Contoh

On-Demand adalah opsi kapasitas default untuk Pekerjaan SageMaker Pelatihan. Instans disediakan saat pekerjaan pelatihan dimulai dan dirilis saat selesai. Anda membayar komputasi per detik, tanpa komitmen dimuka untuk menjalankan pekerjaan ad-hoc. Kapasitas yang dibutuhkan untuk pekerjaan dialokasikan berdasarkan upaya terbaik, berdasarkan ketersediaan di Wilayah selama pengajuan pekerjaan.

Jika On-Demand kapasitas tidak tersedia untuk jenis instans yang diminta, pekerjaan pelatihan memasuki status tunggu. Anda dapat mengonfigurasi periode tunggu dari 2 jam hingga 28 hari dengan mengaturMaxPendingTimeInSeconds. Jika kapasitas tidak tersedia dalam periode tersebut, pekerjaan gagal denganInsufficientCapacityError.

Tip

Untuk mempertahankan On-Demand kapasitas antara pekerjaan pelatihan berturut-turut, aktifkan Managed Warm Pools. Warm Pools mempertahankan instans yang disediakan setelah pekerjaan selesai, sehingga pekerjaan berikutnya menggunakan kembali instance yang sama tanpa memperoleh kembali kapasitas. Ini berguna untuk beban kerja berulang seperti penyetelan hyperparameter atau debugging pelatihan terdistribusi.

Pelatihan Spot Terkelola

Pelatihan Spot Terkelola menggunakan kapasitas cadangan Amazon EC2 Spot dengan penghematan biaya hingga 90% dibandingkan dengan On-Demand harga. SageMaker AI mengelola siklus hidup Spot, termasuk interupsi dan restart otomatis. Dengan Spot Training, beban kerja dapat mengalami gangguan, dan strategi checkpointing direkomendasikan untuk melanjutkan pekerjaan dari status terakhir yang disimpan.

Kumpulan kapasitas spot ditentukan per jenis instans dan Zona Ketersediaan. Untuk memaksimalkan ketersediaan Spot, tentukan subnet di beberapa Zona Ketersediaan diVpcConfig.Subnets. Set StoppingCondition.MaxWaitTimeInSeconds el untuk mengontrol berapa lama SageMaker AI menunggu kapasitas Spot sebelum menghentikan pekerjaan.

Untuk informasi selengkapnya, lihat Pelatihan Spot Terkelola di Amazon SageMaker AI.

Rencana Pelatihan Fleksibel

Rencana Pelatihan Fleksibel memungkinkan Anda untuk memesan kapasitas GPU terlebih dahulu untuk tanggal dan durasi tertentu. Dengan memesan kapasitas, Anda mendapatkan akses yang dapat diprediksi ke jenis instans GPU dengan permintaan tinggi, merencanakan dan menganggarkan biaya pelatihan Anda terlebih dahulu, dan mendapatkan manfaat dari manajemen sumber daya otomatis dan toleransi kesalahan. Harga tergantung pada jenis instans, jumlah instans, durasi reservasi, dan tanggal mulai. Untuk melihat harga untuk konfigurasi spesifik Anda, gunakan SearchTrainingPlanOfferings API atau konsol SageMaker AI. Untuk jenis instans yang didukung, lihatCadangan Rencana Pelatihan Fleksibel untuk beban kerja ML.

Sebelum membeli paket, cari penawaran rencana pelatihan yang tersedia dari konsol SageMaker AI di AWS akun Anda, atau dengan menggunakan SearchTrainingPlanOfferings API. Penawaran yang tersedia mencakup jenis instans, durasi, harga, dan Zona Ketersediaan tempat kapasitas disediakan.

catatan

Untuk mencari dan membeli Rencana Pelatihan Fleksibel, identitas IAM Anda harus memiliki izin yang sesuai, termasuk sagemaker:SearchTrainingPlanOfferings dansagemaker:CreateTrainingPlan. Untuk daftar lengkap tindakan yang diperlukan, lihat Tind akan yang ditentukan oleh Amazon SageMaker.

Tip

Jika pekerjaan pelatihan Anda berjalan di VPC pribadi, setiap blok Kapasitas Cadangan disediakan di Zona Ketersediaan tertentu. Di Subnets dalam Anda VpcConfig harus menyertakan Zona Ketersediaan tempat blok Kapasitas Cadangan Anda disediakan. Untuk paket dengan beberapa blok yang menjangkau Zona Ketersediaan yang berbeda, sertakan subnet di semua zona yang relevan.

Rencana Pelatihan Fleksibel mendukung serangkaian jenis instans tertentu dan tersedia di Wil AWS ayah tertentu. Untuk konfigurasi yang didukung, lihatCadangan Rencana Pelatihan Fleksibel untuk beban kerja ML. Untuk harga, lihat SageMaker Harga AI.

Tip

Untuk praktik terbaik tentang beban kerja pelatihan terdistribusi dengan Pekerjaan SageMaker Pelatihan, lihat Mel atih model bahasa besar di Amazon SageMaker: Praktik terbaik.