

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

# Dapatkan kapasitas komputasi untuk Pekerjaan Pel SageMaker atihan
<a name="train-get-capacity"></a>

Sebelum meminta kapasitas komputasi, konfirmasikan bahwa AWS akun Anda memenuhi prasyarat berikut. Mengatasi persyaratan ini secara berurutan membantu Anda menghindari kegagalan penyediaan umum.

## Langkah 1: Verifikasi ketersediaan instans di Wilayah Anda
<a name="train-get-capacity-verify-instance"></a>

Tidak semua jenis instans tersedia di setiap Wil AWS ayah. Sebelum memilih jenis instans untuk beban kerja pelatihan Anda, verifikasi apakah itu tersedia di Wilayah target Anda.
+ Untuk melihat ketersediaan instans dan harga per Wilayah, lihat [ SageMaker Harga AI](https://aws.amazon.com/sagemaker/pricing/). Pilih ** tab Pel ** atihan dan pilih Wilayah Anda untuk melihat jenis instans yang tersedia, spesifikasi, dan harga per jam.

Jika jenis instans tidak tersedia di Wilayah Anda:
+ Pilih jenis instans alternatif yang tersedia di Wilayah Anda. Untuk GPU-accelerated pelatihan, identifikasi keluarga instance dengan memori GPU dan kemampuan jaringan yang sebanding.
+ Jika beban kerja Anda memerlukan jenis instans tertentu dan persyaratan tempat tinggal dan kepatuhan data memungkinkan, pertimbangkan untuk menjalankan pekerjaan pelatihan di Wilayah lain tempat jenis instans tersebut tersedia. Pastikan data pelatihan Anda dapat diakses dari Wilayah target, atau rencanakan transfer data lintas wilayah.

### Verifikasi ketersediaan instans per Zona Ketersediaan
<a name="train-get-capacity-verify-az"></a>

Ketersediaan instans juga bervariasi menurut Zona Ketersediaan dalam Wilayah. Jenis instans yang ditawarkan di Wilayah Anda belum tentu ditawarkan di setiap Zona Ketersediaan di Wilayah tersebut. Ini penting ketika Anda menjalankan tugas pelatihan di VPC pribadi, karena subnet yang Anda tentukan menentukan Zona Ketersediaan yang dapat digunakan SageMaker AI untuk menyediakan instans. Untuk informasi selengkapnya, lihat [Langkah 3: Konfigurasikan VPC dan subnet Anda (opsional)](#train-get-capacity-vpc).

Untuk mencantumkan Zona Ketersediaan yang menawarkan jenis instans di Wilayah, gunakan Amazon Elastic Compute Cloud `DescribeInstanceTypeOfferings` API:

```
aws ec2 describe-instance-type-offerings \
    --location-type availability-zone \
    --filters Name=instance-type,Values=p5.48xlarge \
    --region us-east-1 \
    --query 'InstanceTypeOfferings[].Location' \
    --output table
```

**catatan**  
Tentukan jenis instans Amazon Elastic Compute Cloud (`p5.48xlarge`), bukan tipe instans SageMaker AI (`ml.p5.48xlarge`). SageMaker Jenis instans pelatihan AI dipetakan ke jenis instans Amazon Elastic Compute Cloud yang setara dengan `ml.` awalan dihapus.

## Langkah 2: Periksa dan minta kuota layanan
<a name="train-get-capacity-quotas"></a>

 AWS Akun Anda memiliki kuota default yang membatasi jumlah instance yang dapat Anda gunakan secara bersamaan untuk Pekerjaan Pel SageMaker atihan. Setiap jenis instans memiliki kuota sendiri.
+ Untuk melihat kuota Anda saat ini, buka konsol Kuota [ Layanan ](https://console.aws.amazon.com/servicequotas/home/services/sagemaker/quotas) dan filter untuk jenis instans yang akan Anda gunakan.
+ Jika kuota Anda tidak mencukupi untuk jumlah contoh yang dibutuhkan pekerjaan pelatihan Anda, minta kenaikan kuota. Kenaikan kuota tidak langsung — kirimkan permintaan Anda sebelum pelatihan yang direncanakan.

**Tip**  
Untuk Rencana Pelatihan Fleksibel, kuota layanan Anda harus sama atau lebih besar dari jumlah instans dalam paket Anda. Untuk informasi selengkapnya, lihat [Lihat kuota rencana SageMaker pelatihan menggunakan AWS konsol manajemen](training-plan-quotas.md).

## Langkah 3: Konfigurasikan VPC dan subnet Anda (opsional)
<a name="train-get-capacity-vpc"></a>

Langkah ini hanya berlaku jika Anda menjalankan pekerjaan pelatihan di VPC pribadi. Secara default, SageMaker Pekerjaan Pelatihan berjalan di lingkungan SageMaker AI-managed jaringan dan tidak memerlukan konfigurasi VPC. Jika organisasi Anda memerlukan pekerjaan pelatihan untuk mengakses sumber daya di VPC pribadi — misalnya, data yang disimpan di Amazon S3 melalui titik akhir VPC, atau sistem file — Anda harus menentukan `Subnets` dan `SecurityGroupIds` dalam `VpcConfig` parameter API. `CreateTrainingJob`

Saat Anda mengonfigurasi VPC, subnet yang Anda tentukan menentukan Zona Ketersediaan yang dapat digunakan SageMaker AI untuk menyediakan instans.
+ **Menyediakan subnet di beberapa Zona Ketersediaan. ** SageMaker AI menyediakan contoh pelatihan dari kumpulan per Availability-Zone kapasitas. Menyertakan subnet di lebih banyak Zona Ketersediaan meningkatkan kumpulan kapasitas yang dapat diambil SageMaker AI, yang meningkatkan kemungkinan penyediaan instans berhasil dan mengurangi waktu tunggu. Tentukan subnet di setidaknya tiga Zona Ketersediaan jika memungkinkan.

  SageMaker AI masih meluncurkan semua instans untuk pekerjaan tertentu dalam satu subnet (Zona Ketersediaan tunggal) untuk menjaga mereka tetap dekat secara fisik dan meminimalkan latensi antar node. Subnet tambahan hanya memperluas opsi yang dapat SageMaker dipilih AI. Mereka tidak menyebarkan instans satu pekerjaan di seluruh Zona Ketersediaan.
+ **Untuk Rencana Pelatihan Fleksibel, sejajarkan subnet dengan Kapasitas Cadangan Anda. ** Setiap blok Kapasitas Cadangan disediakan di Zona Ketersediaan tertentu. Di `Subnets` dalam Anda `VpcConfig` harus menyertakan Zona Ketersediaan tempat blok Kapasitas Cadangan Anda disediakan. Untuk paket dengan beberapa blok yang menjangkau Zona Ketersediaan yang berbeda, sertakan subnet di semua zona yang relevan.
+ **Sejajarkan sumber data dengan Zona Ketersediaan instans pelatihan. ** Jika data pelatihan Anda berada di layanan Availability-Zone-specific penyimpanan seperti atau Amazon EFS, verifikasi bahwa sistem file dapat diakses dari Zona Ketersediaan yang sama tempat instans pelatihan Anda akan berjalan.

## Pilih opsi kapasitas
<a name="train-get-capacity-options"></a>

### On-Demand Contoh
<a name="train-get-capacity-ondemand"></a>

On-Demand adalah opsi kapasitas default untuk Pekerjaan SageMaker Pelatihan. Instans disediakan saat pekerjaan pelatihan dimulai dan dirilis saat selesai. Anda membayar komputasi per detik, tanpa komitmen dimuka untuk menjalankan pekerjaan ad-hoc. Kapasitas yang dibutuhkan untuk pekerjaan dialokasikan berdasarkan upaya terbaik, berdasarkan ketersediaan di Wilayah selama pengajuan pekerjaan.

Jika On-Demand kapasitas tidak tersedia untuk jenis instans yang diminta, pekerjaan pelatihan memasuki status tunggu. Anda dapat mengonfigurasi periode tunggu dari 2 jam hingga 28 hari dengan mengatur`MaxPendingTimeInSeconds`. Jika kapasitas tidak tersedia dalam periode tersebut, pekerjaan gagal dengan`InsufficientCapacityError`.

**Tip**  
Untuk mempertahankan On-Demand kapasitas antara pekerjaan pelatihan berturut-turut, aktifkan Managed Warm Pools. Warm Pools mempertahankan instans yang disediakan setelah pekerjaan selesai, sehingga pekerjaan berikutnya menggunakan kembali instance yang sama tanpa memperoleh kembali kapasitas. Ini berguna untuk beban kerja berulang seperti penyetelan hyperparameter atau debugging pelatihan terdistribusi.

### Pelatihan Spot Terkelola
<a name="train-get-capacity-spot"></a>

Pelatihan Spot Terkelola menggunakan kapasitas cadangan Amazon EC2 Spot dengan penghematan biaya hingga 90% dibandingkan dengan On-Demand harga. SageMaker AI mengelola siklus hidup Spot, termasuk interupsi dan restart otomatis. Dengan Spot Training, beban kerja dapat mengalami gangguan, dan strategi checkpointing direkomendasikan untuk melanjutkan pekerjaan dari status terakhir yang disimpan.

Kumpulan kapasitas spot ditentukan per jenis instans dan Zona Ketersediaan. Untuk memaksimalkan ketersediaan Spot, tentukan subnet di beberapa Zona Ketersediaan di`VpcConfig.Subnets`. Set `StoppingCondition.MaxWaitTimeInSeconds` el untuk mengontrol berapa lama SageMaker AI menunggu kapasitas Spot sebelum menghentikan pekerjaan.

Untuk informasi selengkapnya, lihat [Pelatihan Spot Terkelola di Amazon SageMaker AI](model-managed-spot-training.md).

### Rencana Pelatihan Fleksibel
<a name="train-get-capacity-plans"></a>

Rencana Pelatihan Fleksibel memungkinkan Anda untuk memesan kapasitas GPU terlebih dahulu untuk tanggal dan durasi tertentu. Dengan memesan kapasitas, Anda mendapatkan akses yang dapat diprediksi ke jenis instans GPU dengan permintaan tinggi, merencanakan dan menganggarkan biaya pelatihan Anda terlebih dahulu, dan mendapatkan manfaat dari manajemen sumber daya otomatis dan toleransi kesalahan. Harga tergantung pada jenis instans, jumlah instans, durasi reservasi, dan tanggal mulai. Untuk melihat harga untuk konfigurasi spesifik Anda, gunakan `SearchTrainingPlanOfferings` API atau konsol SageMaker AI. Untuk jenis instans yang didukung, lihat[Cadangan Rencana Pelatihan Fleksibel untuk beban kerja ML](reserve-capacity-with-training-plans.md).

Sebelum membeli paket, cari penawaran rencana pelatihan yang tersedia dari konsol SageMaker AI di AWS akun Anda, atau dengan menggunakan `SearchTrainingPlanOfferings` API. Penawaran yang tersedia mencakup jenis instans, durasi, harga, dan Zona Ketersediaan tempat kapasitas disediakan.

**catatan**  
Untuk mencari dan membeli Rencana Pelatihan Fleksibel, identitas IAM Anda harus memiliki izin yang sesuai, termasuk `sagemaker:SearchTrainingPlanOfferings` dan`sagemaker:CreateTrainingPlan`. Untuk daftar lengkap tindakan yang diperlukan, lihat Tind [ akan yang ditentukan oleh Amazon SageMaker](https://docs.aws.amazon.com/service-authorization/latest/reference/list_amazonsagemaker.html).

**Tip**  
Jika pekerjaan pelatihan Anda berjalan di VPC pribadi, setiap blok Kapasitas Cadangan disediakan di Zona Ketersediaan tertentu. Di `Subnets` dalam Anda `VpcConfig` harus menyertakan Zona Ketersediaan tempat blok Kapasitas Cadangan Anda disediakan. Untuk paket dengan beberapa blok yang menjangkau Zona Ketersediaan yang berbeda, sertakan subnet di semua zona yang relevan.

Rencana Pelatihan Fleksibel mendukung serangkaian jenis instans tertentu dan tersedia di Wil AWS ayah tertentu. Untuk konfigurasi yang didukung, lihat[Cadangan Rencana Pelatihan Fleksibel untuk beban kerja ML](reserve-capacity-with-training-plans.md). Untuk harga, lihat [ SageMaker Harga AI](https://aws.amazon.com/sagemaker/pricing/).

**Tip**  
Untuk praktik terbaik tentang beban kerja pelatihan terdistribusi dengan Pekerjaan SageMaker Pelatihan, lihat Mel [ atih model bahasa besar di Amazon SageMaker: Praktik terbaik. ](https://aws.amazon.com/blogs/machine-learning/training-large-language-models-on-amazon-sagemaker-best-practices/)