Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Mengatur Kebijakan Penskalaan Otomatis untuk Penerapan Multi-Model Titik Akhir
SageMaker Titik akhir multi-model AI sepenuhnya mendukung penskalaan otomatis, yang mengelola replika model untuk memastikan skala model berdasarkan pola lalu lintas. Sebaiknya Anda mengonfigurasi titik akhir multi-model dan ukuran instans berdasarkan Rekomendasi instans untuk penerapan titik akhir multi-model dan juga menyiapkan penskalaan otomatis berbasis instans untuk titik akhir Anda. Tingkat pemanggilan yang digunakan untuk memicu peristiwa skala otomatis didasarkan pada kumpulan prediksi agregat di seluruh rangkaian lengkap model yang dilayani oleh titik akhir. Untuk detail tambahan tentang pengaturan penskalaan otomatis titik akhir, lihat Menskalakan Model Amazon SageMaker AI Secara Otomatis.
Anda dapat mengatur kebijakan penskalaan otomatis dengan metrik yang telah ditentukan dan kustom pada titik akhir multi-model yang didukung CPU dan GPU.
catatan
SageMaker Metrik titik akhir multi-model AI tersedia dengan perincian satu menit.
Tentukan kebijakan penskalaan
Untuk menentukan metrik dan nilai target untuk kebijakan penskalaan, Anda dapat mengonfigurasi kebijakan penskalaan pelacakan target. Anda dapat menggunakan metrik yang telah ditentukan atau metrik khusus.
Konfigurasi kebijakan penskalaan diwakili oleh blok JSON. Anda menyimpan konfigurasi kebijakan penskalaan sebagai blok JSON dalam file teks. Anda menggunakan file teks itu saat memanggil AWS CLI atau Application Auto Scaling API. Untuk informasi selengkapnya tentang sintaksis konfigurasi kebijakan, lihat TargetTrackingScalingPolicyConfiguration dalam Referensi API Application Auto Scaling.
Opsi berikut tersedia untuk menetapkan konfigurasi kebijakan penskalaan pelacakan target.
Gunakan metrik yang telah ditentukan
Untuk menentukan kebijakan penskalaan pelacakan target dengan cepat untuk varian, gunakan metrik yang telah ditentukan SageMakerVariantInvocationsPerInstance sebelumnya. SageMakerVariantInvocationsPerInstanceadalah jumlah rata-rata kali per menit setiap instance untuk varian dipanggil. Kami sangat menyarankan untuk menggunakan metrik ini.
Untuk menggunakan metrik yang telah ditentukan sebelumnya dalam kebijakan penskalaan, buat konfigurasi pelacakan target untuk kebijakan Anda. Dalam konfigurasi pelacakan target, sertakan a PredefinedMetricSpecification untuk metrik yang telah ditentukan dan a TargetValue untuk nilai target metrik tersebut.
Contoh berikut adalah konfigurasi kebijakan tipikal untuk penskalaan pelacakan target untuk varian. Dalam konfigurasi ini, kita menggunakan metrik yang telah ditentukan untuk menyesuaikan jumlah instance varian sehingga setiap instance memiliki InvocationsPerInstance metrik70. SageMakerVariantInvocationsPerInstance
{"TargetValue": 70.0, "PredefinedMetricSpecification": { "PredefinedMetricType": "InvocationsPerInstance" } }
catatan
Sebaiknya gunakan InvocationsPerInstance saat menggunakan titik akhir multi-model. Metrik TargetValue untuk ini tergantung pada persyaratan latensi aplikasi Anda. Kami juga menyarankan Anda memuat uji titik akhir untuk mengatur nilai parameter penskalaan yang sesuai. Untuk mempelajari lebih lanjut tentang pengujian beban dan pengaturan penskalaan otomatis untuk titik akhir Anda, lihat blog Meng konfigurasi titik akhir inferensi penskalaan otomatis di Amazon AI. SageMaker
Menggunakan metrik khusus
Jika Anda perlu menentukan kebijakan penskalaan pelacakan target yang memenuhi persyaratan kustom Anda, tentukan metrik khusus. Anda dapat menentukan metrik khusus berdasarkan metrik varian produksi apa pun yang berubah sebanding dengan penskalaan.
Tidak semua metrik SageMaker AI berfungsi untuk pelacakan target. Metrik harus merupakan metrik pemanfaatan yang valid, dan harus menggambarkan seberapa sibuk sebuah instance. Nilai metrik harus meningkat atau menurun dalam proporsi terbalik dengan jumlah instance varian. Artinya, nilai metrik harus berkurang ketika jumlah instance meningkat.
penting
Sebelum menerapkan penskalaan otomatis dalam produksi, Anda harus menguji penskalaan otomatis dengan metrik kustom Anda.
Contoh metrik kustom untuk titik akhir multi-model yang didukung CPU
Contoh berikut adalah konfigurasi pelacakan target untuk kebijakan penskalaan. Dalam konfigurasi ini, untuk model bernamamy-model, metrik khusus CPUUtilization menyesuaikan jumlah instance pada titik akhir berdasarkan pemanfaatan CPU rata-rata 50% di semua instans.
{"TargetValue": 50, "CustomizedMetricSpecification": {"MetricName": "CPUUtilization", "Namespace": "/aws/sagemaker/Endpoints", "Dimensions": [ {"Name": "EndpointName", "Value": "my-endpoint" }, {"Name": "ModelName","Value": "my-model"} ], "Statistic": "Average", "Unit": "Percent" } }
Contoh metrik kustom untuk titik akhir multi-model yang didukung GPU
Contoh berikut adalah konfigurasi pelacakan target untuk kebijakan penskalaan. Dalam konfigurasi ini, untuk model bernamamy-model, metrik khusus GPUUtilization menyesuaikan jumlah instans pada titik akhir berdasarkan pemanfaatan GPU rata-rata 50% di semua instans.
{"TargetValue": 50, "CustomizedMetricSpecification": {"MetricName": "GPUUtilization", "Namespace": "/aws/sagemaker/Endpoints", "Dimensions": [ {"Name": "EndpointName", "Value": "my-endpoint" }, {"Name": "ModelName","Value": "my-model"} ], "Statistic": "Average", "Unit": "Percent" } }
Tambahkan periode cooldown
Untuk menambahkan periode cooldown untuk menskalakan titik akhir Anda, tentukan nilai, dalam detik, untukScaleOutCooldown. Demikian pula, untuk menambahkan periode cooldown untuk penskalaan di model Anda, tambahkan nilai, dalam detik, untukScaleInCooldown. Untuk informasi selengkapnya tentang ScaleInCooldown dan ScaleOutCooldown, lihat TargetTrackingScalingPolicyConfiguration dalam Referensi API Application Auto Scaling.
Berikut ini adalah contoh konfigurasi pelacakan target untuk kebijakan penskalaan. Dalam konfigurasi ini, metrik yang telah ditentukan digunakan untuk menyesuaikan penskalaan berdasarkan rata-rata 70 di semua instance varian tersebut. SageMakerVariantInvocationsPerInstance Konfigurasi ini menyediakan periode pendinginan penskalaan ke dalam selama 10 menit dan periode pendinginan penskalaan ke luar selama 5 menit.
{"TargetValue": 70.0, "PredefinedMetricSpecification": {"PredefinedMetricType": "SageMakerVariantInvocationsPerInstance" }, "ScaleInCooldown": 600, "ScaleOutCooldown": 300 }