Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Praktik terbaik untuk menerapkan model pada Layanan Hosting SageMaker AI
Saat hosting model menggunakan layanan hosting SageMaker AI, pertimbangkan hal berikut:
-
Biasanya, aplikasi klien mengirimkan permintaan ke titik akhir HTTPS SageMaker AI untuk mendapatkan kesimpulan dari model yang digunakan. Anda juga dapat mengirim permintaan ke titik akhir ini dari notebook Jupyter Anda selama pengujian.
-
Anda dapat menerapkan model yang dilatih dengan SageMaker AI ke target penerapan Anda sendiri. Untuk melakukan itu, Anda perlu mengetahui format spesifik algoritme dari artefak model yang dihasilkan oleh pelatihan model. Untuk informasi selengkapnya tentang format output, lihat bagian yang sesuai dengan algoritma yang Anda gunakanFormat Data Umum untuk Pelatihan.
-
Anda dapat menerapkan beberapa varian model ke titik akhir HTTPS SageMaker AI yang sama. Ini berguna untuk menguji variasi model dalam produksi. Misalnya, Anda telah menerapkan model ke dalam produksi. Anda ingin menguji variasi model dengan mengarahkan sejumlah kecil lalu lintas, katakanlah 5%, ke model baru. Untuk melakukan ini, buat konfigurasi titik akhir yang menjelaskan kedua varian model. Anda menentukan
ProductionVariantdalam permintaan Anda keCreateEndPointConfig. Untuk informasi selengkapnya, lihatProductionVariant. -
Anda dapat mengonfigurasi
ProductionVariantuntuk menggunakan Application Auto Scaling. Untuk informasi tentang mengkonfigurasi penskalaan otomatis, lihatPenskalaan otomatis model Amazon SageMaker AI. -
Anda dapat memodifikasi titik akhir tanpa mengambil model yang sudah diterapkan ke produksi keluar dari layanan. Misalnya, Anda dapat menambahkan varian model baru, memperbarui konfigurasi instance ML Compute dari varian model yang ada, atau mengubah distribusi lalu lintas di antara varian model. Untuk memodifikasi titik akhir, Anda menyediakan konfigurasi titik akhir baru. SageMaker AI mengimplementasikan perubahan tanpa downtime. Untuk informasi lebih lanjut lihat,
UpdateEndpointdanUpdateEndpointWeightsAndCapacities. -
Mengubah atau menghapus artefak model atau mengubah kode inferensi setelah menerapkan model menghasilkan hasil yang tidak dapat diprediksi. Jika Anda perlu mengubah atau menghapus artefak model atau mengubah kode inferensi, ubah titik akhir dengan menyediakan konfigurasi titik akhir baru. Setelah Anda menyediakan konfigurasi titik akhir baru, Anda dapat mengubah atau menghapus artefak model yang sesuai dengan konfigurasi titik akhir lama.
-
Jika Anda ingin mendapatkan kesimpulan pada seluruh kumpulan data, pertimbangkan untuk menggunakan transformasi batch sebagai alternatif untuk layanan hosting. Untuk informasi, lihat Transformasi batch untuk inferensi dengan Amazon AI SageMaker
Menyebarkan Beberapa Instans di Seluruh Zona Ketersediaan
Buat titik akhir yang kuat saat menghosting model Anda. SageMaker Titik akhir AI dapat membantu melindungi aplikasi Anda dari pemadaman Availability Zone dan kegagalan instans. Jika terjadi pemadaman atau instans gagal, SageMaker AI secara otomatis mencoba mendistribusikan instans Anda di seluruh Zona Ketersediaan. Untuk alasan ini, kami sangat menyarankan Anda menerapkan beberapa instans untuk setiap titik akhir produksi.
Jika Anda menggunakan Amazon Virtual Private Cloud (VPC), konfigurasikan VPC dengan setidaknya dua Subnets, masing-masing di Zona Ketersediaan yang berbeda. Jika terjadi pemadaman atau instans gagal, Amazon SageMaker AI secara otomatis mencoba mendistribusikan instans Anda di seluruh Zona Ketersediaan.
Secara umum, untuk mencapai kinerja yang lebih andal, gunakan lebih banyak Jenis Inst ans kecil di Zona Ketersediaan yang berbeda untuk meng-host titik akhir Anda.
Terapkan komponen inferensi untuk ketersediaan tinggi. Selain rekomendasi di atas untuk nomor contoh, untuk mencapai ketersediaan 99,95%, pastikan bahwa komponen inferensi Anda dikonfigurasi untuk memiliki lebih dari dua salinan. Selain itu, dalam kebijakan penskalaan otomatis terkelola Anda, tetapkan jumlah minimum instans menjadi dua juga.