Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Multi-model titik akhir
Multi-model titik akhir menyediakan solusi yang dapat diskalakan dan hemat biaya untuk menerapkan sejumlah besar model. Mereka menggunakan armada sumber daya yang sama dan wadah penyajian bersama untuk menampung semua model Anda. Ini mengurangi biaya hosting dengan meningkatkan pemanfaatan titik akhir dibandingkan dengan menggunakan titik akhir model tunggal. Ini juga mengurangi overhead penerapan karena Amazon SageMaker AI mengelola pemuatan model dalam memori dan menskalakannya berdasarkan pola lalu lintas ke titik akhir Anda.
Diagram berikut menunjukkan cara kerja titik akhir multi-model dibandingkan dengan titik akhir model tunggal.
Multi-model titik akhir ideal untuk menghosting sejumlah besar model yang menggunakan kerangka kerja ML yang sama pada wadah penyajian bersama. Jika Anda memiliki campuran model yang sering dan jarang diakses, titik akhir multi-model dapat secara efisien melayani lalu lintas ini dengan sumber daya yang lebih sedikit dan penghematan biaya yang lebih tinggi. Aplikasi Anda harus toleran terhadap hukuman latensi terkait cold start sesekali yang terjadi saat memanggil model yang jarang digunakan.
Multi-model titik akhir mendukung hosting model yang didukung CPU dan GPU. Dengan menggunakan model yang didukung GPU, Anda dapat menurunkan biaya penerapan model melalui peningkatan penggunaan titik akhir dan instans komputasi akselerasi yang mendasarinya.
Multi-model titik akhir juga memungkinkan pembagian waktu sumber daya memori di seluruh model Anda. Ini bekerja paling baik ketika model cukup mirip dalam ukuran dan latensi pemanggilan. Jika hal ini terjadi, titik akhir multi-model dapat secara efektif menggunakan instance di semua model. Jika Anda memiliki model yang memiliki persyaratan transaksi per detik (TPS) atau latensi yang jauh lebih tinggi, sebaiknya hosting-nya di titik akhir khusus.
Anda dapat menggunakan titik akhir multi-model dengan fitur-fitur berikut:
-
AWS PrivateLinkdan VPC
-
Pipeline inferensi serial (tetapi hanya satu wadah multi-model yang diaktifkan yang dapat disertakan dalam pipeline inferensi)
-
A/B pengujian
Anda dapat menggunakan AWS SDK for Python (Boto) atau konsol SageMaker AI untuk membuat titik akhir multi-model. Untuk titik akhir multi-model yang didukung CPU, Anda dapat membuat titik akhir dengan wadah yang dibuat khusus dengan mengintegrasikan pustaka Server Multi Model.
Topik
Cara kerja titik akhir multi-model
SageMaker AI mengelola siklus hidup model yang dihosting pada titik akhir multi-model dalam memori wadah. Alih-alih mengunduh semua model dari bucket Amazon S3 ke wadah saat Anda membuat titik akhir, SageMaker AI secara dinamis memuat dan menyimpannya dalam cache saat Anda memanggilnya. Ketika SageMaker AI menerima permintaan pemanggilan untuk model tertentu, ia melakukan hal berikut:
-
Merutekan permintaan ke instance di belakang titik akhir.
-
Mengunduh model dari bucket S3 ke volume penyimpanan instance tersebut.
-
Memuat model ke memori wadah (CPU atau GPU, tergantung pada apakah Anda memiliki instans yang didukung CPU atau GPU) pada instance komputasi yang dipercepat tersebut. Jika model sudah dimuat dalam memori wadah, pemanggilan lebih cepat karena SageMaker AI tidak perlu mengunduh dan memuatnya.
SageMaker AI terus merutekan permintaan untuk model ke instance di mana model sudah dimuat. Namun, jika model menerima banyak permintaan pemanggilan, dan ada instance tambahan untuk titik akhir multi-model, SageMaker AI merutekan beberapa permintaan ke instance lain untuk mengakomodasi lalu lintas. Jika model belum dimuat pada instance kedua, model diunduh ke volume penyimpanan instance tersebut dan dimuat ke dalam memori wadah.
Ketika pemanfaatan memori instance tinggi dan SageMaker AI perlu memuat model lain ke dalam memori, ia membongkar model yang tidak digunakan dari wadah instance tersebut untuk memastikan bahwa ada cukup memori untuk memuat model. Model yang dibongkar tetap pada volume penyimpanan instans dan dapat dimuat ke dalam memori wadah nanti tanpa diunduh lagi dari bucket S3. Jika volume penyimpanan instans mencapai kapasitasnya, SageMaker AI menghapus model yang tidak digunakan dari volume penyimpanan.
Untuk menghapus model, hentikan pengiriman permintaan dan hapus dari bucket S3. SageMaker AI menyediakan kemampuan titik akhir multi-model dalam wadah penyajian. Menambahkan model ke, dan menghapusnya dari, titik akhir multi-model tidak memerlukan pembaruan titik akhir itu sendiri. Untuk menambahkan model, Anda mengunggahnya ke bucket S3 dan memanggilnya. Anda tidak perlu perubahan kode untuk menggunakannya.
catatan
Saat Anda memperbarui titik akhir multi-model, permintaan pemanggilan awal pada titik akhir mungkin mengalami latensi yang lebih tinggi karena Smart Routing di titik akhir multi-model beradaptasi dengan pola lalu lintas Anda. Namun, setelah mempelajari pola lalu lintas Anda, Anda dapat mengalami latensi rendah untuk model yang paling sering digunakan. Model yang kurang sering digunakan mungkin mengalami beberapa latensi start dingin karena model dimuat secara dinamis ke instance.
Contoh notebook untuk titik akhir multi-model
Untuk mempelajari lebih lanjut tentang cara menggunakan titik akhir multi-model, Anda dapat mencoba contoh buku catatan berikut:
-
Contoh untuk titik akhir multi-model menggunakan instans yang didukung CPU:
-
Multi-Model Notebook Sampel Endpoint XGBoost
- Buku catatan ini menunjukkan cara menerapkan beberapa model XGBoost ke titik akhir. -
Multi-Model Notebook Sampel BYOC Titik
Akhir — Buku catatan ini menunjukkan cara mengatur dan menerapkan wadah pelanggan yang mendukung titik akhir multi-model di AI. SageMaker
-
-
Contoh untuk titik akhir multi-model menggunakan instans yang didukung GPU:
-
Jalankan beberapa model pembelajaran mendalam pada GPU dengan Multi-model titik akhir Amazon SageMaker AI (MME)
— Buku catatan ini menunjukkan cara menggunakan wadah NVIDIA Triton Inference untuk menerapkan model ke titik akhir multi- ResNet-50 model.
-
Untuk petunjuk tentang cara membuat dan mengakses instance notebook Jupyter yang dapat Anda gunakan untuk menjalankan contoh sebelumnya di SageMaker AI, lihat. Instans SageMaker notebook Amazon Setelah Anda membuat instance notebook dan membukanya, pilih tab Contoh SageMaker AI untuk melihat daftar semua sampel SageMaker AI. Notebook titik akhir multi-model terletak di bagian FUNGSI LAN JUTAN. Untuk membuka buku catatan, pilih tab Gunakan dan pilih Buat salinan.
Untuk informasi selengkapnya tentang kasus penggunaan untuk titik akhir multi-model, lihat blog dan sumber daya berikut: