View a markdown version of this page

Rekomendasi instans untuk penerapan titik akhir multi-model - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Rekomendasi instans untuk penerapan titik akhir multi-model

Ada beberapa item yang perlu dipertimbangkan saat memilih jenis instance SageMaker AI ML untuk titik akhir multi-model:

  • Menyediakan kapasitas Amazon Elastic Block Store (Amazon EBS) yang cukup untuk semua model yang perlu dilayani.

  • Menyeimbangkan kinerja (meminimalkan cold start) dan biaya (jangan terlalu menyediakan kapasitas instans). Untuk informasi tentang ukuran volume penyimpanan yang dilampirkan SageMaker AI untuk setiap jenis instans untuk titik akhir dan untuk titik akhir multi-model, lihatVolume penyimpanan instans.

  • Untuk wadah yang dikonfigurasi untuk berjalan dalam MultiModel mode, volume penyimpanan yang disediakan untuk instansnya lebih besar dari SingleModel mode default. Hal ini memungkinkan lebih banyak model untuk di-cache pada volume penyimpanan instance daripada dalam SingleModel mode.

Saat memilih jenis instance SageMaker AI ML, pertimbangkan hal berikut:

  • Multi-model Endpoint saat ini didukung untuk semua jenis instans CPU dan pada jenis instans GPU tunggal.

  • Untuk distribusi lalu lintas (pola akses) ke model yang ingin Anda host di belakang titik akhir multi-model, bersama dengan ukuran model (berapa banyak model yang dapat dimuat dalam memori pada instance), ingatlah informasi berikut:

    • Pikirkan jumlah memori pada suatu instance sebagai ruang cache untuk model yang akan dimuat, dan pikirkan jumlah vCPU sebagai batas konkurensi untuk melakukan inferensi pada model yang dimuat (dengan asumsi bahwa memanggil model terikat pada CPU).

    • Untuk instans yang didukung CPU, jumlah vCPU memengaruhi pemanggilan bersamaan maksimum Anda per instans (dengan asumsi bahwa memanggil model terikat ke CPU). Jumlah vCPU yang lebih tinggi memungkinkan Anda untuk memanggil model yang lebih unik secara bersamaan.

    • Untuk instans yang didukung GPU, jumlah instance dan memori GPU yang lebih tinggi memungkinkan Anda memiliki lebih banyak model yang dimuat dan siap melayani permintaan inferensi.

    • Untuk instans yang didukung CPU dan GPU, sediakan beberapa memori “slack” sehingga model yang tidak digunakan dapat dibongkar, dan terutama untuk titik akhir multi-model dengan beberapa instance. Jika instance atau Zona Ketersediaan gagal, model pada instans tersebut akan dialihkan ke instans lain di belakang titik akhir.

  • Tentukan toleransi Anda terhadap loading/downloading waktu:

    • Keluarga tipe instance d (misalnya, m5d, c5d, atau r5d) dan g5s dilengkapi dengan SSD NVMe (non-volatile memory express), yang menawarkan I/O kinerja tinggi dan mungkin mengurangi waktu yang dibutuhkan untuk mengunduh model ke volume penyimpanan dan wadah memuat model dari volume penyimpanan.

    • Karena tipe instance d dan g5 dilengkapi dengan penyimpanan SSD NVMe, SageMaker AI tidak melampirkan volume penyimpanan Amazon EBS ke instans komputasi ML yang menghosting titik akhir multi-model ini. Penskalaan otomatis bekerja paling baik ketika model berukuran sama dan homogen, yaitu ketika mereka memiliki latensi inferensi dan persyaratan sumber daya yang serupa.

Anda juga dapat menggunakan panduan berikut untuk membantu Anda mengoptimalkan pemuatan model pada titik akhir multi-model Anda:

Memilih jenis instance yang tidak dapat menampung semua model yang ditargetkan dalam memori

Dalam beberapa kasus, Anda dapat memilih untuk mengurangi biaya dengan memilih jenis instance yang tidak dapat menyimpan semua model yang ditargetkan dalam memori sekaligus. SageMaker AI secara dinamis membongkar model ketika kehabisan memori untuk memberi ruang bagi model yang baru ditargetkan. Untuk model yang jarang diminta, Anda mengorbankan latensi beban dinamis. Dalam kasus dengan kebutuhan latensi yang lebih ketat, Anda dapat memilih jenis instans yang lebih besar atau lebih banyak instans. Menginvestasikan waktu di muka untuk pengujian dan analisis kinerja membantu Anda memiliki penerapan produksi yang sukses.

Mengevaluasi hit cache model Anda

CloudWatch Metrik Amazon dapat membantu Anda mengevaluasi model Anda. Untuk informasi selengkapnya tentang metrik yang dapat Anda gunakan dengan titik akhir multi-model, lihat. CloudWatch Metrik untuk Penerapan Multi-Model Titik Akhir

Anda dapat menggunakan Average statistik ModelCacheHit metrik untuk memantau rasio permintaan di mana model sudah dimuat. Anda dapat menggunakan SampleCount statistik untuk ModelUnloadingTime metrik untuk memantau jumlah permintaan bongkar muat yang dikirim ke wadah selama periode waktu tertentu. Jika model dibongkar terlalu sering (indikator pemecahan , di mana model diturunkan dan dimuat lagi karena tidak ada ruang cache yang tidak mencukupi untuk rangkaian model yang berfungsi), pertimbangkan untuk menggunakan jenis instance yang lebih besar dengan lebih banyak memori atau meningkatkan jumlah instance di belakang titik akhir multi-model. Untuk titik akhir multi-model dengan beberapa instance, ketahuilah bahwa model mungkin dimuat pada lebih dari 1 instance.