View a markdown version of this page

Mengatur SageMaker perilaku caching model titik akhir multi-model AI - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Mengatur SageMaker perilaku caching model titik akhir multi-model AI

Secara default, titik akhir multi-model menyimpan model yang sering digunakan dalam memori (CPU atau GPU, tergantung pada apakah Anda memiliki instans yang didukung CPU atau GPU) dan pada disk untuk memberikan inferensi latensi rendah. Model cache dibongkar and/or dihapus dari disk hanya ketika wadah kehabisan memori atau ruang disk untuk mengakomodasi model yang baru ditargetkan.

Anda dapat mengubah perilaku caching dari titik akhir multi-model dan secara eksplisit mengaktifkan atau menonaktifkan caching model dengan menyetel parameter ModelCacheSetting saat Anda memanggil create_model. https://boto3.amazonaws.com/v1/documentation/api/latest/reference/services/sagemaker.html#SageMaker.Client.create_model

Sebaiknya atur nilai ModelCacheSetting parameter Disabled untuk kasus penggunaan yang tidak mendapat manfaat dari caching model. Misalnya, ketika sejumlah besar model perlu dilayani dari titik akhir tetapi setiap model dipanggil hanya sekali (atau sangat jarang). Untuk kasus penggunaan seperti itu, pengaturan nilai ModelCacheSetting parameter untuk Disabled memungkinkan transaksi per detik (TPS) yang lebih tinggi untuk invoke_endpoint permintaan dibandingkan dengan mode caching default. TPS yang lebih tinggi dalam kasus penggunaan ini adalah karena SageMaker AI melakukan hal berikut setelah invoke_endpoint permintaan:

  • Secara asinkron membongkar model dari memori dan menghapusnya dari disk segera setelah dipanggil.

  • Menyediakan konkurensi yang lebih tinggi untuk mengunduh dan memuat model dalam wadah inferensi. Untuk titik akhir yang didukung CPU dan GPU, konkurensi adalah faktor jumlah vCPU dari instance kontainer.

Untuk panduan memilih jenis instans SageMaker AI ML untuk titik akhir multi-model, lihatRekomendasi instans untuk penerapan titik akhir multi-model.