View a markdown version of this page

Terapkan model dengan Amazon SageMaker Serverless Inference - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Terapkan model dengan Amazon SageMaker Serverless Inference

Amazon SageMaker Serverless Inference adalah opsi inferensi yang dibuat khusus yang memungkinkan Anda menerapkan dan menskalakan model ML tanpa mengonfigurasi atau mengelola infrastruktur yang mendasarinya. On-demand Inferensi Tanpa Server sangat ideal untuk beban kerja yang memiliki periode idle antara semburan lalu lintas dan dapat mentolerir start dingin. Titik akhir tanpa server secara otomatis meluncurkan sumber daya komputasi dan menskalakannya masuk dan keluar tergantung pada lalu lintas, menghilangkan kebutuhan untuk memilih jenis instans atau mengelola kebijakan penskalaan. Ini menghilangkan beban berat yang tidak terdiferensiasi dalam memilih dan mengelola server. Serverless Inference terintegrasi dengan AWS Lambda untuk menawarkan ketersediaan tinggi, toleransi kesalahan bawaan, dan penskalaan otomatis. Dengan model bayar per penggunaan, Serverless Inference adalah opsi hemat biaya jika Anda memiliki pola lalu lintas yang jarang atau tidak dapat diprediksi. Selama tidak ada permintaan, Serverless Inference menskalakan titik akhir Anda hingga 0, membantu Anda meminimalkan biaya Anda. Untuk informasi selengkapnya tentang penetapan harga untuk Inferensi Tanpa Server sesuai permintaan, lihat Harga Amazon SageMaker .

Secara opsional, Anda juga dapat menggunakan Provisioned Concurrency dengan Inferensi Tanpa Server. Inferensi tanpa server dengan konkurensi yang disediakan adalah opsi hemat biaya ketika Anda memiliki ledakan yang dapat diprediksi dalam lalu lintas Anda. Provisioned Concurrency memungkinkan Anda menerapkan model pada titik akhir tanpa server dengan kinerja yang dapat diprediksi, dan skalabilitas tinggi dengan menjaga titik akhir Anda tetap hangat. SageMaker AI memastikan bahwa untuk jumlah Konkurensi Penyediaan yang Anda alokasikan, sumber daya komputasi diinisialisasi dan siap merespons dalam milidetik. Untuk Inferensi Tanpa Server dengan Konkurensi Tersediakan, Anda membayar kapasitas komputasi yang digunakan untuk memproses permintaan inferensi, ditagih berdasarkan milidetik, dan jumlah data yang diproses. Anda juga membayar untuk penggunaan Konkurensi Penyediaan, berdasarkan memori yang dikonfigurasi, durasi yang disediakan, dan jumlah konkurensi yang diaktifkan. Untuk informasi selengkapnya tentang penetapan harga untuk Serverless Inference with Provisioned Concurrency, lihat Harga Amazon. SageMaker

Anda dapat mengintegrasikan Serverless Inference dengan MLOps Pipelines untuk merampingkan alur kerja ML Anda, dan Anda dapat menggunakan titik akhir tanpa server untuk meng-host model yang terdaftar dengan Model Registry. Penerapan Registrasi Model dengan Model Registry

Inferensi Tanpa Server umumnya tersedia di 21 Wil AWS ayah: AS Timur (Virginia Utara), AS Timur (Ohio), AS Barat (California Utara), AS Barat (Oregon), Afrika (Cape Town), Asia Pasifik (Hong Kong), Asia Pasifik (Mumbai), Asia Pasifik (Tokyo), Asia Pasifik (Seoul), Asia Pasifik (Osaka), Asia Pasifik (Singapura), Asia Pasifik (Sydney), Kanada (Tengah), Eropa (Frankfurt)), Eropa (Irlandia), Eropa (London), Eropa (Paris), Eropa (Stockholm), Eropa (Milan), Timur Tengah (Bahrain), Amerika Selatan (São Paulo). Untuk informasi selengkapnya tentang ketersediaan regional Amazon SageMaker AI, lihat Daftar AWS Layanan Regional.

Cara kerjanya

Diagram berikut menunjukkan alur kerja Inferensi Tanpa Server sesuai permintaan dan manfaat menggunakan titik akhir tanpa server.

Diagram yang menunjukkan alur kerja Inferensi Tanpa Server.

Saat Anda membuat titik akhir tanpa server sesuai permintaan, SageMaker AI menyediakan dan mengelola sumber daya komputasi untuk Anda. Kemudian, Anda dapat membuat permintaan inferensi ke titik akhir dan menerima prediksi model sebagai tanggapan. SageMaker AI meningkatkan dan menurunkan sumber daya komputasi sesuai kebutuhan untuk menangani lalu lintas permintaan Anda, dan Anda hanya membayar untuk apa yang Anda gunakan.

Untuk Konkurensi Tersediakan, Serverless Inference juga terintegrasi dengan Application Auto Scaling, sehingga Anda dapat mengelola Konkurensi Tersediakan berdasarkan metrik target atau jadwal. Untuk informasi selengkapnya, lihat Secara otomatis menskalakan Konkurensi yang Disediakan untuk titik akhir tanpa server.

Bagian berikut memberikan rincian tambahan tentang Inferensi Tanpa Server dan cara kerjanya.

Dukungan kontainer

Untuk wadah titik akhir Anda, Anda dapat memilih SageMaker AI-provided wadah atau membawa sendiri. SageMaker AI menyediakan wadah untuk algoritma bawaan dan gambar Docker bawaan untuk beberapa kerangka kerja pembelajaran mesin yang paling umum, seperti Apache MXnet,, TensorFlow PyTorch, dan Chainer. Untuk daftar gambar yang tersedia, lihat SageMaker Gambar Wadah Pem belajaran Mendalam yang Tersedia. Jika Anda membawa wadah Anda sendiri, Anda harus memodifikasinya agar berfungsi dengan SageMaker AI. Untuk informasi lebih lanjut tentang membawa wadah Anda sendiri, lihatSesuaikan wadah inferensi Anda sendiri untuk Amazon AI SageMaker.

Ukuran maksimum gambar wadah yang dapat Anda gunakan adalah 10 GB. Untuk titik akhir tanpa server, sebaiknya buat hanya satu pekerja dalam wadah dan hanya memuat satu salinan model. Perhatikan bahwa ini tidak seperti titik akhir real-time, di mana beberapa wadah SageMaker AI dapat membuat pekerja untuk setiap vCPU untuk memproses permintaan inferensi dan memuat model di setiap pekerja.

Jika Anda sudah memiliki wadah untuk titik akhir waktu nyata, Anda dapat menggunakan wadah yang sama untuk titik akhir tanpa server Anda, meskipun beberapa kemampuan dikecualikan. Untuk mempelajari selengkapnya tentang kemampuan kontainer yang tidak didukung di Inferensi Tanpa Server, lihat. Pengecualian fitur Jika Anda memilih untuk menggunakan wadah yang sama, SageMaker AI akan menyimpan (menyimpan) salinan gambar wadah Anda sampai Anda menghapus semua titik akhir yang menggunakan gambar. SageMaker AI mengenkripsi gambar yang disalin saat diam dengan SageMaker AI-owned AWS KMS kunci.

Ukuran memori

Titik akhir tanpa server Anda memiliki ukuran RAM minimum 1024 MB (1 GB), dan ukuran RAM maksimum yang dapat Anda pilih adalah 6144 MB (6 GB). Ukuran memori yang dapat Anda pilih adalah 1024 MB, 2048 MB, 3072 MB, 4096 MB, 5120 MB, atau 6144 MB. Inferensi tanpa server secara otomatis menetapkan sumber daya komputasi sebanding dengan memori yang Anda pilih. Jika Anda memilih ukuran memori yang lebih besar, wadah Anda memiliki akses ke lebih banyak vCPU. Pilih ukuran memori titik akhir Anda sesuai dengan ukuran model Anda. Umumnya, ukuran memori harus setidaknya sebesar ukuran model Anda. Anda mungkin perlu melakukan benchmark untuk memilih pilihan memori yang tepat untuk model Anda berdasarkan SLA latensi Anda. Untuk panduan langkah demi langkah untuk benchmark, lihat Memperkenalkan Perangkat Benchmarking Inferensi SageMaker Tanpa Server Amazon. Kenaikan ukuran memori memiliki harga yang berbeda; lihat halaman harga Amazon SageMaker AI untuk informasi lebih lanjut.

Terlepas dari ukuran memori yang Anda pilih, titik akhir tanpa server Anda memiliki penyimpanan disk sementara 5 GB yang tersedia. Untuk bantuan dengan masalah izin kontainer saat bekerja dengan penyimpanan, lihatPemecahan Masalah.

Pemanggilan bersamaan

On-demand Serverless Inference mengelola kebijakan penskalaan dan kuota yang telah ditentukan untuk kapasitas titik akhir Anda. Titik akhir tanpa server memiliki kuota untuk berapa banyak pemanggilan bersamaan yang dapat diproses secara bersamaan. Jika titik akhir dipanggil sebelum selesai memproses permintaan pertama, maka itu menangani permintaan kedua secara bersamaan.

Total konkurensi yang dapat Anda bagikan di antara semua titik akhir tanpa server di akun Anda tergantung pada wilayah Anda:

  • Untuk Wilayah AS Timur (Ohio), AS Timur (Virginia Utara), AS Barat (Oregon), Asia Pasifik (Singapura), Asia Pasifik (Sydney), Asia Pasifik (Tokyo), Eropa (Frankfurt), dan Eropa (Irlandia), total konkurensi yang dapat Anda bagikan di antara semua titik akhir tanpa server per Wilayah di akun Anda adalah 1000.

  • Untuk Wilayah AS Barat (California Utara), Afrika (Cape Town), Asia Pasifik (Hong Kong), Asia Pasifik (Mumbai), Asia Pasifik (Osaka), Asia Pasifik (Seoul), Kanada (Tengah), Eropa (London), Eropa (Milan), Eropa (Paris), Eropa (Stockholm), Timur Tengah (Bahrain), dan Amerika Selatan (São Paulo), total konkurensi per Wilayah di akun Anda adalah 500.

Anda dapat mengatur konkurensi maksimum untuk satu titik akhir hingga 200, dan jumlah total titik akhir tanpa server yang dapat Anda host di Wilayah adalah 50. Konkurensi maksimum untuk titik akhir individu mencegah titik akhir tersebut mengambil semua pemanggilan yang diizinkan untuk akun Anda, dan setiap pemanggilan titik akhir di luar maksimum dibatasi.

catatan

Konkurensi yang disediakan yang Anda tetapkan ke titik akhir tanpa server harus selalu kurang dari atau sama dengan konkurensi maksimum yang Anda tetapkan ke titik akhir tersebut.

Untuk mempelajari cara mengatur konkurensi maksimum untuk titik akhir Anda, lihatMembuat konfigurasi titik akhir. Untuk informasi selengkapnya tentang kuota dan batasan, lihat titik SageMaker akhir dan kuota Amazon AI di Referensi Umum AWS. Untuk meminta kenaikan batas layanan, hubungi AWS Dukungan. Untuk petunjuk tentang cara meminta kenaikan batas layanan, lihatWilayah dan Kuota yang Didukung.

Meminimalkan start dingin

Jika titik akhir Inferensi Tanpa Server sesuai permintaan Anda tidak menerima lalu lintas untuk sementara waktu dan kemudian titik akhir Anda tiba-tiba menerima permintaan baru, mungkin perlu beberapa waktu bagi titik akhir Anda untuk memutar sumber daya komputasi untuk memproses permintaan. Ini disebut cold start. Karena titik akhir tanpa server menyediakan sumber daya komputasi sesuai permintaan, titik akhir Anda mungkin mengalami cold start. Cold start juga dapat terjadi jika permintaan bersamaan Anda melebihi penggunaan permintaan bersamaan saat ini. Waktu mulai dingin tergantung pada ukuran model Anda, berapa lama waktu yang dibutuhkan untuk mengunduh model Anda, dan waktu start-up wadah Anda.

Untuk memantau berapa lama waktu mulai dingin Anda, Anda dapat menggunakan CloudWatch metrik Amazon OverheadLatency untuk memantau titik akhir tanpa server Anda. Metrik ini melacak waktu yang dibutuhkan untuk meluncurkan sumber daya komputasi baru untuk titik akhir Anda. Untuk mempelajari lebih lanjut tentang menggunakan CloudWatch metrik dengan titik akhir tanpa server, lihat. Alarm dan log untuk melacak metrik dari titik akhir tanpa server

Anda dapat meminimalkan cold start dengan menggunakan Provisioned Concurrency. SageMaker AI menjaga titik akhir tetap hangat dan siap merespons dalam milidetik, untuk jumlah Konkurensi Penyediaan yang Anda alokasikan.

Pengecualian fitur

Beberapa fitur yang saat ini tersedia untuk SageMaker AI Real-time Inferensi tidak didukung untuk Inferensi Tanpa Server, termasuk GPU, paket model AWS pasar, registri Docker pribadi, T Multi-Model itik Akhir, konfigurasi VPC, isolasi jaringan, pengambilan data, beberapa varian produksi, Model Monitor, dan saluran inferensi.

Anda tidak dapat mengonversi titik akhir real-time berbasis instans menjadi titik akhir tanpa server. Jika Anda mencoba memperbarui titik akhir waktu nyata menjadi tanpa server, Anda menerima ValidationError pesan. Anda dapat mengonversi titik akhir tanpa server ke waktu nyata, tetapi setelah Anda melakukan pembaruan, Anda tidak dapat memutarnya kembali ke serverless.

Memulai

Anda dapat membuat, memperbarui, menjelaskan, dan menghapus titik akhir tanpa server menggunakan konsol SageMaker AI, AWS SDK, Amazon SageMaker Python SDK, dan. AWS CLI Anda dapat memanggil titik akhir Anda menggunakan AWS SDK, Amazon SageMaker Python SDK, dan. AWS CLI Untuk titik akhir tanpa server dengan Konkurensi Tersediakan, Anda dapat menggunakan Penskalaan Otomatis Aplikasi untuk menskalakan Konkurensi Tersediakan secara otomatis berdasarkan metrik target atau jadwal. Untuk informasi selengkapnya tentang cara mengatur dan menggunakan titik akhir tanpa server, baca panduan Operasi titik akhir tanpa server ini. Untuk informasi selengkapnya tentang penskalaan otomatis titik akhir tanpa server dengan Konkurensi Tersediakan, lihat. Secara otomatis menskalakan Konkurensi yang Disediakan untuk titik akhir tanpa server

catatan

Penskalaan Otomatis Aplikasi untuk Inferensi Tanpa Server dengan Konkurensi Penyediaan saat ini tidak didukung. AWS CloudFormation

Contoh buku catatan dan blog

Untuk contoh buku catatan Jupyter yang menunjukkan alur kerja titik akhir tanpa server ujung ke ujung, lihat buku catatan contoh Inferensi Tanpa Server. https://github.com/aws/amazon-sagemaker-examples/tree/master/serverless-inference