View a markdown version of this page

Rekomendasi inferensi AI generatif yang dioptimalkan - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Rekomendasi inferensi AI generatif yang dioptimalkan

Amazon SageMaker AI sekarang mendukung rekomendasi inferensi, kemampuan yang menghilangkan pengoptimalan manual dan pembandingan untuk memberikan kinerja inferensi yang optimal. Alih-alih menguji kombinasi jenis instans GPU, wadah penyajian, strategi paralelisme, dan teknik pengoptimalan secara manual, Anda memberikan persyaratan model dan beban kerja, dan SageMaker AI mengembalikan konfigurasi yang divalidasi dan siap penerapan dengan metrik kinerja nyata.

Rekomendasi inferensi menganalisis arsitektur model Anda, mempersempit ruang konfigurasi, dan menerapkan pengoptimalan yang selaras dengan tujuan seperti decoding spekulatif untuk throughput dan penyetelan kernel untuk latensi. Dengan mengevaluasi beberapa jenis instans, Anda dapat memilih opsi dengan kinerja harga paling tinggi untuk beban kerja Anda. Ini membandingkan setiap konfigurasi pada infrastruktur GPU nyata, sehingga Anda dapat menerapkan dengan percaya diri dan mengukur pengeluaran inferensi Anda dengan tepat.

Cara kerjanya

Memulai dengan rekomendasi inferensi sangat mudah, baik melalui SageMaker AI Studio atau API SageMaker AI. Langkah-langkah berikut menjelaskan alur kerja.

  1. Siapkan model Anda. Arahkan ke artefak model di Amazon S3 atau Registri Model SageMaker AI. Rekomendasi inferensi mendukung format HuggingFace pos pemeriksaan dengan SafeTensor bobot, termasuk model dasar dan model khusus atau disesuaikan.

  2. Tentukan beban kerja Anda. Jelaskan pola lalu lintas yang Anda harapkan, termasuk distribusi token input dan output serta tingkat konkurensi. Anda dapat menggunakan spesifikasi sebaris atau kumpulan data representatif dari Amazon S3.

  3. Tetapkan tujuan Anda. Pilih satu tujuan kinerja: mengoptimalkan biaya, meminimalkan latensi, atau memaksimalkan throughput. Pilih hingga tiga jenis instans untuk dibandingkan.

  4. Tinjau hasil. SageMaker AI mengembalikan konfigurasi yang divalidasi dengan metrik kinerja nyata: Time to First Token (TTFT), latensi antar token, latensi permintaan pada P50/P90/P99, throughput, dan biaya per konfigurasi. Setiap konfigurasi siap penerapan.

  5. Menyebarkan. Terapkan konfigurasi yang dipilih ke titik akhir inferensi SageMaker AI dengan satu tindakan dari SageMaker AI Studio, atau secara terprogram melalui API.

Anda juga dapat membandingkan titik akhir produksi yang ada untuk memvalidasi kinerja saat ini atau membandingkan dengan konfigurasi baru.

Kasus penggunaan

Berikut ini adalah kasus penggunaan umum untuk rekomendasi inferensi.

  • Pre-deployment validasi. Optimalkan dan tolok ukur model baru sebelum melakukan penerapan produksi. Validasi kinerja model sebelum Anda berinvestasi dalam menskalakannya.

  • Pengujian regresi setelah pembaruan. Validasi kinerja setelah pembaruan kontainer, peningkatan kerangka kerja, atau rilis pustaka penyajian. Konfirmasikan bahwa konfigurasi Anda masih optimal sebelum mendorong ke produksi.

  • Right-sizing Ketika kondisi berubah. Saat pola lalu lintas bergeser atau jenis instans baru tersedia, jalankan kembali rekomendasi inferensi dalam hitungan jam daripada memulai ulang proses manual selama seminggu.

  • Perbandingan model. Bandingkan kinerja dan biaya varian model yang berbeda di seluruh jenis instans untuk membuat pilihan yang tepat sebelum penerapan produksi.

  • Optimalisasi biaya. Tolok ukur titik akhir produksi yang ada untuk mengidentifikasi infrastruktur yang disediakan secara berlebihan. Gunakan hasil untuk ukuran yang tepat dan mengurangi pengeluaran inferensi berulang.

Harga

Rekomendasi inferensi tidak memiliki biaya layanan tambahan. Anda dapat menggunakan Reservasi ML (Rencana Pelatihan Fleksibel) yang ada tanpa biaya komputasi tambahan, atau menggunakan komputasi sesuai permintaan yang disediakan secara otomatis.

Wilayah yang Didukung

Rekomendasi inferensi tersedia di Wil AWS ayah berikut:

  • Timur AS (N. Virginia)

  • AS Timur (Ohio)

  • AS Barat (Oregon)

  • Asia Pasifik (Singapura)

  • Asia Pasifik (Tokyo)

  • Eropa (Frankfurt)

  • Eropa (Irlandia)