View a markdown version of this page

Inferensi batuan dasar Amazon - Amazon Nova

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Inferensi batuan dasar Amazon

Setelah Anda melatih dan menguji model Amazon Nova Anda, Anda dapat menerapkannya ke Amazon Bedrock untuk inferensi skala produksi. Proses penerapan melibatkan pembuatan model Amazon Bedrock dengan CreateCustomModel API, mengekspor artefak model Anda ke dalamnya dari bucket Amazon S3 yang dikelola, dan kemudian setelah model AKTIF mengonfigurasi titik akhir dengan inferensi throughput sesuai permintaan atau disediakan.

Setelah membuat model kustom di SageMaker, Anda dapat menggunakan CreateCustomModel API untuk menyebarkannya ke Amazon Bedrock dari SageMaker escrow untuk menjalankan inferensi. Anda kemudian dapat menggunakan CreateCustomModelDeployment untuk membuat titik akhir inferensi OD atau menyiapkan inferensi throughput yang disediakan untuk model Parameter Efficient Fine Tuned (PEFT). Anda dapat mengatur inferensi throughput yang disediakan untuk model kustom Peringkat Penuh.

Anda juga dapat menggunakan SageMaker Python SDK untuk menerapkan model Amazon Nova yang disesuaikan. SageMaker Python SDK memberikan pengalaman yang efisien untuk menerapkan model terlatih ke titik akhir Amazon Bedrock On-Demand atau SageMaker AI Real-time Inference. Untuk informasi selengkapnya, lihat Menyesuaikan dengan SageMaker Python SDK.

Untuk langkah-langkah terperinci untuk menyiapkan inferensi Amazon Bedrock untuk model khusus, lihat Menyebarkan model Amazon Nova yang disesuaikan ke Amazon Bedrock.

Bagian berikut memberikan detail lebih lanjut tentang On-Demand Inferensi pada Model Kustom.

On-demand kesimpulan pada Model Kustom

On-demand Inferensi (OD) memungkinkan Anda menjalankan inferensi pada model Amazon Nova kustom Anda tanpa mempertahankan titik akhir throughput yang disediakan. Ini membantu Anda mengoptimalkan biaya dan skala secara efisien. Dengan On-demand inferensi, Anda dikenakan biaya berdasarkan penggunaan, diukur dalam token, baik masuk maupun keluar.

Persyaratan kompatibilitas

Persyaratan kompatibilitas berikut berlaku:

  • Inferensi OD didukung untuk model pemahaman kustom Amazon Nova Pro, Lite dan Micro. Inferensi OD tidak didukung untuk model pembuatan konten kustom Nova.

  • Inferensi OD didukung untuk model pemahaman khusus Amazon Nova yang dilatih setelah 16 Juli 2025. Model khusus yang dilatih sebelum 16 Juli 2025 tidak kompatibel dengan inferensi OD.

  • Kustomisasi Amazon Bedrock: Inferensi OD didukung untuk model yang disesuaikan dengan kustomisasi Amazon Bedrock dan untuk model siswa yang disuling dari model guru dengan Amazon Bedrock.

  • SageMaker Kustomisasi AI: Untuk model yang disesuaikan di SageMaker AI, inferensi OD hanya didukung untuk model yang Parameter-efficient disetel (PEFT) saat model di-host di Amazon Bedrock. Ini termasuk Pengoptimalan Preferensi Langsung ditambah PEFT. Inferensi OD tidak didukung untuk model yang Full-rank disetel dengan baik.

Pelatihan model dan inferensi

Saat Anda melatih model Amazon Nova Pro, Lite, atau Micro khusus baru di Amazon Bedrock atau SageMaker AI menggunakan PEFT setelah 16 Juli 2025, model akan secara otomatis kompatibel dengan opsi inferensi yang disediakan dan sesuai permintaan. Anda dapat memilih metode inferensi pilihan Anda saat menerapkan model Anda.

Untuk menggunakan inferensi OD dengan model yang dilatih setelah 16 Juli 2025, selesaikan langkah-langkah berikut:

  1. Buat pekerjaan penyempurnaan baru dengan API kustomisasi Amazon Bedrock atau API kustomisasi SageMaker AI.

  2. Terapkan model yang baru dilatih ke Amazon Bedrock menggunakan CreateCustomModel API.

  3. Terapkan untuk inferensi sesuai permintaan menggunakan CustomModelDeployment API.

Batas tarif

Batas permintaan per menit (RPM) dan token per menit (TPM) berikut berlaku untuk permintaan inferensi sesuai permintaan:

Model Dasar untuk Model Kustom RPM untuk Penerapan Model Kustom TPM untuk Penerapan Model Kustom
Nova 2 Lite 2.000 4.000.000

Untuk mempelajari lebih lanjut tentang kuota yang tersedia untuk Amazon Nova, lihatKuota untuk Amazon Nova.

Latensi

Anda dapat mengharapkan perbedaan latensi ujung ke ujung (yaitu, Time To First Token (TTFT)) sebesar 20-55% antara pemanggilan model dasar dan adaptor. Nilai latensi yang tepat bervariasi menurut ukuran model dan sesuai dengan standar industri.