View a markdown version of this page

Optimalkan inferensi model untuk latensi - Amazon Bedrock

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Optimalkan inferensi model untuk latensi

catatan

Fitur Latency Optimized Inference sedang dalam rilis pratinjau untuk Amazon Bedrock dan dapat berubah.

Latency-optimized inferensi untuk model dasar Amazon Bedrock memberikan waktu respons yang lebih cepat dan daya tanggap yang lebih baik untuk aplikasi AI. Versi yang dioptimalkan Amazon Nova Pro, model Claude 3.5 Haiku Anthropic dan model Llama 3.1 405B dan 70B Meta menawarkan latensi yang berkurang secara signifikan tanpa mengorbankan akurasi.

Mengakses kemampuan pengoptimalan latensi tidak memerlukan pengaturan tambahan atau penyetelan model, memungkinkan peningkatan langsung aplikasi yang ada dengan waktu respons yang lebih cepat. Anda dapat mengatur parameter “Latensi” ke “dioptimalkan” saat memanggil API runtime Amazon Bedrock. Jika Anda memilih “standar” sebagai opsi pemanggilan Anda, permintaan Anda akan dilayani oleh inferensi standar. Secara default semua permintaan dialihkan ke melalui “standar”.

"performanceConfig" : { "latency" : "standard | optimized" }

Setelah Anda mencapai kuota penggunaan untuk pengoptimalan latensi untuk model, kami akan mencoba melayani permintaan dengan latensi Standar. Dalam kasus seperti itu, permintaan akan dibebankan pada tarif latensi Standar. Konfigurasi latensi untuk permintaan yang dilayani terlihat di respons API dan AWS CloudTrail log. Anda juga dapat melihat metrik untuk permintaan yang dioptimalkan latensi di Amazon CloudWatch log di bawah “model-id+latency-”.

Inferensi yang dioptimalkan latensi tersedia untuk Llama 3.1 70B dan 405B Meta, serta Claude 3.5 Haiku Anthropic di Wilayah AS Timur (Ohio) dan AS Barat (Oregon) melalui inferensi lintas wilayah. bedrock/latest/userguide/cross-region-inference.html

Inferensi yang dioptimalkan latensi tersedia untuk Amazon Nova Pro Wilayah AS Timur (Virginia Utara), AS Timur (Ohio), dan AS Barat (Oregon) melalui inferensi Lintas wilayah.

Untuk informasi selengkapnya tentang harga, kunjungi halaman harga.

catatan

Inferensi yang dioptimalkan latensi untuk Llama 3.1 405B saat ini mendukung permintaan dengan jumlah token input dan output total hingga 11K. Untuk permintaan jumlah token yang lebih besar, kami akan kembali ke mode standar.

Tabel berikut menunjukkan profil inferensi yang mendukung pengoptimalan latensi:

Penyedia Model Model ID Cross-region dukungan profil inferensi
Amazon New Pro amazon.nova-pro-v 1:0

us-east-1

us-east-2

Antropik Claude 3.5 Haiku antropik.laude-3-5-haiku-20241022-v 1:0

us-east-2

us-west-2

Meta Llama 3.1 405B Instruksi meta.llama3-1-405b-instruksi-v 1:0

us-east-2

Meta Llama 3.1 70B Instruksi meta.llama3-1-70b-instruksi-v 1:0

us-east-2

us-west-2

Untuk informasi selengkapnya tentang profil inferensi, lihatWilayah dan model yang didukung untuk profil inferensi.