Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Optimalkan inferensi model untuk latensi
catatan
Fitur Latency Optimized Inference sedang dalam rilis pratinjau untuk Amazon Bedrock dan dapat berubah.
Latency-optimized inferensi untuk model dasar Amazon Bedrock memberikan waktu respons yang lebih cepat dan daya tanggap yang lebih baik untuk aplikasi AI. Versi yang dioptimalkan Amazon Nova Pro, model Claude 3.5 Haiku Anthropic
Mengakses kemampuan pengoptimalan latensi tidak memerlukan pengaturan tambahan atau penyetelan model, memungkinkan peningkatan langsung aplikasi yang ada dengan waktu respons yang lebih cepat. Anda dapat mengatur parameter “Latensi” ke “dioptimalkan” saat memanggil API runtime Amazon Bedrock. Jika Anda memilih “standar” sebagai opsi pemanggilan Anda, permintaan Anda akan dilayani oleh inferensi standar. Secara default semua permintaan dialihkan ke melalui “standar”.
"performanceConfig" : { "latency" : "standard | optimized" }
Setelah Anda mencapai kuota penggunaan untuk pengoptimalan latensi untuk model, kami akan mencoba melayani permintaan dengan latensi Standar. Dalam kasus seperti itu, permintaan akan dibebankan pada tarif latensi Standar. Konfigurasi latensi untuk permintaan yang dilayani terlihat di respons API dan AWS CloudTrail log. Anda juga dapat melihat metrik untuk permintaan yang dioptimalkan latensi di Amazon CloudWatch log di bawah “model-id+latency-”.
Inferensi yang dioptimalkan latensi tersedia untuk Llama 3.1 70B dan 405B Meta, serta Claude 3.5 Haiku Anthropic di Wilayah AS Timur (Ohio) dan AS Barat (Oregon) melalui inferensi lintas wilayah. bedrock/latest/userguide/cross-region-inference.html
Inferensi yang dioptimalkan latensi tersedia untuk Amazon Nova Pro Wilayah AS Timur (Virginia Utara), AS Timur (Ohio), dan AS Barat (Oregon) melalui inferensi Lintas wilayah.
Untuk informasi selengkapnya tentang harga, kunjungi halaman harga
catatan
Inferensi yang dioptimalkan latensi untuk Llama 3.1 405B saat ini mendukung permintaan dengan jumlah token input dan output total hingga 11K. Untuk permintaan jumlah token yang lebih besar, kami akan kembali ke mode standar.
Tabel berikut menunjukkan profil inferensi yang mendukung pengoptimalan latensi:
| Penyedia | Model | Model ID | Cross-region dukungan profil inferensi |
|---|---|---|---|
| Amazon | New Pro | amazon.nova-pro-v 1:0 |
us-east-1 us-east-2 |
| Antropik | Claude 3.5 Haiku | antropik.laude-3-5-haiku-20241022-v 1:0 |
us-east-2 us-west-2 |
| Meta | Llama 3.1 405B Instruksi | meta.llama3-1-405b-instruksi-v 1:0 |
us-east-2 |
| Meta | Llama 3.1 70B Instruksi | meta.llama3-1-70b-instruksi-v 1:0 |
us-east-2 us-west-2 |
Untuk informasi selengkapnya tentang profil inferensi, lihatWilayah dan model yang didukung untuk profil inferensi.