Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Titik akhir didukung oleh Amazon Bedrock
Amazon Bedrock mendukung berbagai titik akhir untuk melakukan operasi infer ensi.
Operasi inferensi
Untuk aplikasi baru, kami merekomendasikan titik bedrock-runtime akhir. Ini mendukung Bedrock-native InvokeModel dan Converse API, OpenAI-compatible Responses and Chat Completions API, dan Anthropic Messages API, dan di situlah fitur Amazon Bedrock seperti Guardrails, perutean prompt cerdas, dan inferensi lintas wilayah tersedia. Rute permintaan inferensi model lintas Wilayah AWS dengan inferensi lintas wilayah Amazon Bedrock juga mendukung titik akhir keduabedrock-mantle, yang saat ini menawarkan kemampuan tambahan seperti penggunaan alat sisi server dan pra-konfigurasi (termasuk pencarian web), inferensi asinkron denganbackground=true, dan pembuatan Proyek dan Ruang Kerja. Proyek (OpenAI-compatible) Ruang kerja () Anthropic-compatible Untuk melihat titik akhir mana yang didukung setiap model, lihatKetersediaan titik akhir berdasarkan model.
| Titik akhir | API yang didukung | Deskripsi |
|---|---|---|
bedrock-runtime.{region}.amazonaws.com (direkomendasikan) |
InvokeModel/Converse/Penyeles aian Obrolan/API Tang gapan/API Pesan Inferensi menggunakan Anthropic Messages API | Region-specific titik akhir untuk membuat permintaan inferensi untuk model yang dihosting di Amazon Bedrock menggunakan API. InvokeModel/Converse/Chat Completions/Responses/Messages Untuk informasi selengkapnya tentang Bedrock-native operasi, lihat operasi https://docs.aws.amazon.com/bedrock/latest/APIReference/API_Operations_Amazon_Bedrock_Runtime.html Amazon Bedrock Runtime API. OpenAI-compatible API dipanggil pada /openai/v1 jalur titik akhir ini daripada melalui AWS SDK. |
bedrock-mantle.{region}.api.aws |
API Tanggapan/API Penyelesaian Obrolan /API Pesan Inferensi menggunakan Anthropic Messages API | Region-specific titik akhir untuk membuat permintaan inferensi untuk model yang dihosting di Amazon Bedrock menggunakan OpenAI-compatible titik akhir dan Anthropic Messages API. |
Aplikasi yang ada yang menggunakan bedrock-mantle terus didukung penuh dan tidak perlu diubah. Kedua titik akhir memungkinkan Anda membawa basis kode OpenAI SDK yang ada ke Amazon Bedrock dengan hanya mengubah URL dasar dan kunci API, dan keduanya mendukung API Tang OpenAI-compatible gapan dan Penyelesaian Obrolan serta API Pesan Anthropic.
Tabel berikut membandingkan apa yang tersedia di setiap titik akhir.
| API | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| InvokeModel | ||
| Konversi/ ConverseStream | ||
| Penyelesaian Obrolan () OpenAI-compatible | ||
| Tanggapan API (OpenAI-compatible) | ||
| Pesan API (Anthropic-native) |
catatan
Messages API tersedia di kedua titik akhir, tetapi kedua permukaan tidak memiliki dukungan fitur yang identik. Secara khusus, output terstruktur (output_config.formatparameter) tidak didukung pada bedrock-mantle - permintaan yang termasuk output_config.format ditolak dengan kesalahan 400. Untuk menggunakan output terstruktur dengan model Anthropic Claude, panggil Converse atau InvokeModel API aktif. bedrock-runtime
catatan
Responses API juga tersedia di kedua titik akhir tanpa dukungan fitur yang identik. Padabedrock-runtime:
Permintaan selalu sinkron.
background=trueditolak dengan kesalahan 400.storeParameter tidak terpengaruh dan mempertahankan defaultnyatrue, sehingga percakapan multi-putaran yang disimpan berfungsi secara normal.Server-side penggunaan alat dan alat pra-konfigurasi tidak tersedia, termasuk pencarian Penelusuran Web web. Client-side penggunaan alat bekerja pada kedua titik akhir.
Hanya proyek default yang didukung. Lihat Proyek (OpenAI-compatible).
Respons yang tersimpan adalah milik Wilayah AWS yang melayaninya. Mengambil, membatalkan, atau menghapusnya, dan melanjutkan percakapan dengan
previous_response_id, semuanya ditangani oleh Wilayah tersebut.
| Kemampuan | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Cross-region inferensi (profil geografis dan global) | ||
| Manajemen percakapan yang penuh status | ||
| Inferensi asinkron (berjalan lama) | ||
| Client-side penggunaan alat | ||
| Server-side penggunaan alat | ||
| Pre-configured alat siap pakai | ||
| Proyek | Hanya proyek default | |
| Ruang kerja |
| Item | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Otentik asi AWS SigV4 | ||
| Kunci API Bedrock (juga berfungsi dengan OpenAI SDK) | ||
| Atribusi penggunaan | Prinsip IAM, penand aan metadata per permintaan, profil inferensi aplikasi Profil inferensi aplikasi | Proyek, Ruang Kerja |
catatan
Aktifbedrock-runtime, penggunaan atribut Responses API hanya oleh prinsipal IAM. Per-request penandaan metadata dan profil inferensi aplikasi tidak tersedia di dalamnya — permintaan yang menamai profil inferensi aplikasi sebagai target inferensi ditolak dengan kesalahan 400. Ini tidak mempengaruhi inferensi lintas wilayah: profil inferensi geografis dan global yang ditentukan sistem bekerja secara normal.
| Fitur | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Batasan pengaman | ||
| Caching cepat | ||
| Perutean prompt cerdas |
catatan
Dukungan caching yang cepat bedrock-mantle tergantung pada model spesifik - lihat setiap kartu model di bawah Sekilas tentang model untuk detailnya.
Pendekatan throughput dan kuota
Setiap titik akhir menggunakan pendekatan yang berbeda untuk mengelola throughput.
-
bedrock-runtimeDalam banyak layanan multi-tenant tradisional, arsitektur dirancang di sekitar kuota per akun untuk mengelola akses yang adil ke sumber daya bersama. Ini adalah pendekatan yang digunakan denganbedrock-runtime. Setiap model memiliki kuota throughput tetap (RPM dan TPM) yang dapat Anda minta kenaikan. Lihat perinciannya di Kuota untuk titik akhir runtime dasar. -
bedrock-mantle— Titik akhir ini dirancang dengan mekanisme penjadwalan dan antrean kerja lanjutan yang memberikan distribusi yang adil sambil mendukung batas throughput awal yang lebih tinggi. Desain ini juga memungkinkanbedrock-mantleuntuk meng-host serangkaian model yang luas dan memberikan berbagai kemampuan yang tersedia di seluruh katalog model. Dalam kebanyakan kasus, permintaan dilayani segera. Dalam beberapa kasus, permintaan dapat diantri sebentar saat beban kerja dalam penerbangan selesai dan throughput tersedia. Untuk detailnya, lihat Kuota untuk titik akhir mantel dasar dan Praktik terbaik penskalaan dan throughput.
Harga
Per-token harga untuk model yang sama identik pada bedrock-runtime danbedrock-mantle. Pilih titik akhir berdasarkan API dan kemampuan yang Anda butuhkan, bukan biaya. Untuk harga saat ini, lihat harga https://aws.amazon.com/bedrock/pricing/
Kapan memilih setiap titik akhir
Mulailah dengan bedrock-runtime ketika Anda ingin:
Panggil API OpenAI-compatible Tanggapan atau Penyelesaian Obrolan, atau API Pesan Anthropic.
Gunakan API Bedrock-native InvokeModel atau Converse.
Gunakan fitur Amazon Bedrock yang hanya tersedia di titik akhir ini, seperti Guardrails dan perutean prompt cerdas.
Gunakan inferensi lintas wilayah untuk merutekan permintaan di seluruh geografi atau secara global.
Gunakan bedrock-mantle saat Anda ingin:
Bangun alur kerja agen dengan penggunaan alat sisi server atau alat yang telah dikonfigurasi sebelumnya, termasuk pencarian web. Penelusuran Web
Jalankan beban kerja inferensi asinkron atau berjalan lama, termasuk permintaan Respons dengan.
background=trueBuat Proyek (OpenAI-compatible) atau Ruang kerja () Anthropic-compatible untuk mengisolasi beban kerja dan melacak biaya dan penggunaan di tingkat aplikasi.
Gunakan model yang hanya tersedia pada
bedrock-mantle. Lihat Ketersediaan titik akhir berdasarkan model.
Kedua titik akhir dapat digunakan bersama dari aplikasi yang sama — pilih per kasus penggunaan.
Mengurangi biaya keluaran data dengan titik akhir antarmuka VPC
Jika Anda memanggil Amazon Bedrock dari dalam VPC, pertimbangkan untuk menggunakan titik akhir antarmuka VPC (AWS PrivateLink) untuk menjaga lalu lintas di dalam jaringan AWS dan menghindari biaya keluar data yang terkait dengan gateway NAT atau gateway internet.