View a markdown version of this page

Titik akhir didukung oleh Amazon Bedrock - Amazon Bedrock

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Titik akhir didukung oleh Amazon Bedrock

Titik akhir adalah URL yang digunakan aplikasi Anda untuk mengirim permintaan inferensi ke Amazon Bedrock. Amazon Bedrock menyediakan dua titik akhir inferensi. Titik akhir yang Anda pilih menentukan API dan fitur mana yang tersedia.

Untuk sebagian besar aplikasi baru, gunakan titik bedrock-runtime akhir. Gunakan bedrock-mantle saat Anda secara khusus membutuhkan kemampuan yang saat ini hanya tersedia di sana, seperti alat sisi server dan pra-konfigurasi (termasuk pencarian web), inferensi latar belakang, Proyek, atau Ruang Kerja. Ruang kerja () Anthropic-compatible Untuk melihat titik akhir mana yang didukung setiap model, lihatKetersediaan titik akhir. Tabel berikut membandingkan dua titik akhir.

Titik akhir API yang didukung Deskripsi
bedrock-runtime.{region}.amazonaws.com (direkomendasikan) InvokeModel/Converse/Penyeles aian Obrolan/API Tang gapan/API Pesan Inferensi menggunakan Anthropic Messages API Region-specific titik akhir untuk membuat permintaan inferensi untuk model yang dihosting di Amazon Bedrock menggunakan API. InvokeModel/Converse/Chat Completions/Responses/Messages Untuk informasi selengkapnya tentang Bedrock-native operasi, lihat operasi https://docs.aws.amazon.com/bedrock/latest/APIReference/API_Operations_Amazon_Bedrock_Runtime.html Amazon Bedrock Runtime API. OpenAI-compatible API dipanggil pada /openai/v1 jalur titik akhir ini daripada melalui AWS SDK.
bedrock-mantle.{region}.api.aws API Tanggapan/API Penyelesaian Obrolan /API Pesan Inferensi menggunakan Anthropic Messages API Region-specific titik akhir untuk membuat permintaan inferensi untuk model yang dihosting di Amazon Bedrock menggunakan OpenAI-compatible titik akhir dan Anthropic Messages API.
catatan

Kedua titik akhir menggunakan mesin inferensi Mantle yang mendasari yang sama dan mendapat manfaat dari desain akses operator nol (ZOA) Mantle. bedrock-mantleNama mengidentifikasi permukaan titik akhir, bukan mesin inferensi yang berbeda.

Aplikasi yang ada yang menggunakan bedrock-mantle terus didukung penuh dan tidak perlu diubah. Kedua titik akhir memungkinkan Anda membawa basis kode OpenAI SDK yang ada ke Amazon Bedrock dengan hanya mengubah URL dasar dan kunci API, dan keduanya mendukung API Tang OpenAI-compatible gapan dan Penyelesaian Obrolan serta API Pesan Anthropic.

catatan

Messages API tersedia di kedua titik akhir, tetapi kedua permukaan tidak memiliki dukungan fitur yang identik. Secara khusus, output terstruktur (output_config.formatparameter) tidak didukung pada bedrock-mantle - permintaan yang termasuk output_config.format ditolak dengan kesalahan 400. Untuk menggunakan output terstruktur dengan model Anthropic Claude, panggil Converse atau InvokeModel API aktif. bedrock-runtime

catatan

Responses API juga tersedia di kedua titik akhir tanpa dukungan fitur yang identik. Padabedrock-runtime:

  • Permintaan selalu sinkron. background=trueditolak dengan kesalahan 400. storeParameter tidak terpengaruh dan mempertahankan defaultnyatrue, sehingga percakapan multi-putaran yang disimpan berfungsi secara normal.

  • Server-side penggunaan alat dan alat pra-konfigurasi tidak tersedia, termasuk pencarian Pencarian Web web. Client-side penggunaan alat bekerja pada kedua titik akhir.

  • Hanya proyek default yang didukung. Lihat Proyek (OpenAI-compatible).

  • Respons yang tersimpan adalah milik Wilayah AWS yang melayaninya. Mengambil, membatalkan, atau menghapusnya, dan melanjutkan percakapan denganprevious_response_id, semuanya ditangani oleh Wilayah tersebut.

Otentikasi tidak memberikan akses dengan sendirinya. Baik Anda menggunakan SIGv4 atau kunci API Bedrock, prinsipal IAM terkait harus memiliki izin untuk tindakan yang diperlukan. Untuk persyaratan kebijakan lengkap dan contoh, lihatPrasyarat untuk menjalankan inferensi model.

Operasional
Item bedrock-runtime bedrock-mantle
Otentik asi AWS SigV4 supported supported
Kunci API Bedrock (juga berfungsi dengan OpenAI SDK) supported supported
Otorisasi IAM untuk inferensi bedrock:InvokeModelpada target inferensi dan, untuk Responses API, proyek default; bedrock:InvokeModelWithResponseStream untuk streaming bedrock-mantle:CreateInference
Atribusi penggunaan Prinsip IAM, penand aan metadata per permintaan, profil inferensi aplikasi Profil inferensi aplikasi Proyek, Ruang Kerja
catatan

Aktifbedrock-runtime, penggunaan atribut Responses API hanya oleh prinsipal IAM. Per-request penandaan metadata dan profil inferensi aplikasi tidak tersedia di dalamnya — permintaan yang menamai profil inferensi aplikasi sebagai target inferensi ditolak dengan kesalahan 400. Ini tidak mempengaruhi inferensi lintas wilayah: profil inferensi geografis dan global yang ditentukan sistem bekerja secara normal.

Ketersediaan fitur batuan dasar
Fitur bedrock-runtime bedrock-mantle
Batasan pengaman supported not-supported
Caching cepat supported supported
Perutean prompt cerdas supported not-supported
catatan

Dukungan caching yang cepat bedrock-mantle tergantung pada model spesifik - lihat setiap kartu model di bawah Sekilas tentang model untuk detailnya.

Pendekatan throughput dan kuota

Setiap titik akhir menggunakan pendekatan yang berbeda untuk mengelola throughput.

  • bedrock-runtimeDalam banyak layanan multi-tenant tradisional, arsitektur dirancang di sekitar kuota per akun untuk mengelola akses yang adil ke sumber daya bersama. Ini adalah pendekatan yang digunakan denganbedrock-runtime. Setiap model memiliki kuota throughput tetap (RPM dan TPM) yang dapat Anda minta kenaikan. Lihat perinciannya di Kuota untuk titik akhir runtime dasar.

  • bedrock-mantle— Titik akhir ini dirancang dengan mekanisme penjadwalan dan antrean kerja lanjutan yang memberikan distribusi yang adil sambil mendukung batas throughput awal yang lebih tinggi. Desain ini juga memungkinkan bedrock-mantle untuk meng-host serangkaian model yang luas dan memberikan berbagai kemampuan yang tersedia di seluruh katalog model. Dalam kebanyakan kasus, permintaan dilayani segera. Dalam beberapa kasus, permintaan dapat diantri sebentar saat beban kerja dalam penerbangan selesai dan throughput tersedia. Untuk detailnya, lihat Kuota untuk titik akhir mantel dasar dan Praktik terbaik penskalaan dan throughput.

Harga

Per-token harga untuk model yang sama identik pada bedrock-runtime danbedrock-mantle. Pilih titik akhir berdasarkan API dan kemampuan yang Anda butuhkan, bukan biaya. Untuk harga saat ini, lihat harga https://aws.amazon.com/bedrock/pricing/ Amazon Bedrock.

Kapan memilih setiap titik akhir

Mulailah dengan bedrock-runtime ketika Anda ingin:

Gunakan bedrock-mantle saat Anda ingin:

  • Bangun alur kerja agen dengan penggunaan alat sisi server atau alat yang telah dikonfigurasi sebelumnya, termasuk pencarian web. Pencarian Web

  • Jalankan beban kerja inferensi asinkron atau berjalan lama, termasuk permintaan Respons dengan. background=true

  • Buat Proyek (OpenAI-compatible) atau Ruang kerja () Anthropic-compatible untuk mengisolasi beban kerja dan melacak biaya dan penggunaan di tingkat aplikasi.

  • Gunakan model yang hanya tersedia padabedrock-mantle. Lihat Ketersediaan titik akhir.

Kedua titik akhir dapat digunakan bersama dari aplikasi yang sama — pilih per kasus penggunaan.

Mengurangi biaya keluaran data dengan titik akhir antarmuka VPC

Jika Anda memanggil Amazon Bedrock dari dalam VPC, pertimbangkan untuk menggunakan titik akhir antarmuka VPC (AWS PrivateLink) untuk menjaga lalu lintas di dalam jaringan AWS dan menghindari biaya keluar data yang terkait dengan gateway NAT atau gateway internet.