Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Kuota untuk titik akhir runtime dasar
T bedrock-runtime. itik akhir adalah titik akhir inferensi utama untuk Amazon Bedrock. Lalu lintas inferensi ke titik akhir ini diatur oleh kuota berbasis token per model. Anda dapat melihat kuota ini di konsol Kuota Layanan dengan memilih Amazon Bedrock sebagai layanan, atau di tabel kuota layanan Amazon Bedrock di. Referensi Umum AWSregion.amazonaws.com
catatan
Kuota model pada titik akhir ini dibagikan di setiap API inferensi yang Anda gunakan untuk menyebutnya, termasuk, Converse InvokeModel, Responses , dan Chat Completions. Meskipun nama kuota mengacu padaInvokeModel, mereka tidak per API. Lalu lintas ke bedrock-mantle titik akhir dihitung secara terpisah — lihatKuota untuk titik akhir mantel dasar.
Jenis kuota
Inferensi pada bedrock-runtime titik akhir diatur oleh kuota per model berikut:
| Kuota | Lingkup | Deskripsi |
|---|---|---|
Cross-Region InvokeModel token per menit untuk ${model} |
Per model, per Wilayah | Jumlah maksimum token per menit (input + output, gabungan) yang dapat digunakan akun Anda untuk model saat dipanggil melalui profil inferensi lintas wilayah. |
On-demand InvokeModel token per menit untuk ${model} |
Per model, per Wilayah | Jumlah maksimum token per menit (input + output, gabungan) yang dapat digunakan akun Anda untuk model saat dipanggil sesuai permintaan di satu Wilayah. |
Model token maksimum pemanggilan per hari untuk ${model} |
Per model, per Wilayah | Jumlah maksimum token per hari (input + output, gabungan) yang dapat digunakan akun Anda untuk model. Secara default, nilai ini adalah kuota per menit dikalikan dengan 24 × 60. Baru Akun AWS mungkin menerima kuota yang dikurangi. |
InvokeModel permintaan per menit untuk ${model} |
Per model, per Wilayah | Jumlah maksimum permintaan inferensi per menit yang dapat dikirimkan akun Anda untuk model. RPM diberlakukan untuk beberapa model di bedrock-runtime titik akhir dan bukan yang lain; lihat konsol Kuota Layanan untuk kuota yang tepat yang berlaku untuk model Anda. |
Ku bedrock-runtime ota TPM titik akhir menghitung token input dan output bersama-sama terhadap satu kuota per model. Titik akhir bedrock-mantle menerapkan kuota input-token-per-menit dan output-token-per-menit terpisah; untuk detailnya, lihat. Kuota untuk titik akhir mantel dasar
catatan
Kuota RPM pada titik bedrock-runtime akhir bersifat khusus model. Beberapa model — misalnya, Anthropic Claude Opus 4.7 dan Claude Opus 4.8 — tidak memiliki kuota RPM dan hanya diatur oleh kuota berbasis token yang dijelaskan di bagian ini. Untuk model yang memiliki kuota RPM, lihat nilai pastinya di konsol Kuota Layanan.
Token keluaran diubah menjadi penggunaan kuota melalui tingkat pembakaran khusus model. Untuk detail tentang bagaimana kuota berbasis token dihitung dan bagaimana parameter max_tokens permintaan mempengaruhi pengurangan, lihatBagaimana token dihitung di Amazon Bedrock.
Kuota runtime terkait
Kemampuan Amazon Bedrock berikut dilayani melalui bedrock-runtime titik akhir dan memiliki kuota tersendiri:
-
Profil inferensi kustom — profil Application-defined inferensi yang membungkus model yang mendasarinya. Lihat Menyiapkan sumber daya pemanggilan model menggunakan profil inferensi.
-
Inferensi batch — Pekerjaan inferensi asinkron, volume besar. Lihat Memproses beberapa prompt dengan inferensi batch.
-
Throughput yang disediakan — Kapasitas unit model yang dicadangkan. Lihat Tingkatkan kapasitas pemanggilan model dengan Provisioned Throughput di Amazon Bedrock.
Kuota ini hanya berlaku untuk bedrock-runtime titik akhir dan tidak terekspos pada bedrock-mantle titik akhir.
Meminta peningkatan kuota
Langkah-langkah untuk meminta kenaikan kuota untuk akun Anda bergantung pada nilai di kolom Dapat disesuaikan di tabel kuota di kuota layanan Amazon Bedrock.
penting
Sebelum meminta peningkatan kuota, verifikasi bahwa model tersebut tidak dalam status siklus hidup Legacy atau Deprecated. Kenaikan kuota tidak diberikan untuk model yang dijadwalkan untuk pensiun. Periksa status siklus hidup model di Siklus hidup model halaman dan pertimbangkan untuk bermigrasi ke model penerus sebagai gantinya.
-
Jika kuota ditandai sebagai Ya, Anda dapat menyesuaikannya dengan mengikuti langkah-langkah di Mem inta Peningkatan Kuota di Panduan Pengguna Kuota Layanan.
-
Untuk model apa pun, Anda dapat meminta peningkatan kuota berikut bersama-sama:
-
Cross-Region InvokeModel token per menit untuk
${model} -
On-demand InvokeModel token per menit untuk
${model} -
Model token maksimum pemanggilan per hari untuk
${model}
Untuk meminta kenaikan untuk kombinasi kuota ini, minta kenaikan Cross-Region InvokeModel token per menit untuk
${model}kuota dengan mengikuti langkah-langkah di Meminta Peningkatan Kuota di Panduan Pengguna Kuota Layanan. Setelah Anda melakukannya, tim dukungan akan menghubungi dan menawarkan Anda opsi untuk juga meningkatkan dua kuota lainnya.catatan
Karena permintaan yang luar biasa, prioritas akan diberikan kepada pelanggan yang menghasilkan lalu lintas yang menghabiskan alokasi kuota yang ada. Permintaan Anda mungkin ditolak jika Anda tidak memenuhi syarat ini.
-
Untuk bedrock-mantle kenaikan kuota, lihatMeminta peningkatan kuota.