View a markdown version of this page

Kuota untuk titik akhir runtime dasar - Amazon Bedrock

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Kuota untuk titik akhir runtime dasar

T bedrock-runtime.region.amazonaws.com itik akhir adalah titik akhir inferensi utama untuk Amazon Bedrock. Lalu lintas inferensi ke titik akhir ini diatur oleh kuota berbasis token per model. Anda dapat melihat kuota ini di konsol Kuota Layanan dengan memilih Amazon Bedrock sebagai layanan, atau di tabel kuota layanan Amazon Bedrock di. Referensi Umum AWS

catatan

Kuota model pada titik akhir ini dibagikan di setiap API inferensi yang Anda gunakan untuk menyebutnya, termasuk, Converse InvokeModel, Responses , dan Chat Completions. Meskipun nama kuota mengacu padaInvokeModel, mereka tidak per API. Lalu lintas ke bedrock-mantle titik akhir dihitung secara terpisah — lihatKuota untuk titik akhir mantel dasar.

Jenis kuota

Inferensi pada bedrock-runtime titik akhir diatur oleh kuota per model berikut:

kuota waktu operasi dasar per model
Kuota Lingkup Deskripsi
Cross-Region InvokeModel token per menit untuk ${model} Per model, per Wilayah Jumlah maksimum token per menit (input + output, gabungan) yang dapat digunakan akun Anda untuk model saat dipanggil melalui profil inferensi lintas wilayah.
On-demand InvokeModel token per menit untuk ${model} Per model, per Wilayah Jumlah maksimum token per menit (input + output, gabungan) yang dapat digunakan akun Anda untuk model saat dipanggil sesuai permintaan di satu Wilayah.
Model token maksimum pemanggilan per hari untuk ${model} Per model, per Wilayah Jumlah maksimum token per hari (input + output, gabungan) yang dapat digunakan akun Anda untuk model. Secara default, nilai ini adalah kuota per menit dikalikan dengan 24 × 60. Baru Akun AWS mungkin menerima kuota yang dikurangi.
InvokeModel permintaan per menit untuk ${model} Per model, per Wilayah Jumlah maksimum permintaan inferensi per menit yang dapat dikirimkan akun Anda untuk model. RPM diberlakukan untuk beberapa model di bedrock-runtime titik akhir dan bukan yang lain; lihat konsol Kuota Layanan untuk kuota yang tepat yang berlaku untuk model Anda.

Ku bedrock-runtime ota TPM titik akhir menghitung token input dan output bersama-sama terhadap satu kuota per model. Titik akhir bedrock-mantle menerapkan kuota input-token-per-menit dan output-token-per-menit terpisah; untuk detailnya, lihat. Kuota untuk titik akhir mantel dasar

catatan

Kuota RPM pada titik bedrock-runtime akhir bersifat khusus model. Beberapa model — misalnya, Anthropic Claude Opus 4.7 dan Claude Opus 4.8 — tidak memiliki kuota RPM dan hanya diatur oleh kuota berbasis token yang dijelaskan di bagian ini. Untuk model yang memiliki kuota RPM, lihat nilai pastinya di konsol Kuota Layanan.

Token keluaran diubah menjadi penggunaan kuota melalui tingkat pembakaran khusus model. Untuk detail tentang bagaimana kuota berbasis token dihitung dan bagaimana parameter max_tokens permintaan mempengaruhi pengurangan, lihatBagaimana token dihitung di Amazon Bedrock.

Kuota runtime terkait

Kemampuan Amazon Bedrock berikut dilayani melalui bedrock-runtime titik akhir dan memiliki kuota tersendiri:

Kuota ini hanya berlaku untuk bedrock-runtime titik akhir dan tidak terekspos pada bedrock-mantle titik akhir.

Meminta peningkatan kuota

Langkah-langkah untuk meminta kenaikan kuota untuk akun Anda bergantung pada nilai di kolom Dapat disesuaikan di tabel kuota di kuota layanan Amazon Bedrock.

penting

Sebelum meminta peningkatan kuota, verifikasi bahwa model tersebut tidak dalam status siklus hidup Legacy atau Deprecated. Kenaikan kuota tidak diberikan untuk model yang dijadwalkan untuk pensiun. Periksa status siklus hidup model di Siklus hidup model halaman dan pertimbangkan untuk bermigrasi ke model penerus sebagai gantinya.

Untuk bedrock-mantle kenaikan kuota, lihatMeminta peningkatan kuota.