

本文属于机器翻译版本。若本译文内容与英语原文存在差异，则一律以英文原文为准。

# 基底运行时端点的配额
<a name="quotas-runtime"></a>

`bedrock-runtime.{{region}}.amazonaws.com`终端节点是 Amazon Bedrock 的主要推理终端节点。此端点的推理流量受基于每个模型令牌的配额控制。您可以在 S [ervice Quotas 控制台中查看这些配额](https://docs.aws.amazon.com/servicequotas/latest/userguide/gs-request-quota.html)，方法是选择 **Amazon Bedrock** 作为服务，也可以在 [Amazon Bedrock 服务配额表中查看这些配额](https://docs.aws.amazon.com/general/latest/gr/bedrock.html#limits_bedrock)。 AWS 一般参考

## 配额类型
<a name="quotas-runtime-types"></a>

`bedrock-runtime`端点上的推理受以下每个模型的配额控制：


**每个模型的基岩运行时间配额**  

| 配额 | Scope | 说明 | 
| --- | --- | --- | 
| Cross-Region InvokeModel 每分钟代币为 {{${model}}} | 每个型号、每个区域 | 通过跨区域推理配置文件调用时，您的账户每分钟可以为模型使用的最大代币数量（输入\+输出，合计）。 | 
| On-demand InvokeModel 每分钟代币为 {{${model}}} | 每个型号、每个区域 | 在单个区域中按需调用时，您的账户每分钟可以为模型使用的最大代币数量（输入\+输出，合计）。 | 
| 每天的模型调用最大代币数 {{${model}}} | 每个型号、每个区域 | 您的账户每天可用于模型的最大代币数量（输入\+输出，合计）。默认情况下，此值为每分钟配额乘以 24 × 60。新手 AWS 账户 可能会减少配额。 | 
| InvokeModel 每分钟请求的次数 {{${model}}} | 每个型号、每个区域 | 您的账户每分钟可以为模型提交的最大推理请求数。bedrock-runtime终端节点上的某些型号强制执行 RPM，而其他模型则不强制执行；有关适用于您的模型的确切配额，请参阅 Service Quotas 控制台。 | 

`bedrock-runtime`端点 TPM 配额将输入和输出令牌一起计入每个模型的单个配额。`bedrock-mantle`终端节点分别应用每分钟输入令牌和每分钟输出令牌配额；有关详细信息，请参阅。[基岩地幔端点的配额](quotas-mantle.md)

**注意**  
`bedrock-runtime`终端节点上的 RPM 配额因型号而异。某些模型（例如 Anthropic Claude Opus 4.7 和 Claude Opus 4.8）没有 RPM 配额，仅受本节中描述的基于代币的配额控制。对于具有 RPM 配额的型号，请在 Serv [ice Quotas 控制台](https://docs.aws.amazon.com/servicequotas/latest/userguide/gs-request-quota.html)中查看确切的值。

输出代币通过特定模型的耗尽率转换为配额使用量。有关如何计算基于令牌的配额以及`max_tokens`请求参数如何影响扣除额的详细信息，请参阅。[Amazon Bedrock 中词元的计算方式](quotas-token-burndown.md)

## 相关的运行时配额
<a name="quotas-runtime-other"></a>

以下 Amazon Bedrock 功能通过`bedrock-runtime`终端节点提供服务，并有自己的单独配额：
+ **自定义推理配置文件** — 封装底层模型的 Application-defined 推理配置文件。请参阅[使用推理配置文件设置模型调用资源](inference-profiles.md)。
+ **Batch 推理** — 异步、大容量推理作业。请参阅[使用批量推理处理多个提示](batch-inference.md)。
+ **预配置吞吐量**-预留模型单元容量。请参阅[利用 Amazon Bedrock 中的预调配吞吐量增加模型调用容量](prov-throughput.md)。

这些配额仅适用于`bedrock-runtime`终端节点，不在终`bedrock-mantle`端节点上公开。

## 请求提高配额
<a name="quotas-runtime-increase"></a>

申请增加账户配额的步骤取决于 [Amazon Bedrock 服务](https://docs.aws.amazon.com/general/latest/gr/bedrock.html#limits_bedrock)配额中配额表中**可调整**列中的值。

**重要**  
在请求增加配额之前，请确认模型未处于 “*旧版*” 或 “*已弃用*” 的生命周期状态。对于计划退役的车型，不允许增加配额。在[模型生命周期](model-lifecycle.md)页面上查看模型的生命周期状态，并考虑改为迁移到后续模型。
+ 如果某个配额被标记为**是**，则可以按照《服务配额用户指南》中[请求增加配额](https://docs.aws.amazon.com/servicequotas/latest/userguide/request-quota-increase.html)的步骤进行调整。
+ 对于任何模型，您都可以同时请求增加以下配额：
  + Cross-Region InvokeModel 每分钟代币为 {{${model}}}
  + On-demand InvokeModel 每分钟代币为 {{${model}}}
  + 每天的模型调用最大代币数 {{${model}}}

  要申请增加这些配额的任意组合，请按照 Service {{${model}}} Quotas 用户指南中[请求增加配额中的步骤申请增加](https://docs.aws.amazon.com/servicequotas/latest/userguide/request-quota-increase.html)**每分钟Cross-Region InvokeModel 令牌**的配额。完成后，支持团队将与您联系，并为您提供增加其他两个配额的选项。
**注意**  
由于需求过大，将优先考虑那些产生的流量消耗了现有配额分配的客户。如果您不符合此条件，将可能拒绝您的请求。

有关`bedrock-mantle`配额增加的信息，请参阅[请求提高配额](quotas-mantle.md#quotas-mantle-increase)。