本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
基岩运行时端点的配额
该bedrock-runtime.终端节点是亚马逊 Bedrock 的主要推理终端节点。流向此端点的推理流量受基于每个模型代币的配额管辖。您可以在服务配额控制台中选择 Amazon Bedrock 作为服务来查看这些配额,也可以在中的亚马逊基岩服务配额表中查看这些配额。 AWS 一般参考region.amazonaws.com
注意
模型在此端点上的配额将在你调用它的每个推理 API 中共享,包括InvokeModel对话、响应和聊天完成。尽管配额名称是指InvokeModel,但它们不是针对每个 API 的。到bedrock-mantle端点的流量是单独计算的,请参阅基岩地幔端点的配额。
配额类型
bedrock-runtime端点上的推理受以下每模型配额的约束:
| 配额 | Scope | 说明 |
|---|---|---|
Cross-Region InvokeModel 每分钟代币用于 ${model} |
每个型号,每个区域 | 通过跨区域推理配置文件调用时,您的账户每分钟(输入 + 输出,组合)可以用于模型的最大代币数量。 |
On-demand InvokeModel 每分钟代币用于 ${model} |
每个型号,每个区域 | 在单个区域按需调用时,您的账户每分钟(输入 + 输出,合计)可以用于模型的最大代币数量。 |
模型调用每天的最大令牌数 ${model} |
每个型号,每个区域 | 您的账户每天可以用于模型的最大代币数量(输入+输出,合计)。默认情况下,此值是每分钟配额乘以 24 × 60。新手 AWS 账户 可能会减少配额。 |
InvokeModel 每分钟请求次数 ${model} |
每个型号,每个区域 | 您的账户每分钟可以为该模型提交的最大推理请求数。bedrock-runtime终端上的某些型号强制执行 RPM,而对其他模型不强制执行;有关适用于您的模型的确切配额,请参阅服务配额控制台。 |
bedrock-runtime终端节点 TPM 配额将输入和输出令牌与单个模型配额相结合。bedrock-mantle终端节点采用单独的每分钟输入令牌和每分钟输出令牌配额;有关详细信息,请参阅。基岩地幔端点的配额
注意
bedrock-runtime端点上的 RPM 配额因型号而异。某些型号——例如Anthropic克劳德作品4.7和克劳德作品4.8——没有 RPM 配额,仅受本节中描述的基于代币的配额管辖。对于确实有 RPM 配额的型号,请在服务配额控制台中查看确切值。
输出代币通过特定模型的消耗率转换为配额使用量。有关如何计算基于代币的配额以及max_tokens请求参数如何影响扣除额的详细信息,请参阅。Amazon Bedrock 中词元的计算方式
相关的运行时配额
以下 Amazon Bedrock 功能通过bedrock-runtime终端节点提供并有自己的单独配额:
-
自定义推理配置文件 ——封装底层模型的 Application-defined 推理配置文件。请参阅使用推理配置文件设置模型调用资源。
-
批量推理 — 异步的大容量推理作业。请参阅使用批量推理处理多个提示。
-
预置吞吐量 — 预留的模型单位容量。请参阅利用 Amazon Bedrock 中的预调配吞吐量增加模型调用容量。
这些配额仅适用于bedrock-runtime终端节点,不在终bedrock-mantle端节点上公开。
请求提高配额
申请增加账户配额的步骤取决于亚马逊 Bedrock 服务配额表中可调整列中的值。
重要
在申请增加配额之前,请确认模型未处于旧版或已弃用生命周期状态。对于计划停用的车型,不允许增加配额。在模型生命周期页面上查看模型的生命周期状态,并考虑改为迁移到后续模型。
-
如果某个配额被标记为是,则可以按照《服务配额用户指南》中请求增加配额的步骤进行调整。
-
对于任何模型,您都可以同时请求增加以下配额:
-
Cross-Region InvokeModel 每分钟代币用于
${model} -
On-demand InvokeModel 每分钟代币用于
${model} -
模型调用每天的最大令牌数
${model}
要请求增加这些配额的任意组合,请按照《服务配额用户指南》中的 “申请增加
${model}配额” 中的步骤申请增加每分钟Cross-Region InvokeModel 代币的配额。在您这样做之后,支持团队将与您联系,为您提供增加其他两个配额的选项。注意
由于需求过大,将优先考虑那些产生的流量消耗了现有配额分配的客户。如果您不符合此条件,将可能拒绝您的请求。
-
有关bedrock-mantle配额增加的信息,请参阅请求提高配额。