View a markdown version of this page

基岩运行时端点的配额 - Amazon Bedrock

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

基岩运行时端点的配额

bedrock-runtime.region.amazonaws.com终端节点是亚马逊 Bedrock 的主要推理终端节点。流向此端点的推理流量受基于每个模型代币的配额管辖。您可以在服务配额控制台中选择 Amazon Bedrock 作为服务来查看这些配额,也可以在中的亚马逊基岩服务配额表中查看这些配额。 AWS 一般参考

注意

模型在此端点上的配额将在你调用它的每个推理 API 中共享,包括InvokeModel对话响应和聊天完成。尽管配额名称是指InvokeModel,但它们不是针对每个 API 的。到bedrock-mantle端点的流量是单独计算的,请参阅基岩地幔端点的配额

配额类型

bedrock-runtime端点上的推理受以下每模型配额的约束:

每个模型的基本运行时配额
配额 Scope 说明
Cross-Region InvokeModel 每分钟代币用于 ${model} 每个型号,每个区域 通过跨区域推理配置文件调用时,您的账户每分钟(输入 + 输出,组合)可以用于模型的最大代币数量。
On-demand InvokeModel 每分钟代币用于 ${model} 每个型号,每个区域 在单个区域按需调用时,您的账户每分钟(输入 + 输出,合计)可以用于模型的最大代币数量。
模型调用每天的最大令牌数 ${model} 每个型号,每个区域 您的账户每天可以用于模型的最大代币数量(输入+输出,合计)。默认情况下,此值是每分钟配额乘以 24 × 60。新手 AWS 账户 可能会减少配额。
InvokeModel 每分钟请求次数 ${model} 每个型号,每个区域 您的账户每分钟可以为该模型提交的最大推理请求数。bedrock-runtime终端上的某些型号强制执行 RPM,而对其他模型不强制执行;有关适用于您的模型的确切配额,请参阅服务配额控制台。

bedrock-runtime终端节点 TPM 配额将输入和输出令牌与单个模型配额相结合。bedrock-mantle终端节点采用单独的每分钟输入令牌和每分钟输出令牌配额;有关详细信息,请参阅。基岩地幔端点的配额

注意

bedrock-runtime端点上的 RPM 配额因型号而异。某些型号——例如Anthropic克劳德作品4.7和克劳德作品4.8——没有 RPM 配额,仅受本节中描述的基于代币的配额管辖。对于确实有 RPM 配额的型号,请在服务配额控制台中查看确切值

输出代币通过特定模型的消耗率转换为配额使用量。有关如何计算基于代币的配额以及max_tokens请求参数如何影响扣除额的详细信息,请参阅。Amazon Bedrock 中词元的计算方式

相关的运行时配额

以下 Amazon Bedrock 功能通过bedrock-runtime终端节点提供并有自己的单独配额:

这些配额仅适用于bedrock-runtime终端节点,不在终bedrock-mantle端节点上公开。

请求提高配额

申请增加账户配额的步骤取决于亚马逊 Bedrock 服务配额表中可调整列中的值。

重要

在申请增加配额之前,请确认模型未处于旧版已弃用生命周期状态。对于计划停用的车型,不允许增加配额。在模型生命周期页面上查看模型的生命周期状态,并考虑改为迁移到后续模型。

  • 如果某个配额被标记为,则可以按照《服务配额用户指南》中请求增加配额的步骤进行调整。

  • 对于任何模型,您都可以同时请求增加以下配额:

    • Cross-Region InvokeModel 每分钟代币用于 ${model}

    • On-demand InvokeModel 每分钟代币用于 ${model}

    • 模型调用每天的最大令牌数 ${model}

    要请求增加这些配额的任意组合,请按照《服务配额用户指南》中的 “申请增加${model}配额” 中的步骤申请增加每分钟Cross-Region InvokeModel 代币的配额。在您这样做之后,支持团队将与您联系,为您提供增加其他两个配额的选项。

    注意

    由于需求过大,将优先考虑那些产生的流量消耗了现有配额分配的客户。如果您不符合此条件,将可能拒绝您的请求。

有关bedrock-mantle配额增加的信息,请参阅请求提高配额