本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
亚马逊 Bedrock 支持的终端节点
终端节点是您的应用程序用来向亚马逊 Bedrock 发送推理请求的 URL。亚马逊 Bedrock 提供了两个推理终端节点。您选择的终端节点决定了哪些 API 和功能可用。
对于大多数新应用程序,使用bedrock-runtime端点。bedrock-mantle当您特别需要当前仅在那里可用的功能时使用,例如服务器端和预配置的工具(包括 Web 搜索)、后台推断、项目或工作区。工作空间 () Anthropic-compatible要查看每个模型支持哪个端点,请参阅终端可用性。下表比较了两个端点。
| Endpoint | 支持的 API | 描述 |
|---|---|---|
bedrock-runtime.{region}.amazonaws.com(推荐) |
InvokeModel/交谈/聊天完成/回复 API /消息 API | Region-specific 用于使用 API 对亚马逊基岩中托管的模型提出推理请求的终端节点。 InvokeModel/Converse/Chat Completions/Responses/Messages 有关这些 Bedrock-native 操作的更多信息,请参阅亚马逊 Bedrock 运行时 API 操作。这 OpenAI-compatible 些 API 是通过此端点的/openai/v1路径调用的,而不是通过 AWS SDK 调用的。 |
bedrock-mantle.{region}.api.aws |
回复 API/聊天完成 API/消息 API | Region-specific 用于使用终端节点和 Anthropic Messages API 对托管在 Amazon Bedrock 中的模型提出推理请求的 OpenAI-compatible 终端节点。 |
注意
两个端点都使用相同的底层 Mantle 推理引擎,并受益于 Mantle 的零操作员访问权限 (ZOA) bedrock-mantle名称标识的是端点表面,而不是不同的推理引擎。
使用的现有应用程序bedrock-mantle将继续得到完全支持,无需更改。这两个终端节点都允许您通过仅更改基本网址和API密钥将现有的OpenAI SDK代码库引入亚马逊Bedrock,并且都支持 OpenAI-compatible 响应和聊天完成 API 以及 Anthropic Messages API。
| API | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| InvokeModel | ||
| 交谈/ ConverseStream | ||
| 聊天完成 () OpenAI-compatible | ||
| 响应 API (OpenAI-compatible) | ||
| 消息 API (Anthropic-native) |
注意
消息 API 在两个端点上都可用,但这两个界面不支持相同的功能。特别是,不支持结构化输出(output_config.format参数),包含的bedrock-mantle请求会output_config.format被拒绝,错误为 400。要在 Anthropic Claude 模型中使用结构化输出,请调用 Converse 或 InvokeModel API。bedrock-runtime
注意
响应API也可在两个端点上使用,但不支持相同的功能。在 bedrock-runtime 上:
请求始终是同步的。
background=true因 400 错误而被拒绝。该store参数不受影响,其默认值保持不变true,因此存储的多回合对话可以正常运行。Server-side 工具使用和预先配置的工具不可用,包括网络搜索。 Client-side 工具的使用适用于两个端点。
仅支持默认项目。请参阅项目 (OpenAI-compatible)。
存储的响应属于提供 AWS 区域 该响应的人。检索、取消或删除它以及继续与
previous_response_id之对话均由该地区处理。
| 能力 | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Cross-region 推断(地理和全球概况) | ||
| 有状态的对话管理 | ||
| 异步(长时间运行)推理 | ||
| Client-side 工具的使用 | ||
| Server-side 工具的使用 | ||
| Pre-configured 即用型工具 | ||
| Projects | 仅限默认项目 | |
| 工作空间 |
身份验证本身不授予访问权限。无论您使用 SigV4 还是 Bedrock API 密钥,关联的 IAM 委托人都必须具有执行所需操作的权限。有关完整的政策要求和示例,请参阅运行模型推理的先决条件。
| Item | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| AWS SigV4 身份验证 | ||
| Bedrock API 密钥(也适用于 OpenAI SDK) | ||
| 用于推理的 IAM 授权 | bedrock:InvokeModel在推理目标上,对于响应 API,在默认项目上;bedrock:InvokeModelWithResponseStream用于直播 |
bedrock-mantle:CreateInference |
| 使用情况归因 | IAM 委托人、每个请求的元数据标记、应用程序推理配置文件 | 项目、工作空间 |
注意
开启bedrock-runtime,只有 I AM 委托人使用响应 API 属性。 Per-request 元数据标记和应用程序推理配置文件在其上不可用——将应用程序推理配置文件命名为其推理目标的请求会被拒绝,错误为 400。这不会影响跨区域推理:系统定义的地理和全球推理配置文件可以正常运行。
注意
是否支持提示缓存bedrock-mantle取决于具体型号—— 模型一览 有关详细信息,请参阅下面的每个型号卡。
吞吐量和配额方法
每个终端使用不同的方法来管理吞吐量。
-
bedrock-runtime— 在许多传统的多租户服务中,该架构是围绕每个账户的配额设计的,用于管理对共享资源的公平共享访问权限。这是使用的方法bedrock-runtime。每种型号都有固定的吞吐量配额(RPM 和 TPM),您可以申请提高。有关更多信息,请参阅 基岩运行时端点的配额。 -
bedrock-mantle— 该端点采用先进的调度和工作队列机制构建,可在支持更高的初始吞吐量限制的同时提供公平的分配。这种设计还bedrock-mantle允许托管广泛的模型,并提供模型目录中可用的全部功能。在大多数情况下,请求会立即得到处理。在某些情况下,在运行中的工作负载完成且吞吐量可用时,可能会对请求进行短暂排队。有关详细信息,请参阅 基岩地幔端点的配额 和 扩展和吞吐量最佳实践。
定价
Per-token 相同型号的定价在bedrock-runtime和上是相同的bedrock-mantle。根据所需的 API 和功能选择终端节点,而不是成本。有关当前定价,请参阅亚马逊 Bedrock 定价
何时选择每个端点
从你想要的bedrock-runtime时候开始:
调用 OpenAI-compatible 回复或聊天完成 API 或 Anthropic Messages API。
使用 Bedrock-native InvokeModel或 Converse API。
使用跨区域推理在不同地理位置或全球范围内路由请求。
bedrock-mantle在你想的时候使用:
使用服务器端工具或预先配置的工具(包括网络搜索)来构建代理工作流程。
运行异步或长时间运行的推理工作负载,包括使用响应请求。
background=true创建项目 (OpenAI-compatible)或工作空间 () Anthropic-compatible隔离工作负载并跟踪应用程序级别的成本和使用情况。
使用仅在上可用的模型
bedrock-mantle。请参阅终端可用性。
两个端点可以在同一个应用程序中一起使用——根据用例进行选择。
使用 VPC 接口终端节点降低数据输出成本
如果您从 VPC 内部调用 Amazon Bedrock,请考虑使用 VPC 接口终端节点 (AWS PrivateLink) 将流量保持在 AWS 网络内,并避免与 NAT 网关或互联网网关相关的数据出口费用。