Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Terminales compatibles con Amazon Bedrock
Un punto final es la URL que utiliza su aplicación para enviar solicitudes de inferencia a Amazon Bedrock. Amazon Bedrock proporciona dos puntos finales de inferencia. El punto final que elija determina qué API y funciones están disponibles.
Para la mayoría de las aplicaciones nuevas, utilice el bedrock-runtime punto final. Úselo bedrock-mantle cuando necesite específicamente funciones que actualmente solo están disponibles allí, como las herramientas preconfiguradas y del lado del servidor (incluida la búsqueda en la web), la inferencia en segundo plano, los proyectos o los espacios de trabajo. Espacios de trabajo () Anthropic-compatible Para ver qué punto final admite cada modelo, consulte. Disponibilidad de terminales En la siguiente tabla se comparan los dos puntos finales.
| Punto de conexión | API compatibles | Descripción |
|---|---|---|
bedrock-runtime.{region}.amazonaws.com (recomendado) |
InvokeModel/Converse//Finalizaciones de chat/API de respuestas /API de mensajes Inferencia mediante la API de mensajes antrópicos | Region-specific puntos de conexión para realizar solicitudes de inferencia para modelos alojados en Amazon Bedrock mediante las API. InvokeModel/Converse/Chat Completions/Responses/Messages Para obtener más información sobre Bedrock-native las operaciones, consulte las operaciones de la API de Amazon Bedrock Runtime. Las OpenAI-compatible API se invocan en las /openai/v1 rutas de este punto final y no a través de los AWS SDK. |
bedrock-mantle.{region}.api.aws |
API de respuestas/API de finalización de API de finalización de chat chats/API de mensajes Inferencia mediante la API de mensajes antrópicos | Region-specific puntos de enlace para realizar solicitudes de inferencia para modelos alojados en Amazon Bedrock mediante los OpenAI-compatible puntos de enlace y la API de mensajes antrópicos. |
nota
Ambos puntos de enlace utilizan el mismo motor de inferencia subyacente de Mantle y se benefician del diseño de acceso sin operador (ZOA) de Mantle. bedrock-mantle nombre identifica una superficie de punto final, no un motor de inferencia diferente.
Las aplicaciones existentes que se utilizan bedrock-mantle siguen siendo totalmente compatibles y no es necesario cambiarlas. Ambos puntos de enlace permiten incorporar una base de código del SDK de OpenAI existente a Amazon Bedrock cambiando únicamente la URL y la clave de API básicas, y ambos admiten las API de OpenAI-compatible respuestas y finalización de chat y la API de mensajes antrópicos.
| API | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| InvokeModel | ||
| Converse/ ConverseStream | ||
| Finalizaciones de chat () OpenAI-compatible | ||
| API de respuestas () OpenAI-compatible | ||
| API de mensajes (Anthropic-native) |
nota
La API de mensajes está disponible en ambos terminales, pero las dos superficies no admiten funciones idénticas. En particular, no se admiten las salidas estructuradas (el output_config.format parámetro)bedrock-mantle; las solicitudes que incluyen output_config.format se rechazan con un error 400. Para usar salidas estructuradas con modelos de Anthropic Claude, activa las Converse o InvokeModel las API. bedrock-runtime
nota
La API Responses también está disponible en ambos terminales sin ofrecer funciones idénticas. En bedrock-runtime:
Las solicitudes son siempre sincrónicas.
background=truese rechaza con un error 400. Elstoreparámetro no se ve afectado y mantiene su valor predeterminadotrue, por lo que las conversaciones almacenadas en varios turnos funcionan con normalidad.Server-side El uso de herramientas y las herramientas preconfiguradas no están disponibles, incluida la búsqueda en la web. Client-side el uso de la herramienta funciona en ambos puntos finales.
Solo se admite el proyecto predeterminado. Consulte Proyectos (OpenAI-compatible).
Una respuesta almacenada pertenece a la persona Región de AWS que la entregó. Esa región se encarga de recuperarlo, cancelarlo o eliminarlo y continuar la conversación con
previous_response_idél.
| Funcionalidad | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Cross-region inferencia (perfiles geográficos y globales) | ||
| Gestión de conversaciones con estado | ||
| Inferencia asincrónica (de larga duración) | ||
| Client-side uso de herramientas | ||
| Server-side uso de herramientas | ||
| Pre-configured herramientas listas para usar | ||
| Proyectos | Solo proyecto predeterminado | |
| Espacios de trabajo |
La autenticación no otorga el acceso por sí sola. Ya sea que utilices SigV4 o una clave de API de Bedrock, el director de IAM asociado debe tener permiso para realizar la acción requerida. Para ver todos los requisitos y ejemplos de políticas, consulte. Requisitos previos para ejecutar la inferencia de modelos
| Elemento | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Autenticación AWS SigV4 | ||
| Clave de API de Bedrock (también funciona con el SDK de OpenAI) | ||
| Autorización de IAM para la inferencia | bedrock:InvokeModelen el objetivo de la inferencia y, en el caso de la API de respuestas, en el proyecto predeterminado; para la transmisión bedrock:InvokeModelWithResponseStream |
bedrock-mantle:CreateInference |
| Atribución de uso | Principal de IAM, etiquetado de metadatos por solicitud, perfiles de inferencia de aplicaciones Perfiles de inferencia de aplicaciones | Proyectos (OpenAI-compatible)Proyectos, espacios de trabajo |
nota
Si está activadabedrock-runtime, la API Responses atribuye el uso únicamente por parte del director de IAM. Per-request El etiquetado de metadatos y los perfiles de inferencia de aplicaciones no están disponibles en ella: se rechaza una solicitud en la que se nombra un perfil de inferencia de una aplicación como objetivo de inferencia y se produce un error 400. Esto no afecta a la inferencia entre regiones: los perfiles de inferencia geográficos y globales definidos por el sistema funcionan con normalidad.
| Característica | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Barandas | ||
| Almacenamiento en caché rápido | ||
| Enrutamiento rápido inteligente |
nota
La compatibilidad con el almacenamiento rápido en caché bedrock-mantle depende del modelo específico; consulte cada modelo de tarjeta en la sección siguiente Modelos de un vistazo para obtener más información.
Enfoque de rendimiento y cuota
Cada punto final utiliza un enfoque diferente para administrar el rendimiento.
-
bedrock-runtime— En muchos servicios multiusuario tradicionales, la arquitectura está diseñada en torno a cuotas por cuenta para gestionar un acceso equitativo a los recursos compartidos. Este es el enfoque que se utiliza con.bedrock-runtimeCada modelo tiene cuotas de rendimiento fijas (RPM y TPM) para las que puede solicitar aumentos. Para obtener más información, consulte Cuotas para el punto final de ejecución básico. -
bedrock-mantle— Este punto final está diseñado con mecanismos avanzados de programación y espera de trabajos que permiten una distribución equitativa de la distribución y, al mismo tiempo, admiten límites de rendimiento iniciales más altos. Este diseño tambiénbedrock-mantlepermite alojar un amplio conjunto de modelos y ofrecer toda la gama de capacidades disponibles en el catálogo de modelos. En la mayoría de los casos, las solicitudes se atienden de inmediato. En algunos casos, una solicitud puede quedar en cola brevemente mientras se completan las cargas de trabajo en curso y la capacidad de procesamiento está disponible. Para más detalles, consulte Cuotas para el punto final entre el lecho rocoso y el manto y Mejores prácticas de escalado y rendimiento.
Precios
Per-token los precios del mismo modelo son idénticos en y. bedrock-runtime bedrock-mantle Elija un punto final en función de las API y las capacidades que necesita, no en función del costo. Para ver los precios actuales, consulte los precios de
¿Cuándo elegir cada punto final
Empieza bedrock-runtime cuando quieras:
Llama a las API de OpenAI-compatible respuestas o de finalización del chat, o a la API de mensajes antrópicos.
Usa las API Bedrock-native InvokeModel o las de Converse.
Utilice las funciones de Amazon Bedrock que solo están disponibles en este punto final, como las barreras de protección y el enrutamiento rápido inteligente.
Utilice la inferencia interregional para enrutar las solicitudes a través de una ubicación geográfica o global.
bedrock-mantleUtilízala cuando quieras:
Cree flujos de trabajo para agencias con el uso de herramientas del lado del servidor o herramientas preconfiguradas, incluida la búsqueda en la web. Búsqueda en la web
Ejecute cargas de trabajo de inferencia asincrónicas o de larga duración, incluidas las solicitudes de respuestas con.
background=trueCree Proyectos (OpenAI-compatible) o aísle cargas Espacios de trabajo () Anthropic-compatible de trabajo y realice un seguimiento de los costos y el uso a nivel de la aplicación.
Utilice un modelo que solo esté disponible en
bedrock-mantle. Consulte Disponibilidad de terminales.
Ambos terminales se pueden usar juntos desde la misma aplicación; elija para cada caso de uso.
Reduzca los costos de salida de datos con los puntos finales de la interfaz de VPC
Si llama a Amazon Bedrock desde una VPC, considere la posibilidad de utilizar puntos de enlace de interfaz de VPC (AWS PrivateLink) para mantener el tráfico dentro de la red de AWS y evitar los cargos por salida de datos asociados a las pasarelas NAT o pasarelas de Internet.