View a markdown version of this page

Terminales compatibles con Amazon Bedrock - Amazon Bedrock

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Terminales compatibles con Amazon Bedrock

Un punto final es la URL que utiliza su aplicación para enviar solicitudes de inferencia a Amazon Bedrock. Amazon Bedrock proporciona dos puntos finales de inferencia. El punto final que elija determina qué API y funciones están disponibles.

Para la mayoría de las aplicaciones nuevas, utilice el bedrock-runtime punto final. Úselo bedrock-mantle cuando necesite específicamente funciones que actualmente solo están disponibles allí, como las herramientas preconfiguradas y del lado del servidor (incluida la búsqueda en la web), la inferencia en segundo plano, los proyectos o los espacios de trabajo. Espacios de trabajo () Anthropic-compatible Para ver qué punto final admite cada modelo, consulte. Disponibilidad de terminales En la siguiente tabla se comparan los dos puntos finales.

Punto de conexión API compatibles Descripción
bedrock-runtime.{region}.amazonaws.com (recomendado) InvokeModel/Converse//Finalizaciones de chat/API de respuestas /API de mensajes Inferencia mediante la API de mensajes antrópicos Region-specific puntos de conexión para realizar solicitudes de inferencia para modelos alojados en Amazon Bedrock mediante las API. InvokeModel/Converse/Chat Completions/Responses/Messages Para obtener más información sobre Bedrock-native las operaciones, consulte las operaciones de la API de Amazon Bedrock Runtime. Las OpenAI-compatible API se invocan en las /openai/v1 rutas de este punto final y no a través de los AWS SDK.
bedrock-mantle.{region}.api.aws API de respuestas/API de finalización de API de finalización de chat chats/API de mensajes Inferencia mediante la API de mensajes antrópicos Region-specific puntos de enlace para realizar solicitudes de inferencia para modelos alojados en Amazon Bedrock mediante los OpenAI-compatible puntos de enlace y la API de mensajes antrópicos.
nota

Ambos puntos de enlace utilizan el mismo motor de inferencia subyacente de Mantle y se benefician del diseño de acceso sin operador (ZOA) de Mantle. El bedrock-mantle nombre identifica una superficie de punto final, no un motor de inferencia diferente.

Las aplicaciones existentes que se utilizan bedrock-mantle siguen siendo totalmente compatibles y no es necesario cambiarlas. Ambos puntos de enlace permiten incorporar una base de código del SDK de OpenAI existente a Amazon Bedrock cambiando únicamente la URL y la clave de API básicas, y ambos admiten las API de OpenAI-compatible respuestas y finalización de chat y la API de mensajes antrópicos.

nota

La API de mensajes está disponible en ambos terminales, pero las dos superficies no admiten funciones idénticas. En particular, no se admiten las salidas estructuradas (el output_config.format parámetro)bedrock-mantle; las solicitudes que incluyen output_config.format se rechazan con un error 400. Para usar salidas estructuradas con modelos de Anthropic Claude, activa las Converse o InvokeModel las API. bedrock-runtime

nota

La API Responses también está disponible en ambos terminales sin ofrecer funciones idénticas. En bedrock-runtime:

  • Las solicitudes son siempre sincrónicas. background=truese rechaza con un error 400. El store parámetro no se ve afectado y mantiene su valor predeterminadotrue, por lo que las conversaciones almacenadas en varios turnos funcionan con normalidad.

  • Server-side El uso de herramientas y las herramientas preconfiguradas no están disponibles, incluida la búsqueda en la web. Client-side el uso de la herramienta funciona en ambos puntos finales.

  • Solo se admite el proyecto predeterminado. Consulte Proyectos (OpenAI-compatible).

  • Una respuesta almacenada pertenece a la persona Región de AWS que la entregó. Esa región se encarga de recuperarlo, cancelarlo o eliminarlo y continuar la conversación con previous_response_id él.

La autenticación no otorga el acceso por sí sola. Ya sea que utilices SigV4 o una clave de API de Bedrock, el director de IAM asociado debe tener permiso para realizar la acción requerida. Para ver todos los requisitos y ejemplos de políticas, consulte. Requisitos previos para ejecutar la inferencia de modelos

Operational (En funcionamiento)
Elemento bedrock-runtime bedrock-mantle
Autenticación AWS SigV4 supported supported
Clave de API de Bedrock (también funciona con el SDK de OpenAI) supported supported
Autorización de IAM para la inferencia bedrock:InvokeModelen el objetivo de la inferencia y, en el caso de la API de respuestas, en el proyecto predeterminado; para la transmisión bedrock:InvokeModelWithResponseStream bedrock-mantle:CreateInference
Atribución de uso Principal de IAM, etiquetado de metadatos por solicitud, perfiles de inferencia de aplicaciones Perfiles de inferencia de aplicaciones Proyectos (OpenAI-compatible)Proyectos, espacios de trabajo
nota

Si está activadabedrock-runtime, la API Responses atribuye el uso únicamente por parte del director de IAM. Per-request El etiquetado de metadatos y los perfiles de inferencia de aplicaciones no están disponibles en ella: se rechaza una solicitud en la que se nombra un perfil de inferencia de una aplicación como objetivo de inferencia y se produce un error 400. Esto no afecta a la inferencia entre regiones: los perfiles de inferencia geográficos y globales definidos por el sistema funcionan con normalidad.

Disponibilidad de funciones fundamentales
Característica bedrock-runtime bedrock-mantle
Barandas supported not-supported
Almacenamiento en caché rápido supported supported
Enrutamiento rápido inteligente supported not-supported
nota

La compatibilidad con el almacenamiento rápido en caché bedrock-mantle depende del modelo específico; consulte cada modelo de tarjeta en la sección siguiente Modelos de un vistazo para obtener más información.

Enfoque de rendimiento y cuota

Cada punto final utiliza un enfoque diferente para administrar el rendimiento.

  • bedrock-runtime— En muchos servicios multiusuario tradicionales, la arquitectura está diseñada en torno a cuotas por cuenta para gestionar un acceso equitativo a los recursos compartidos. Este es el enfoque que se utiliza con. bedrock-runtime Cada modelo tiene cuotas de rendimiento fijas (RPM y TPM) para las que puede solicitar aumentos. Para obtener más información, consulte Cuotas para el punto final de ejecución básico.

  • bedrock-mantle— Este punto final está diseñado con mecanismos avanzados de programación y espera de trabajos que permiten una distribución equitativa de la distribución y, al mismo tiempo, admiten límites de rendimiento iniciales más altos. Este diseño también bedrock-mantle permite alojar un amplio conjunto de modelos y ofrecer toda la gama de capacidades disponibles en el catálogo de modelos. En la mayoría de los casos, las solicitudes se atienden de inmediato. En algunos casos, una solicitud puede quedar en cola brevemente mientras se completan las cargas de trabajo en curso y la capacidad de procesamiento está disponible. Para más detalles, consulte Cuotas para el punto final entre el lecho rocoso y el manto y Mejores prácticas de escalado y rendimiento.

Precios

Per-token los precios del mismo modelo son idénticos en y. bedrock-runtime bedrock-mantle Elija un punto final en función de las API y las capacidades que necesita, no en función del costo. Para ver los precios actuales, consulte los precios de Amazon Bedrock.

¿Cuándo elegir cada punto final

Empieza bedrock-runtime cuando quieras:

bedrock-mantleUtilízala cuando quieras:

Ambos terminales se pueden usar juntos desde la misma aplicación; elija para cada caso de uso.

Reduzca los costos de salida de datos con los puntos finales de la interfaz de VPC

Si llama a Amazon Bedrock desde una VPC, considere la posibilidad de utilizar puntos de enlace de interfaz de VPC (AWS PrivateLink) para mantener el tráfico dentro de la red de AWS y evitar los cargos por salida de datos asociados a las pasarelas NAT o pasarelas de Internet.