View a markdown version of this page

Almacenamiento en caché de peticiones para una inferencia de modelos más rápida - Amazon Bedrock

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Almacenamiento en caché de peticiones para una inferencia de modelos más rápida

El almacenamiento en caché de peticiones es una característica opcional que puede utilizar con los modelos compatibles en Amazon Bedrock para reducir la latencia de la respuesta de inferencia y los costos de los tokens de entrada. Amazon Bedrock admite dos tipos de almacenamiento en caché de mensajes: el almacenamiento en caché de mensajes implícito y el almacenamiento en caché de mensajes explícito. La compatibilidad con cada tipo varía según el modelo y la API.

El almacenamiento en caché de peticiones puede ser útil cuando tiene cargas de trabajo con contextos largos y repetitivos que se reutilizan con frecuencia para múltiples consultas. Por ejemplo, si tiene un chatbot en el que los usuarios pueden cargar documentos y hacer preguntas sobre ellos, el modelo puede tardar mucho tiempo en procesar el documento cada vez que el usuario proporciona información. Con el almacenamiento en caché de peticiones, puede almacenar en caché el documento para que las futuras consultas que contengan el documento no tengan que volver a procesarlo.

Tipos de almacenamiento rápido en caché

Los dos tipos difieren en la forma en que se selecciona el contenido de las solicitudes reutilizable:

Tipo Funcionamiento Configuración de la solicitud
Almacenamiento en caché de mensajes implícito Amazon Bedrock y el modelo intentan reutilizar automáticamente los prefijos de aviso que cumplan los requisitos. No se requieren controles de caché ni puntos de interrupción en su solicitud.
Almacenamiento en caché de mensajes explícito Los prefijos de aviso reutilizables se identifican añadiendo puntos de interrupción o controles de caché específicos del modelo. La solicitud debe incluir los controles de caché compatibles con el modelo y la API.

Almacenamiento en caché de mensajes implícito

El almacenamiento en caché de mensajes implícito intenta reutilizar automáticamente los prefijos de mensajes que cumplan los requisitos sin requerir controles de caché en la solicitud. Mantén el contenido estático al principio de la solicitud y el contenido dinámico al final para aumentar la probabilidad de que el prefijo coincida exactamente.

El almacenamiento en caché de mensajes implícitos es la mejor opción. Repetir un mensaje idéntico no garantiza una visita a la caché, y las tasas de aciertos de la caché pueden variar.

Almacenamiento en caché de mensajes explícitos

El almacenamiento en caché de mensajes explícito permite identificar prefijos de mensajes reutilizables mediante controles de caché o puntos de control de caché específicos del modelo. Los puntos de control de la caché son marcadores que definen la subsección contigua de la solicitud que desea almacenar en caché. Los prefijos de las solicitudes deben permanecer estáticos entre las solicitudes. Los cambios en un prefijo de aviso en solicitudes posteriores provocan errores en la memoria caché.

Los puntos de control de la caché tienen un número mínimo y máximo de fichas, según el modelo. Solo puede crear un punto de control de caché si el prefijo de petición total cumple con el número mínimo de tokens. Por ejemplo, Claude Opus 5 requiere al menos 512 tokens por punto de control de caché, Claude Sonnet 5 requiere al menos 1024 tokens por punto de control de caché y Claude Haiku 4.5 requiere al menos 4.096 tokens por punto de control de caché. El mínimo se aplica de forma acumulativa a todo el prefijo de aviso antes de cada punto de control, incluido, cuando proceda, el contenido de los campos y. tools system messages No se requiere un número mínimo de fichas entre los puntos de control de la caché. En el caso de un modelo con un mínimo de 1024 fichas, puede definir puntos de control adicionales con una diferencia de menos de 1024 fichas, siempre que el prefijo total que aparece antes de cada punto de control contenga al menos 1024 fichas. Si añades un punto de control de caché antes de que el prefijo total de la línea de comandos alcance el número mínimo de fichas, la inferencia seguirá siendo correcta, pero el prefijo no se almacenará en caché.

La caché tiene un tiempo de vida (TTL), que se restablece con cada visita a la caché exitosa. Durante este período, se conserva el contexto de la memoria caché. Si no se realiza ningún acceso a la caché en la ventana TTL, la caché caduca. Muchos modelos admiten un TTL de 5 minutos. Consulta la tarjeta de modelo de tu modelo para ver las condiciones exactas del TTL.

El almacenamiento en caché explícito de mensajes permite controlar qué contenido de mensajes se puede almacenar en caché. No garantiza que una solicitud que cumpla los requisitos provoque un acceso a la memoria caché.

Facturación de los tokens almacenados en caché

Tanto para el almacenamiento en caché de mensajes implícitos como para el almacenamiento en caché de mensajes explícitos, los tokens leídos correctamente de la caché se registran como tokens almacenados en caché y se facturan según la tasa de lectura de caché del modelo. Los tokens que no se leen desde la caché se facturan según la tarifa estándar de los tokens de entrada. Según el modelo, los tokens escritos en la caché se pueden facturar a una tasa superior a la tarifa estándar de los tokens de entrada. Para obtener más información, consulte la página de Precios de Amazon Bedrock.

importante

La compatibilidad con el almacenamiento rápido en caché no garantiza que ninguna solicitud acceda a la caché. Compruebe los campos de uso de la caché en la respuesta del modelo para determinar si los tokens se leyeron o se escribieron en la caché.

Puede utilizar el almacenamiento rápido en caché cuando ejecute la inferencia en Amazon Bedrock con modelos compatibles. La disponibilidad de cada tipo de almacenamiento en caché de solicitudes varía según el modelo y la API. El almacenamiento rápido en caché está disponible a través de las siguientes funciones de Amazon Bedrock:

Converse y las API ConverseStream

Puedes mantener una conversación con un modelo compatible. Para el almacenamiento en caché de mensajes explícitos, especifique los puntos de control de caché en las solicitudes.

InvokeModel InvokeModelWithResponseStreamy API

Puede enviar solicitudes con un solo mensaje a los modelos compatibles. Para el almacenamiento en caché explícito de mensajes, habilite el almacenamiento en caché de mensajes y especifique los puntos de control de la caché.

Almacenamiento rápido en caché con inferencia Cross-region

El almacenamiento rápido en caché se puede utilizar junto con la inferencia entre regiones. Cross-region La inferencia selecciona automáticamente la AWS región óptima dentro de su geografía para atender su solicitud de inferencia, maximizando así los recursos disponibles y la disponibilidad del modelo. En momentos de alta demanda, estas optimizaciones pueden provocar un aumento de las escrituras en caché.

Administración de peticiones de Amazon Bedrock

Al crear o modificar una petición, puede optar por habilitar el almacenamiento en caché de peticiones. Según el modelo, puede almacenar en caché las peticiones del sistema, las instrucciones del sistema y los mensajes (del usuario y del asistente). También puede elegir deshabilitar el almacenamiento en caché de peticiones.

nota

El almacenamiento rápido en caché solo se admite para los puntos finales de inferencia bajo demanda. No es compatible con la API de inferencia por lotes.

En el caso de los modelos que admiten el almacenamiento explícito de mensajes en caché, las API proporcionan un control detallado sobre el almacenamiento en caché de mensajes. Puedes establecer puntos de control de caché individuales dentro de tus instrucciones y añadir puntos de control hasta el máximo permitido para el modelo. Para obtener más información, consulte Modelos compatibles, regiones y límites de almacenamiento en caché explícitos.

Modelos compatibles, regiones y límites de almacenamiento en caché explícitos

La compatibilidad inmediata con el almacenamiento en caché varía según el modelo y la API. Las tarjetas modelo identifican si un modelo admite el almacenamiento en caché de mensajes implícito, el almacenamiento en caché de mensajes explícito o ambos. El almacenamiento rápido en caché está disponible en todas AWS las regiones en las que están disponibles los modelos compatibles. Para comprobar la disponibilidad de los modelos por región, consulteDisponibilidad regional por modelos.

En la siguiente tabla se enumeran los modelos que admiten el almacenamiento en caché de mensajes explícitos, junto con sus valores mínimos de símbolos, el número máximo de puntos de control de la caché y los campos que permiten los puntos de control de la caché.

Para ver qué tipos de almacenamiento rápido en caché admite un modelo, consulte la sección Descripción general de los modelos y, a continuación, elija el modelo que le interese.

Nombre de modelo ID del modelo Tipo de versión Número mínimo de tokens por punto de control de caché Número máximo de puntos de control de caché por solicitud TTL compatible Campos que aceptan puntos de control de caché de peticiones

Claude Fable 5.1

antropic.claude-fable-5-1

Disponibilidad general

512

4

5 minutos, 1 hora

`system`, `messages` y `tools`

Claude Mythos 5.1

antropic.claude-mythos-5-1

Restringido

512

4

5 minutos, 1 hora

`system`, `messages` y `tools`

Claude Fable 5

antropic.claude-fable-5

Disponibilidad general

512

4

5 minutos, 1 hora

`system`, `messages` y `tools`

Claude Mythos 5

antropic.claude-mythos-5

Restringido

512

4

5 minutos, 1 hora

`system`, `messages` y `tools`

Claude Mythos Preview

anthropic.claude-mythos-preview

Restringido

4.096

4

5 minutos, 1 hora

`system`, `messages` y `tools`

Claude Opus 5

antropic.claude-opus-5

Disponibilidad general

512

4

5 minutos, 1 hora

`system`, `messages` y `tools`

Claude Opus 4.8

antropic.claude-opus-4-8

Disponibilidad general

1 024

4

5 minutos, 1 hora

`system`, `messages` y `tools`

Claude Opus 4.7

antrópico. claude-opus-4-7

Disponibilidad general

4.096

4

5 minutos, 1 hora

`system`, `messages` y `tools`

Claude Opus 4.6

antropic.claude-opus-4-6-v1

Disponibilidad general

4.096

4

5 minutos, 1 hora

`system`, `messages` y `tools`

Claude Opus 4.5

antropic.claude-opus-4-5-20251101-v 1:0

Disponibilidad general

4.096

4

5 minutos, 1 hora

`system`, `messages` y `tools`

Claude Sonnet 5

antrópico. Claude-sonnet-5

Disponibilidad general

1 024

4

5 minutos, 1 hora

`system`, `messages` y `tools`

Claude Sonnet 4.6

antropic.claude-sonnet-4-6

Disponibilidad general

1 024

4

5 minutos, 1 hora

`system`, `messages` y `tools`

Claude Sonnet 4.5

anthropic.claude-sonnet-4-5-20250929-v1:0

Disponibilidad general

1 024

4

5 minutos, 1 hora

`system`, `messages` y `tools`

Claude 3.7 Sonnet

antrópico. claude-3-7-sonnet-20250219-v 1:0

Disponibilidad general

1 024

4

5 minutos

`system`, `messages` y `tools`

Claude 3.5 Sonnet v2

anthropic.claude-3-5-sonnet-20241022-v2:0

Vista previa

1 024

4

5 minutos

`system`, `messages` y `tools`

Claude Haiku 4.5

anthropic.claude-haiku-4-5-20251001-v1:0

Disponibilidad general

4.096

4

5 minutos, 1 hora

`system`, `messages` y `tools`

GPT-5.6 Sol

openai.gpt-5.6-sol

Disponibilidad general

1 024

4

30 minutos

prompt_cache_breakpointactiva y bloquea (API de input_text respuestasinput_image) input_file

GPT-5.6 Terra

openai.gpt-5.6-terra

Disponibilidad general

1 024

4

30 minutos

prompt_cache_breakpointactiva y bloquea (API de input_text respuestasinput_image) input_file

GPT-5.6 Luna

openai.gpt-5.6-luna

Disponibilidad general

1 024

4

30 minutos

prompt_cache_breakpointactiva y bloquea (API de input_text respuestasinput_image) input_file

Para usar la opción TTL de 1 hora con los modelos compatibles (Claude Fable 5,Claude Opus 5,Claude Opus 4.8,,Claude Opus 4.7, Claude Opus 4.6Claude Opus 4.5, yClaude Haiku 4.5) Claude Sonnet 5 Claude Sonnet 4.6Claude Sonnet 4.5, especifica el ttl campo en el punto de control de la caché. En la API de Converse, "ttl": "1h" añádelo a tu objeto. cachePoint En la InvokeModel API para modelos de Claude, "ttl": "1h" añádelo a tu cache_control objeto. Si no se proporciona ningún ttl valor, se aplica el comportamiento de almacenamiento en caché predeterminado de 5 minutos. El TTL de 1 hora es útil para sesiones de larga duración o escenarios de procesamiento por lotes en los que se desea mantener la caché durante períodos prolongados.

Amazon Novaofrece almacenamiento en caché implícito para todas las solicitudes de texto, incluidos los mensajes. User System Este mecanismo puede proporcionar beneficios de latencia cuando las solicitudes comienzan con partes repetitivas, sin una configuración explícita. Amazon NovaLos modelos que se muestran compatibles con el almacenamiento en caché de mensajes explícitos en sus tarjetas de modelo también permiten especificar puntos de control de la caché para tener un mayor control sobre la aptitud de la caché.

Almacenamiento rápido en caché para los modelos de Anthropic

Los modelos antrópicos que admiten el almacenamiento rápido en caché en Amazon Bedrock admiten tanto el almacenamiento en caché implícito como el almacenamiento en caché explícito. El almacenamiento en caché implícito intenta reutilizar automáticamente los prefijos de aviso que cumplan los requisitos sin requerir controles de caché en la solicitud.

Para el almacenamiento en caché de prontas explícitas, Amazon Bedrock ofrece un enfoque simplificado para la administración de la caché que reduce la complejidad de colocar manualmente los puntos de control de la caché. En lugar de tener que especificar las ubicaciones exactas de los puntos de control de caché, puede utilizar la administración automática de caché con un único punto de interrupción al final del contenido estático.

Al habilitar la administración simplificada de la memoria caché, el sistema comprueba automáticamente si se ha accedido a la memoria caché en los límites de los bloques de contenido anteriores y analiza hasta aproximadamente 20 bloques de contenido desde el punto de interrupción especificado. Esto permite que el modelo encuentre el prefijo coincidente más largo de la caché sin necesidad de que usted prediga las ubicaciones óptimas de los puntos de control. Para usarlo, coloque un único punto de control de caché al final del contenido estático, antes de cualquier contenido dinámico o variable. El sistema encontrará automáticamente la mejor coincidencia en la caché.

Para un control más detallado, puede seguir utilizando varios puntos de control de caché (hasta cuatro para los modelos Claude) para especificar los límites exactos de la caché. Debe utilizar varios puntos de control de caché si almacena en caché secciones que cambian con diferentes frecuencias o si desea tener más control sobre qué es exactamente lo que se almacena en caché.

importante

La comprobación automática de prefijos solo examina aproximadamente 20 bloques de contenido de su punto de control de caché. Si su contenido estático se extiende más allá de este intervalo, considere la posibilidad de usar varios puntos de control de caché o reestructurar la petición para colocar dentro de este intervalo el contenido que se reutiliza con más frecuencia.

Mejores prácticas para usar la administración de la caché en los modelos antrópicos

Si tiene mensajes que se utilizan con una cadencia normal (es decir, mensajes del sistema que se utilizan con más frecuencia que cada 5 minutos), siga utilizando la caché de 5 minutos, ya que se seguirá actualizando sin coste adicional.

La memoria caché de 1 hora se utiliza mejor en los siguientes casos:

  • Cuando tiene mensajes que probablemente se usen con una frecuencia inferior a 5 minutos, pero con más frecuencia que cada hora. Por ejemplo, cuando un agente secundario de una agencia tarda más de 5 minutos o cuando se almacena una conversación de chat larga con un usuario y, por lo general, se espera que el usuario no responda en los próximos 5 minutos.

  • Cuando la latencia es importante y es posible que tus instrucciones de seguimiento se envíen más de 5 minutos.

  • Cuando quieras mejorar tu velocidad límite, utiliza este límite, ya que las visitas a la caché no se deducen de tu límite de velocidad.

Puedes usar los controles de caché de 1 hora y 5 minutos en la misma solicitud, pero con una restricción importante: las entradas de caché con un TTL más largo deben aparecer antes que los TTL más cortos (es decir, debe aparecer una entrada de caché de 1 hora antes de cualquier entrada de caché de 5 minutos).

Almacenamiento rápido en caché para los modelos de OpenAI

Los modelos OpenAI de Amazon Bedrock admiten el almacenamiento en caché inmediato implícito a través de la API de respuestas. GPT-5.6 Los modelos también admiten el almacenamiento en caché explícito de mensajes. La API de respuestas está disponible tanto en los terminales como en bedrock-runtime los bedrock-mantle terminales.

GPT-5.6 modelos

GPT-5.6 Sol (openai.gpt-5.6-sol), Terra (openai.gpt-5.6-terra) y Luna (openai.gpt-5.6-luna) admiten tanto el almacenamiento en caché de mensajes implícito como el almacenamiento en caché de mensajes explícito. Los puntos de interrupción explícitos en la caché de las solicitudes te permiten controlar con precisión qué partes de la solicitud se pueden almacenar en caché. Esto es especialmente útil para los flujos de trabajo de las agencias, en los que las instrucciones del sistema, las definiciones de herramientas y los archivos de referencia se repiten en muchas llamadas y solo cambian las entradas más recientes.

Características clave:

  • Puntos de interrupción de caché explícitos: marca el final exacto de un prefijo de aviso reutilizable agregándolo "prompt_cache_breakpoint": {"mode": "explicit"} a un bloque de contenido compatible.

  • Modos de caché: configurados prompt_cache_options.mode para controlar el comportamiento de los puntos de interrupción:

    • implicit(predeterminado): coloca un punto de interrupción automático en el mensaje más reciente y también utiliza cualquier punto de interrupción explícito que proporciones.

    • explicit— Desactiva el punto de interrupción automático. Solo se utilizan puntos de interrupción explícitos para las lecturas y escrituras de la memoria caché. Si no existen puntos de interrupción explícitos, la solicitud no utiliza el almacenamiento en caché inmediato ni incurre en cargos por escritura en caché.

  • Longitud mínima del prefijo: 1024 fichas por punto de interrupción.

  • TTL mínimo de 30 minutos: los prefijos almacenados en caché permanecen disponibles para su reutilización durante al menos 30 minutos, tiempo suficiente para cubrir la ráfaga de llamadas que genera la ejecución de un solo agente. El TTL se establece mediante prompt_cache_options.ttl y de forma predeterminada es. 30m

  • Facturación de escritura en caché: los tokens escritos en la caché se facturan a 1,25 veces la tarifa de los tokens de entrada sin almacenar en caché. Las lecturas de la caché se facturan con un descuento del 90% en comparación con los tokens de entrada sin almacenar en caché.

  • Los tokens almacenados en caché no se tienen en cuenta para los límites de velocidad: los tokens de entrada en caché que se leen rápidamente no se deducen de la cuota de tokens de entrada por minuto.

Interpretación de la respuesta

El objeto de uso de la respuesta incluye dos campos específicos de la caché:

  • cached_tokens— Número de tokens de entrada leídos desde la caché (facturados con la tasa de descuento por lectura de caché).

  • cache_write_tokens— Número de tokens de entrada escritos en la caché (facturados a 1,25 veces la tarifa de los tokens de entrada sin almacenar en caché).

Cuando cached_tokens es superior a cero y cache_write_tokens es cero, su solicitud coincide totalmente con una entrada de la caché existente; no se han producido nuevas escrituras y ha obtenido el máximo ahorro de costes.

Mejores prácticas para usar la administración de caché en los modelos GPT 5.6

  • Coloque los puntos de interrupción después del contenido estable: las instrucciones del sistema, las definiciones de las herramientas y los documentos de referencia que no cambien entre las llamadas deben aparecer antes del punto de interrupción. El contenido después del punto de interrupción puede cambiar libremente sin invalidar el prefijo almacenado en caché.

  • explicitModo de uso para bucles de agencia: cuando quieres tener un control total sobre lo que se almacena en caché y quieres evitar que los puntos de interrupción automáticos consuman espacios de escritura.

  • Supervise cache_write_tokens: compare el volumen de escritura en caché con las lecturas de caché posteriores para comprender el impacto neto en los costos y ajustar la ubicación de los puntos de interrupción en consecuencia.

GPT-5.5 y modelos anteriores

Para los modelos de OpenAI anteriores a GPT-5.6 (como openai.gpt-5.5 yopenai.gpt-5.4), el almacenamiento en caché de mensajes implícito es automático. No es necesario añadir ningún parámetro especial. El sistema intenta almacenar automáticamente en caché los prefijos de aviso válidos de 1024 fichas o más. Las escrituras en caché no tienen ningún coste adicional en estos modelos.

Características clave:

  • Almacenamiento en caché inmediato implícito: no es necesario cambiar el código. El sistema intenta almacenar en caché los prefijos automáticamente basándose en la coincidencia exacta de los prefijos.

  • Longitud mínima del prefijo: 1024 fichas.

  • Sin tarifa de escritura en caché: solo se facturan las lecturas en caché con una tarifa con descuento.

  • Los tokens almacenados en caché no se tienen en cuenta para los límites de velocidad: los tokens de entrada en caché que se leen rápidamente no se deducen de la cuota de tokens de entrada por minuto.

Prácticas recomendadas para usar la administración de caché en modelos anteriores y en modelos anteriores GPT-5.5

  • Coloque el contenido estático (solicitudes del sistema, definiciones de herramientas, documentos de referencia) al principio de la solicitud.

  • Coloque el contenido variable (entrada específica del usuario) al final.

  • Mantenga un flujo constante de solicitudes con prefijos idénticos para minimizar el desalojo de la memoria caché.

Introducción

En las siguientes secciones se muestra una breve descripción de cómo utilizar la característica de almacenamiento en caché de peticiones para cada método de interacción con los modelos a través de Amazon Bedrock.

La API Converse ofrece opciones avanzadas y flexibles para implementar el almacenamiento en caché de peticiones en conversaciones de varios turnos. Para obtener más información sobre los requisitos de petición de cada modelo, consulte la sección anterior Modelos compatibles, regiones y límites de almacenamiento en caché explícitos.

Ejemplo de solicitud

Los siguientes ejemplos muestran un punto de control de caché establecido en los campos messages, system o tools de una solicitud a la API Converse. Puede colocar puntos de control en cualquiera de estas ubicaciones para una solicitud determinada. Por ejemplo, si envía una solicitud al modelo Claude 3.5 Sonnet v2, puede colocar dos puntos de control de caché en messages, un punto de control de caché en system y otro en tools. Para obtener información más detallada y ejemplos de cómo estructurar y enviar solicitudes de la API Converse, consulte Inferencia mediante la API de Converse.

importante

Los puntos de control de la caché se procesan en este orden: tools → →. system messages El tamaño mínimo de la caché se evalúa en función de los tokens acumulados en las tres secciones combinadas, no en cada sección de forma individual. Como las secciones están encadenadas, al cambiar el contenido de una sección anterior se invalida la caché para las secciones posteriores (por ejemplo, al modificar se tools invalidan las cachés system ymessages). Para obtener los mejores índices de aciertos de la caché, coloque el contenido estable (tools,system) antes del contenido variable (messages) y coloque los puntos de control de la caché después del contenido estable.

Especifique el valor ttl deseado como se indica a continuación. Si el valor ttl no está especificado, se aplica el comportamiento predeterminado de 5 minutos de almacenamiento en caché.

"cachePoint" : { "type": "default", "ttl" : "5m | 1h" }
messages checkpoints

En este ejemplo, el primer campo image proporciona una imagen al modelo y el segundo campo text pide al modelo que analice la imagen. Siempre que el número de tokens que preceden al cachePoint en el objeto content satisfaga el número mínimo de tokens del modelo, se crea un punto de control de caché.

... "messages": [ { "role": "user", "content": [ { "image": { "bytes": "asfb14tscve..." } }, { "text": "What's in this image?" }, { "cachePoint": { "type": "default" } } ] } ] ...
system checkpoints

En este ejemplo, debe proporcionar la petición del sistema en el campo text. Además, puede añadir un campo cachePoint para almacenar en caché la petición del sistema.

... "system": [ { "text": "You are an app that creates play lists for a radio station that plays rock and pop music. Only return song names and the artist. " }, { "cachePoint": { "type": "default" } } ], ...
tools checkpoints

En este ejemplo, debe proporcionar la definición de la herramienta en el campo toolSpec. (Como alternativa, puede llamar a una herramienta que haya definido previamente. Para obtener más información, consulteUso de una herramienta para completar una respuesta modelo de Amazon Bedrock.) Después, puede añadir un campo cachePoint para almacenar en caché la herramienta.

... toolConfig={ "tools": [ { "toolSpec": { "name": "top_song", "description": "Get the most popular song played on a radio station.", "inputSchema": { "json": { "type": "object", "properties": { "sign": { "type": "string", "description": "The call sign for the radio station for which you want the most popular song. Example calls signs are WZPZ and WKRP." } }, "required": [ "sign" ] } } } }, { "cachePoint": { "type": "default" } } ] } ...

La respuesta modelo de la Converse API incluye tres campos nuevos que son específicos para el almacenamiento en caché de solicitudes. Los valores cacheReadInputTokens y cacheWriteInputTokens indican cuántos tokens se han leído de la caché y cuántos se han escrito en ella debido a una solicitud anterior. Los cacheDetails valores indican el ttl utilizado para la cantidad de tokens escritos en la caché. Estos son valores que Amazon Bedrock le cobra a una tarifa inferior al costo de la inferencia completa del modelo.

importante

Cuando se habilita el almacenamiento rápido en caché, el inputTokens campo representa solo los tokens de entrada que no están en caché (los tokens que no se leyeron ni escribieron en la caché). Para calcular el total de tokens de entrada enviados en una solicitud, utilice la siguiente fórmula:

total input tokens = inputTokens + cacheReadInputTokens + cacheWriteInputTokens

El almacenamiento rápido en caché está activado de forma predeterminada al llamar a la InvokeModel API. Puede establecer puntos de control de caché en cualquier punto del cuerpo de la solicitud, de forma similar al ejemplo anterior de la API Converse.

Anthropic Claude

El siguiente ejemplo muestra cómo estructurar el cuerpo de la InvokeModel solicitud para el modelo Anthropic Claude 3.5 Sonnet v2. Tenga en cuenta que el formato exacto y los campos del cuerpo de InvokeModel las solicitudes pueden variar según el modelo que elija. Para ver el formato y el contenido de los cuerpos de solicitud y respuesta para los diferentes modelos, consulte Parámetros de solicitud de inferencia y campos de respuesta para los modelos fundacionales.

Especifique el valor ttl deseado como se indica a continuación. Si el valor ttl no está especificado, se aplica el comportamiento predeterminado de 5 minutos de almacenamiento en caché.

"cache_control" : { "type": "ephemeral", "ttl" : "5m | 1h" }
body={ "anthropic_version": "bedrock-2023-05-31", "system":"Reply concisely", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe the best way to learn programming." }, { "type": "text", "text": "Add additional context here for the prompt that meets the minimum token requirement for your chosen model.", "cache_control": { "type": "ephemeral" } } ] } ], "max_tokens": 2048, "temperature": 0.5, "top_p": 0.8, "stop_sequences": [ "stop" ], "top_k": 250 }
Amazon Nova

El siguiente ejemplo muestra cómo estructurar el cuerpo de la InvokeModel solicitud del Amazon Nova modelo. Tenga en cuenta que el formato exacto y los campos del cuerpo de InvokeModel las solicitudes pueden variar según el modelo que elija. Para ver el formato y el contenido de los cuerpos de solicitud y respuesta para los diferentes modelos, consulte Parámetros de solicitud de inferencia y campos de respuesta para los modelos fundacionales.

{ "system": [{ "text": "Reply Concisely" }], "messages": [{ "role": "user", "content": [{ "text": "Describe the best way to learn programming" }, { "text": "Add additional context here for the prompt that meets the minimum token requirement for your chosen model.", "cachePoint": { "type": "default" } }] }], "inferenceConfig": { "maxTokens": 300, "topP": 0.1, "topK": 20, "temperature": 0.3 } }

Para obtener más información sobre el envío de una InvokeModel solicitud, consulteEnvía un solo mensaje con InvokeModel.

Para los modelos de OpenAI, se utiliza la API de respuestas, disponible tanto en los terminales como en bedrock-runtime los bedrock-mantle terminales, con parámetros de almacenamiento en caché rápidos específicos para la generación del modelo. En el caso de GPT-5.6 los modelos, se controla el almacenamiento en caché con puntos de interrupción explícitos. En versiones anteriores, el almacenamiento en caché es automático. GPT-5.5

GPT-5.6 ejemplo con puntos de interrupción de caché explícitos

El siguiente ejemplo muestra una solicitud de la API Responses para openai.gpt-5.6-sol usar puntos de interrupción de caché explícitos. La instrucción del sistema se almacena en caché y se reutiliza en las solicitudes posteriores.

{ "model": "openai.gpt-5.6-sol", "prompt_cache_key": "my-app:system-prompt-v1", "prompt_cache_options": { "mode": "explicit" }, "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions. Follow these guidelines: 1. Always cite the relevant documentation section. 2. If unsure, escalate to a human agent. 3. Be concise but thorough...", "prompt_cache_breakpoint": { "mode": "explicit" } } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }

GPT-5.5 ejemplo con almacenamiento en caché automático

En los modelos anteriores GPT-5.5 y en los modelos anteriores, el almacenamiento en caché de las notificaciones es automático. No se necesitan puntos de interrupción ni claves de caché; solo asegúrese de que el prefijo de aviso supere los 1024 tokens.

{ "model": "openai.gpt-5.5", "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions..." } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }

Respuesta

La respuesta incluye las métricas de uso de la caché en el objeto: usage

{ "id": "resp_abc123", "output": [...], "usage": { "input_tokens": 2048, "output_tokens": 256, "total_tokens": 2304, "input_tokens_details": { "cached_tokens": 1920, "cache_write_tokens": 0 } } }

En esta respuesta, se distribuyeron 1.920 tokens desde la caché y no se escribió ningún token nuevo, lo que indica que se ha utilizado toda la caché y se ha ahorrado al máximo los costes.

En un entorno de pruebas de chat de la consola de Amazon Bedrock, puede activar la opción de almacenamiento en caché de peticiones y Amazon Bedrock creará automáticamente puntos de control de caché por usted.

Siga las instrucciones de Generación de respuestas en la consola mediante áreas de juego para empezar a usar peticiones en un entorno de pruebas de Amazon Bedrock. En los modelos compatibles, el almacenamiento en caché de peticiones se activa automáticamente en el entorno de pruebas. Sin embargo, si no es así, haz lo siguiente para activar el almacenamiento rápido en caché:

  1. Abra el menú de configuraciones.

  2. Active la opción Almacenamiento en caché de peticiones.

  3. Ejecute sus peticiones.

Cuando las respuestas combinadas de entrada y modelo alcancen la cantidad mínima requerida de tokens para un punto de control (que varía según el modelo), Amazon Bedrock creará automáticamente el primer punto de control de caché para usted. A medida que continúe chateando, Amazon Bedrock puede crear puntos de control adicionales, hasta el número máximo de puntos de control permitido para el modelo. El mínimo se compara con el número acumulado de puntos antes de cada punto de control, no con el número de puntos añadidos desde el punto de control anterior. Puede ver los puntos de control de caché en cualquier momento seleccionando Ver los puntos de control de la caché junto a la opción Almacenamiento en caché de peticiones, como se muestra en la siguiente captura de pantalla.

Conmutador de interfaz de usuario para el almacenamiento en caché de peticiones en el entorno de pruebas de texto de Amazon Bedrock.

Puede ver cuántos tokens se leen y escriben en la caché debido a cada interacción con el modelo consultando la ventana emergente Métricas de almacenamiento en caché ( The metrics icon shown in model responses when prompt caching is enabled. ) en las respuestas del entorno de pruebas.

Cuadro de métricas de almacenamiento en caché que muestra el número de tokens leídos y escritos en la caché.

Si desactiva la opción de almacenamiento en caché de peticiones mientras está en medio de una conversación, puede seguir chateando con el modelo.