View a markdown version of this page

Armazenamento em cache de prompts para agilizar a inferência do modelo - Amazon Bedrock

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Armazenamento em cache de prompts para agilizar a inferência do modelo

O armazenamento em cache de prompts é um recurso opcional que você pode usar com modelos compatíveis no Amazon Bedrock para reduzir a latência da resposta de inferência e os custos de token de entrada. O Amazon Bedrock oferece suporte a dois tipos de cache de prompts: cache implícito de solicitações e cache explícito de solicitações. O suporte para cada tipo varia de acordo com o modelo e a API.

O armazenamento em cache de prompts pode ajudar quando você tem workloads com contextos longos e repetidos que são frequentemente reutilizados para várias consultas. Por exemplo, se você tiver um chatbot em que os usuários possam fazer upload de documentos e fazer perguntas a esses documentos, o modelo pode demorar para processá-los sempre que o usuário fornecer entradas. Com o armazenamento em cache de prompts, é possível armazenar um documento em cache para que futuras consultas contendo o documento não precisem reprocessá-lo.

Tipos de cache de avisos

Os dois tipos diferem na forma como o conteúdo reutilizável do prompt é selecionado:

Tipo Como funciona Solicitar configuração
Cache implícito de prompts O Amazon Bedrock e o modelo tentam reutilizar automaticamente os prefixos de prompt qualificados. Não são necessários controles de cache ou pontos de interrupção em sua solicitação.
Cache explícito de solicitações Você identifica prefixos de prompt reutilizáveis adicionando controles de cache ou pontos de interrupção específicos do modelo. Sua solicitação deve incluir os controles de cache suportados pelo modelo e pela API.

Cache implícito de prompts

O cache de prompt implícito tenta reutilizar automaticamente os prefixos de prompt qualificados sem exigir controles de cache em sua solicitação. Mantenha o conteúdo estático no início do prompt e o conteúdo dinâmico no final para aumentar a probabilidade de uma correspondência exata de prefixo.

O cache implícito de prompts é o melhor esforço. Repetir um prompt idêntico não garante um acerto no cache, e as taxas de acerto do cache podem variar.

Armazenamento em cache explícito de prompts

O cache explícito de prompts permite identificar prefixos de prompt reutilizáveis usando controles de cache específicos do modelo ou pontos de verificação de cache. Os pontos de verificação de cache são marcadores que definem a subseção contígua do prompt que você deseja armazenar em cache. Os prefixos do prompt devem permanecer estáticos entre as solicitações. Alterações no prefixo de um prompt em solicitações subsequentes resultam em falhas de cache.

Os pontos de verificação de cache têm um número mínimo e máximo de tokens, dependendo do modelo. Só é possível criar um ponto de verificação de cache se o prefixo total do prompt atender ao número mínimo de tokens. Por exemplo, Claude Opus 5 exige pelo menos 512 tokens por ponto de verificação de cache, Claude Sonnet 5 exige pelo menos 1.024 tokens por ponto de verificação de cache e Claude Haiku 4.5 exige pelo menos 4.096 tokens por ponto de verificação de cache. O mínimo se aplica cumulativamente a todo o prefixo do prompt antes de cada ponto de verificação, incluindo, quando aplicável, o conteúdo nos campos toolssystem, e. messages Não há um número mínimo de tokens exigidos entre os pontos de verificação de cache. Para um modelo com um mínimo de 1.024 tokens, você pode definir pontos de verificação adicionais separados por menos de 1.024 tokens, desde que o prefixo total do prompt antes de cada ponto de verificação contenha pelo menos 1.024 tokens. Se você adicionar um ponto de verificação de cache antes que o prefixo total do prompt atinja o número mínimo de tokens, sua inferência ainda será bem-sucedida, mas seu prefixo não será armazenado em cache.

O cache tem um Time To Live (TTL), que é reiniciado a cada acesso bem-sucedido ao cache. Durante esse período, o contexto no cache é preservado. Se nenhum acerto de cache ocorrer na janela de TTL, o cache expirará. Muitos modelos suportam um TTL de 5 minutos. Verifique a placa modelo do seu modelo para ver as condições exatas do TTL.

O cache explícito de solicitações fornece controle sobre qual conteúdo de solicitação é elegível para armazenamento em cache. Isso não garante que uma solicitação qualificada resulte em um acesso ao cache.

Cobrança de tokens em cache

Tanto para o cache de prompt implícito quanto para o cache de solicitações explícitas, os tokens lidos com sucesso do cache são relatados como tokens em cache e cobrados de acordo com a taxa de leitura do cache do modelo. Os tokens que não são lidos do cache são cobrados de acordo com a taxa padrão do token de entrada. Dependendo do modelo, os tokens gravados no cache podem ser cobrados a uma taxa maior do que a taxa padrão do token de entrada. Para obter mais informações, consulte a página de preços do Amazon Bedrock.

Importante

O suporte para cache imediato não garante um acesso ao cache para qualquer solicitação. Verifique os campos de uso do cache na resposta do modelo para determinar se os tokens foram lidos ou gravados no cache.

Você pode usar o cache de prompts ao executar a inferência no Amazon Bedrock com modelos compatíveis. A disponibilidade de cada tipo de cache de prompt varia de acordo com o modelo e a API. O cache imediato está disponível por meio dos seguintes recursos do Amazon Bedrock:

Converse e APIs ConverseStream

Você pode manter uma conversa com um modelo compatível. Para o cache de solicitações explícitas, especifique pontos de verificação de cache em suas solicitações.

InvokeModel e InvokeModelWithResponseStream APIs

Você pode enviar solicitações de solicitação única aos modelos compatíveis. Para o cache explícito de prompts, ative o cache de prompts e especifique seus pontos de verificação de cache.

Armazenamento imediato em cache com inferência Cross-region

O cache imediato pode ser usado em conjunto com a inferência entre regiões. Cross-region a inferência seleciona automaticamente a AWS região ideal em sua geografia para atender à sua solicitação de inferência, maximizando assim os recursos disponíveis e a disponibilidade do modelo. Em momentos de alta demanda, essas otimizações podem aumentar as gravações em cache.

Gerenciamento de Prompts do Amazon Bedrock

Ao criar ou modificar um prompt, você pode optar por ativar o armazenamento em cache de prompts. Dependendo do modelo, é possível armazenar em cache os prompts do sistema, as instruções do sistema e as mensagens (usuário e assistente). Também é possível optar por desabilitar o armazenamento em cache de prompts.

nota

O cache imediato só é compatível com endpoints de inferência sob demanda. Ela não é compatível com a API de inferência em lote.

Para modelos que oferecem suporte ao cache explícito de prompts, as APIs fornecem controle granular sobre o cache de prompts. Você pode definir pontos de verificação de cache individuais em seus prompts e adicionar pontos de verificação até o máximo permitido para o modelo. Para obter mais informações, consulte Modelos compatíveis, regiões e limites explícitos de cache.

Modelos compatíveis, regiões e limites explícitos de cache

O suporte imediato ao cache varia de acordo com o modelo e a API. As placas de modelo identificam se um modelo oferece suporte ao cache implícito de solicitações, ao cache explícito de solicitações ou a ambos. O cache imediato está disponível em todas as AWS regiões em que os modelos compatíveis estão disponíveis. Para verificar a disponibilidade do modelo por região, consulteDisponibilidade regional por modelos.

A tabela a seguir lista os modelos que oferecem suporte ao cache explícito de prompts, junto com seus tokens mínimos, número máximo de pontos de verificação de cache e campos que permitem pontos de verificação de cache.

Para ver quais tipos de cache de prompts um modelo suporta, consulte Modelos em um piscar de olhos e escolha o modelo em que você está interessado.

Nome do modelo ID do modelo Tipo de versão Número mínimo de tokens por ponto de verificação de cache Número máximo de pontos de verificação de cache por solicitação TTL suportado Campos que aceitam pontos de verificação de armazenamento em cache de prompts

Claude Fable 5.1

antrópico.claude-Fable-5-1

Disponível para o público

512

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude Mythos 5.1

antropic.claude-mythos-5-1

Fechado

512

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude Fable 5

antrópica.claude-Fable-5

Disponível para o público

512

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude Mythos 5

antropic.claude-mythos-5

Fechado

512

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude Mythos Preview

ante-prévia de anthropic.claude-mythos

Fechado

4.096

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude Opus 5

antrópico. claude-opus-5

Disponível para o público

512

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude Opus 4.8

antrópico. claude-opus-4-8

Disponível para o público

1,024

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude Opus 4.7

antrópico. claude-opus-4-7

Disponível para o público

4.096

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude Opus 4.6

antrópico.claude-opus-4-6-v1

Disponível para o público

4.096

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude Opus 4.5

anthropic.claude-opus-4-5-20251101-v 1:0

Disponível para o público

4.096

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude Sonnet 5

antropic.claude-sonneto-5

Disponível para o público

1,024

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude Sonnet 4.6

antropic.claude-soneto-4-6

Disponível para o público

1,024

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude Sonnet 4.5

anthropic.claude-sonnet-4-5-20250929-v1:0

Disponível para o público

1,024

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude 3.7 Sonnet

anthropic.claude-3-7-soneto-20250219-v 10:

Disponível para o público

1,024

4

5 minutos

“system”, “messages” e “tools”

Claude 3.5 Sonnet v2

anthropic.claude-3-5-sonnet-20241022-v2:0

Demonstração

1,024

4

5 minutos

“system”, “messages” e “tools”

Claude Haiku 4.5

anthropic.claude-haiku-4-5-20251001-v1:0

Disponível para o público

4.096

4

5 minutos, 1 hora

“system”, “messages” e “tools”

GPT-5.6 Sol

openai.gpt-5.6-sol

Disponível para o público

1,024

4

30 minutos

prompt_cache_breakpointativado input_textinput_image, e input_file bloqueia (API de respostas)

GPT-5.6 Terra

openai.gpt-5.6-terra

Disponível para o público

1,024

4

30 minutos

prompt_cache_breakpointativado input_textinput_image, e input_file bloqueia (API de respostas)

GPT-5.6 Luna

openai.gpt-5.6-luna

Disponível para o público

1,024

4

30 minutos

prompt_cache_breakpointativado input_textinput_image, e input_file bloqueia (API de respostas)

Para usar a opção TTL de 1 hora com modelos compatíveis (Claude Fable 5,,Claude Opus 5,Claude Opus 4.8,Claude Opus 4.7, Claude Opus 4.6Claude Opus 4.5, eClaude Haiku 4.5) Claude Sonnet 5 Claude Sonnet 4.6Claude Sonnet 4.5, especifique o ttl campo em seu ponto de verificação de cache. Na API Converse, adicione "ttl": "1h" ao seu cachePoint objeto. Na InvokeModel API para modelos Claude, adicione "ttl": "1h" ao seu cache_control objeto. Se nenhum ttl valor for fornecido, o comportamento padrão de cache de 5 minutos se aplica. O TTL de 1 hora é útil para sessões de execução mais longa ou cenários de processamento em lote em que você deseja manter o cache por longos períodos.

Amazon Novaoferece cache de solicitações implícitas para todas as solicitações de texto, incluindo User mensagens. System Esse mecanismo pode oferecer benefícios de latência quando as solicitações começam com partes repetitivas, sem configuração explícita. Amazon Novaos modelos mostrados como compatíveis com o Explicit Prompt Caching em suas placas de modelo também permitem que você especifique pontos de verificação de cache para maior controle sobre a elegibilidade do cache.

Armazenamento imediato em cache para modelos da Anthropic

Os modelos antrópicos que oferecem suporte ao cache imediato no Amazon Bedrock oferecem suporte ao cache implícito de solicitações e ao cache explícito de solicitações. O cache de prompt implícito tenta reutilizar automaticamente os prefixos de prompt qualificados sem exigir controles de cache em sua solicitação.

Para o cache explícito de solicitações, o Amazon Bedrock oferece uma abordagem simplificada para o gerenciamento de cache que reduz a complexidade de colocar manualmente pontos de verificação de cache. Em vez de exigir que você especifique os locais exatos dos pontos de verificação de cache, é possível usar o gerenciamento de cache automático com um único ponto de interrupção no final do conteúdo estático.

Ao habilitar o gerenciamento de cache simplificado, o sistema verifica automaticamente os acertos de cache nos limites anteriores do bloco de conteúdo, analisando aproximadamente vinte blocos de conteúdo a partir do ponto de interrupção especificado. Isso permite que o modelo encontre o prefixo correspondente mais longo do cache sem exigir que você preveja os locais ideais dos pontos de verificação. Para usar isso, coloque um único ponto de verificação de cache no final do conteúdo estático, antes de qualquer conteúdo dinâmico ou variável. O sistema encontrará automaticamente a melhor correspondência de cache.

Para ter um controle mais granular, você ainda pode usar vários pontos de verificação de cache (até quatro para os modelos Claude) para especificar limites exatos de cache. Você deve usar vários pontos de verificação de cache se estiver armazenando seções que mudam em frequências diferentes ou se quiser ter maior controle sobre exatamente o que é armazenado em cache.

Importante

A verificação automática de prefixo só analisa aproximadamente vinte blocos de conteúdo do ponto de verificação de cache. Se o conteúdo estático ultrapassar esse intervalo, considere a possibilidade de usar vários pontos de verificação de cache ou reestruturar o prompt para colocar o conteúdo reutilizado com maior frequência dentro desse intervalo.

Melhores práticas para usar o gerenciamento de cache em modelos antrópicos

Se você tiver solicitações usadas em uma cadência regular (ou seja, solicitações do sistema que são usadas com mais frequência do que a cada 5 minutos), continue usando o cache de 5 minutos, pois ele continuará sendo atualizado sem custo adicional.

O cache de 1 hora é melhor usado nos seguintes cenários:

  • Quando você tem solicitações que provavelmente são usadas com menos de 5 minutos, mas com mais frequência do que a cada hora. Por exemplo, quando um agente secundário agente leva mais de 5 minutos ou quando armazena uma longa conversa de bate-papo com um usuário e você geralmente espera que o usuário não responda nos próximos 5 minutos.

  • Quando a latência é importante e suas solicitações de acompanhamento podem ser enviadas por mais de 5 minutos.

  • Quando você quiser melhorar seu limite de taxa, use, pois os acessos ao cache não são deduzidos do seu limite de taxa.

Você pode usar controles de cache de 1 hora e 5 minutos na mesma solicitação, mas com uma restrição importante: as entradas de cache com TTL mais longo devem aparecer antes de TTLs mais curtos (ou seja, uma entrada de cache de 1 hora deve aparecer antes de qualquer entrada de cache de 5 minutos).

Armazenamento imediato em cache para modelos da OpenAI

Os modelos OpenAI no Amazon Bedrock oferecem suporte ao cache implícito de solicitações por meio da API de respostas. GPT-5.6 os modelos também oferecem suporte ao cache explícito de prompts. A API de respostas está disponível tanto no endpoint bedrock-runtime quanto no bedrock-mantle endpoint.

GPT-5.6 modelos

GPT-5.6 Sol (openai.gpt-5.6-sol), Terra (openai.gpt-5.6-terra) e Luna (openai.gpt-5.6-luna) suportam tanto o cache implícito do prompt quanto o cache explícito do prompt. Os pontos de interrupção explícitos do cache de solicitações oferecem controle preciso sobre quais partes da solicitação são elegíveis para armazenamento em cache. Isso é especialmente valioso para fluxos de trabalho agentes em que as instruções do sistema, as definições de ferramentas e os arquivos de referência se repetem em várias chamadas, enquanto somente as entradas mais recentes são alteradas.

Características principais:

  • Pontos de interrupção explícitos do cache — Marque o final exato de um prefixo de prompt reutilizável adicionando-o "prompt_cache_breakpoint": {"mode": "explicit"} a um bloco de conteúdo compatível.

  • Modos de cache — Definido prompt_cache_options.mode para controlar o comportamento do ponto de interrupção:

    • implicit(padrão) — Coloca um ponto de interrupção automático na mensagem mais recente e também usa qualquer ponto de interrupção explícito que você fornecer.

    • explicit— Desativa o ponto de interrupção automático. Somente pontos de interrupção explícitos são usados para leituras e gravações de cache. Se não houver pontos de interrupção explícitos, a solicitação não usará o cache imediato nem incorrerá em cobranças de gravação em cache.

  • Tamanho mínimo do prefixo — 1.024 tokens por ponto de interrupção.

  • TTL mínimo de 30 minutos — Os prefixos em cache permanecem disponíveis para reutilização por pelo menos 30 minutos, tempo suficiente para cobrir a explosão de chamadas geradas por uma única execução de agente. O TTL é definido via prompt_cache_options.ttl e o padrão é. 30m

  • Cobrança de gravação em cache — Os tokens gravados no cache são cobrados a 1,25 vezes a taxa do token de entrada não armazenado em cache. As leituras de cache são cobradas com um desconto de 90% em comparação com os tokens de entrada não armazenados em cache.

  • Os tokens em cache não contam para os limites de taxa — Os tokens de entrada em cache lidos por meio do cache imediato não contam na cota de tokens de entrada por minuto.

Como interpretar a resposta

O objeto de uso na resposta inclui dois campos específicos do cache:

  • cached_tokens— Número de tokens de entrada lidos do cache (cobrados de acordo com a taxa de desconto de leitura do cache).

  • cache_write_tokens— Número de tokens de entrada gravados no cache (cobrados em 1,25 × a taxa do token de entrada não armazenado em cache).

Quando cached_tokens é maior que zero e cache_write_tokens é zero, sua solicitação correspondeu totalmente a uma entrada de cache existente — nenhuma nova gravação ocorreu e você obteve a máxima economia de custos.

Melhores práticas para usar o gerenciamento de cache nos modelos GPT 5.6

  • Coloque pontos de interrupção após conteúdo estável — As instruções do sistema, as definições de ferramentas e os documentos de referência que não mudam entre as chamadas devem aparecer antes do ponto de interrupção. O conteúdo após o ponto de interrupção pode mudar livremente sem invalidar o prefixo armazenado em cache.

  • explicitModo de uso para loops agentes — Quando você quiser ter controle total sobre o que é armazenado em cache e evitar que pontos de interrupção automáticos consumam slots de gravação.

  • Monitore cache_write_tokens — Compare o volume de gravação em cache com as leituras de cache subsequentes para entender o impacto do custo líquido e ajustar adequadamente o posicionamento do ponto de interrupção.

GPT-5.5 e modelos anteriores

Para modelos OpenAI anteriores a GPT-5.6 (como openai.gpt-5.5 eopenai.gpt-5.4), o Implicit Prompt Caching é automático. Você não precisa adicionar nenhum parâmetro especial. O sistema tenta automaticamente armazenar em cache prefixos de prompt elegíveis de 1.024 tokens ou mais. As gravações em cache não têm nenhuma taxa adicional nesses modelos.

Características principais:

  • Cache de prompt implícito — Nenhuma alteração de código é necessária. O sistema tenta armazenar prefixos em cache automaticamente com base na correspondência exata de prefixos.

  • Tamanho mínimo do prefixo — 1.024 tokens.

  • Sem taxa de gravação em cache — Somente as leituras de cache são cobradas com desconto.

  • Os tokens em cache não contam para os limites de taxa — Os tokens de entrada em cache lidos por meio do cache imediato não contam na cota de tokens de entrada por minuto.

Práticas recomendadas para usar o gerenciamento de cache em modelos anteriores GPT-5.5 e

  • Coloque conteúdo estático (solicitações do sistema, definições de ferramentas, documentos de referência) no início da solicitação.

  • Coloque conteúdo variável (entrada específica do usuário) no final.

  • Mantenha um fluxo constante de solicitações com prefixos idênticos para minimizar os despejos de cache.

Introdução

As seções a seguir mostram uma breve visão geral de como usar o recurso de armazenamento em cache de prompts para cada método de interação com modelos por meio do Amazon Bedrock.

A API Converse oferece opções avançadas e flexíveis para implementar o armazenamento em cache de prompts em conversas de vários turnos. Para ter mais informações sobre os requisitos de prompt para cada modelo, consulte a seção anterior Modelos compatíveis, regiões e limites explícitos de cache.

Exemplo de solicitação

Os exemplos a seguir mostram um ponto de verificação de cache definido nos campos messages, system ou tools de uma solicitação para a API Converse. É possível colocar pontos de verificação em qualquer um desses locais para uma determinada solicitação. Por exemplo, ao enviar uma solicitação ao modelo Claude 3.5 Sonnet v2, você pode colocar dois pontos de verificação de cache em messages, um ponto de verificação de cache em system e um em tools. Para ter informações mais detalhadas e exemplos de estruturação e envio de solicitações de API Converse, consulte Inferência usando a API Converse.

Importante

Os pontos de verificação de cache são processados nesta ordem: toolssystemmessages. O tamanho mínimo do cache é avaliado em relação aos tokens cumulativos em todas as três seções combinadas, não em cada seção individualmente. Como as seções estão em cadeia, alterar o conteúdo em uma seção anterior invalida o cache das seções posteriores (por exemplo, modificar tools invalida os caches e.). system messages Para obter as melhores taxas de acerto do cache, coloque o conteúdo estável (tools,system) antes do conteúdo variável (messages) e coloque os pontos de verificação do cache após o conteúdo estável.

Especifique o valor ttl desejado conforme abaixo, quando o valor ttl não for especificado, o comportamento padrão de 5 minutos de armazenamento em cache se aplica.

"cachePoint" : { "type": "default", "ttl" : "5m | 1h" }
messages checkpoints

Neste exemplo, o primeiro campo, image, fornece uma imagem para o modelo e o segundo, text, solicita que o modelo analise a imagem. Desde que o número de tokens anteriores ao cachePoint no objeto content atenda à contagem mínima de tokens do modelo, um ponto de verificação de cache será criado.

... "messages": [ { "role": "user", "content": [ { "image": { "bytes": "asfb14tscve..." } }, { "text": "What's in this image?" }, { "cachePoint": { "type": "default" } } ] } ] ...
system checkpoints

Neste exemplo, o prompt do sistema é fornecido no campo text. Além disso, você pode adicionar um campo cachePoint para armazenar em cache o prompt do sistema.

... "system": [ { "text": "You are an app that creates play lists for a radio station that plays rock and pop music. Only return song names and the artist. " }, { "cachePoint": { "type": "default" } } ], ...
tools checkpoints

Neste exemplo, a definição da ferramenta é fornecida no campo toolSpec. (Como alternativa, você pode chamar uma ferramenta que você definiu anteriormente. Para obter mais informações, consulteUse uma ferramenta para concluir uma resposta do modelo do Amazon Bedrock.) Depois, você pode adicionar um campo cachePoint para armazenar a ferramenta em cache.

... toolConfig={ "tools": [ { "toolSpec": { "name": "top_song", "description": "Get the most popular song played on a radio station.", "inputSchema": { "json": { "type": "object", "properties": { "sign": { "type": "string", "description": "The call sign for the radio station for which you want the most popular song. Example calls signs are WZPZ and WKRP." } }, "required": [ "sign" ] } } } }, { "cachePoint": { "type": "default" } } ] } ...

A resposta do modelo da Converse API inclui três novos campos que são específicos para o cache de solicitações. Os valores cacheReadInputTokens e cacheWriteInputTokens informam quantos tokens foram lidos do cache e quantos tokens foram gravados no cache em resposta à sua solicitação anterior. Os cacheDetails valores indicam o ttl usado para o número de tokens gravados no cache. Esses são os valores com base nos quais o Amazon Bedrock aplica cobranças, a uma taxa inferior ao custo de inferência de modelo completa.

Importante

Quando o cache de prompts está ativado, o inputTokens campo representa somente os tokens de entrada não armazenados em cache (tokens que não foram lidos ou gravados no cache). Para calcular o total de tokens de entrada enviados em uma solicitação, use a seguinte fórmula:

total input tokens = inputTokens + cacheReadInputTokens + cacheWriteInputTokens

O cache de prompts é ativado por padrão quando você chama a InvokeModel API. Você pode definir pontos de verificação de cache em qualquer ponto do corpo da solicitação, de modo semelhante ao exemplo anterior da API Converse.

Anthropic Claude

O exemplo a seguir mostra como estruturar o corpo da sua InvokeModel solicitação para o modelo Anthropic Claude 3.5 Sonnet v2. Observe que o formato e os campos exatos do corpo das InvokeModel solicitações podem variar dependendo do modelo escolhido. Para ver o formato e o conteúdo do corpo de solicitação e resposta para diferentes modelos, consulte Parâmetros de solicitação de inferência e campos de resposta para modelos de base.

Especifique o valor ttl desejado conforme abaixo, quando o valor ttl não for especificado, o comportamento padrão de 5 minutos de armazenamento em cache se aplica.

"cache_control" : { "type": "ephemeral", "ttl" : "5m | 1h" }
body={ "anthropic_version": "bedrock-2023-05-31", "system":"Reply concisely", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe the best way to learn programming." }, { "type": "text", "text": "Add additional context here for the prompt that meets the minimum token requirement for your chosen model.", "cache_control": { "type": "ephemeral" } } ] } ], "max_tokens": 2048, "temperature": 0.5, "top_p": 0.8, "stop_sequences": [ "stop" ], "top_k": 250 }
Amazônia Nova

O exemplo a seguir mostra como estruturar o corpo da sua InvokeModel solicitação para o Amazon Nova modelo. Observe que o formato e os campos exatos do corpo das InvokeModel solicitações podem variar dependendo do modelo escolhido. Para ver o formato e o conteúdo do corpo de solicitação e resposta para diferentes modelos, consulte Parâmetros de solicitação de inferência e campos de resposta para modelos de base.

{ "system": [{ "text": "Reply Concisely" }], "messages": [{ "role": "user", "content": [{ "text": "Describe the best way to learn programming" }, { "text": "Add additional context here for the prompt that meets the minimum token requirement for your chosen model.", "cachePoint": { "type": "default" } }] }], "inferenceConfig": { "maxTokens": 300, "topP": 0.1, "topK": 20, "temperature": 0.3 } }

Para obter mais informações sobre como enviar uma InvokeModel solicitação, consulteEnvie uma única solicitação com InvokeModel.

Para modelos OpenAI, você usa a API Responses — disponível nos endpoints bedrock-runtime e bedrock-mantle endpoints — com parâmetros de cache imediatos específicos para a geração do modelo. Para GPT-5.6 modelos, você controla o armazenamento em cache com pontos de interrupção explícitos. Para GPT-5.5 e antes, o armazenamento em cache é automático.

GPT-5.6 exemplo com pontos de interrupção de cache explícitos

O exemplo a seguir mostra uma solicitação da API Responses para openai.gpt-5.6-sol usar pontos de interrupção de cache explícitos. A instrução do sistema é armazenada em cache e reutilizada nas solicitações subsequentes.

{ "model": "openai.gpt-5.6-sol", "prompt_cache_key": "my-app:system-prompt-v1", "prompt_cache_options": { "mode": "explicit" }, "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions. Follow these guidelines: 1. Always cite the relevant documentation section. 2. If unsure, escalate to a human agent. 3. Be concise but thorough...", "prompt_cache_breakpoint": { "mode": "explicit" } } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }

GPT-5.5 exemplo com cache automático

Para modelos anteriores GPT-5.5 e anteriores, o cache imediato é automático. Não são necessários pontos de interrupção ou chaves de cache — apenas certifique-se de que o prefixo do prompt exceda 1.024 tokens.

{ "model": "openai.gpt-5.5", "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions..." } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }

Resposta

A resposta inclui métricas de uso do cache no usage objeto:

{ "id": "resp_abc123", "output": [...], "usage": { "input_tokens": 2048, "output_tokens": 256, "total_tokens": 2304, "input_tokens_details": { "cached_tokens": 1920, "cache_write_tokens": 0 } } }

Nessa resposta, 1.920 tokens foram servidos a partir do cache e nenhum novo token foi gravado, indicando um cache completo atingido com o máximo de economia de custos.

Em um playground de chat no console do Amazon Bedrock, é possível ativar a opção de armazenamento em cache de prompts para que o Amazon Bedrock crie automaticamente pontos de verificação de cache para você.

Siga as instruções em Gerar respostas no console usando playgrounds para começar a usar prompts em um playground do Amazon Bedrock. Para modelos compatíveis, o armazenamento em cache de prompts é ativado automaticamente no playground. No entanto, se não estiver, faça o seguinte para ativar o cache de prompts:

  1. Abra o menu Configurações.

  2. Ative o botão Armazenamento em cache de prompts.

  3. Execute seus prompts.

Depois que as entradas e respostas do modelo atingem, em conjunto, o número mínimo necessário de tokens para um ponto de verificação (que varia de acordo com o modelo), o Amazon Bedrock cria automaticamente o primeiro ponto de verificação de cache para você. À medida que você continua conversando, o Amazon Bedrock pode criar pontos de verificação adicionais, até o número máximo de pontos de verificação permitido para o modelo. O mínimo é avaliado em relação ao número cumulativo de tokens antes de cada ponto de verificação, não ao número de tokens adicionados desde o ponto de verificação anterior. É possível visualizar os pontos de verificação de cache a qualquer momento escolhendo Visualizar pontos de verificação de cache ao lado do botão Armazenamento em cache de prompts, conforme mostrado na captura de tela a seguir.

Ativação e desativação da interface de usuário para armazenamento em cache de prompts em um playground de texto do Amazon Bedrock.

É possível ver quantos tokens estão sendo lidos e gravados no cache em resposta a cada interação com o modelo visualizando o pop-up Métricas de cache ( The metrics icon shown in model responses when prompt caching is enabled. ) nas respostas do playground.

Caixa de métricas de armazenamento em cache que mostra o número de tokens lidos e gravados no cache.

Se você desativar o botão de armazenamento em cache de prompts no meio de uma conversa, poderá continuar conversando com o modelo.