View a markdown version of this page

Armazenamento em cache de prompts para agilizar a inferência do modelo - Amazon Bedrock

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Armazenamento em cache de prompts para agilizar a inferência do modelo

O armazenamento em cache de prompts é um recurso opcional que você pode usar com modelos compatíveis no Amazon Bedrock para reduzir a latência da resposta de inferência e os custos de token de entrada. Ao adicionar partes do seu contexto a um cache, o modelo pode usar o cache para pular o recálculo das entradas, permitindo que a Bedrock compartilhe a economia de computação e reduza suas latências de resposta.

O armazenamento em cache de prompts pode ajudar quando você tem workloads com contextos longos e repetidos que são frequentemente reutilizados para várias consultas. Por exemplo, se você tiver um chatbot em que os usuários possam fazer upload de documentos e fazer perguntas a esses documentos, o modelo pode demorar para processá-los sempre que o usuário fornecer entradas. Com o armazenamento em cache de prompts, é possível armazenar um documento em cache para que futuras consultas contendo o documento não precisem reprocessá-lo.

Ao usar o armazenamento em cache de prompts, é aplicada uma taxa de cobrança reduzida pelos tokens lidos do cache. Dependendo do modelo, pode ser aplicada uma taxa de cobrança mais alta aos tokens gravados em cache do que a dos tokens de entrada não armazenados em cache. Todos os tokens não lidos ou gravados em cache são cobrados de acordo com a taxa de token de entrada padrão desse modelo. Para obter mais informações, consulte a página de preços do Amazon Bedrock.

Como funciona

Se você optar por usar o armazenamento em cache de prompts, o Amazon Bedrock criará um cache composto de pontos de verificação de cache. Esses são marcadores que definem a subseção contígua do prompt que você deseja armazenar em cache (geralmente chamada de prefixo do prompt). Esses prefixos de prompt devem ser estáticos entre as solicitações. Alterações no prefixo do prompt em solicitações subsequentes resultarão em ausências no cache.

Os pontos de verificação de cache têm um número mínimo e máximo de tokens, dependendo do modelo específico que você está usando. Só é possível criar um ponto de verificação de cache se o prefixo total do prompt atender ao número mínimo de tokens. Por exemplo, Claude 3.7 Sonnet requer pelo menos 1.024 tokens por ponto de verificação de cache, enquanto, Claude Opus 4.5 Claude Opus 4.6Claude Haiku 4.5, e Claude Sonnet 4.5 exige pelo menos 4.096 tokens por ponto de verificação de cache. Isso significa que, para um modelo com um mínimo de 1.024 tokens, seu primeiro ponto de verificação de cache pode ser definido após 1.024 tokens e seu segundo ponto de verificação de cache pode ser definido após 2.048 tokens. Se você tentar adicionar um ponto de verificação de cache antes de atingir o número mínimo de tokens, a inferência ainda assim será bem-sucedida, mas o prefixo não será armazenado em cache. O cache tem um Time To Live (TTL), que é redefinido a cada acesso bem-sucedido ao cache. Durante esse período, o contexto no cache é preservado. Se nenhum acerto de cache ocorrer na janela de TTL, o cache expirará. Muitos modelos suportam um TTL de 5 minutos. Verifique a placa do modelo do seu modelo para ver as condições exatas do TTL.

Você pode usar o armazenamento em cache de prompts sempre que obtiver inferência do modelo no Amazon Bedrock para modelos compatíveis. Os seguintes recursos do Amazon Bedrock permitem usar o armazenamento em cache de prompts:

Converse e ConverseStream APIs

Você pode manter uma conversa com um modelo em que especifica pontos de verificação de cache em seus prompts.

InvokeModel e InvokeModelWithResponseStream APIs

Você pode enviar solicitações de prompt único nas quais habilita o armazenamento em cache de prompts e especifica os pontos de verificação de cache.

Cache imediato com inferência Cross-region

O cache imediato pode ser usado em conjunto com a inferência entre regiões. Cross-region a inferência seleciona automaticamente a AWS região ideal em sua geografia para atender à sua solicitação de inferência, maximizando assim os recursos disponíveis e a disponibilidade do modelo. Em momentos de alta demanda, essas otimizações podem aumentar as gravações em cache.

Gerenciamento de Prompts do Amazon Bedrock

Ao criar ou modificar um prompt, você pode optar por ativar o armazenamento em cache de prompts. Dependendo do modelo, é possível armazenar em cache os prompts do sistema, as instruções do sistema e as mensagens (usuário e assistente). Também é possível optar por desabilitar o armazenamento em cache de prompts.

nota

O cache imediato só é compatível com endpoints de inferência sob demanda. Não é compatível com a API de inferência em lote.

As APIs oferecem a você o mais alto nível de flexibilidade e controle granular sobre o armazenamento em cache de prompts. É possível definir um ponto de verificação de cache individual nos prompts. Você pode ampliar o cache criando mais pontos de verificação de cache, até o número máximo de pontos de verificação de cache permitido para o modelo em questão. Para obter mais informações, consulte Modelos, regiões e limites oferecidos.

Modelos, regiões e limites oferecidos

O cache imediato está disponível em todas as AWS regiões em que os modelos compatíveis estão disponíveis. Para verificar a disponibilidade do modelo por região, consulteDisponibilidade regional por modelos.

A tabela a seguir lista os modelos compatíveis, bem como os tokens mínimos, o número máximo de pontos de verificação de cache e os campos que permitem pontos de verificação de cache.

Para ver quais modelos oferecem suporte ao cache imediato, consulte Visão geral dos modelos e escolha o modelo em que você está interessado. A tabela a seguir mostra o cache imediato para modelos que não estão presentes no models-at-a-glance.

Nome do modelo ID do modelo Tipo de versão Número mínimo de tokens por ponto de verificação de cache Número máximo de pontos de verificação de cache por solicitação TTL suportado Campos que aceitam pontos de verificação de armazenamento em cache de prompts

Claude Opus 4.5

antropic.claude-opus-4-5-20251101-v 1:0

Disponível para o público

4.096

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude Opus 4.6

antropic.claude-opus-4-6-v1

Disponível para o público

4.096

4

5 minutos

“system”, “messages” e “tools”

Claude Sonnet 4.5

anthropic.claude-sonnet-4-5-20250929-v1:0

Disponível para o público

4.096

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude Sonnet 4.6

antropic.claude-sonnet-4-6

Disponível para o público

1,024

4

5 minutos

“system”, “messages” e “tools”

Claude Haiku 4.5

anthropic.claude-haiku-4-5-20251001-v1:0

Disponível para o público

4.096

4

5 minutos, 1 hora

“system”, “messages” e “tools”

Claude Opus 4

anthropic.claude-opus-4-20250514-v1:0

Disponível para o público

1,024

4

5 minutos

“system”, “messages” e “tools”

Claude 3.7 Sonnet

anthropic.claude-3-7-sonnet-20250219-v 1:0

Disponível para o público

1,024

4

5 minutos

“system”, “messages” e “tools”

Claude 3.5 Sonnet v2

anthropic.claude-3-5-sonnet-20241022-v2:0

Demonstração

1,024

4

5 minutos

“system”, “messages” e “tools”

GPT-5.6 Sol

openai.gpt-5.6-sol

Disponível para o público

1,024

4

30 minutos

prompt_cache_breakpointativado input_textinput_image, e input_file bloqueia (API de respostas)

GPT-5.6 Terra

openai.gpt-5.6-terra

Disponível para o público

1,024

4

30 minutos

prompt_cache_breakpointativado input_textinput_image, e input_file bloqueia (API de respostas)

GPT-5.6 Luna

openai.gpt-5.6-luna

Disponível para o público

1,024

4

30 minutos

prompt_cache_breakpointativado input_textinput_image, e input_file bloqueia (API de respostas)

Para usar a opção TTL de 1 hora com modelos compatíveis (Claude Opus4.5,, eClaude Sonnet 4.5)Claude Haiku 4.5, especifique o ttl campo em seu ponto de verificação de cache. Na API Converse, adicione "ttl": "1h" ao seu cachePoint objeto. Na InvokeModel API para modelos Claude, adicione "ttl": "1h" ao seu cache_control objeto. Se nenhum ttl valor for fornecido, o comportamento padrão de armazenamento em cache de 5 minutos será aplicado. O TTL de 1 hora é útil para sessões de execução mais longa ou cenários de processamento em lote nos quais você deseja manter o cache por longos períodos.

O Amazon Nova oferece armazenamento em cache de prompts automático para todos os prompts de texto, inclusive para mensagens User e System. Esse mecanismo pode fornecer benefícios de latência quando os prompts começam com partes repetitivas, mesmo sem configuração explícita. No entanto, para reduzir os custos e garantir benefícios de desempenho mais consistentes, recomendamos optar pelo armazenamento em cache de prompts explícito.

Gerenciamento de cache para modelos da Anthropic

Para os modelos Claude, o Amazon Bedrock oferece uma abordagem simplificada para o gerenciamento de cache que reduz a complexidade da colocação manual de pontos de verificação de cache. Em vez de exigir que você especifique os locais exatos dos pontos de verificação de cache, é possível usar o gerenciamento de cache automático com um único ponto de interrupção no final do conteúdo estático.

Ao habilitar o gerenciamento de cache simplificado, o sistema verifica automaticamente os acertos de cache nos limites anteriores do bloco de conteúdo, analisando aproximadamente vinte blocos de conteúdo a partir do ponto de interrupção especificado. Isso permite que o modelo encontre o prefixo correspondente mais longo do cache sem exigir que você preveja os locais ideais dos pontos de verificação. Para usar isso, coloque um único ponto de verificação de cache no final do conteúdo estático, antes de qualquer conteúdo dinâmico ou variável. O sistema encontrará automaticamente a melhor correspondência de cache.

Para ter um controle mais granular, você ainda pode usar vários pontos de verificação de cache (até quatro para os modelos Claude) para especificar limites exatos de cache. Você deve usar vários pontos de verificação de cache se estiver armazenando seções que mudam em frequências diferentes ou se quiser ter maior controle sobre exatamente o que é armazenado em cache.

Importante

A verificação automática de prefixo só analisa aproximadamente vinte blocos de conteúdo do ponto de verificação de cache. Se o conteúdo estático ultrapassar esse intervalo, considere a possibilidade de usar vários pontos de verificação de cache ou reestruturar o prompt para colocar o conteúdo reutilizado com maior frequência dentro desse intervalo.

Melhores práticas para usar o gerenciamento de cache em modelos antrópicos

Se você tiver solicitações que são usadas em um ritmo regular (ou seja, solicitações do sistema que são usadas com mais frequência do que a cada 5 minutos), continue usando o cache de 5 minutos, pois ele continuará sendo atualizado sem custo adicional.

O cache de 1 hora é melhor usado nos seguintes cenários:

  • Quando você tem avisos que provavelmente são usados com menos frequência do que 5 minutos, mas com mais frequência do que a cada hora. Por exemplo, quando um agente secundário agente demora mais de 5 minutos ou quando armazena uma longa conversa de bate-papo com um usuário e você geralmente espera que o usuário não responda nos próximos 5 minutos.

  • Quando a latência é importante e suas solicitações de acompanhamento podem ser enviadas além de 5 minutos.

  • Quando você quiser melhorar seu limite de taxa, use, já que os acessos ao cache não são deduzidos do seu limite de taxa.

Você pode usar controles de cache de 1 hora e 5 minutos na mesma solicitação, mas com uma restrição importante: entradas de cache com TTL mais longo devem aparecer antes de TTLs mais curtos (ou seja, uma entrada de cache de 1 hora deve aparecer antes de qualquer entrada de cache de 5 minutos).

Gerenciamento de cache para modelos da OpenAI

Os modelos OpenAI no Amazon Bedrock oferecem suporte ao cache imediato por meio da API de respostas no endpoint. bedrock-mantle O comportamento do armazenamento em cache varia de acordo com a geração do modelo.

GPT-5.6 modelos

GPT-5.6 Sol (openai.gpt-5.6-sol), Terra (openai.gpt-5.6-terra) e Luna (openai.gpt-5.6-luna) introduzem pontos de interrupção explícitos do cache do prompt, oferecendo controle preciso sobre quais partes do seu prompt são armazenadas em cache. Isso é especialmente valioso para fluxos de trabalho agentes em que as instruções do sistema, as definições de ferramentas e os arquivos de referência se repetem em muitas chamadas, enquanto apenas a entrada mais recente é alterada.

Características principais:

  • Pontos de interrupção explícitos do cache — marque o final exato de um prefixo de prompt reutilizável adicionando "prompt_cache_breakpoint": {"mode": "explicit"} a um bloco de conteúdo compatível.

  • Modos de cacheprompt_cache_options.mode Defina para controlar o comportamento do ponto de interrupção:

    • implicit(padrão) — Coloca um ponto de interrupção automático na mensagem mais recente e também usa os pontos de interrupção explícitos fornecidos por você.

    • explicit— Desativa o ponto de interrupção automático. Somente pontos de interrupção explícitos são usados para leituras e gravações em cache. Se não existirem pontos de interrupção explícitos, a solicitação não usa o cache imediato nem incorre em cobranças de gravação em cache.

  • Tamanho mínimo do prefixo — 1.024 tokens por ponto de interrupção.

  • TTL mínimo de 30 minutos — os prefixos em cache permanecem disponíveis para reutilização por pelo menos 30 minutos, tempo suficiente para cobrir a sequência de chamadas geradas por uma única execução de agente. O TTL é definido por meio de prompt_cache_options.ttl e o padrão é. 30m

  • Cobrança de gravação em cache — Os tokens gravados no cache são cobrados a 1,25 vezes a taxa de tokens de entrada sem cache. As leituras em cache são cobradas com um desconto de 90% em comparação com os tokens de entrada não armazenados em cache.

  • Os tokens em cache não contam para os limites de taxa — os tokens de entrada em cache lidos por meio do cache imediato não contam na cota de tokens de entrada por minuto.

Como interpretar a resposta

O objeto de uso na resposta inclui dois campos específicos do cache:

  • cached_tokens— Número de tokens de entrada lidos do cache (cobrados de acordo com a taxa de desconto de leitura em cache).

  • cache_write_tokens— Número de tokens de entrada gravados no cache (cobrado em 1,25 × a taxa de tokens de entrada sem cache).

Quando cached_tokens é maior que zero e cache_write_tokens é zero, sua solicitação correspondeu totalmente a uma entrada de cache existente — nenhuma nova gravação ocorreu e você obteve a máxima economia de custos.

Melhores práticas para usar o gerenciamento de cache nos modelos GPT 5.6

  • Coloque pontos de interrupção após conteúdo estável — As instruções do sistema, as definições de ferramentas e os documentos de referência que não mudam entre as chamadas devem aparecer antes do ponto de interrupção. O conteúdo após o ponto de interrupção pode mudar livremente sem invalidar o prefixo em cache.

  • explicitModo de uso para loops agentes — Quando você quer controle total sobre o que é armazenado em cache e quer evitar que pontos de interrupção automáticos consumam slots de gravação.

  • Monitore cache_write_tokens — compare o volume de gravação em cache com as leituras subsequentes do cache para entender o impacto do custo líquido e ajustar adequadamente o posicionamento dos pontos de interrupção.

GPT-5.5 e modelos anteriores

Para modelos OpenAI anteriores a GPT-5.6 (como openai.gpt-5.5 eopenai.gpt-5.4), o cache imediato é automático. Você não precisa adicionar nenhum parâmetro especial — o sistema armazena automaticamente prefixos de prompt elegíveis de 1.024 tokens ou mais. As gravações em cache não têm nenhuma taxa adicional nesses modelos.

Características principais:

  • Cache automático — Nenhuma alteração de código é necessária. O sistema armazena prefixos em cache automaticamente com base na correspondência exata de prefixos.

  • Comprimento mínimo do prefixo — 1.024 tokens.

  • Sem taxa de gravação em cache — somente as leituras de cache são cobradas com desconto.

  • Os tokens em cache não contam para os limites de taxa — os tokens de entrada em cache lidos por meio do cache imediato não contam na cota de tokens de entrada por minuto.

Práticas recomendadas para usar o gerenciamento de cache em GPT-5.5 modelos anteriores

  • Coloque conteúdo estático (solicitações do sistema, definições de ferramentas, documentos de referência) no início da solicitação.

  • Coloque conteúdo variável (entrada específica do usuário) no final.

  • Mantenha um fluxo constante de solicitações com prefixos idênticos para minimizar os despejos de cache.

Introdução

As seções a seguir mostram uma breve visão geral de como usar o recurso de armazenamento em cache de prompts para cada método de interação com modelos por meio do Amazon Bedrock.

A API Converse oferece opções avançadas e flexíveis para implementar o armazenamento em cache de prompts em conversas de vários turnos. Para ter mais informações sobre os requisitos de prompt para cada modelo, consulte a seção anterior Modelos, regiões e limites oferecidos.

Exemplo de solicitação

Os exemplos a seguir mostram um ponto de verificação de cache definido nos campos messages, system ou tools de uma solicitação para a API Converse. É possível colocar pontos de verificação em qualquer um desses locais para uma determinada solicitação. Por exemplo, ao enviar uma solicitação ao modelo Claude 3.5 Sonnet v2, você pode colocar dois pontos de verificação de cache em messages, um ponto de verificação de cache em system e um em tools. Para ter informações mais detalhadas e exemplos de estruturação e envio de solicitações de API Converse, consulte Inferência usando a API Converse.

Importante

Os pontos de verificação do cache são processados nesta ordem: toolssystemmessages. O tamanho mínimo do cache é avaliado em relação aos tokens cumulativos em todas as três seções combinadas, não em cada seção individualmente. Como as seções estão encadeadas, alterar o conteúdo em uma seção anterior invalida o cache das seções posteriores (por exemplo, modificar tools invalida os caches e). system messages Para obter as melhores taxas de acerto do cache, coloque o conteúdo estável (tools,system) antes do conteúdo variável (messages) e coloque os pontos de verificação do cache após o conteúdo estável.

Especifique o valor de ttl desejado conforme abaixo, quando o valor de ttl não for especificado, o comportamento padrão de 5 minutos de armazenamento em cache se aplica.

"cachePoint" : { "type": "default", "ttl" : "5m | 1h" }
messages checkpoints

Neste exemplo, o primeiro campo, image, fornece uma imagem para o modelo e o segundo, text, solicita que o modelo analise a imagem. Desde que o número de tokens anteriores ao cachePoint no objeto content atenda à contagem mínima de tokens do modelo, um ponto de verificação de cache será criado.

... "messages": [ { "role": "user", "content": [ { "image": { "bytes": "asfb14tscve..." } }, { "text": "What's in this image?" }, { "cachePoint": { "type": "default" } } ] } ] ...
system checkpoints

Neste exemplo, o prompt do sistema é fornecido no campo text. Além disso, você pode adicionar um campo cachePoint para armazenar em cache o prompt do sistema.

... "system": [ { "text": "You are an app that creates play lists for a radio station that plays rock and pop music. Only return song names and the artist. " }, { "cachePoint": { "type": "default" } } ], ...
tools checkpoints

Neste exemplo, a definição da ferramenta é fornecida no campo toolSpec. (Como alternativa, você pode chamar uma ferramenta que você definiu anteriormente. Para obter mais informações, consulteUse uma ferramenta para concluir uma resposta do modelo do Amazon Bedrock.) Depois, você pode adicionar um campo cachePoint para armazenar a ferramenta em cache.

... toolConfig={ "tools": [ { "toolSpec": { "name": "top_song", "description": "Get the most popular song played on a radio station.", "inputSchema": { "json": { "type": "object", "properties": { "sign": { "type": "string", "description": "The call sign for the radio station for which you want the most popular song. Example calls signs are WZPZ and WKRP." } }, "required": [ "sign" ] } } } }, { "cachePoint": { "type": "default" } } ] } ...

A resposta do modelo da Converse API inclui três novos campos que são específicos para o cache de solicitações. Os valores cacheReadInputTokens e cacheWriteInputTokens informam quantos tokens foram lidos do cache e quantos tokens foram gravados no cache em resposta à sua solicitação anterior. Os cacheDetails valores informam o ttl usado para o número de tokens gravados no cache. Esses são os valores com base nos quais o Amazon Bedrock aplica cobranças, a uma taxa inferior ao custo de inferência de modelo completa.

Importante

Quando o cache de prompts está ativado, o inputTokens campo representa somente os tokens de entrada não armazenados em cache (tokens que não foram lidos ou gravados no cache). Para calcular o total de tokens de entrada enviados em uma solicitação, use a seguinte fórmula:

total input tokens = inputTokens + cacheReadInputTokens + cacheWriteInputTokens

O cache de prompts é ativado por padrão quando você chama a InvokeModelAPI. Você pode definir pontos de verificação de cache em qualquer ponto do corpo da solicitação, de modo semelhante ao exemplo anterior da API Converse.

Anthropic Claude

O exemplo a seguir mostra como estruturar o corpo da sua InvokeModel solicitação para o modelo Anthropic Claude 3.5 Sonnet v2. Observe que o formato e os campos exatos do corpo das InvokeModel solicitações podem variar dependendo do modelo escolhido. Para ver o formato e o conteúdo do corpo de solicitação e resposta para diferentes modelos, consulte Parâmetros de solicitação de inferência e campos de resposta para modelos de base.

Especifique o valor de ttl desejado conforme abaixo, quando o valor de ttl não for especificado, o comportamento padrão de 5 minutos de armazenamento em cache se aplica.

"cache_control" : { "type": "ephemeral", "ttl" : "5m | 1h" }
body={ "anthropic_version": "bedrock-2023-05-31", "system":"Reply concisely", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe the best way to learn programming." }, { "type": "text", "text": "Add additional context here for the prompt that meets the minimum token requirement for your chosen model.", "cache_control": { "type": "ephemeral" } } ] } ], "max_tokens": 2048, "temperature": 0.5, "top_p": 0.8, "stop_sequences": [ "stop" ], "top_k": 250 }
Amazon Nova

O exemplo a seguir mostra como estruturar o corpo da sua InvokeModel solicitação para o Amazon Nova modelo. Observe que o formato e os campos exatos do corpo das InvokeModel solicitações podem variar dependendo do modelo escolhido. Para ver o formato e o conteúdo do corpo de solicitação e resposta para diferentes modelos, consulte Parâmetros de solicitação de inferência e campos de resposta para modelos de base.

{ "system": [{ "text": "Reply Concisely" }], "messages": [{ "role": "user", "content": [{ "text": "Describe the best way to learn programming" }, { "text": "Add additional context here for the prompt that meets the minimum token requirement for your chosen model.", "cachePoint": { "type": "default" } }] }], "inferenceConfig": { "maxTokens": 300, "topP": 0.1, "topK": 20, "temperature": 0.3 } }

Para obter mais informações sobre o envio de uma InvokeModel solicitação, consulteEnvie uma única solicitação com InvokeModel.

Para modelos OpenAI no bedrock-mantle endpoint, você usa a API de respostas com parâmetros de cache instantâneos específicos para a geração do modelo. Para GPT-5.6 modelos, você controla o armazenamento em cache com pontos de interrupção explícitos. Para GPT-5.5 e antes, o armazenamento em cache é automático.

GPT-5.6 exemplo com pontos de interrupção de cache explícitos

O exemplo a seguir mostra uma solicitação da API de respostas para o openai.gpt-5.6-sol uso de pontos de interrupção de cache explícitos. A instrução do sistema é armazenada em cache e reutilizada nas solicitações subsequentes.

{ "model": "openai.gpt-5.6-sol", "prompt_cache_key": "my-app:system-prompt-v1", "prompt_cache_options": { "mode": "explicit" }, "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions. Follow these guidelines: 1. Always cite the relevant documentation section. 2. If unsure, escalate to a human agent. 3. Be concise but thorough...", "prompt_cache_breakpoint": { "mode": "explicit" } } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }

GPT-5.5 exemplo com cache automático

Para modelos anteriores GPT-5.5 e anteriores, o cache imediato é automático. Não são necessários pontos de interrupção ou chaves de cache. Apenas certifique-se de que seu prefixo de prompt exceda 1.024 tokens.

{ "model": "openai.gpt-5.5", "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions..." } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }

Resposta

A resposta inclui métricas de uso do cache no usage objeto:

{ "id": "resp_abc123", "output": [...], "usage": { "input_tokens": 2048, "output_tokens": 256, "total_tokens": 2304, "input_tokens_details": { "cached_tokens": 1920, "cache_write_tokens": 0 } } }

Nessa resposta, 1.920 tokens foram servidos a partir do cache e nenhum novo token foi gravado, indicando uma perda total do cache com a máxima economia de custos.

Em um playground de chat no console do Amazon Bedrock, é possível ativar a opção de armazenamento em cache de prompts para que o Amazon Bedrock crie automaticamente pontos de verificação de cache para você.

Siga as instruções em Gerar respostas no console usando playgrounds para começar a usar prompts em um playground do Amazon Bedrock. Para modelos compatíveis, o armazenamento em cache de prompts é ativado automaticamente no playground. No entanto, se não estiver, faça o seguinte para ativar o cache de prompts:

  1. Abra o menu Configurações.

  2. Ative o botão Armazenamento em cache de prompts.

  3. Execute seus prompts.

Depois que as entradas e respostas do modelo atingem, em conjunto, o número mínimo necessário de tokens para um ponto de verificação (que varia de acordo com o modelo), o Amazon Bedrock cria automaticamente o primeiro ponto de verificação de cache para você. Conforme o chat continua, a cada vez subsequente que o número mínimo de tokens é atingido, é criado um ponto de verificação, até o número máximo de pontos de verificação permitido para o modelo. É possível visualizar os pontos de verificação de cache a qualquer momento escolhendo Visualizar pontos de verificação de cache ao lado do botão Armazenamento em cache de prompts, conforme mostrado na captura de tela a seguir.

Ativação e desativação da interface de usuário para armazenamento em cache de prompts em um playground de texto do Amazon Bedrock.

É possível ver quantos tokens estão sendo lidos e gravados no cache em resposta a cada interação com o modelo visualizando o pop-up Métricas de cache ( The metrics icon shown in model responses when prompt caching is enabled. ) nas respostas do playground.

Caixa de métricas de armazenamento em cache que mostra o número de tokens lidos e gravados no cache.

Se você desativar o botão de armazenamento em cache de prompts no meio de uma conversa, poderá continuar conversando com o modelo.