View a markdown version of this page

Caching dei prompt per un’inferenza del modello più rapida - Amazon Bedrock

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Caching dei prompt per un’inferenza del modello più rapida

Il caching dei prompt è una funzionalità facoltativa che si può utilizzare con i modelli supportati in Amazon Bedrock per ridurre la latenza di risposta all’inferenza e i costi dei token di input. Amazon Bedrock supporta due tipi di prompt caching: Implicit Prompt Caching ed Explicit Prompt Caching. Il supporto per ogni tipo varia in base al modello e all'API.

Il caching dei prompt può essere utile quando sono presenti carichi di lavoro con contesti lunghi e ripetuti spesso riutilizzati per più query. Ad esempio, se si dispone di un chatbot in cui gli utenti possono caricare documenti e successivamente porre domande sui documenti stessi, il modello può richiedere molto tempo per elaborare il documento ogni volta che l’utente fornisce un input. Con il caching dei prompt, è possibile memorizzare nella cache il documento in modo che le future query contenenti il documento non debbano elaborarlo nuovamente.

Tipi di memorizzazione nella cache dei prompt

I due tipi differiscono nel modo in cui viene selezionato il contenuto riutilizzabile dei prompt:

Tipo Come funziona Configurazione della richiesta
Memorizzazione implicita dei prompt nella cache Amazon Bedrock e il modello tentano automaticamente di riutilizzare i prefissi di prompt idonei. Nella tua richiesta non sono richiesti controlli o punti di interruzione della cache.
Caching esplicito dei prompt È possibile identificare i prefissi dei prompt riutilizzabili aggiungendo controlli o punti di interruzione della cache specifici del modello. La richiesta deve includere i controlli della cache supportati dal modello e dall'API.

Prompt caching implicito

Il Prompt Caching implicito tenta automaticamente di riutilizzare i prefissi di prompt idonei senza richiedere controlli della cache nella richiesta. Mantieni il contenuto statico all'inizio del prompt e il contenuto dinamico alla fine per aumentare la probabilità di una corrispondenza esatta del prefisso.

La memorizzazione nella cache implicita dei prompt è la soluzione migliore. La ripetizione di un prompt identico non garantisce un accesso alla cache e le percentuali di accessi alla cache possono variare.

Memorizzazione esplicita dei prompt nella cache

L'Explicit Prompt Caching consente di identificare i prefissi dei prompt riutilizzabili utilizzando controlli di cache specifici del modello o checkpoint della cache. I checkpoint della cache sono indicatori che definiscono la sottosezione contigua del prompt da memorizzare nella cache. I prefissi dei prompt devono rimanere statici tra le richieste. Le modifiche al prefisso dei prompt nelle richieste successive comportano errori nella cache.

I checkpoint della cache hanno un numero minimo e massimo di token, a seconda del modello. Si può creare un punto di controllo della cache solo se il prefisso totale del prompt soddisfa il numero minimo di token. Ad esempio, Claude Opus 5 richiede almeno 512 token per checkpoint della cache, Claude Sonnet 5 richiede almeno 1.024 token per checkpoint della cache e Claude Haiku 4.5 richiede almeno 4.096 token per checkpoint della cache. Il valore minimo si applica cumulativamente all'intero prefisso del prompt prima di ogni checkpoint, incluso, ove applicabile, il contenuto nei campi, e. tools system messages Non è richiesto un numero minimo di token tra i checkpoint della cache. Per un modello con un minimo di 1.024 token, puoi definire checkpoint aggiuntivi distanti meno di 1.024 token, purché il prefisso totale del prompt prima di ogni checkpoint contenga almeno 1.024 token. Se aggiungete un checkpoint della cache prima che il prefisso totale del prompt soddisfi il numero minimo di token, l'inferenza ha comunque esito positivo, ma il prefisso non viene memorizzato nella cache.

La cache ha un Time To Live (TTL), che si azzera ad ogni accesso riuscito alla cache. Durante questo periodo, il contesto nella cache viene mantenuto. Se non si verificano accessi alla cache nell’intervallo TTL, la cache scade. Molti modelli supportano un TTL di 5 minuti. Controlla la scheda modello del tuo modello per vedere le condizioni TTL esatte.

L'Explicit Prompt Caching consente di controllare quale contenuto del prompt è idoneo per la memorizzazione nella cache. Non garantisce che una richiesta idonea comporti un accesso alla cache.

Fatturazione dei token memorizzati nella cache

Sia per Implicit Prompt Caching che per Explicit Prompt Caching, i token letti correttamente dalla cache vengono segnalati come token memorizzati nella cache e fatturati in base alla velocità di lettura della cache del modello. I token che non vengono letti dalla cache vengono fatturati in base alla tariffa standard dei token di input. A seconda del modello, i token scritti nella cache possono essere fatturati a una tariffa superiore alla tariffa standard dei token di input. Per ulteriori informazioni, consulta la pagina Prezzi di Amazon Bedrock.

Importante

Il supporto per il prompt caching non garantisce un accesso alla cache per qualsiasi richiesta. Controlla i campi di utilizzo della cache nella risposta del modello per determinare se i token sono stati letti o scritti nella cache.

Puoi utilizzare il prompt caching quando esegui l'inferenza in Amazon Bedrock con modelli supportati. La disponibilità di ogni tipo di caching dei prompt varia in base al modello e all'API. Il prompt caching è disponibile tramite le seguenti funzionalità di Amazon Bedrock:

Converse e le API ConverseStream

Puoi continuare una conversazione con un modello supportato. Per Explicit Prompt Caching, specifica i checkpoint della cache nei prompt.

InvokeModel InvokeModelWithResponseStreame API

È possibile inviare richieste con una sola richiesta ai modelli supportati. Per Explicit Prompt Caching, abilita il prompt caching e specifica i checkpoint della cache.

Prompt Caching con inferenza Cross-region

La memorizzazione nella cache rapida può essere utilizzata insieme all'inferenza interregionale. Cross-region l'inferenza seleziona automaticamente la AWS regione ottimale all'interno dell'area geografica per soddisfare la richiesta di inferenza, massimizzando così le risorse disponibili e la disponibilità del modello. Nei momenti di maggiore richiesta, tali ottimizzazioni possono comportare un aumento delle scritture nella cache.

Gestione prompt di Amazon Bedrock

Quando si crea o si modifica un prompt, è possibile scegliere di abilitare il caching dei prompt. In base al modello, è possibile memorizzare nella cache i prompt e le istruzioni di sistema e i messaggi (di utente e assistente). È inoltre possibile scegliere di disattivare il caching dei prompt.

Nota

La memorizzazione rapida nella cache è supportata solo per gli endpoint di inferenza su richiesta. Non è supportato con l'API di inferenza batch.

Per i modelli che supportano Explicit Prompt Caching, le API forniscono un controllo granulare sulla cache dei prompt. È possibile impostare singoli checkpoint della cache all'interno dei prompt e aggiungere checkpoint fino al massimo consentito per il modello. Per ulteriori informazioni, consulta Modelli supportati, regioni e limiti espliciti di memorizzazione nella cache.

Modelli supportati, regioni e limiti espliciti di memorizzazione nella cache

Il supporto per il caching rapido varia in base al modello e all'API. Le schede modello identificano se un modello supporta Implicit Prompt Caching, Explicit Prompt Caching o entrambi. Il prompt caching è disponibile in tutte le AWS regioni in cui sono disponibili i modelli supportati. Per verificare la disponibilità dei modelli per regione, consultaDisponibilità regionale per modelli.

La tabella seguente elenca i modelli che supportano l'Explicit Prompt Caching, insieme al numero minimo di token, al numero massimo di checkpoint della cache e ai campi che consentono i checkpoint della cache.

Per vedere quali tipi di prompt caching sono supportati da un modello, consultate la sezione Modelli a colpo d'occhio, quindi scegliete il modello che vi interessa.

Nome modello ID modello Tipi di rilascio Numero minimo di token per punto di controllo della cache Numero massimo di punti di controllo della cache per richiesta TTL supportato Campi che accettano punti di controllo per il caching dei prompt

Claude Fable 5.1

anthropic.claude-fable-5-1

Disponibilità generale

512

4

5 minuti, 1 ora

`system`, `messages` e `tools`

Claude Mythos 5.1

antropico.claude-mythos-5-1

Recintato

512

4

5 minuti, 1 ora

`system`, `messages` e `tools`

Claude Fable 5

antropico.claude-fable-5

Disponibilità generale

512

4

5 minuti, 1 ora

`system`, `messages` e `tools`

Claude Mythos 5

antropico.claude-mythos-5

Recintato

512

4

5 minuti, 1 ora

`system`, `messages` e `tools`

Claude Mythos Preview

anthropic.claude-mythos-preview

Recintato

4,096

4

5 minuti, 1 ora

`system`, `messages` e `tools`

Claude Opus 5

antropico.claude-opus-5

Disponibilità generale

512

4

5 minuti, 1 ora

`system`, `messages` e `tools`

Claude Opus 4.8

antropico.claude-opus-4-8

Disponibilità generale

1,024

4

5 minuti, 1 ora

`system`, `messages` e `tools`

Claude Opus 4.7

antropico.claude-opus-4-7

Disponibilità generale

4,096

4

5 minuti, 1 ora

`system`, `messages` e `tools`

Claude Opus 4.6

antropico.claude-opus-4-6-v1

Disponibilità generale

4,096

4

5 minuti, 1 ora

`system`, `messages` e `tools`

Claude Opus 4.5

antropico.claude-opus-4-5-20251101-v 1:0

Disponibilità generale

4,096

4

5 minuti, 1 ora

`system`, `messages` e `tools`

Claude Sonnet 5

antropico.claude-sonnet-5

Disponibilità generale

1,024

4

5 minuti, 1 ora

`system`, `messages` e `tools`

Claude Sonnet 4.6

antropico.claude-sonnet-4-6

Disponibilità generale

1,024

4

5 minuti, 1 ora

`system`, `messages` e `tools`

Claude Sonnet 4.5

anthropic.claude-sonnet-4-5-20250929-v1:0

Disponibilità generale

1,024

4

5 minuti, 1 ora

`system`, `messages` e `tools`

Claude 3.7 Sonnet

anthropic.claude-3-7-sonnet-20250219-v1:0

Disponibilità generale

1,024

4

5 minuti

`system`, `messages` e `tools`

Claude 3.5 Sonnet v2

anthropic.claude-3-5-sonnet-20241022-v2:0

Anteprima

1,024

4

5 minuti

`system`, `messages` e `tools`

Claude Haiku 4.5

anthropic.claude-haiku-4-5-20251001-v1:0

Disponibilità generale

4,096

4

5 minuti, 1 ora

`system`, `messages` e `tools`

GPT-5.6 Sol

openai.gpt-5.6-sol

Disponibilità generale

1,024

4

30 minuti

prompt_cache_breakpointattivo, e blocchi (API di input_text rispostainput_image) input_file

GPT-5.6 Terra

openai.gpt-5.6-terra

Disponibilità generale

1,024

4

30 minuti

prompt_cache_breakpointattivo, e blocchi (API di input_text rispostainput_image) input_file

GPT-5.6 Luna

openai.gpt-5.6-luna

Disponibilità generale

1,024

4

30 minuti

prompt_cache_breakpointattivo, e blocchi (API di input_text rispostainput_image) input_file

Per utilizzare l'opzione TTL di 1 ora con i modelli supportati (Claude Fable 5,Claude Opus 5,Claude Opus 4.8,Claude Opus 4.7,Claude Opus 4.6,Claude Opus 4.5,Claude Sonnet 5,Claude Sonnet 4.6, eClaude Haiku 4.5)Claude Sonnet 4.5, specifica il ttl campo nel checkpoint della cache. Nell'API Converse, aggiungi "ttl": "1h" al tuo cachePoint oggetto. Nell' InvokeModel API per i modelli Claude, aggiungili "ttl": "1h" al tuo cache_control oggetto. Se non viene fornito alcun ttl valore, si applica il comportamento di memorizzazione nella cache predefinito di 5 minuti. Il TTL di 1 ora è utile per sessioni più lunghe o scenari di elaborazione in batch in cui si desidera mantenere la cache per periodi prolungati.

Amazon Novaoffre il Prompt Caching implicito per tutti i prompt di testo, inclusi i messaggi. User System Questo meccanismo può offrire vantaggi in termini di latenza quando i prompt iniziano con parti ripetitive, senza una configurazione esplicita. Amazon Novai modelli che supportano l'Explicit Prompt Caching nelle rispettive schede modello consentono inoltre di specificare i checkpoint della cache per un maggiore controllo sull'idoneità della cache.

Prompt caching per i modelli di Anthropic

I modelli Anthropic che supportano il prompt caching su Amazon Bedrock supportano sia il Prompt Caching implicito che il Prompt Caching esplicito. L'implicit Prompt Caching tenta automaticamente di riutilizzare i prefissi di prompt idonei senza richiedere controlli della cache nella richiesta.

Per Explicit Prompt Caching, Amazon Bedrock offre un approccio semplificato alla gestione della cache che riduce la complessità del posizionamento manuale dei checkpoint della cache. Anziché richiedere di specificare le posizioni esatte dei punti di controllo della cache, è possibile utilizzare la gestione automatica della cache con un singolo punto di interruzione al termine del contenuto statico.

Quando si abilita la gestione semplificata della cache, il sistema verifica automaticamente gli accessi alla cache in base ai limiti dei blocchi di contenuto precedenti, analizzando fino a circa 20 blocchi di contenuto dal punto di interruzione specificato. Ciò consente al modello di trovare il prefisso corrispondente più lungo nella cache senza la necessità di prevedere le posizioni ottimali dei punti di controllo. A tale scopo, posizionare un singolo punto di controllo della cache al termine del contenuto statico, prima di qualsiasi contenuto dinamico o variabile. Il sistema trova automaticamente la migliore corrispondenza nella cache.

Per un controllo più granulare, è comunque possibile utilizzare più punti di controllo della cache (fino a 4 per i modelli Claude) per specificare i limiti esatti della cache. È necessario utilizzare più punti di controllo della se si memorizzano nella cache sezioni che cambiano con frequenze diverse o se si desidera un maggiore controllo su ciò che viene esattamente memorizzato nella cache.

Importante

Il controllo automatico del prefisso analizza solo circa 20 blocchi di contenuto dal punto di controllo della cache. Se il contenuto statico si estende oltre questo intervallo, prendere in considerazione l’utilizzo di più punti di controllo della cache o la nuova creazione di del prompt per inserire i contenuti riutilizzati più frequentemente all’interno dell’intervallo.

Le migliori pratiche per l'utilizzo della gestione della cache in Anthropic Models

Se hai prompt che vengono utilizzati a cadenza regolare (ad esempio, prompt di sistema che vengono utilizzati più frequentemente di ogni 5 minuti), continua a utilizzare la cache di 5 minuti, poiché continuerà ad essere aggiornata senza costi aggiuntivi.

La cache da 1 ora viene utilizzata al meglio nei seguenti scenari:

  • Quando sono presenti prompt che probabilmente vengono utilizzati meno frequentemente di 5 minuti, ma più frequentemente di ogni ora. Ad esempio, quando un agente secondario impiega più di 5 minuti o quando memorizza una lunga conversazione in chat con un utente e in genere ci si aspetta che l'utente non risponda nei prossimi 5 minuti.

  • Quando la latenza è importante e le richieste di follow-up possono essere inviate oltre i 5 minuti.

  • Se desideri migliorare il tuo limite di velocità, utilizza il limite di velocità, poiché gli accessi alla cache non vengono detratti dal limite di velocità.

Puoi utilizzare i controlli della cache di 1 ora e di 5 minuti nella stessa richiesta, ma con un vincolo importante: le voci della cache con un TTL più lungo devono apparire prima dei TTL più brevi (ad esempio, una voce della cache di 1 ora deve apparire prima di qualsiasi voce della cache di 5 minuti).

Prompt caching per i modelli di OpenAI

I modelli OpenAI su Amazon Bedrock supportano il Prompt Caching implicito tramite l'API Responses. GPT-5.6 i modelli supportano anche l'Explicit Prompt Caching. L'API Responses è disponibile sia sugli endpoint che sugli endpointbedrock-runtime. bedrock-mantle

GPT-5.6 modelli

GPT-5.6 Sol (openai.gpt-5.6-sol), Terra (openai.gpt-5.6-terra) e Luna (openai.gpt-5.6-luna) supportano sia l'Implicit Prompt Caching che l'Explicit Prompt Caching. I punti di interruzione espliciti della cache dei prompt consentono di controllare con precisione quali parti del prompt sono idonee per la memorizzazione nella cache. Ciò è particolarmente utile per i flussi di lavoro agentici in cui le istruzioni di sistema, le definizioni degli strumenti e i file di riferimento si ripetono in molte chiamate mentre solo gli ultimi input vengono modificati.

Caratteristiche principali:

  • Punti di interruzione espliciti della cache: contrassegna la fine esatta di un prefisso di prompt riutilizzabile aggiungendolo "prompt_cache_breakpoint": {"mode": "explicit"} a un blocco di contenuto supportato.

  • Modalità cache: impostate per controllare il comportamento dei punti prompt_cache_options.mode di interruzione:

    • implicit(impostazione predefinita): inserisce un punto di interruzione automatico nel messaggio più recente e utilizza anche eventuali punti di interruzione espliciti forniti.

    • explicit— Disabilita il punto di interruzione automatico. Per le letture e le scritture della cache vengono utilizzati solo punti di interruzione espliciti. Se non esistono punti di interruzione espliciti, la richiesta non utilizza il prompt caching né comporta costi di scrittura nella cache.

  • Lunghezza minima del prefisso: 1.024 token per punto di interruzione.

  • TTL minimo di 30 minuti: i prefissi memorizzati nella cache rimangono disponibili per il riutilizzo per almeno 30 minuti, un tempo sufficiente a coprire la raffica di chiamate generata da una singola esecuzione di un agente. Il TTL è impostato tramite e per impostazione predefinita è. prompt_cache_options.ttl 30m

  • Fatturazione in scrittura nella cache: i token scritti nella cache vengono fatturati a 1,25 volte la velocità del token di input non memorizzato nella cache. Le letture della cache vengono fatturate con uno sconto del 90% rispetto ai token di input non memorizzati nella cache.

  • I token memorizzati nella cache non vengono conteggiati ai fini dei limiti di velocità: i token di input memorizzati nella cache letti tramite prompt caching non vengono conteggiati ai fini della quota di token di input al minuto.

Comprensione della risposta

L'oggetto di utilizzo nella risposta include due campi specifici della cache:

  • cached_tokens— Numero di token di input letti dalla cache (fatturato in base al tasso di sconto per la lettura nella cache).

  • cache_write_tokens— Numero di token di input scritti nella cache (fatturato a 1,25 volte la tariffa dei token di input non memorizzati nella cache).

Quando cached_tokens è maggiore di zero e cache_write_tokens pari a zero, la richiesta corrisponde completamente a una voce della cache esistente: non si sono verificate nuove scritture e si è ottenuto il massimo risparmio sui costi.

Procedure consigliate per l'utilizzo della gestione della cache nei modelli GPT 5.6

  • Posiziona i punti di interruzione dopo i contenuti stabili: le istruzioni di sistema, le definizioni degli strumenti e i documenti di riferimento che non cambiano tra una chiamata e l'altra dovrebbero apparire prima del punto di interruzione. Il contenuto dopo il punto di interruzione può cambiare liberamente senza invalidare il prefisso memorizzato nella cache.

  • Usa la explicit modalità per i loop agentici: quando vuoi il pieno controllo su ciò che viene memorizzato nella cache ed evitare che i breakpoint automatici consumino gli slot di scrittura.

  • Monitoraggio cache_write_tokens: confronta il volume di scrittura della cache con le letture successive della cache per comprendere l'impatto netto sui costi e regolare di conseguenza il posizionamento dei punti di interruzione.

GPT-5.5 e modelli precedenti

Per i modelli OpenAI precedenti GPT-5.6 (come openai.gpt-5.5 eopenai.gpt-5.4), l'Implicit Prompt Caching è automatico. Non è necessario aggiungere parametri speciali. Il sistema tenta automaticamente di memorizzare nella cache i prefissi di prompt idonei pari o superiori a 1.024 token. Le scritture nella cache non comportano costi aggiuntivi su questi modelli.

Caratteristiche principali:

  • Prompt Caching implicito: non sono necessarie modifiche al codice. Il sistema tenta di memorizzare automaticamente i prefissi nella cache in base alla corrispondenza esatta dei prefissi.

  • Lunghezza minima del prefisso: 1.024 token.

  • Nessun costo di scrittura nella cache: solo le letture della cache vengono fatturate a una tariffa scontata.

  • I token memorizzati nella cache non vengono conteggiati ai fini dei limiti di velocità: i token di input memorizzati nella cache letti tramite prompt caching non vengono conteggiati ai fini della quota di token di input al minuto.

Procedure GPT-5.5 consigliate per l'utilizzo della gestione della cache nei modelli precedenti e precedenti

  • Inserite il contenuto statico (prompt di sistema, definizioni degli strumenti, documenti di riferimento) all'inizio del prompt.

  • Inserisci il contenuto variabile (input specifico dell'utente) alla fine.

  • Mantieni un flusso costante di richieste con prefissi identici per ridurre al minimo l'eliminazione della cache.

Nozioni di base

Le sezioni seguenti mostrano una breve panoramica su come utilizzare la funzionalità di caching dei prompt per ogni metodo di interazione con i modelli tramite Amazon Bedrock.

L’API Converse offre opzioni avanzate e flessibili per implementare il caching dei prompt conversazioni a più turni. Per ulteriori informazioni sui requisiti dei prompt per ogni modello, consulta la sezione Modelli supportati, regioni e limiti espliciti di memorizzazione nella cache precedente.

Richiesta di esempio

Gli esempi seguenti mostrano un punto di controllo della cache impostato nel campo messages, system o tools di una richiesta all’API Converse. È possibile posizionare punti di controllo in una qualsiasi di queste posizioni per una determinata richiesta. Ad esempio, se si invia una richiesta al modello Claude 3.5 Sonnet v2, è possibile inserire due punti di controllo della cache inmessages, uno in system e uno in tools. Per ulteriori informazioni e per esempi di strutturazione e invio di richieste API Converse, consulta Inferenza utilizzando l'API Converse.

Importante

I checkpoint della cache vengono elaborati in questo ordine: → →. tools system messages La dimensione minima della cache viene valutata rispetto ai token cumulativi di tutte e tre le sezioni combinate, non di ciascuna sezione singolarmente. Poiché le sezioni sono concatenate, la modifica del contenuto in una sezione precedente invalida la cache per le sezioni successive (ad esempio, la modifica tools invalida le cache and). system messages Per ottimizzare le percentuali di accesso alla cache, posiziona il contenuto stabile (tools,system) prima del contenuto variabile () e posiziona i messages checkpoint della cache dopo il contenuto stabile.

Specificate il valore ttl desiderato come segue, se il valore ttl non è specificato, si applica il comportamento predefinito di 5 minuti di caching.

"cachePoint" : { "type": "default", "ttl" : "5m | 1h" }
messages checkpoints

In questo esempio, il primo campo image fornisce un’immagine al modello e il secondo campo text chiede al modello di analizzare l’immagine. Fino a quando il numero di token che precedono cachePoint nell’oggetto content soddisfa il numero di token minimo per il modello, viene creato un punto di controllo della cache.

... "messages": [ { "role": "user", "content": [ { "image": { "bytes": "asfb14tscve..." } }, { "text": "What's in this image?" }, { "cachePoint": { "type": "default" } } ] } ] ...
system checkpoints

In questo esempio, il prompt di sistema viene fornito nel campo text. Si può anche aggiungere un campo cachePoint per memorizzare nella cache il prompt di sistema.

... "system": [ { "text": "You are an app that creates play lists for a radio station that plays rock and pop music. Only return song names and the artist. " }, { "cachePoint": { "type": "default" } } ], ...
tools checkpoints

In questo esempio, la definizione dello strumento viene fornita nel campo toolSpec. (In alternativa, puoi chiamare uno strumento che hai definito in precedenza. Per ulteriori informazioni, consultateUtilizzo di uno strumento per completare una risposta al modello Amazon Bedrock.) Successivamente, è possibile aggiungere un campo cachePoint per memorizzare lo strumento nella cache.

... toolConfig={ "tools": [ { "toolSpec": { "name": "top_song", "description": "Get the most popular song played on a radio station.", "inputSchema": { "json": { "type": "object", "properties": { "sign": { "type": "string", "description": "The call sign for the radio station for which you want the most popular song. Example calls signs are WZPZ and WKRP." } }, "required": [ "sign" ] } } } }, { "cachePoint": { "type": "default" } } ] } ...

La risposta del modello dell'ConverseAPI include tre nuovi campi specifici per la memorizzazione nella cache dei prompt. I valori cacheReadInputTokens e cacheWriteInputTokens indicano quanti token sono stati letti e scritti dalla e nella cache a causa della richiesta precedente. I cacheDetails valori indicano il ttl utilizzato per il numero di token scritti nella cache. Si tratta dei valori che vengono addebitati da Amazon Bedrock, a una tariffa inferiore al costo dell’inferenza del modello completa.

Importante

Quando il prompt caching è abilitato, il inputTokens campo rappresenta solo i token di input non memorizzati nella cache (token che non sono stati letti o scritti nella cache). Per calcolare il totale dei token di input inviati in una richiesta, usa la seguente formula:

total input tokens = inputTokens + cacheReadInputTokens + cacheWriteInputTokens

Il prompt caching è abilitato per impostazione predefinita quando si chiama l'InvokeModelAPI. È possibile impostare i punti di controllo della cache in qualsiasi punto del corpo della richiesta, in modo analogo all’esempio precedente per l’API Converse.

Anthropic Claude

L'esempio seguente mostra come strutturare il corpo della InvokeModel richiesta per il modello Anthropic Claude 3.5 Sonnet v2. Tieni presente che il formato e i campi esatti del corpo per InvokeModel le richieste possono variare a seconda del modello scelto. Per visualizzare il formato e il contenuto dei corpi di richiesta e risposta per modelli diversi, consulta Parametri di richiesta di inferenza e campi di risposta per i modelli di fondazione.

Specificate il valore ttl desiderato come segue, se il valore ttl non è specificato, si applica il comportamento predefinito di 5 minuti di caching.

"cache_control" : { "type": "ephemeral", "ttl" : "5m | 1h" }
body={ "anthropic_version": "bedrock-2023-05-31", "system":"Reply concisely", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe the best way to learn programming." }, { "type": "text", "text": "Add additional context here for the prompt that meets the minimum token requirement for your chosen model.", "cache_control": { "type": "ephemeral" } } ] } ], "max_tokens": 2048, "temperature": 0.5, "top_p": 0.8, "stop_sequences": [ "stop" ], "top_k": 250 }
Amazon Nova

L'esempio seguente mostra come strutturare il corpo della InvokeModel richiesta per il modello. Amazon Nova Tieni presente che il formato e i campi esatti del corpo per InvokeModel le richieste possono variare a seconda del modello scelto. Per visualizzare il formato e il contenuto dei corpi di richiesta e risposta per modelli diversi, consulta Parametri di richiesta di inferenza e campi di risposta per i modelli di fondazione.

{ "system": [{ "text": "Reply Concisely" }], "messages": [{ "role": "user", "content": [{ "text": "Describe the best way to learn programming" }, { "text": "Add additional context here for the prompt that meets the minimum token requirement for your chosen model.", "cachePoint": { "type": "default" } }] }], "inferenceConfig": { "maxTokens": 300, "topP": 0.1, "topK": 20, "temperature": 0.3 } }

Per ulteriori informazioni sull'invio di una InvokeModel richiesta, vedereInvia una singola richiesta con InvokeModel.

Per i modelli OpenAI, utilizzi l'API Responses, disponibile sia sugli endpoint che sugli bedrock-mantle endpoint, con parametri di memorizzazione nella cache prompt specifici per la generazione del modello. bedrock-runtime Per i GPT-5.6 modelli, controlli la memorizzazione nella cache con punti di interruzione espliciti. Per GPT-5.5 e versioni precedenti, la memorizzazione nella cache è automatica.

GPT-5.6 esempio con punti di interruzione espliciti della cache

L'esempio seguente mostra una richiesta dell'API Responses per l'openai.gpt-5.6-solutilizzo di punti di interruzione espliciti della cache. Le istruzioni di sistema vengono memorizzate nella cache e riutilizzate nelle richieste successive.

{ "model": "openai.gpt-5.6-sol", "prompt_cache_key": "my-app:system-prompt-v1", "prompt_cache_options": { "mode": "explicit" }, "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions. Follow these guidelines: 1. Always cite the relevant documentation section. 2. If unsure, escalate to a human agent. 3. Be concise but thorough...", "prompt_cache_breakpoint": { "mode": "explicit" } } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }

GPT-5.5 esempio con memorizzazione automatica nella cache

Per GPT-5.5 i modelli precedenti, la memorizzazione nella cache dei prompt è automatica. Non sono necessari punti di interruzione o chiavi di cache: assicurati solo che il prefisso del prompt superi i 1.024 token.

{ "model": "openai.gpt-5.5", "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions..." } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }

Risposta

La risposta include le metriche sull'utilizzo della cache nell'oggetto: usage

{ "id": "resp_abc123", "output": [...], "usage": { "input_tokens": 2048, "output_tokens": 256, "total_tokens": 2304, "input_tokens_details": { "cached_tokens": 1920, "cache_write_tokens": 0 } } }

In questa risposta, 1.920 token sono stati serviti dalla cache e non sono stati scritti nuovi token, il che indica un accesso completo alla cache con il massimo risparmio sui costi.

In un playground di chat nella console Amazon Bedrock, è possibile attivare l’opzione di caching dei prompt in modo che Amazon Bedrock crei automaticamente i punti di controllo della cache.

Per iniziare a utilizzare prompt in un playground Amazon Bedrock, segui le istruzioni presenti in Generare risposte nella console utilizzando i playground. Per i modelli supportati, il caching dei prompt viene attivato automaticamente nel playground. Tuttavia, in caso contrario, procedi come segue per attivare il prompt caching:

  1. Apri il menu Configurazioni.

  2. Attiva l’interruttore Caching dei prompt.

  3. Esegui i prompt.

Dopo che le risposte combinate di input e del modello hanno raggiunto il numero minimo richiesto di token per un punto di controllo (che varia in base al modello), Amazon Bedrock crea automaticamente il primo punto di controllo della cache. Mentre continui a chattare, Amazon Bedrock può creare checkpoint aggiuntivi, fino al numero massimo di checkpoint consentito per il modello. Il valore minimo viene valutato in base al numero cumulativo di token prima di ogni checkpoint, non al numero di token aggiunti dal checkpoint precedente. Per visualizzare i punti di controllo della cache, in qualsiasi momento seleziona Visualizza i punti di controllo della cache accanto all’interruttore Caching dei prompt, come mostrato nella schermata seguente.

Interruttore dell’interfaccia utente per il caching dei prompt in un playground di testo in Amazon Bedrock.

Per visualizzare il numero di token letti e scritti dalla e nella cache a causa di ogni interazione con il modello, apri la finestra popup Parametri di caching ( The metrics icon shown in model responses when prompt caching is enabled. ) nelle risposte del playground.

Casella dei parametri di caching che mostra il numero di token letti e scritti dalla e nella cache.

Se disattivi l’interruttore di caching dei prompt durante una conversazione, puoi continuare a chattare con il modello.