Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Prompt-Caching für schnellere Modellinferenz
Prompt-Caching ist ein optionales Feature, das Sie mit unterstützten Modellen in Amazon Bedrock verwenden können, um die Latenz bei Inferenzantworten und die Kosten für Eingabe-Token zu reduzieren. Amazon Bedrock unterstützt zwei Arten von Prompt-Caching: Implizites Prompt-Caching und Explizites Prompt-Caching. Die Unterstützung für jeden Typ variiert je nach Modell und API.
Prompt-Caching kann hilfreich sein, wenn Sie Workloads mit langen und sich wiederholenden Kontexten haben, die häufig für mehrere Abfragen wiederverwendet werden. Wenn Sie beispielsweise über einen Chatbot verfügen, bei dem Benutzer Dokumente hochladen und Fragen zu ihnen stellen können, kann es für das Modell zeitaufwändig sein, das Dokument jedes Mal zu verarbeiten, wenn der Benutzer eine Eingabe vornimmt. Mit Prompt-Caching können Sie das Dokument zwischenspeichern, sodass künftige Abfragen, die das Dokument enthalten, es nicht erneut verarbeiten müssen.
Arten des Prompt-Caching
Die beiden Typen unterscheiden sich darin, wie wiederverwendbarer Inhalt der Eingabeaufforderung ausgewählt wird:
| Typ | Funktionsweise | Konfiguration anfordern |
|---|---|---|
| Implizites Zwischenspeichern von Aufforderungen | Amazon Bedrock und das Modell versuchen automatisch, berechtigte Prompt-Präfixe wiederzuverwenden. | In Ihrer Anfrage sind keine Cache-Kontrollen oder Breakpoints erforderlich. |
| Explizites Zwischenspeichern von Aufforderungen | Sie identifizieren wiederverwendbare Prompt-Präfixe, indem Sie modellspezifische Cache-Steuerelemente oder Breakpoints hinzufügen. | Ihre Anfrage muss die Cache-Steuerelemente enthalten, die vom Modell und der API unterstützt werden. |
Implizites Zwischenspeichern von Aufforderungen
Implizites Prompt-Caching versucht automatisch, geeignete Prompt-Präfixe wiederzuverwenden, ohne dass Cache-Kontrollen in Ihrer Anfrage erforderlich sind. Bewahren Sie statische Inhalte am Anfang Ihrer Aufforderung und dynamische Inhalte am Ende auf, um die Wahrscheinlichkeit einer exakten Übereinstimmung mit den Präfixen zu erhöhen.
Implizites Prompt-Caching ist die beste Methode. Die Wiederholung einer identischen Eingabeaufforderung garantiert keinen Cachetreffer, und die Cache-Trefferraten können variieren.
Explizites Zwischenspeichern von Aufforderungen
Explizites Prompt-Caching ermöglicht es Ihnen, wiederverwendbare Prompt-Präfixe mithilfe modellspezifischer Cache-Steuerelemente oder Cache-Checkpoints zu identifizieren. Cache-Checkpoints sind Markierungen, die den zusammenhängenden Unterabschnitt Ihrer Aufforderung definieren, den Sie zwischenspeichern möchten. Die Präfixe der Eingabeaufforderung sollten zwischen den Anfragen statisch bleiben. Änderungen an einem Prompt-Präfix in nachfolgenden Anfragen führen zu Cache-Fehlern.
Cache-Checkpoints haben je nach Modell eine Mindest- und Höchstanzahl an Tokens. Sie können nur dann einen Cache-Checkpoint erstellen, wenn Ihr gesamtes Prompt-Präfix der Mindestanzahl an Token entspricht. Claude Opus 5Erfordert beispielsweise mindestens 512 Token pro Cache-Checkpoint, Claude Sonnet 5 mindestens 1.024 Token pro Cache-Checkpoint und Claude Haiku 4.5 mindestens 4.096 Token pro Cache-Checkpoint. Das Minimum gilt kumulativ für das gesamte Prompt-Präfix vor jedem Checkpoint, einschließlich, falls zutreffend, des Inhalts in den Feldern, und. tools system messages Zwischen den Cache-Checkpoints ist keine Mindestanzahl an Tokens erforderlich. Für ein Modell mit einem Minimum von 1.024 Token können Sie zusätzliche Checkpoints definieren, die weniger als 1.024 Token voneinander entfernt sind, solange das gesamte Prompt-Präfix vor jedem Checkpoint mindestens 1.024 Token enthält. Wenn Sie einen Cache-Checkpoint hinzufügen, bevor das gesamte Prompt-Präfix die Mindestanzahl an Token erreicht, ist Ihre Inferenz trotzdem erfolgreich, aber Ihr Präfix wird nicht zwischengespeichert.
Der Cache hat eine Gültigkeitsdauer (TTL), die bei jedem erfolgreichen Cache-Treffer zurückgesetzt wird. Während dieses Zeitraums bleibt der Kontext im Cache erhalten. Wenn innerhalb des TTL-Fensters keine Cache-Treffer auftreten, läuft Ihr Cache ab. Viele Modelle unterstützen eine TTL von 5 Minuten. Die genauen TTL-Bedingungen finden Sie auf der Modellkarte Ihres Modells.
Explizites Prompt-Caching ermöglicht die Kontrolle darüber, welcher Inhalt der Eingabeaufforderung zwischengespeichert werden kann. Es garantiert nicht, dass eine berechtigte Anfrage zu einem Cache-Treffer führt.
Abrechnung für zwischengespeicherte Token
Sowohl beim impliziten Prompt-Caching als auch beim Expliziten Prompt-Caching werden erfolgreich aus dem Cache gelesene Token als zwischengespeicherte Token gemeldet und mit der Cache-Leserate des Modells in Rechnung gestellt. Token, die nicht aus dem Cache gelesen werden, werden mit der Standardrate für Eingabe-Tokens in Rechnung gestellt. Je nach Modell können in den Cache geschriebene Token mit einer Rate in Rechnung gestellt werden, die über der Standardgebühr für Eingabe-Tokens liegt. Weitere Informationen finden Sie auf der Amazon-Bedrock-Preisseite
Wichtig
Die Unterstützung von Prompt-Caching garantiert nicht, dass bei einer Anfrage ein Cache-Treffer erzielt wird. Überprüfen Sie die Felder für die Cache-Nutzung in der Modellantwort, um festzustellen, ob Token aus dem Cache gelesen oder in den Cache geschrieben wurden.
Sie können das Prompt-Caching verwenden, wenn Sie Inferenz in Amazon Bedrock mit unterstützten Modellen ausführen. Die Verfügbarkeit der einzelnen Prompt-Caching-Typen variiert je nach Modell und API. Prompt-Caching ist über die folgenden Amazon Bedrock-Funktionen verfügbar:
- Converse und APIs ConverseStream
-
Sie können eine Konversation mit einem unterstützten Modell fortsetzen. Geben Sie für das Zwischenspeichern von expliziten Eingabeaufforderungen Cache-Checkpoints in Ihren Prompts an.
- InvokeModel InvokeModelWithResponseStreamund APIs
-
Sie können Anfragen mit nur einer Aufforderung an unterstützte Modelle senden. Für Explizites Prompt-Caching aktivieren Sie das Prompt-Caching und geben Sie Ihre Cache-Checkpoints an.
- Prompt-Caching mit Inferenz Cross-region
-
Prompt-Caching kann in Verbindung mit regionsübergreifender Inferenz verwendet werden. Cross-region Inference wählt automatisch die optimale AWS Region innerhalb Ihrer Region aus, um Ihre Inferenzanfrage zu bearbeiten, wodurch die verfügbaren Ressourcen und die Modellverfügbarkeit maximiert werden. In Zeiten hoher Nachfrage können diese Optimierungen zu erhöhten Cache-Schreibvorgängen führen.
- Amazon Bedrock Prompt Management
-
Wenn Sie einen Prompt erstellen oder ändern, können Sie wählen, ob Prompt-Caching aktiviert werden soll. Je nach Modell können Sie System-Prompts, Systemanweisungen und Nachrichten (Benutzer- und Assistentnachrichten) zwischenspeichern. Sie können Prompt-Caching auch deaktivieren.
Anmerkung
Prompt-Caching wird nur für On-Demand-Inferenzendpunkte unterstützt. Es wird von der Batch-Inferenz-API nicht unterstützt.
Bei Modellen, die Explizites Prompt-Caching unterstützen, bieten die APIs eine granulare Steuerung des Prompt-Caches. Sie können einzelne Cache-Checkpoints in Ihren Prompts festlegen und Checkpoints bis zu dem für das Modell zulässigen Höchstwert hinzufügen. Weitere Informationen finden Sie unter Unterstützte Modelle, Regionen und explizite Caching-Grenzwerte.
Unterstützte Modelle, Regionen und explizite Caching-Grenzwerte
Die Unterstützung von Prompt-Caching variiert je nach Modell und API. Modellkarten geben an, ob ein Modell implizites Prompt-Caching, Explizites Prompt-Caching oder beides unterstützt. Prompt-Caching ist in allen AWS Regionen verfügbar, in denen die unterstützten Modelle verfügbar sind. Informationen zur Überprüfung der Modellverfügbarkeit nach Regionen finden Sie unterRegionale Verfügbarkeit nach Modellen.
In der folgenden Tabelle sind Modelle aufgeführt, die explizites Prompt-Caching unterstützen, zusammen mit ihren Mindestwerten für Token, der maximalen Anzahl von Cache-Checkpoints und den Feldern, die Cache-Checkpoints zulassen.
Informationen dazu, welche Arten von Prompt-Caching ein Modell unterstützt, finden Sie unter Modelle auf einen Blick, und wählen Sie dann das Modell aus, an dem Sie interessiert sind.
| Modellname | Modell-ID | Art der Veröffentlichung | Mindestanzahl von Token pro Cache-Checkpoint | Maximale Anzahl von Cache-Checkpoints pro Anforderung | Unterstütztes TTL | Felder, die Prompt-Cache-Checkpoints akzeptieren |
|---|---|---|---|---|---|---|
Claude Fable 5.1 |
anthropic.claude-fable-5-1 |
Allgemein verfügbar |
512 |
4 |
5 Minuten, 1 Stunde |
„System“, „Nachrichten“ und „Tools“ |
Claude Mythos 5.1 |
anthropisch. Claude-Mythos-5-1 |
Geschützt |
512 |
4 |
5 Minuten, 1 Stunde |
„System“, „Nachrichten“ und „Tools“ |
Claude Fable 5 |
anthropisch. Claude-Fable-5 |
Allgemein verfügbar |
512 |
4 |
5 Minuten, 1 Stunde |
„System“, „Nachrichten“ und „Tools“ |
Claude Mythos 5 |
anthropisch. Claude-Mythos-5 |
Geschützt |
512 |
4 |
5 Minuten, 1 Stunde |
„System“, „Nachrichten“ und „Tools“ |
Claude Mythos Preview |
anthropic.claude-mythos-vorschau |
Geschützt |
4.096 |
4 |
5 Minuten, 1 Stunde |
„System“, „Nachrichten“ und „Tools“ |
Claude Opus 5 |
anthropisch. Claude-Opus-5 |
Allgemein verfügbar |
512 |
4 |
5 Minuten, 1 Stunde |
„System“, „Nachrichten“ und „Tools“ |
Claude Opus 4.8 |
anthropisch. Claude-Opus-4-8 |
Allgemein verfügbar |
1,024 |
4 |
5 Minuten, 1 Stunde |
„System“, „Nachrichten“ und „Tools“ |
Claude Opus 4.7 |
anthropisch. Claude-Opus-4-7 |
Allgemein verfügbar |
4.096 |
4 |
5 Minuten, 1 Stunde |
„System“, „Nachrichten“ und „Tools“ |
Claude Opus 4.6 |
anthropisch. Claude-Opus-4-6-v1 |
Allgemein verfügbar |
4.096 |
4 |
5 Minuten, 1 Stunde |
„System“, „Nachrichten“ und „Tools“ |
Claude Opus 4.5 |
anthropisch. Claude-Opus-4-5-20251101-v 1:0 |
Allgemein verfügbar |
4.096 |
4 |
5 Minuten, 1 Stunde |
„System“, „Nachrichten“ und „Tools“ |
Claude Sonnet 5 |
anthropisch. Claude-Sonnet-5 |
Allgemein verfügbar |
1,024 |
4 |
5 Minuten, 1 Stunde |
„System“, „Nachrichten“ und „Tools“ |
Claude Sonnet 4.6 |
anthropisch. Claude-Sonnet-4-6 |
Allgemein verfügbar |
1,024 |
4 |
5 Minuten, 1 Stunde |
„System“, „Nachrichten“ und „Tools“ |
Claude Sonnet 4.5 |
anthropic.claude-sonnet-4-5-20250929-v1:0 |
Allgemein verfügbar |
1,024 |
4 |
5 Minuten, 1 Stunde |
„System“, „Nachrichten“ und „Tools“ |
Claude 3.7 Sonnet |
anthropic.claude-3-7-sonnet-20250219-v1:0 |
Allgemein verfügbar |
1,024 |
4 |
5 Minuten |
„System“, „Nachrichten“ und „Tools“ |
Claude 3.5 Sonnet v2 |
anthropic.claude-3-5-sonnet-20241022-v2:0 |
Vorversion |
1,024 |
4 |
5 Minuten |
„System“, „Nachrichten“ und „Tools“ |
Claude Haiku 4.5 |
anthropic.claude-haiku-4-5-20251001-v1:0 |
Allgemein verfügbar |
4.096 |
4 |
5 Minuten, 1 Stunde |
„System“, „Nachrichten“ und „Tools“ |
GPT-5.6 Sol |
openai.gpt-5.6-sol |
Allgemein verfügbar |
1,024 |
4 |
30 Minuten |
|
GPT-5.6 Terra |
openai.gpt-5.6-terra |
Allgemein verfügbar |
1,024 |
4 |
30 Minuten |
|
GPT-5.6 Luna |
openai.gpt-5.6-luna |
Allgemein verfügbar |
1,024 |
4 |
30 Minuten |
|
Um die 1-Stunden-TTL-Option mit unterstützten Modellen (Claude Fable 5,,,,Claude Opus 5,Claude Opus 4.8, Claude Opus 4.7Claude Opus 4.6, undClaude Haiku 4.5) zu verwenden Claude Opus 4.5 Claude Sonnet 5 Claude Sonnet 4.6Claude Sonnet 4.5, geben Sie das ttl Feld in Ihrem Cache-Checkpoint an. Fügen Sie in der Converse-API Ihrem cachePoint Objekt "ttl": "1h" hinzu. Fügen Sie in der InvokeModel API für Claude-Modelle Ihrem cache_control Objekt "ttl": "1h" etwas hinzu. Wenn kein ttl Wert angegeben wird, gilt das standardmäßige 5-Minuten-Caching-Verhalten. Die TTL von 1 Stunde ist nützlich für länger laufende Sitzungen oder Batchverarbeitungsszenarien, in denen Sie den Cache über längere Zeiträume verwalten möchten.
Amazon Novabietet implizites Zwischenspeichern von Eingabeaufforderungen für alle Textanfragen, einschließlich Nachrichten. User System Dieser Mechanismus kann Latenzvorteile bieten, wenn Eingabeaufforderungen mit sich wiederholenden Teilen ohne ausdrückliche Konfiguration beginnen. Amazon NovaModelle, in deren Modellkarten explizites Prompt-Caching unterstützt wird, ermöglichen auch die Angabe von Cache-Checkpoints, um die Cache-Eignung besser kontrollieren zu können.
Prompt-Caching für Modelle von Anthropic
Anthropische Modelle, die Prompt-Caching auf Amazon Bedrock unterstützen, unterstützen sowohl implizites Prompt-Caching als auch Explizites Prompt-Caching. Implicit Prompt Caching versucht automatisch, geeignete Prompt-Präfixe wiederzuverwenden, ohne dass in Ihrer Anfrage Cache-Kontrollen erforderlich sind.
Für das Explizite Prompt-Caching bietet Amazon Bedrock einen vereinfachten Ansatz für die Cache-Verwaltung, der die Komplexität der manuellen Platzierung von Cache-Checkpoints reduziert. Anstatt von Ihnen die Angabe exakter Cache-Checkpoint-Positionen zu verlangen, können Sie das automatische Cache-Management mit einem einzigen Haltepunkt am Ende Ihres statischen Inhalts verwenden.
Wenn Sie das vereinfachte Cache-Management aktivieren, sucht das System automatisch nach Cache-Treffern an den Grenzen früherer Inhaltsblöcke und schaut dabei bis zu etwa 20 Inhaltsblöcke ab dem angegebenen Haltepunkt zurück. Auf diese Weise kann das Modell das Präfix mit der längsten Übereinstimmung in Ihrem Cache finden, ohne dass Sie die optimalen Checkpoint-Positionen vorhersagen müssen. Damit Sie dieses Verfahren nutzen können, platzieren Sie einen einzelnen Cache-Checkpoint am Ende Ihres statischen Inhalts, und zwar vor dynamischen oder variablen Inhalten. Das System findet automatisch die beste Cache-Übereinstimmung.
Für eine genauere Steuerung können Sie immer noch mehrere Cache-Checkpoints (bis zu 4 bei Claude-Modellen) verwenden, um die genauen Cache-Grenzen festzulegen. Sie sollten mehrere Cache-Checkpoints verwenden, wenn Sie Abschnitte zwischenspeichern, die sich unterschiedlich häufig ändern, oder wenn Sie mehr Kontrolle darüber haben möchten, was genau zwischengespeichert wird.
Wichtig
Bei der automatischen Präfixüberprüfung werden nur etwa 20 Inhaltsblöcke von Ihrem Cache-Checkpoint aus geprüft. Wenn Ihr statischer Inhalt diesen Bereich überschreitet, sollten Sie in Erwägung ziehen, mehrere Cache-Checkpoints zu verwenden oder Ihren Prompt so umzustrukturieren, dass die am häufigsten wiederverwendeten Inhalte innerhalb dieses Bereichs platziert werden.
Bewährte Methoden für die Verwendung der Cache-Verwaltung in Anthropic Models
Wenn Sie Eingabeaufforderungen haben, die in regelmäßigen Abständen verwendet werden (d. h. Systemaufforderungen, die häufiger als alle 5 Minuten verwendet werden), verwenden Sie weiterhin den 5-Minuten-Cache, da dieser weiterhin ohne zusätzliche Kosten aktualisiert wird.
Der 1-Stunden-Cache wird am besten in den folgenden Szenarien verwendet:
-
Wenn Sie Eingabeaufforderungen haben, die wahrscheinlich seltener als 5 Minuten, aber häufiger als jede Stunde verwendet werden. Zum Beispiel, wenn ein Agenten-Side-Agent länger als 5 Minuten benötigt oder wenn Sie eine lange Chat-Konversation mit einem Benutzer speichern und Sie im Allgemeinen erwarten, dass der Benutzer in den nächsten 5 Minuten nicht reagiert.
-
Wenn die Latenz wichtig ist und Ihre Aufforderungen zur Nachverfolgung möglicherweise länger als 5 Minuten gesendet werden.
-
Wenn Sie Ihr Ratenlimit verbessern möchten, nutzen Sie es, da Cache-Treffer nicht von Ihrem Ratenlimit abgezogen werden.
Sie können in derselben Anfrage sowohl Cache-Kontrollen für 1 Stunde als auch 5 Minuten verwenden, allerdings mit einer wichtigen Einschränkung: Cache-Einträge mit einer längeren TTL müssen vor kürzeren TTLs erscheinen (d. h. ein 1-stündiger Cacheeintrag muss vor allen 5-Minuten-Cacheeinträgen erscheinen).
Promptes Caching für Modelle von OpenAI
OpenAI-Modelle auf Amazon Bedrock unterstützen implizites Prompt-Caching über die Responses API. GPT-5.6 Modelle unterstützen auch explizites Prompt-Caching. Die Responses API ist sowohl auf den Endpunkten als auch auf den bedrock-runtime bedrock-mantle Endpunkten verfügbar.
GPT-5.6 Modelle
GPT-5.6 Sol (openai.gpt-5.6-sol), Terra () und Luna (openai.gpt-5.6-terraopenai.gpt-5.6-luna) unterstützen sowohl implizites Prompt-Caching als auch Explizites Prompt-Caching. Mithilfe von Breakpoints im Cache für explizite Eingabeaufforderungen können Sie genau steuern, welche Teile Ihrer Eingabeaufforderung zwischengespeichert werden können. Dies ist besonders nützlich für agentische Workflows, bei denen sich Systemanweisungen, Tooldefinitionen und Referenzdateien bei vielen Aufrufen wiederholen, während sich nur die letzten Eingaben ändern.
Wichtigste Eigenschaften:
Explizite Cache-Breakpoints — Markieren Sie das genaue Ende eines wiederverwendbaren Prompt-Präfixes, indem Sie
"prompt_cache_breakpoint": {"mode": "explicit"}es zu einem unterstützten Inhaltsblock hinzufügen.Cache-Modi — Diese Einstellung dient
prompt_cache_options.modezur Steuerung des Verhaltens von Breakpoints:implicit(Standard) — Platziert einen automatischen Breakpoint für die letzte Nachricht und verwendet auch alle expliziten Breakpoints, die Sie angeben.explicit— Deaktiviert den automatischen Breakpoint. Für Lese- und Schreibvorgänge im Cache werden nur explizite Breakpoints verwendet. Wenn keine expliziten Breakpoints vorhanden sind, verwendet die Anforderung kein Prompt-Caching und es fallen auch keine Cache-Schreibgebühren an.
Mindestlänge des Präfixes — 1.024 Token pro Breakpoint.
TTL von mindestens 30 Minuten — Zwischengespeicherte Präfixe bleiben mindestens 30 Minuten lang zur Wiederverwendung verfügbar. Das ist lang genug, um die Anzahl der Anrufe abzudecken, die ein einzelner Agentenlauf generiert. Die TTL ist über
prompt_cache_options.ttlgesetzt und standardmäßig auf.30mAbrechnung von Cache-Schreibvorgängen — In den Cache geschriebene Token werden mit dem 1,25-fachen der Rate für nicht zwischengespeicherte Eingabe-Tokens in Rechnung gestellt. Cache-Lesevorgänge werden im Vergleich zu nicht zwischengespeicherten Eingabe-Token mit einem Rabatt von 90% in Rechnung gestellt.
Zwischengespeicherte Token werden nicht auf die Ratenlimits angerechnet — Zwischengespeicherte Eingabe-Token, die durch das Prompt-Caching gelesen werden, werden nicht auf das Kontingent für Eingabe-Tokens pro Minute angerechnet.
Die Antwort verstehen
Das Nutzungsobjekt in der Antwort umfasst zwei cachespezifische Felder:
cached_tokens— Anzahl der aus dem Cache gelesenen Eingabe-Tokens (für die Abrechnung wird der Diskontsatz für Cache-Lesevorgänge berechnet).cache_write_tokens— Anzahl der Eingabe-Tokens, die in den Cache geschrieben wurden (die Abrechnung erfolgt mit dem 1,25-fachen der Rate für nicht zwischengespeicherte Eingabe-Tokens).
Wenn cached_tokens größer als Null und Null cache_write_tokens ist, stimmt Ihre Anfrage vollständig mit einem vorhandenen Cache-Eintrag überein — es wurden keine neuen Schreibvorgänge vorgenommen und Sie haben die maximale Kostenersparnis erzielt.
Bewährte Methoden für die Verwendung der Cache-Verwaltung in GPT 5.6-Modellen
Platzieren Sie Haltepunkte nach stabilen Inhalten — Systemanweisungen, Tooldefinitionen und Referenzdokumente, die sich zwischen den Aufrufen nicht ändern, sollten vor dem Breakpoint erscheinen. Der Inhalt nach dem Breakpoint kann beliebig geändert werden, ohne dass das zwischengespeicherte Präfix ungültig wird.
Verwenden Sie
explicitden Modus für agentische Schleifen — Wenn Sie die volle Kontrolle darüber haben möchten, was zwischengespeichert wird, und vermeiden möchten, dass automatische Breakpoints Schreibplätze belegen.Überwachen
cache_write_tokens— Vergleichen Sie das Cache-Schreibvolumen mit nachfolgenden Cache-Lesevorgängen, um sich ein Bild von den Nettokosten zu machen und die Platzierung der Breakpoints entsprechend anzupassen.
GPT-5.5 und frühere Modelle
Bei älteren OpenAI-Modellen GPT-5.6 (wie openai.gpt-5.5 undopenai.gpt-5.4) erfolgt das implizite Prompt-Caching automatisch. Sie müssen keine speziellen Parameter hinzufügen. Das System versucht automatisch, geeignete Präfixe für Eingabeaufforderungen von 1.024 Token oder mehr zwischenzuspeichern. Für Cache-Writes fallen für diese Modelle keine zusätzliche Gebühr an.
Wichtigste Eigenschaften:
Implizites Prompt-Caching — Es sind keine Codeänderungen erforderlich. Das System versucht automatisch, Präfixe auf der Grundlage einer exakten Präfixübereinstimmung zwischenzuspeichern.
Mindestlänge des Präfixes — 1.024 Token.
Keine Cache-Schreibgebühr — Nur Cache-Lesevorgänge werden zu einem ermäßigten Preis in Rechnung gestellt.
Zwischengespeicherte Token zählen nicht zu den Ratenlimits — Zwischengespeicherte Eingabetoken, die durch das Prompt-Caching gelesen werden, werden nicht auf das Kontingent für Eingabe-Tokens pro Minute angerechnet.
Bewährte Methoden für die Verwendung der Cache-Verwaltung in und früheren Modellen GPT-5.5
Platzieren Sie statische Inhalte (Systemaufforderungen, Werkzeugdefinitionen, Referenzdokumente) am Anfang Ihrer Eingabeaufforderung.
Platzieren Sie variablen Inhalt (benutzerspezifische Eingabe) am Ende.
Sorgen Sie für einen stetigen Strom von Anfragen mit identischen Präfixen, um Cache-Löschungen zu minimieren.
Erste Schritte
Die folgenden Abschnitte geben Ihnen einen kurzen Überblick darüber, wie Sie das Prompt-Caching-Feature für jede Methode der Interaktion mit Modellen über Amazon Bedrock verwenden können.
Die Converse-API bietet erweiterte und flexible Optionen für die Implementierung von Prompt-Caching in Multi-Turn-Konversationen. Weitere Informationen zu den Prompt-Anfragen der einzelnen Modelle finden Sie im vorherigen Abschnitt Unterstützte Modelle, Regionen und explizite Caching-Grenzwerte.
Beispielanforderung
Die folgenden Beispiele zeigen einen Cache-Checkpoint, der im Feld messages, system oder tools einer Anfrage an die Converse-API festgelegt ist. Sie können an jedem dieser Orte Checkpoints für eine bestimmte Anfrage platzieren. Wenn Sie beispielsweise eine Anfrage an das Modell Claude 3.5 Sonnet v2 senden, könnten Sie zwei Cache-Checkpoints in messages platzieren, einen Cache-Checkpoint in system und einen in tools. Ausführlichere Informationen und Beispiele für die Strukturierung und das Senden von Converse-API-Anfragen finden Sie unter Inferenz mit der Converse-API.
Wichtig
Cache-Checkpoints werden in dieser Reihenfolge verarbeitet: → →. tools system messages Die minimale Cachegröße wird anhand der kumulativen Tokens in allen drei Abschnitten zusammen berechnet, nicht in jedem Abschnitt einzeln. Da die Abschnitte verkettet sind, macht das Ändern des Inhalts in einem früheren Abschnitt den Cache für spätere Abschnitte ungültig (z. B. macht eine Änderung die system Und-Caches tools ungültig). messages Um die besten Cache-Trefferraten zu erzielen, platzieren Sie stabile Inhalte (tools,system) vor variablem Inhalt (messages) und Cache-Checkpoints nach dem stabilen Inhalt.
Geben Sie den gewünschten TTL-Wert wie unten angegeben an. Wenn kein TTL-Wert angegeben ist, gilt das Standardverhalten von 5 Minuten Caching.
"cachePoint" : { "type": "default", "ttl" : "5m | 1h" }
Die Modellantwort der Converse API enthält drei neue Felder, die speziell für das Zwischenspeichern von Eingabeaufforderungen spezifisch sind. Die Werte cacheReadInputTokens und cacheWriteInputTokens geben an, wie viele Token aus dem Cache gelesen wurden und wie viele Token aufgrund Ihrer vorherigen Anforderung in den Cache geschrieben wurden. Die cacheDetails Werte geben den TTL an, der für die Anzahl der in den Cache geschriebenen Token verwendet wird. Dies sind Werte, die Ihnen von Amazon Bedrock in Rechnung gestellt werden, und zwar zu einem Preis, der unter den Kosten für die vollständige Modellinferenz liegt.
Wichtig
Wenn das Zwischenspeichern von Eingabeaufforderungen aktiviert ist, stellt das inputTokens Feld nur die nicht zwischengespeicherten Eingabetoken dar (Token, die nicht aus dem Cache gelesen oder in den Cache geschrieben wurden). Verwenden Sie die folgende Formel, um die Gesamtzahl der in einer Anfrage gesendeten Eingabetokens zu berechnen:
total input tokens = inputTokens + cacheReadInputTokens + cacheWriteInputTokens
Das Zwischenspeichern von Eingabeaufforderungen ist standardmäßig aktiviert, wenn Sie die InvokeModel API aufrufen. Sie können Cache-Checkpoints an jeder beliebigen Stelle in Ihrem Anforderungstext festlegen, ähnlich wie im vorherigen Beispiel für die Converse-API.
Weitere Informationen zum Senden einer InvokeModel Anfrage finden Sie unterSenden Sie eine einzelne Aufforderung mit InvokeModel.
Für OpenAI-Modelle verwenden Sie die Responses API — die sowohl auf dem als auch auf den bedrock-runtime bedrock-mantle Endpunkten verfügbar ist — mit Prompt-Caching-Parametern, die für die Modellgenerierung spezifisch sind. Bei GPT-5.6 Modellen steuern Sie das Caching mit expliziten Breakpoints. Für GPT-5.5 und frühere Versionen erfolgt das Caching automatisch.
GPT-5.6 Beispiel mit expliziten Cache-Breakpoints
Das folgende Beispiel zeigt eine Responses API-Anforderung zur openai.gpt-5.6-sol Verwendung expliziter Cache-Breakpoints. Die Systemanweisung wird zwischengespeichert und für nachfolgende Anfragen wiederverwendet.
{ "model": "openai.gpt-5.6-sol", "prompt_cache_key": "my-app:system-prompt-v1", "prompt_cache_options": { "mode": "explicit" }, "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions. Follow these guidelines: 1. Always cite the relevant documentation section. 2. If unsure, escalate to a human agent. 3. Be concise but thorough...", "prompt_cache_breakpoint": { "mode": "explicit" } } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }
GPT-5.5 Beispiel mit automatischem Caching
Bei GPT-5.5 und früheren Modellen erfolgt das Zwischenspeichern von Eingabeaufforderungen automatisch. Es sind keine Breakpoints oder Cache-Schlüssel erforderlich. Stellen Sie einfach sicher, dass Ihr Prompt-Präfix 1.024 Token überschreitet.
{ "model": "openai.gpt-5.5", "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions..." } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }
Antwort
Die Antwort enthält Metriken zur Cache-Nutzung im usage Objekt:
{ "id": "resp_abc123", "output": [...], "usage": { "input_tokens": 2048, "output_tokens": 256, "total_tokens": 2304, "input_tokens_details": { "cached_tokens": 1920, "cache_write_tokens": 0 } } }
In dieser Antwort wurden 1.920 Token aus dem Cache bereitgestellt und keine neuen Token geschrieben, was auf einen vollständigen Cache-Treffer mit maximalen Kosteneinsparungen hindeutet.
In einem Chat-Playground der Amazon-Bedrock-Konsole können Sie die Prompt-Caching-Option aktivieren, sodass Amazon Bedrock automatisch Cache-Checkpoints für Sie erstellt.
Folgen Sie den Anweisungen unter Generieren von Antworten in der Konsole mithilfe von Playgrounds, um mit dem Erstellen von Prompts in einem Amazon-Bedrock-Playground zu beginnen. Bei unterstützten Modellen wird das Prompt-Caching im Playground automatisch aktiviert. Ist dies jedoch nicht der Fall, gehen Sie wie folgt vor, um das Zwischenspeichern von Eingabeaufforderungen zu aktivieren:
-
Öffnen Sie das Menü Konfigurationen.
-
Aktivieren Sie die Option Prompt-Caching.
-
Führen Sie Ihre Prompts aus.
Nachdem Ihre kombinierten Eingabe- und Modellantworten die für einen Checkpoint erforderliche Mindestanzahl an Token erreicht haben (die je nach Modell unterschiedlich ist), erstellt Amazon Bedrock automatisch den ersten Cache-Checkpoint für Sie. Während Sie weiter chatten, kann Amazon Bedrock zusätzliche Checkpoints erstellen, und zwar bis zur maximal zulässigen Anzahl von Checkpoints für das Modell. Die Mindestanzahl wird anhand der kumulativen Anzahl von Tokens vor jedem Checkpoint berechnet, nicht anhand der Anzahl der seit dem vorherigen Checkpoint hinzugefügten Tokens. Sie können Ihre Cache-Checkpoints jederzeit einsehen, indem Sie neben der Option Prompt-Caching die Option Cache-Checkpoints anzeigen auswählen, wie im folgenden Screenshot gezeigt.
Sie können sehen, wie viele Token aufgrund jeder Interaktion mit dem Modell aus dem Cache gelesen und in den Cache geschrieben werden, indem Sie das Popup-Fenster mit den Caching-Metriken (
) in den Playground-Antworten aufrufen.
Wenn Sie während einer Konversation den Umschalter für Prompt-Caching deaktivieren, können Sie den Chat mit dem Model fortsetzen.