View a markdown version of this page

Prompt-Caching für schnellere Modellinferenz - Amazon Bedrock

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Prompt-Caching für schnellere Modellinferenz

Prompt-Caching ist ein optionales Feature, das Sie mit unterstützten Modellen in Amazon Bedrock verwenden können, um die Latenz bei Inferenzantworten und die Kosten für Eingabe-Token zu reduzieren. Amazon Bedrock unterstützt zwei Arten von Prompt-Caching: Implizites Prompt-Caching und Explizites Prompt-Caching. Die Unterstützung für jeden Typ variiert je nach Modell und API.

Prompt-Caching kann hilfreich sein, wenn Sie Workloads mit langen und sich wiederholenden Kontexten haben, die häufig für mehrere Abfragen wiederverwendet werden. Wenn Sie beispielsweise über einen Chatbot verfügen, bei dem Benutzer Dokumente hochladen und Fragen zu ihnen stellen können, kann es für das Modell zeitaufwändig sein, das Dokument jedes Mal zu verarbeiten, wenn der Benutzer eine Eingabe vornimmt. Mit Prompt-Caching können Sie das Dokument zwischenspeichern, sodass künftige Abfragen, die das Dokument enthalten, es nicht erneut verarbeiten müssen.

Arten des Prompt-Caching

Die beiden Typen unterscheiden sich darin, wie wiederverwendbarer Inhalt der Eingabeaufforderung ausgewählt wird:

Typ Funktionsweise Konfiguration anfordern
Implizites Zwischenspeichern von Aufforderungen Amazon Bedrock und das Modell versuchen automatisch, berechtigte Prompt-Präfixe wiederzuverwenden. In Ihrer Anfrage sind keine Cache-Kontrollen oder Breakpoints erforderlich.
Explizites Zwischenspeichern von Aufforderungen Sie identifizieren wiederverwendbare Prompt-Präfixe, indem Sie modellspezifische Cache-Steuerelemente oder Breakpoints hinzufügen. Ihre Anfrage muss die Cache-Steuerelemente enthalten, die vom Modell und der API unterstützt werden.

Implizites Zwischenspeichern von Aufforderungen

Implizites Prompt-Caching versucht automatisch, geeignete Prompt-Präfixe wiederzuverwenden, ohne dass Cache-Kontrollen in Ihrer Anfrage erforderlich sind. Bewahren Sie statische Inhalte am Anfang Ihrer Aufforderung und dynamische Inhalte am Ende auf, um die Wahrscheinlichkeit einer exakten Übereinstimmung mit den Präfixen zu erhöhen.

Implizites Prompt-Caching ist die beste Methode. Die Wiederholung einer identischen Eingabeaufforderung garantiert keinen Cachetreffer, und die Cache-Trefferraten können variieren.

Explizites Zwischenspeichern von Aufforderungen

Explizites Prompt-Caching ermöglicht es Ihnen, wiederverwendbare Prompt-Präfixe mithilfe modellspezifischer Cache-Steuerelemente oder Cache-Checkpoints zu identifizieren. Cache-Checkpoints sind Markierungen, die den zusammenhängenden Unterabschnitt Ihrer Aufforderung definieren, den Sie zwischenspeichern möchten. Die Präfixe der Eingabeaufforderung sollten zwischen den Anfragen statisch bleiben. Änderungen an einem Prompt-Präfix in nachfolgenden Anfragen führen zu Cache-Fehlern.

Cache-Checkpoints haben je nach Modell eine Mindest- und Höchstanzahl an Tokens. Sie können nur dann einen Cache-Checkpoint erstellen, wenn Ihr gesamtes Prompt-Präfix der Mindestanzahl an Token entspricht. Claude Opus 5Erfordert beispielsweise mindestens 512 Token pro Cache-Checkpoint, Claude Sonnet 5 mindestens 1.024 Token pro Cache-Checkpoint und Claude Haiku 4.5 mindestens 4.096 Token pro Cache-Checkpoint. Das Minimum gilt kumulativ für das gesamte Prompt-Präfix vor jedem Checkpoint, einschließlich, falls zutreffend, des Inhalts in den Feldern, und. tools system messages Zwischen den Cache-Checkpoints ist keine Mindestanzahl an Tokens erforderlich. Für ein Modell mit einem Minimum von 1.024 Token können Sie zusätzliche Checkpoints definieren, die weniger als 1.024 Token voneinander entfernt sind, solange das gesamte Prompt-Präfix vor jedem Checkpoint mindestens 1.024 Token enthält. Wenn Sie einen Cache-Checkpoint hinzufügen, bevor das gesamte Prompt-Präfix die Mindestanzahl an Token erreicht, ist Ihre Inferenz trotzdem erfolgreich, aber Ihr Präfix wird nicht zwischengespeichert.

Der Cache hat eine Gültigkeitsdauer (TTL), die bei jedem erfolgreichen Cache-Treffer zurückgesetzt wird. Während dieses Zeitraums bleibt der Kontext im Cache erhalten. Wenn innerhalb des TTL-Fensters keine Cache-Treffer auftreten, läuft Ihr Cache ab. Viele Modelle unterstützen eine TTL von 5 Minuten. Die genauen TTL-Bedingungen finden Sie auf der Modellkarte Ihres Modells.

Explizites Prompt-Caching ermöglicht die Kontrolle darüber, welcher Inhalt der Eingabeaufforderung zwischengespeichert werden kann. Es garantiert nicht, dass eine berechtigte Anfrage zu einem Cache-Treffer führt.

Abrechnung für zwischengespeicherte Token

Sowohl beim impliziten Prompt-Caching als auch beim Expliziten Prompt-Caching werden erfolgreich aus dem Cache gelesene Token als zwischengespeicherte Token gemeldet und mit der Cache-Leserate des Modells in Rechnung gestellt. Token, die nicht aus dem Cache gelesen werden, werden mit der Standardrate für Eingabe-Tokens in Rechnung gestellt. Je nach Modell können in den Cache geschriebene Token mit einer Rate in Rechnung gestellt werden, die über der Standardgebühr für Eingabe-Tokens liegt. Weitere Informationen finden Sie auf der Amazon-Bedrock-Preisseite.

Wichtig

Die Unterstützung von Prompt-Caching garantiert nicht, dass bei einer Anfrage ein Cache-Treffer erzielt wird. Überprüfen Sie die Felder für die Cache-Nutzung in der Modellantwort, um festzustellen, ob Token aus dem Cache gelesen oder in den Cache geschrieben wurden.

Sie können das Prompt-Caching verwenden, wenn Sie Inferenz in Amazon Bedrock mit unterstützten Modellen ausführen. Die Verfügbarkeit der einzelnen Prompt-Caching-Typen variiert je nach Modell und API. Prompt-Caching ist über die folgenden Amazon Bedrock-Funktionen verfügbar:

Converse und APIs ConverseStream

Sie können eine Konversation mit einem unterstützten Modell fortsetzen. Geben Sie für das Zwischenspeichern von expliziten Eingabeaufforderungen Cache-Checkpoints in Ihren Prompts an.

InvokeModel InvokeModelWithResponseStreamund APIs

Sie können Anfragen mit nur einer Aufforderung an unterstützte Modelle senden. Für Explizites Prompt-Caching aktivieren Sie das Prompt-Caching und geben Sie Ihre Cache-Checkpoints an.

Prompt-Caching mit Inferenz Cross-region

Prompt-Caching kann in Verbindung mit regionsübergreifender Inferenz verwendet werden. Cross-region Inference wählt automatisch die optimale AWS Region innerhalb Ihrer Region aus, um Ihre Inferenzanfrage zu bearbeiten, wodurch die verfügbaren Ressourcen und die Modellverfügbarkeit maximiert werden. In Zeiten hoher Nachfrage können diese Optimierungen zu erhöhten Cache-Schreibvorgängen führen.

Amazon Bedrock Prompt Management

Wenn Sie einen Prompt erstellen oder ändern, können Sie wählen, ob Prompt-Caching aktiviert werden soll. Je nach Modell können Sie System-Prompts, Systemanweisungen und Nachrichten (Benutzer- und Assistentnachrichten) zwischenspeichern. Sie können Prompt-Caching auch deaktivieren.

Anmerkung

Prompt-Caching wird nur für On-Demand-Inferenzendpunkte unterstützt. Es wird von der Batch-Inferenz-API nicht unterstützt.

Bei Modellen, die Explizites Prompt-Caching unterstützen, bieten die APIs eine granulare Steuerung des Prompt-Caches. Sie können einzelne Cache-Checkpoints in Ihren Prompts festlegen und Checkpoints bis zu dem für das Modell zulässigen Höchstwert hinzufügen. Weitere Informationen finden Sie unter Unterstützte Modelle, Regionen und explizite Caching-Grenzwerte.

Unterstützte Modelle, Regionen und explizite Caching-Grenzwerte

Die Unterstützung von Prompt-Caching variiert je nach Modell und API. Modellkarten geben an, ob ein Modell implizites Prompt-Caching, Explizites Prompt-Caching oder beides unterstützt. Prompt-Caching ist in allen AWS Regionen verfügbar, in denen die unterstützten Modelle verfügbar sind. Informationen zur Überprüfung der Modellverfügbarkeit nach Regionen finden Sie unterRegionale Verfügbarkeit nach Modellen.

In der folgenden Tabelle sind Modelle aufgeführt, die explizites Prompt-Caching unterstützen, zusammen mit ihren Mindestwerten für Token, der maximalen Anzahl von Cache-Checkpoints und den Feldern, die Cache-Checkpoints zulassen.

Informationen dazu, welche Arten von Prompt-Caching ein Modell unterstützt, finden Sie unter Modelle auf einen Blick, und wählen Sie dann das Modell aus, an dem Sie interessiert sind.

Modellname Modell-ID Art der Veröffentlichung Mindestanzahl von Token pro Cache-Checkpoint Maximale Anzahl von Cache-Checkpoints pro Anforderung Unterstütztes TTL Felder, die Prompt-Cache-Checkpoints akzeptieren

Claude Fable 5.1

anthropic.claude-fable-5-1

Allgemein verfügbar

512

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude Mythos 5.1

anthropisch. Claude-Mythos-5-1

Geschützt

512

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude Fable 5

anthropisch. Claude-Fable-5

Allgemein verfügbar

512

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude Mythos 5

anthropisch. Claude-Mythos-5

Geschützt

512

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude Mythos Preview

anthropic.claude-mythos-vorschau

Geschützt

4.096

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude Opus 5

anthropisch. Claude-Opus-5

Allgemein verfügbar

512

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude Opus 4.8

anthropisch. Claude-Opus-4-8

Allgemein verfügbar

1,024

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude Opus 4.7

anthropisch. Claude-Opus-4-7

Allgemein verfügbar

4.096

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude Opus 4.6

anthropisch. Claude-Opus-4-6-v1

Allgemein verfügbar

4.096

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude Opus 4.5

anthropisch. Claude-Opus-4-5-20251101-v 1:0

Allgemein verfügbar

4.096

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude Sonnet 5

anthropisch. Claude-Sonnet-5

Allgemein verfügbar

1,024

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude Sonnet 4.6

anthropisch. Claude-Sonnet-4-6

Allgemein verfügbar

1,024

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude Sonnet 4.5

anthropic.claude-sonnet-4-5-20250929-v1:0

Allgemein verfügbar

1,024

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

Claude 3.7 Sonnet

anthropic.claude-3-7-sonnet-20250219-v1:0

Allgemein verfügbar

1,024

4

5 Minuten

„System“, „Nachrichten“ und „Tools“

Claude 3.5 Sonnet v2

anthropic.claude-3-5-sonnet-20241022-v2:0

Vorversion

1,024

4

5 Minuten

„System“, „Nachrichten“ und „Tools“

Claude Haiku 4.5

anthropic.claude-haiku-4-5-20251001-v1:0

Allgemein verfügbar

4.096

4

5 Minuten, 1 Stunde

„System“, „Nachrichten“ und „Tools“

GPT-5.6 Sol

openai.gpt-5.6-sol

Allgemein verfügbar

1,024

4

30 Minuten

prompt_cache_breakpointaktiviertinput_text, input_image und blockiert (Responses API) input_file

GPT-5.6 Terra

openai.gpt-5.6-terra

Allgemein verfügbar

1,024

4

30 Minuten

prompt_cache_breakpointaninput_text, input_image und blockiert (Responses API) input_file

GPT-5.6 Luna

openai.gpt-5.6-luna

Allgemein verfügbar

1,024

4

30 Minuten

prompt_cache_breakpointaktiviertinput_text, input_image und blockiert (Responses API) input_file

Um die 1-Stunden-TTL-Option mit unterstützten Modellen (Claude Fable 5,,,,Claude Opus 5,Claude Opus 4.8, Claude Opus 4.7Claude Opus 4.6, undClaude Haiku 4.5) zu verwenden Claude Opus 4.5 Claude Sonnet 5 Claude Sonnet 4.6Claude Sonnet 4.5, geben Sie das ttl Feld in Ihrem Cache-Checkpoint an. Fügen Sie in der Converse-API Ihrem cachePoint Objekt "ttl": "1h" hinzu. Fügen Sie in der InvokeModel API für Claude-Modelle Ihrem cache_control Objekt "ttl": "1h" etwas hinzu. Wenn kein ttl Wert angegeben wird, gilt das standardmäßige 5-Minuten-Caching-Verhalten. Die TTL von 1 Stunde ist nützlich für länger laufende Sitzungen oder Batchverarbeitungsszenarien, in denen Sie den Cache über längere Zeiträume verwalten möchten.

Amazon Novabietet implizites Zwischenspeichern von Eingabeaufforderungen für alle Textanfragen, einschließlich Nachrichten. User System Dieser Mechanismus kann Latenzvorteile bieten, wenn Eingabeaufforderungen mit sich wiederholenden Teilen ohne ausdrückliche Konfiguration beginnen. Amazon NovaModelle, in deren Modellkarten explizites Prompt-Caching unterstützt wird, ermöglichen auch die Angabe von Cache-Checkpoints, um die Cache-Eignung besser kontrollieren zu können.

Prompt-Caching für Modelle von Anthropic

Anthropische Modelle, die Prompt-Caching auf Amazon Bedrock unterstützen, unterstützen sowohl implizites Prompt-Caching als auch Explizites Prompt-Caching. Implicit Prompt Caching versucht automatisch, geeignete Prompt-Präfixe wiederzuverwenden, ohne dass in Ihrer Anfrage Cache-Kontrollen erforderlich sind.

Für das Explizite Prompt-Caching bietet Amazon Bedrock einen vereinfachten Ansatz für die Cache-Verwaltung, der die Komplexität der manuellen Platzierung von Cache-Checkpoints reduziert. Anstatt von Ihnen die Angabe exakter Cache-Checkpoint-Positionen zu verlangen, können Sie das automatische Cache-Management mit einem einzigen Haltepunkt am Ende Ihres statischen Inhalts verwenden.

Wenn Sie das vereinfachte Cache-Management aktivieren, sucht das System automatisch nach Cache-Treffern an den Grenzen früherer Inhaltsblöcke und schaut dabei bis zu etwa 20 Inhaltsblöcke ab dem angegebenen Haltepunkt zurück. Auf diese Weise kann das Modell das Präfix mit der längsten Übereinstimmung in Ihrem Cache finden, ohne dass Sie die optimalen Checkpoint-Positionen vorhersagen müssen. Damit Sie dieses Verfahren nutzen können, platzieren Sie einen einzelnen Cache-Checkpoint am Ende Ihres statischen Inhalts, und zwar vor dynamischen oder variablen Inhalten. Das System findet automatisch die beste Cache-Übereinstimmung.

Für eine genauere Steuerung können Sie immer noch mehrere Cache-Checkpoints (bis zu 4 bei Claude-Modellen) verwenden, um die genauen Cache-Grenzen festzulegen. Sie sollten mehrere Cache-Checkpoints verwenden, wenn Sie Abschnitte zwischenspeichern, die sich unterschiedlich häufig ändern, oder wenn Sie mehr Kontrolle darüber haben möchten, was genau zwischengespeichert wird.

Wichtig

Bei der automatischen Präfixüberprüfung werden nur etwa 20 Inhaltsblöcke von Ihrem Cache-Checkpoint aus geprüft. Wenn Ihr statischer Inhalt diesen Bereich überschreitet, sollten Sie in Erwägung ziehen, mehrere Cache-Checkpoints zu verwenden oder Ihren Prompt so umzustrukturieren, dass die am häufigsten wiederverwendeten Inhalte innerhalb dieses Bereichs platziert werden.

Bewährte Methoden für die Verwendung der Cache-Verwaltung in Anthropic Models

Wenn Sie Eingabeaufforderungen haben, die in regelmäßigen Abständen verwendet werden (d. h. Systemaufforderungen, die häufiger als alle 5 Minuten verwendet werden), verwenden Sie weiterhin den 5-Minuten-Cache, da dieser weiterhin ohne zusätzliche Kosten aktualisiert wird.

Der 1-Stunden-Cache wird am besten in den folgenden Szenarien verwendet:

  • Wenn Sie Eingabeaufforderungen haben, die wahrscheinlich seltener als 5 Minuten, aber häufiger als jede Stunde verwendet werden. Zum Beispiel, wenn ein Agenten-Side-Agent länger als 5 Minuten benötigt oder wenn Sie eine lange Chat-Konversation mit einem Benutzer speichern und Sie im Allgemeinen erwarten, dass der Benutzer in den nächsten 5 Minuten nicht reagiert.

  • Wenn die Latenz wichtig ist und Ihre Aufforderungen zur Nachverfolgung möglicherweise länger als 5 Minuten gesendet werden.

  • Wenn Sie Ihr Ratenlimit verbessern möchten, nutzen Sie es, da Cache-Treffer nicht von Ihrem Ratenlimit abgezogen werden.

Sie können in derselben Anfrage sowohl Cache-Kontrollen für 1 Stunde als auch 5 Minuten verwenden, allerdings mit einer wichtigen Einschränkung: Cache-Einträge mit einer längeren TTL müssen vor kürzeren TTLs erscheinen (d. h. ein 1-stündiger Cacheeintrag muss vor allen 5-Minuten-Cacheeinträgen erscheinen).

Promptes Caching für Modelle von OpenAI

OpenAI-Modelle auf Amazon Bedrock unterstützen implizites Prompt-Caching über die Responses API. GPT-5.6 Modelle unterstützen auch explizites Prompt-Caching. Die Responses API ist sowohl auf den Endpunkten als auch auf den bedrock-runtime bedrock-mantle Endpunkten verfügbar.

GPT-5.6 Modelle

GPT-5.6 Sol (openai.gpt-5.6-sol), Terra () und Luna (openai.gpt-5.6-terraopenai.gpt-5.6-luna) unterstützen sowohl implizites Prompt-Caching als auch Explizites Prompt-Caching. Mithilfe von Breakpoints im Cache für explizite Eingabeaufforderungen können Sie genau steuern, welche Teile Ihrer Eingabeaufforderung zwischengespeichert werden können. Dies ist besonders nützlich für agentische Workflows, bei denen sich Systemanweisungen, Tooldefinitionen und Referenzdateien bei vielen Aufrufen wiederholen, während sich nur die letzten Eingaben ändern.

Wichtigste Eigenschaften:

  • Explizite Cache-Breakpoints — Markieren Sie das genaue Ende eines wiederverwendbaren Prompt-Präfixes, indem Sie "prompt_cache_breakpoint": {"mode": "explicit"} es zu einem unterstützten Inhaltsblock hinzufügen.

  • Cache-Modi — Diese Einstellung dient prompt_cache_options.mode zur Steuerung des Verhaltens von Breakpoints:

    • implicit(Standard) — Platziert einen automatischen Breakpoint für die letzte Nachricht und verwendet auch alle expliziten Breakpoints, die Sie angeben.

    • explicit— Deaktiviert den automatischen Breakpoint. Für Lese- und Schreibvorgänge im Cache werden nur explizite Breakpoints verwendet. Wenn keine expliziten Breakpoints vorhanden sind, verwendet die Anforderung kein Prompt-Caching und es fallen auch keine Cache-Schreibgebühren an.

  • Mindestlänge des Präfixes — 1.024 Token pro Breakpoint.

  • TTL von mindestens 30 Minuten — Zwischengespeicherte Präfixe bleiben mindestens 30 Minuten lang zur Wiederverwendung verfügbar. Das ist lang genug, um die Anzahl der Anrufe abzudecken, die ein einzelner Agentenlauf generiert. Die TTL ist über prompt_cache_options.ttl gesetzt und standardmäßig auf. 30m

  • Abrechnung von Cache-Schreibvorgängen — In den Cache geschriebene Token werden mit dem 1,25-fachen der Rate für nicht zwischengespeicherte Eingabe-Tokens in Rechnung gestellt. Cache-Lesevorgänge werden im Vergleich zu nicht zwischengespeicherten Eingabe-Token mit einem Rabatt von 90% in Rechnung gestellt.

  • Zwischengespeicherte Token werden nicht auf die Ratenlimits angerechnet — Zwischengespeicherte Eingabe-Token, die durch das Prompt-Caching gelesen werden, werden nicht auf das Kontingent für Eingabe-Tokens pro Minute angerechnet.

Die Antwort verstehen

Das Nutzungsobjekt in der Antwort umfasst zwei cachespezifische Felder:

  • cached_tokens— Anzahl der aus dem Cache gelesenen Eingabe-Tokens (für die Abrechnung wird der Diskontsatz für Cache-Lesevorgänge berechnet).

  • cache_write_tokens— Anzahl der Eingabe-Tokens, die in den Cache geschrieben wurden (die Abrechnung erfolgt mit dem 1,25-fachen der Rate für nicht zwischengespeicherte Eingabe-Tokens).

Wenn cached_tokens größer als Null und Null cache_write_tokens ist, stimmt Ihre Anfrage vollständig mit einem vorhandenen Cache-Eintrag überein — es wurden keine neuen Schreibvorgänge vorgenommen und Sie haben die maximale Kostenersparnis erzielt.

Bewährte Methoden für die Verwendung der Cache-Verwaltung in GPT 5.6-Modellen

  • Platzieren Sie Haltepunkte nach stabilen Inhalten — Systemanweisungen, Tooldefinitionen und Referenzdokumente, die sich zwischen den Aufrufen nicht ändern, sollten vor dem Breakpoint erscheinen. Der Inhalt nach dem Breakpoint kann beliebig geändert werden, ohne dass das zwischengespeicherte Präfix ungültig wird.

  • Verwenden Sie explicit den Modus für agentische Schleifen — Wenn Sie die volle Kontrolle darüber haben möchten, was zwischengespeichert wird, und vermeiden möchten, dass automatische Breakpoints Schreibplätze belegen.

  • Überwachen cache_write_tokens — Vergleichen Sie das Cache-Schreibvolumen mit nachfolgenden Cache-Lesevorgängen, um sich ein Bild von den Nettokosten zu machen und die Platzierung der Breakpoints entsprechend anzupassen.

GPT-5.5 und frühere Modelle

Bei älteren OpenAI-Modellen GPT-5.6 (wie openai.gpt-5.5 undopenai.gpt-5.4) erfolgt das implizite Prompt-Caching automatisch. Sie müssen keine speziellen Parameter hinzufügen. Das System versucht automatisch, geeignete Präfixe für Eingabeaufforderungen von 1.024 Token oder mehr zwischenzuspeichern. Für Cache-Writes fallen für diese Modelle keine zusätzliche Gebühr an.

Wichtigste Eigenschaften:

  • Implizites Prompt-Caching — Es sind keine Codeänderungen erforderlich. Das System versucht automatisch, Präfixe auf der Grundlage einer exakten Präfixübereinstimmung zwischenzuspeichern.

  • Mindestlänge des Präfixes — 1.024 Token.

  • Keine Cache-Schreibgebühr — Nur Cache-Lesevorgänge werden zu einem ermäßigten Preis in Rechnung gestellt.

  • Zwischengespeicherte Token zählen nicht zu den Ratenlimits — Zwischengespeicherte Eingabetoken, die durch das Prompt-Caching gelesen werden, werden nicht auf das Kontingent für Eingabe-Tokens pro Minute angerechnet.

Bewährte Methoden für die Verwendung der Cache-Verwaltung in und früheren Modellen GPT-5.5

  • Platzieren Sie statische Inhalte (Systemaufforderungen, Werkzeugdefinitionen, Referenzdokumente) am Anfang Ihrer Eingabeaufforderung.

  • Platzieren Sie variablen Inhalt (benutzerspezifische Eingabe) am Ende.

  • Sorgen Sie für einen stetigen Strom von Anfragen mit identischen Präfixen, um Cache-Löschungen zu minimieren.

Erste Schritte

Die folgenden Abschnitte geben Ihnen einen kurzen Überblick darüber, wie Sie das Prompt-Caching-Feature für jede Methode der Interaktion mit Modellen über Amazon Bedrock verwenden können.

Die Converse-API bietet erweiterte und flexible Optionen für die Implementierung von Prompt-Caching in Multi-Turn-Konversationen. Weitere Informationen zu den Prompt-Anfragen der einzelnen Modelle finden Sie im vorherigen Abschnitt Unterstützte Modelle, Regionen und explizite Caching-Grenzwerte.

Beispielanforderung

Die folgenden Beispiele zeigen einen Cache-Checkpoint, der im Feld messages, system oder tools einer Anfrage an die Converse-API festgelegt ist. Sie können an jedem dieser Orte Checkpoints für eine bestimmte Anfrage platzieren. Wenn Sie beispielsweise eine Anfrage an das Modell Claude 3.5 Sonnet v2 senden, könnten Sie zwei Cache-Checkpoints in messages platzieren, einen Cache-Checkpoint in system und einen in tools. Ausführlichere Informationen und Beispiele für die Strukturierung und das Senden von Converse-API-Anfragen finden Sie unter Inferenz mit der Converse-API.

Wichtig

Cache-Checkpoints werden in dieser Reihenfolge verarbeitet: → →. tools system messages Die minimale Cachegröße wird anhand der kumulativen Tokens in allen drei Abschnitten zusammen berechnet, nicht in jedem Abschnitt einzeln. Da die Abschnitte verkettet sind, macht das Ändern des Inhalts in einem früheren Abschnitt den Cache für spätere Abschnitte ungültig (z. B. macht eine Änderung die system Und-Caches tools ungültig). messages Um die besten Cache-Trefferraten zu erzielen, platzieren Sie stabile Inhalte (tools,system) vor variablem Inhalt (messages) und Cache-Checkpoints nach dem stabilen Inhalt.

Geben Sie den gewünschten TTL-Wert wie unten angegeben an. Wenn kein TTL-Wert angegeben ist, gilt das Standardverhalten von 5 Minuten Caching.

"cachePoint" : { "type": "default", "ttl" : "5m | 1h" }
messages checkpoints

In diesem Beispiel liefert das erste image-Feld ein Bild für das Modell, und das zweite text-Feld fordert das Modell auf, das Bild zu analysieren. Solange die Zahl der Token vor dem cachePoint im content-Objekt der Mindestanzahl von Token für das Modell entspricht, wird ein Cache-Checkpoint erstellt.

... "messages": [ { "role": "user", "content": [ { "image": { "bytes": "asfb14tscve..." } }, { "text": "What's in this image?" }, { "cachePoint": { "type": "default" } } ] } ] ...
system checkpoints

In diesem Beispiel geben Sie Ihren System-Prompt in das text-Feld ein. Darüber hinaus können Sie ein cachePoint-Feld hinzufügen, um den System-Prompt zwischenzuspeichern.

... "system": [ { "text": "You are an app that creates play lists for a radio station that plays rock and pop music. Only return song names and the artist. " }, { "cachePoint": { "type": "default" } } ], ...
tools checkpoints

In diesem Beispiel geben Sie Ihre Tool-Definition in das toolSpec-Feld ein. (Alternativ können Sie ein Tool aufrufen, das Sie zuvor definiert haben. Weitere Informationen finden Sie unterVerwenden eines Tools, um eine Amazon-Bedrock-Modellantwort zu vervollständigen.) Anschließend können Sie ein cachePoint-Feld hinzufügen, um das Tool zwischenzuspeichern.

... toolConfig={ "tools": [ { "toolSpec": { "name": "top_song", "description": "Get the most popular song played on a radio station.", "inputSchema": { "json": { "type": "object", "properties": { "sign": { "type": "string", "description": "The call sign for the radio station for which you want the most popular song. Example calls signs are WZPZ and WKRP." } }, "required": [ "sign" ] } } } }, { "cachePoint": { "type": "default" } } ] } ...

Die Modellantwort der Converse API enthält drei neue Felder, die speziell für das Zwischenspeichern von Eingabeaufforderungen spezifisch sind. Die Werte cacheReadInputTokens und cacheWriteInputTokens geben an, wie viele Token aus dem Cache gelesen wurden und wie viele Token aufgrund Ihrer vorherigen Anforderung in den Cache geschrieben wurden. Die cacheDetails Werte geben den TTL an, der für die Anzahl der in den Cache geschriebenen Token verwendet wird. Dies sind Werte, die Ihnen von Amazon Bedrock in Rechnung gestellt werden, und zwar zu einem Preis, der unter den Kosten für die vollständige Modellinferenz liegt.

Wichtig

Wenn das Zwischenspeichern von Eingabeaufforderungen aktiviert ist, stellt das inputTokens Feld nur die nicht zwischengespeicherten Eingabetoken dar (Token, die nicht aus dem Cache gelesen oder in den Cache geschrieben wurden). Verwenden Sie die folgende Formel, um die Gesamtzahl der in einer Anfrage gesendeten Eingabetokens zu berechnen:

total input tokens = inputTokens + cacheReadInputTokens + cacheWriteInputTokens

Das Zwischenspeichern von Eingabeaufforderungen ist standardmäßig aktiviert, wenn Sie die InvokeModel API aufrufen. Sie können Cache-Checkpoints an jeder beliebigen Stelle in Ihrem Anforderungstext festlegen, ähnlich wie im vorherigen Beispiel für die Converse-API.

Anthropic Claude

Das folgende Beispiel zeigt, wie Sie den Hauptteil Ihrer InvokeModel Anfrage für das Anthropic Claude 3.5 Sonnet v2-Modell strukturieren. Beachten Sie, dass das genaue Format und die Felder des InvokeModel Nachrichtentexts für Anfragen je nach dem von Ihnen ausgewählten Modell variieren können. Das Format und den Inhalt der Anforderungs- und Antworttexte für verschiedene Modelle finden Sie unter Inferenzanforderungsparameter und Antwortfelder für Basismodelle.

Geben Sie den gewünschten TTL-Wert wie folgt an. Wenn kein TTL-Wert angegeben ist, gilt das Standardverhalten von 5 Minuten Zwischenspeicherung.

"cache_control" : { "type": "ephemeral", "ttl" : "5m | 1h" }
body={ "anthropic_version": "bedrock-2023-05-31", "system":"Reply concisely", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe the best way to learn programming." }, { "type": "text", "text": "Add additional context here for the prompt that meets the minimum token requirement for your chosen model.", "cache_control": { "type": "ephemeral" } } ] } ], "max_tokens": 2048, "temperature": 0.5, "top_p": 0.8, "stop_sequences": [ "stop" ], "top_k": 250 }
Amazon Nova

Das folgende Beispiel zeigt, wie Sie den Hauptteil Ihrer InvokeModel Anfrage für das Modell strukturieren. Amazon Nova Beachten Sie, dass das genaue Format und die Felder des InvokeModel Nachrichtentexts für Anfragen je nach dem von Ihnen ausgewählten Modell variieren können. Das Format und den Inhalt der Anforderungs- und Antworttexte für verschiedene Modelle finden Sie unter Inferenzanforderungsparameter und Antwortfelder für Basismodelle.

{ "system": [{ "text": "Reply Concisely" }], "messages": [{ "role": "user", "content": [{ "text": "Describe the best way to learn programming" }, { "text": "Add additional context here for the prompt that meets the minimum token requirement for your chosen model.", "cachePoint": { "type": "default" } }] }], "inferenceConfig": { "maxTokens": 300, "topP": 0.1, "topK": 20, "temperature": 0.3 } }

Weitere Informationen zum Senden einer InvokeModel Anfrage finden Sie unterSenden Sie eine einzelne Aufforderung mit InvokeModel.

Für OpenAI-Modelle verwenden Sie die Responses API — die sowohl auf dem als auch auf den bedrock-runtime bedrock-mantle Endpunkten verfügbar ist — mit Prompt-Caching-Parametern, die für die Modellgenerierung spezifisch sind. Bei GPT-5.6 Modellen steuern Sie das Caching mit expliziten Breakpoints. Für GPT-5.5 und frühere Versionen erfolgt das Caching automatisch.

GPT-5.6 Beispiel mit expliziten Cache-Breakpoints

Das folgende Beispiel zeigt eine Responses API-Anforderung zur openai.gpt-5.6-sol Verwendung expliziter Cache-Breakpoints. Die Systemanweisung wird zwischengespeichert und für nachfolgende Anfragen wiederverwendet.

{ "model": "openai.gpt-5.6-sol", "prompt_cache_key": "my-app:system-prompt-v1", "prompt_cache_options": { "mode": "explicit" }, "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions. Follow these guidelines: 1. Always cite the relevant documentation section. 2. If unsure, escalate to a human agent. 3. Be concise but thorough...", "prompt_cache_breakpoint": { "mode": "explicit" } } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }

GPT-5.5 Beispiel mit automatischem Caching

Bei GPT-5.5 und früheren Modellen erfolgt das Zwischenspeichern von Eingabeaufforderungen automatisch. Es sind keine Breakpoints oder Cache-Schlüssel erforderlich. Stellen Sie einfach sicher, dass Ihr Prompt-Präfix 1.024 Token überschreitet.

{ "model": "openai.gpt-5.5", "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions..." } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }

Antwort

Die Antwort enthält Metriken zur Cache-Nutzung im usage Objekt:

{ "id": "resp_abc123", "output": [...], "usage": { "input_tokens": 2048, "output_tokens": 256, "total_tokens": 2304, "input_tokens_details": { "cached_tokens": 1920, "cache_write_tokens": 0 } } }

In dieser Antwort wurden 1.920 Token aus dem Cache bereitgestellt und keine neuen Token geschrieben, was auf einen vollständigen Cache-Treffer mit maximalen Kosteneinsparungen hindeutet.

In einem Chat-Playground der Amazon-Bedrock-Konsole können Sie die Prompt-Caching-Option aktivieren, sodass Amazon Bedrock automatisch Cache-Checkpoints für Sie erstellt.

Folgen Sie den Anweisungen unter Generieren von Antworten in der Konsole mithilfe von Playgrounds, um mit dem Erstellen von Prompts in einem Amazon-Bedrock-Playground zu beginnen. Bei unterstützten Modellen wird das Prompt-Caching im Playground automatisch aktiviert. Ist dies jedoch nicht der Fall, gehen Sie wie folgt vor, um das Zwischenspeichern von Eingabeaufforderungen zu aktivieren:

  1. Öffnen Sie das Menü Konfigurationen.

  2. Aktivieren Sie die Option Prompt-Caching.

  3. Führen Sie Ihre Prompts aus.

Nachdem Ihre kombinierten Eingabe- und Modellantworten die für einen Checkpoint erforderliche Mindestanzahl an Token erreicht haben (die je nach Modell unterschiedlich ist), erstellt Amazon Bedrock automatisch den ersten Cache-Checkpoint für Sie. Während Sie weiter chatten, kann Amazon Bedrock zusätzliche Checkpoints erstellen, und zwar bis zur maximal zulässigen Anzahl von Checkpoints für das Modell. Die Mindestanzahl wird anhand der kumulativen Anzahl von Tokens vor jedem Checkpoint berechnet, nicht anhand der Anzahl der seit dem vorherigen Checkpoint hinzugefügten Tokens. Sie können Ihre Cache-Checkpoints jederzeit einsehen, indem Sie neben der Option Prompt-Caching die Option Cache-Checkpoints anzeigen auswählen, wie im folgenden Screenshot gezeigt.

Benutzeroberflächen-Umschalter für Prompt-Caching in einer Text-Playground von Amazon Bedrock

Sie können sehen, wie viele Token aufgrund jeder Interaktion mit dem Modell aus dem Cache gelesen und in den Cache geschrieben werden, indem Sie das Popup-Fenster mit den Caching-Metriken ( The metrics icon shown in model responses when prompt caching is enabled. ) in den Playground-Antworten aufrufen.

Feld für Caching-Metriken, in dem die Anzahl der Token angezeigt wird, die aus dem Cache gelesen und in den Cache geschrieben wurden.

Wenn Sie während einer Konversation den Umschalter für Prompt-Caching deaktivieren, können Sie den Chat mit dem Model fortsetzen.