Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Mise en cache des invites pour une inférence de modèle plus rapide
La mise en cache des invites est une fonctionnalité facultative que vous pouvez utiliser avec les modèles pris en charge dans Amazon Bedrock afin de réduire la latence des réponses d’inférence et les coûts des jetons d’entrée. Amazon Bedrock prend en charge deux types de mise en cache rapide : la mise en cache rapide implicite et la mise en cache rapide explicite. La prise en charge de chaque type varie selon le modèle et l'API.
La mise en cache des invites peut être utile lorsque des charges de travail comportant des contextes longs et répétés sont fréquemment réutilisées pour plusieurs requêtes. Par exemple, si vous avez un chatbot où les utilisateurs peuvent charger des documents et poser des questions à leur sujet, le modèle peut prendre beaucoup de temps à traiter les documents chaque fois que l’utilisateur fournit des entrées. Grâce à la mise en cache des invites, vous pouvez mettre le document en cache afin que les futures requêtes contenant le document n’aient pas besoin de le retraiter.
Types de mise en cache rapide
Les deux types diffèrent quant à la manière dont le contenu d'invite réutilisable est sélectionné :
| Type | Comment ça marche | Configuration de la demande |
|---|---|---|
| Mise en cache rapide implicite | Amazon Bedrock et le modèle tentent automatiquement de réutiliser les préfixes d'invite éligibles. | Aucun contrôle de cache ni aucun point d'arrêt n'est requis dans votre demande. |
| Mise en cache rapide explicite | Vous identifiez les préfixes d'invite réutilisables en ajoutant des contrôles de cache ou des points d'arrêt spécifiques au modèle. | Votre demande doit inclure les contrôles de cache pris en charge par le modèle et l'API. |
Mise en cache rapide implicite
La mise en cache implicite tente automatiquement de réutiliser les préfixes d'invite éligibles sans nécessiter de contrôles de cache dans votre demande. Conservez le contenu statique au début de votre invite et le contenu dynamique à la fin pour augmenter la probabilité d'une correspondance exacte entre les préfixes.
La mise en cache rapide implicite est la meilleure solution. La répétition d'une invite identique ne garantit pas l'accès au cache, et les taux d'accès au cache peuvent varier.
Mise en cache rapide explicite
La mise en cache explicite des invites vous permet d'identifier des préfixes d'invite réutilisables à l'aide de contrôles de cache ou de points de contrôle de cache spécifiques au modèle. Les points de contrôle du cache sont des marqueurs qui définissent la sous-section contiguë de votre invite que vous souhaitez mettre en cache. Les préfixes rapides doivent rester statiques entre les requêtes. Les modifications apportées à un préfixe d'invite dans les requêtes suivantes entraînent des erreurs de cache.
Les points de contrôle du cache comportent un nombre minimum et maximum de jetons, selon le modèle. Vous ne pouvez créer un point de contrôle du cache que si le nombre total de préfixes d’invite correspond au nombre minimum de jetons. Par exemple, Claude Opus 5 nécessite au moins 512 jetons par point de contrôle de cache, Claude Sonnet 5 nécessite au moins 1 024 jetons par point de contrôle de cache et Claude Haiku 4.5 nécessite au moins 4 096 jetons par point de contrôle de cache. Le minimum s'applique cumulativement à l'intégralité du préfixe d'invite avant chaque point de contrôle, y compris, le cas échéant, au contenu des champs toolssystem, et. messages Il n'y a pas de nombre minimum de jetons requis entre les points de contrôle du cache. Pour un modèle avec un minimum de 1 024 jetons, vous pouvez définir des points de contrôle supplémentaires distants de moins de 1 024 jetons, à condition que le préfixe d'invite total avant chaque point de contrôle contienne au moins 1 024 jetons. Si vous ajoutez un point de contrôle de cache avant que le nombre total de préfixes d'invite n'atteigne le nombre minimum de jetons, votre inférence est toujours réussie, mais votre préfixe n'est pas mis en cache.
Le cache possède une durée de vie (TTL), qui se réinitialise à chaque accès réussi au cache. Pendant cette période, le contexte en cache est conservé. Si aucun accès au cache ne se produit pendant la période TTL, celui-ci expire. De nombreux modèles prennent en charge un TTL de 5 minutes. Consultez la fiche modèle de votre modèle pour connaître les conditions TTL exactes.
La mise en cache explicite des invites permet de contrôler quel contenu d'invite est éligible à la mise en cache. Cela ne garantit pas qu'une demande éligible entraîne un accès au cache.
Facturation des jetons mis en cache
Pour la mise en cache rapide implicite et la mise en cache rapide explicite, les jetons lus avec succès depuis le cache sont signalés comme des jetons mis en cache et facturés au taux de lecture du cache du modèle. Les jetons qui ne sont pas lus depuis le cache sont facturés au tarif standard des jetons d'entrée. Selon le modèle, les jetons écrits dans le cache peuvent être facturés à un taux supérieur au taux de jetons d'entrée standard. Pour plus d’informations, consultez la page Tarification Amazon Bedrock
Important
La prise en charge de la mise en cache rapide ne garantit pas l'accès au cache pour toute demande. Vérifiez les champs d'utilisation du cache dans la réponse du modèle pour déterminer si les jetons ont été lus ou écrits dans le cache.
Vous pouvez utiliser la mise en cache rapide lorsque vous exécutez une inférence dans Amazon Bedrock avec des modèles pris en charge. La disponibilité de chaque type de mise en cache rapide varie selon le modèle et l'API. La mise en cache rapide est disponible via les fonctionnalités Amazon Bedrock suivantes :
- Converse et API ConverseStream
-
Vous pouvez poursuivre une conversation avec un modèle pris en charge. Pour la mise en cache explicite des invites, spécifiez les points de contrôle du cache dans vos invites.
- InvokeModel et InvokeModelWithResponseStream API
-
Vous pouvez envoyer des demandes en une seule invite aux modèles pris en charge. Pour la mise en cache rapide explicite, activez la mise en cache rapide et spécifiez vos points de contrôle du cache.
- Mise en cache rapide avec inférence Cross-region
-
La mise en cache rapide peut être utilisée conjointement avec l'inférence interrégionale. Cross-region l'inférence sélectionne automatiquement la AWS région optimale de votre zone géographique pour répondre à votre demande d'inférence, maximisant ainsi les ressources disponibles et la disponibilité des modèles. En période de forte demande, ces optimisations peuvent entraîner une augmentation du nombre d’écritures dans le cache.
- Amazon Bedrock Prompt Management
-
Lorsque vous créez ou modifiez une invite, vous pouvez choisir d’activer la mise en cache des invites. Selon le modèle, vous pouvez mettre en cache les invites système, les instructions système et les messages (utilisateur et assistant). Vous pouvez également choisir de désactiver la mise en cache des invites.
Note
La mise en cache rapide n'est prise en charge que pour les points de terminaison d'inférence à la demande. Elle n'est pas prise en charge par l'API d'inférence par lots.
Pour les modèles qui prennent en charge la mise en cache rapide explicite, les API fournissent un contrôle granulaire du cache d'invite. Vous pouvez définir des points de contrôle de cache individuels dans vos instructions et ajouter des points de contrôle jusqu'au maximum autorisé pour le modèle. Pour de plus amples informations, veuillez consulter Modèles, régions et limites de mise en cache explicites pris en charge.
Modèles, régions et limites de mise en cache explicites pris en charge
La prise en charge de la mise en cache rapide varie selon le modèle et l'API. Les fiches modèles indiquent si un modèle prend en charge la mise en cache rapide implicite, la mise en cache rapide explicite ou les deux. La mise en cache rapide est disponible dans toutes les AWS régions où les modèles pris en charge sont disponibles. Pour vérifier la disponibilité des modèles par région, consultezDisponibilité régionale par modèle.
Le tableau suivant répertorie les modèles qui prennent en charge la mise en cache rapide explicite, ainsi que leurs minimums de jetons, leur nombre maximum de points de contrôle de cache et les champs qui autorisent les points de contrôle de cache.
Pour connaître les types de mise en cache rapide pris en charge par un modèle, reportez-vous à la section Modèles en un coup d'œil, puis choisissez le modèle qui vous intéresse.
| Nom du modèle | ID du modèle | Type de version | Nombre minimum de jetons par point de contrôle du cache | Nombre maximum de points de contrôle du cache par demande | TTL pris en charge | Champs qui acceptent les points de contrôle de mise en cache des invites |
|---|---|---|---|---|---|---|
Claude Fable 5.1 |
anthropique.claude-fable-5-1 |
Disponibilité générale |
512 |
4 |
5 minutes, 1 heure |
`système`, `messages` et `outils` |
Claude Mythos 5.1 |
anthropique.claude-mythos-5-1 |
Clôturé |
512 |
4 |
5 minutes, 1 heure |
`système`, `messages` et `outils` |
Claude Fable 5 |
anthropique.claude-fable-5 |
Disponibilité générale |
512 |
4 |
5 minutes, 1 heure |
`système`, `messages` et `outils` |
Claude Mythos 5 |
anthropique.claude-mythos-5 |
Clôturé |
512 |
4 |
5 minutes, 1 heure |
`système`, `messages` et `outils` |
Claude Mythos Preview |
anthropic.claude-mythos-aperçu |
Clôturé |
4 096 |
4 |
5 minutes, 1 heure |
`système`, `messages` et `outils` |
Claude Opus 5 |
anthropic.claude-opus-5 |
Disponibilité générale |
512 |
4 |
5 minutes, 1 heure |
`système`, `messages` et `outils` |
Claude Opus 4.8 |
anthropique.claude-opus-4-8 |
Disponibilité générale |
1,024 |
4 |
5 minutes, 1 heure |
`système`, `messages` et `outils` |
Claude Opus 4.7 |
anthropique.claude-opus-4-7 |
Disponibilité générale |
4 096 |
4 |
5 minutes, 1 heure |
`système`, `messages` et `outils` |
Claude Opus 4.6 |
anthropique.claude-opus-4-6-v1 |
Disponibilité générale |
4 096 |
4 |
5 minutes, 1 heure |
`système`, `messages` et `outils` |
Claude Opus 4.5 |
anthropique.claude-opus-4-5-20251101-v 1:0 |
Disponibilité générale |
4 096 |
4 |
5 minutes, 1 heure |
`système`, `messages` et `outils` |
Claude Sonnet 5 |
anthropique.claude-sonnet-5 |
Disponibilité générale |
1,024 |
4 |
5 minutes, 1 heure |
`système`, `messages` et `outils` |
Claude Sonnet 4.6 |
anthropique.claude-sonnet-4-6 |
Disponibilité générale |
1,024 |
4 |
5 minutes, 1 heure |
`système`, `messages` et `outils` |
Claude Sonnet 4.5 |
anthropic.claude-sonnet-4-5-20250929-v1:0 |
Disponibilité générale |
1,024 |
4 |
5 minutes, 1 heure |
`système`, `messages` et `outils` |
Claude 3.7 Sonnet |
anthropic.claude-3-7-sonnet-20250219-v1:0 |
Disponibilité générale |
1,024 |
4 |
5 minutes |
`système`, `messages` et `outils` |
Claude 3.5 Sonnet v2 |
anthropic.claude-3-5-sonnet-20241022-v2:0 |
Version préliminaire |
1,024 |
4 |
5 minutes |
`système`, `messages` et `outils` |
Claude Haiku 4.5 |
anthropic.claude-haiku-4-5-20251001-v1:0 |
Disponibilité générale |
4 096 |
4 |
5 minutes, 1 heure |
`système`, `messages` et `outils` |
GPT-5.6 Sol |
openai.gpt-5.6-sol |
Disponibilité générale |
1,024 |
4 |
30 minutes |
|
GPT-5.6 Terra |
openai.gpt-5.6-terra |
Disponibilité générale |
1,024 |
4 |
30 minutes |
|
GPT-5.6 Luna |
openai.gpt-5.6-luna |
Disponibilité générale |
1,024 |
4 |
30 minutes |
|
Pour utiliser l'option TTL d'une heure avec les modèles pris en charge (Claude Fable 5Claude Opus 5,Claude Opus 4.8,Claude Opus 4.7,Claude Opus 4.6,Claude Opus 4.5, etClaude Haiku 4.5) Claude Sonnet 5 Claude Sonnet 4.6Claude Sonnet 4.5, spécifiez le ttl champ dans votre point de contrôle du cache. Dans l'API Converse, ajoutez-le "ttl": "1h" à votre cachePoint objet. Dans l' InvokeModel API pour les modèles Claude, ajoutez-les "ttl": "1h" à votre cache_control objet. Si aucune ttl valeur n'est fournie, le comportement de mise en cache par défaut de 5 minutes s'applique. Le TTL d'une heure est utile pour les sessions de longue durée ou les scénarios de traitement par lots dans lesquels vous souhaitez conserver le cache pendant de longues périodes.
Amazon Novapropose une mise en cache implicite pour toutes les invites textuelles, y compris User les messages. System Ce mécanisme peut apporter des avantages en termes de latence lorsque les instructions commencent par des parties répétitives, sans configuration explicite. Amazon Novales modèles présentés comme prenant en charge la mise en cache rapide explicite dans leurs fiches modèles vous permettent également de spécifier des points de contrôle du cache pour mieux contrôler l'éligibilité du cache.
Mise en cache rapide des modèles d'Anthropic
Les modèles anthropiques qui prennent en charge la mise en cache rapide sur Amazon Bedrock prennent en charge à la fois la mise en cache rapide implicite et la mise en cache rapide explicite. La mise en cache implicite tente automatiquement de réutiliser les préfixes d'invite éligibles sans nécessiter de contrôles de cache dans votre demande.
Pour la mise en cache rapide et explicite, Amazon Bedrock propose une approche simplifiée de la gestion du cache qui réduit la complexité liée au placement manuel des points de contrôle du cache. Au lieu de vous obliger à spécifier des emplacements précis pour les points de contrôle du cache, vous pouvez utiliser la gestion automatique du cache avec un seul point d’arrêt à la fin de votre contenu statique.
Lorsque vous activez la gestion simplifiée du cache, le système vérifie automatiquement les accès au cache aux limites des blocs de contenu précédents, en remontant jusqu’à environ 20 blocs de contenu par rapport au point d’arrêt spécifié. Cela permet au modèle de trouver le préfixe correspondant le plus long dans votre cache sans que vous ayez à prévoir l’emplacement optimal des points de contrôle. Pour l’utiliser, placez un point de contrôle du cache unique à la fin de votre contenu statique, avant tout contenu dynamique ou variable. Le système trouvera automatiquement la meilleure correspondance dans le cache.
Pour un contrôle plus précis, vous pouvez toujours utiliser plusieurs points de contrôle du cache (jusqu’à 4 pour les modèles Claude) pour définir les limites exactes du cache. Vous devez utiliser plusieurs points de contrôle du cache si vous mettez en cache des sections qui changent à des fréquences différentes ou si vous souhaitez mieux contrôler exactement ce qui est mis en cache.
Important
La vérification automatique des préfixes ne prend en compte qu’une vingtaine de blocs de contenu depuis le point de contrôle du cache. Si votre contenu statique dépasse cette plage, envisagez d’utiliser plusieurs points de contrôle du cache ou de restructurer votre invite pour placer le contenu le plus fréquemment réutilisé dans cette plage.
Meilleures pratiques relatives à l'utilisation de la gestion du cache dans les modèles anthropiques
Si certaines instructions sont utilisées à une cadence régulière (c'est-à-dire si les instructions système sont utilisées plus fréquemment que toutes les 5 minutes), continuez à utiliser le cache de 5 minutes, car celui-ci continuera d'être actualisé sans frais supplémentaires.
Il est préférable d'utiliser le cache d'une heure dans les scénarios suivants :
-
Lorsque vous avez des instructions qui sont probablement utilisées moins de 5 minutes, mais plus fréquemment que toutes les heures. Par exemple, lorsqu'un agent secondaire d'une agence prend plus de 5 minutes, ou lorsque vous stockez une longue conversation avec un utilisateur et que vous vous attendez généralement à ce que cet utilisateur ne réponde pas dans les 5 prochaines minutes.
-
Lorsque la latence est importante et que vos demandes de suivi peuvent être envoyées au-delà de 5 minutes.
-
Lorsque vous souhaitez améliorer l'utilisation de votre limite de débit, car les accès au cache ne sont pas déduits de votre limite de débit.
Vous pouvez utiliser à la fois des contrôles de cache d'une heure et de 5 minutes dans la même requête, mais avec une contrainte importante : les entrées de cache avec un TTL plus long doivent apparaître avant des TTL plus courts (c'est-à-dire qu'une entrée de cache d'une heure doit apparaître avant toute entrée de cache de 5 minutes).
Mise en cache rapide pour les modèles d'OpenAI
Les modèles OpenAI sur Amazon Bedrock prennent en charge la mise en cache rapide implicite via l'API Responses. GPT-5.6 les modèles prennent également en charge la mise en cache rapide explicite. L'API Responses est disponible à la fois sur les bedrock-mantle terminaux bedrock-runtime et sur les terminaux.
GPT-5.6 modèles
GPT-5.6 Sol (openai.gpt-5.6-sol), Terra () et Luna (openai.gpt-5.6-terraopenai.gpt-5.6-luna) prennent en charge à la fois la mise en cache rapide implicite et la mise en cache rapide explicite. Les points d'arrêt explicites du cache des invites vous permettent de contrôler avec précision les parties de votre invite éligibles à la mise en cache. Cela est particulièrement utile pour les flux de travail agentiques où les instructions système, les définitions d'outils et les fichiers de référence se répètent sur de nombreux appels alors que seules les dernières entrées sont modifiées.
Caractéristiques principales :
Points d'arrêt explicites du cache : marquez la fin exacte d'un préfixe d'invite réutilisable en l'ajoutant
"prompt_cache_breakpoint": {"mode": "explicit"}à un bloc de contenu pris en charge.Modes de cache : paramétrés
prompt_cache_options.modepour contrôler le comportement des points d'arrêt :implicit(par défaut) : place un point d'arrêt automatique sur le dernier message et utilise également tous les points d'arrêt explicites que vous fournissez.explicit— Désactive le point d'arrêt automatique. Seuls les points d'arrêt explicites sont utilisés pour les lectures et les écritures dans le cache. S'il n'existe aucun point d'arrêt explicite, la demande n'utilise pas la mise en cache rapide et n'entraîne pas de frais d'écriture en cache.
Longueur minimale du préfixe : 1 024 jetons par point d'arrêt.
TTL minimum de 30 minutes : les préfixes mis en cache peuvent être réutilisés pendant au moins 30 minutes, soit suffisamment longtemps pour couvrir la rafale d'appels générée par une seule exécution d'agent. Le TTL est défini via
prompt_cache_options.ttlet est défini par défaut sur.30mFacturation de l'écriture dans le cache : les jetons écrits dans le cache sont facturés à 1,25 fois le taux des jetons d'entrée non mis en cache. Les lectures de cache sont facturées avec une réduction de 90 % par rapport aux jetons d'entrée non mis en cache.
Les jetons mis en cache ne sont pas pris en compte dans les limites de débit — Les jetons d'entrée en cache lus via la mise en cache rapide ne sont pas pris en compte dans le quota de jetons d'entrée par minute.
Comprendre la réponse
L'objet d'utilisation de la réponse inclut deux champs spécifiques au cache :
cached_tokens— Nombre de jetons d'entrée lus depuis le cache (facturés au taux d'actualisation pour lecture en cache).cache_write_tokens— Nombre de jetons d'entrée écrits dans le cache (facturés à 1,25 fois le taux de jetons d'entrée non mis en cache).
Lorsque cached_tokens cette valeur est supérieure à zéro et cache_write_tokens égale à zéro, votre demande correspondait entièrement à une entrée de cache existante. Aucune nouvelle écriture n'a eu lieu et vous avez réalisé le maximum d'économies.
Meilleures pratiques pour utiliser la gestion du cache dans les modèles GPT 5.6
Placez les points d'arrêt après un contenu stable : les instructions système, les définitions d'outils et les documents de référence qui ne changent pas entre les appels devraient apparaître avant le point d'arrêt. Le contenu situé après le point d'arrêt peut changer librement sans invalider le préfixe mis en cache.
explicitMode d'utilisation pour les boucles agentiques : lorsque vous souhaitez contrôler totalement ce qui est mis en cache et éviter que les points d'arrêt automatiques ne consomment des emplacements d'écriture.Surveiller
cache_write_tokens: comparez le volume d'écriture en cache par rapport aux lectures de cache suivantes pour comprendre l'impact sur les coûts nets et ajuster le placement des points d'arrêt en conséquence.
GPT-5.5 et modèles antérieurs
Pour les modèles OpenAI antérieurs à GPT-5.6 (tels que openai.gpt-5.5 etopenai.gpt-5.4), la mise en cache rapide implicite est automatique. Il n'est pas nécessaire d'ajouter de paramètres particuliers. Le système tente automatiquement de mettre en cache les préfixes d'invite éligibles de 1 024 jetons ou plus. Les écritures en cache sont gratuites sur ces modèles.
Caractéristiques principales :
Mise en cache rapide implicite : aucune modification de code n'est requise. Le système tente de mettre automatiquement en cache les préfixes en fonction de leur correspondance exacte.
Longueur minimale du préfixe : 1 024 jetons.
Aucuns frais d'écriture du cache — Seules les lectures du cache sont facturées à un tarif réduit.
Les jetons mis en cache ne sont pas pris en compte dans les limites de débit — Les jetons d'entrée en cache lus via la mise en cache rapide ne sont pas pris en compte dans le quota de jetons d'entrée par minute.
Meilleures pratiques relatives à l'utilisation de la gestion du cache dans les modèles GPT-5.5 et les modèles antérieurs
Placez du contenu statique (instructions système, définitions d'outils, documents de référence) au début de votre invite.
Placez un contenu variable (entrée spécifique à l'utilisateur) à la fin.
Maintenez un flux constant de demandes avec des préfixes identiques afin de minimiser les évictions de cache.
Prise en main
Les sections suivantes présentent un bref aperçu de l’utilisation de la fonctionnalité de mise en cache des invites pour chaque méthode d’interaction avec les modèles via Amazon Bedrock.
L’API Converse fournit des options avancées et flexibles pour implémenter une mise en cache des invites dans les conversations complexes. Pour plus d’informations sur les exigences d’invite pour chaque modèle, consultez la section précédente : Modèles, régions et limites de mise en cache explicites pris en charge.
Exemple de demande
Les exemples suivants montrent un point de contrôle du cache défini dans les champs messages, system ou tools, ou d’une demande à l’API Converse. Vous pouvez placer des points de contrôle à n’importe lequel de ces emplacements pour une demande donnée. Par exemple, si vous envoyez une demande au modèle Claude 3.5 Sonnet v2, vous pouvez placer deux points de contrôle du cache dans messages, un point de contrôle du cache dans system et un autre dans tools. Pour plus de détails et des exemples de structuration et d’envoi de demandes d’API Converse, consultez Inférence à l'aide de l'API Converse.
Important
Les points de contrôle du cache sont traités dans cet ordre : tools → system →messages. La taille minimale du cache est évaluée par rapport aux jetons cumulés dans les trois sections combinées, et non par rapport à chaque section individuellement. Les sections étant enchaînées, la modification du contenu d'une section précédente invalide le cache des sections suivantes (par exemple, la modification tools invalide les caches et). system messages Pour optimiser le taux d'accès au cache, placez le contenu stable (tools,system) avant le contenu variable (messages) et placez les points de contrôle du cache après le contenu stable.
Spécifiez la valeur ttl souhaitée comme ci-dessous. Lorsque la valeur ttl n'est pas spécifiée, le comportement par défaut d'une mise en cache de 5 minutes s'applique.
"cachePoint" : { "type": "default", "ttl" : "5m | 1h" }
La réponse du modèle de l'ConverseAPI inclut trois nouveaux champs spécifiques à la mise en cache rapide. Les valeurs cacheReadInputTokens et cacheWriteInputTokens vous indiquent combien de jetons ont été lus depuis le cache et combien de jetons ont été écrits dans le cache à la suite de votre précédente demande. Les cacheDetails valeurs vous indiquent le ttl utilisé pour le nombre de jetons écrits dans le cache. Il s’agit de valeurs qui vous sont facturées par Amazon Bedrock, à un tarif inférieur au coût de l’inférence de modèle complète.
Important
Lorsque la mise en cache rapide est activée, le inputTokens champ représente uniquement les jetons d'entrée non mis en cache (jetons qui n'ont pas été lus ou écrits dans le cache). Pour calculer le nombre total de jetons d'entrée envoyés dans une demande, utilisez la formule suivante :
total input tokens = inputTokens + cacheReadInputTokens + cacheWriteInputTokens
La mise en cache rapide est activée par défaut lorsque vous appelez l'InvokeModelAPI. Vous pouvez définir des points de contrôle du cache à tout moment dans le corps de votre demande, comme dans l’exemple précédent pour l’API Converse.
Pour plus d'informations sur l'envoi d'une InvokeModel demande, consultezSoumettez une seule invite avec InvokeModel.
Pour les modèles OpenAI, vous utilisez l'API Responses, disponible à la fois sur les bedrock-mantle terminaux bedrock-runtime et sur les terminaux, avec des paramètres de mise en cache rapide spécifiques à la génération du modèle. Pour les GPT-5.6 modèles, vous contrôlez la mise en cache à l'aide de points d'arrêt explicites. Pour les versions antérieures GPT-5.5 et antérieures, la mise en cache est automatique.
GPT-5.6 exemple avec des points d'arrêt de cache explicites
L'exemple suivant montre une demande d'API Responses visant à openai.gpt-5.6-sol utiliser des points d'arrêt de cache explicites. L'instruction système est mise en cache et réutilisée lors des requêtes suivantes.
{ "model": "openai.gpt-5.6-sol", "prompt_cache_key": "my-app:system-prompt-v1", "prompt_cache_options": { "mode": "explicit" }, "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions. Follow these guidelines: 1. Always cite the relevant documentation section. 2. If unsure, escalate to a human agent. 3. Be concise but thorough...", "prompt_cache_breakpoint": { "mode": "explicit" } } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }
GPT-5.5 exemple avec mise en cache automatique
Pour GPT-5.5 les modèles antérieurs, la mise en cache rapide est automatique. Aucun point d'arrêt ou clé de cache n'est nécessaire. Assurez-vous simplement que le préfixe de votre invite dépasse 1 024 jetons.
{ "model": "openai.gpt-5.5", "input": [ { "type": "message", "role": "developer", "content": [ { "type": "input_text", "text": "You are a technical support agent. Use the company knowledge base to answer questions..." } ] }, { "type": "message", "role": "user", "content": [ { "type": "input_text", "text": "How do I configure SSO for my organization?" } ] } ] }
Réponse
La réponse inclut des mesures d'utilisation du cache dans l'usageobjet :
{ "id": "resp_abc123", "output": [...], "usage": { "input_tokens": 2048, "output_tokens": 256, "total_tokens": 2304, "input_tokens_details": { "cached_tokens": 1920, "cache_write_tokens": 0 } } }
Dans cette réponse, 1 920 jetons ont été servis à partir du cache et aucun nouveau jeton n'a été écrit, ce qui indique un accès complet au cache avec des économies de coûts maximales.
Dans un terrain de jeu de discussion de la console Amazon Bedrock, vous pouvez activer l’option de mise en cache des invites. Ensuite, Amazon Bedrock crée automatiquement des points de contrôle du cache pour vous.
Suivez les instructions de Génération de réponses dans la console à l’aide de terrains de jeu pour commencer à recevoir des invites dans un terrain de jeu Amazon Bedrock. Pour les modèles pris en charge, la mise en cache des invites est automatiquement activée dans le terrain de jeu. Toutefois, si ce n'est pas le cas, procédez comme suit pour activer la mise en cache rapide :
-
Ouvrez le menu Configurations.
-
Activez la bascule Mise en cache des invites.
-
Exécutez vos invites.
Une fois que vos réponses combinées d’entrée et de modèle atteignent le nombre minimum de jetons requis pour un point de contrôle (qui varie selon le modèle), Amazon Bedrock crée automatiquement le premier point de contrôle du cache pour vous. Pendant que vous continuez à discuter, Amazon Bedrock peut créer des points de contrôle supplémentaires, dans la limite du nombre maximum de points de contrôle autorisé pour le modèle. Le minimum est évalué en fonction du nombre cumulé de jetons avant chaque point de contrôle, et non du nombre de jetons ajoutés depuis le point de contrôle précédent. Vous pouvez consulter les points de contrôle de votre cache à tout moment en choisissant Afficher les points de contrôle du cache en regard de la bascule Mise en cache des invites, comme le montre la capture d’écran suivante.
Vous pouvez voir le nombre de jetons qui sont lus depuis et écrits dans le cache en raison de chaque interaction avec le modèle en consultant la fenêtre contextuelle Métriques de mise en cache (
) dans les réponses du terrain de jeu.
Si vous désactivez la bascule de mise en cache des invites alors que vous êtes au milieu d’une conversation, vous pouvez continuer à discuter avec le modèle.