View a markdown version of this page

API de réponses sur le point de terminaison entre le socle et le manteau rocheux - Amazon Bedrock

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

API de réponses sur le point de terminaison entre le socle et le manteau rocheux

Amazon Bedrock fournit l'API OpenAI Responses à la fois sur les bedrock-mantle terminaux bedrock-runtime et sur les terminaux. L'API vous permet d'utiliser des OpenAI kits SDK et des outils familiers avec les modèles Amazon Bedrock. Vous pouvez ainsi migrer des applications existantes avec un minimum de modifications de code. Il vous suffit de mettre à jour votre URL de base et votre clé d'API. Pour les nouvelles applications, nous recommandons le bedrock-runtime terminal.

Les deux points de terminaison ne prennent pas en charge les mêmes fonctionnalités. Les requêtes activées bedrock-runtime sont toujours synchrones, les outils côté serveur ne sont pas disponibles et seul le projet par défaut est pris en charge. Pour la comparaison complète, voirPoints de terminaison pris en charge par Amazon Bedrock, et pour les détails de chaque différence, voirUtilisation de l'API Responses sur le point de terminaison Bedrock-Runtime.

Important

Lorsque vous utilisez le OpenAI SDK avec Amazon Bedrock, vous devez le pointer vers le point de terminaison Amazon Bedrock, et non vers le point de terminaison. OpenAI Définissez les variables d'environnement suivantes, en choisissant l'URL de base pour le point de terminaison souhaité :

# bedrock-runtime (recommended) OPENAI_BASE_URL="https://bedrock-runtime.<your-region>.amazonaws.com/openai/v1" # bedrock-mantle OPENAI_BASE_URL="https://bedrock-mantle.<your-region>.api.aws/v1" OPENAI_API_KEY="<your Bedrock API key>"

N'utilisez pas votre clé OpenAI API ni l'URL OpenAI de base (https://api.openai.com/v1). Ils se connectent OpenAI directement à Amazon Bedrock, et non à Amazon Bedrock. Pour créer une clé d'API Amazon Bedrock, consultezclés d’API.

Les principaux avantages sont les suivants :

  • Inférence asynchrone  : prise en charge des charges de travail d'inférence de longue durée via l'API Responses. Disponible bedrock-mantle uniquement sur.

  • Gestion dynamique des conversations  : reconstruisez automatiquement le contexte sans transmettre manuellement l'historique des conversations à chaque demande

  • Utilisation simplifiée des outils — Intégration rationalisée pour les flux de travail des agences

  • Modes de réponse flexibles  : prise en charge des réponses en streaming et sans diffusion

  • Migration facile — Compatible avec les bases de OpenAI code SDK existantes

Chaque terminal est régi par son propre ensemble de quotas. Pour le trafic Responses activébedrock-runtime, les quotas de jetons par minute et de jetons par jour du modèle s'appliquent, et ils sont partagés avec les autres API d'inférence sur ce point de terminaison — voir. Quotas pour le paramètre d'exécution fondamental Pour bedrock-mantle, veuillez consulter Quotas pour la limite entre le substrat rocheux et le manteau.

Régions et points de terminaison pris en charge

Sur le bedrock-runtime terminal, l'API Responses est disponible partout Région AWS où ce point de terminaison est disponible, y compris dans les régions AWS GovCloud (États-Unis). Pour la liste, veuillez consulter Disponibilité régionale par point de terminaison. Les modèles qui prennent en charge l'API sur chaque point de terminaison sont répertoriés dansDisponibilité des terminaux par modèle.

Le bedrock-mantle point de terminaison est disponible dans les AWS régions suivantes :

Nom de la région Région Endpoint
USA Est (Ohio) us-east-2 bedrock-mantle.us-east-2.api.aws
USA Est (Virginie du Nord) us-east-1 bedrock-mantle.us-east-1.api.aws
USA Ouest (Oregon) us-west-2 bedrock-mantle.us-west-2.api.aws
Asie-Pacifique (Jakarta) ap-southeast-3 bedrock-mantle.ap-southeast-3.api.aws
Asie-Pacifique (Mumbai) ap-south-1 bedrock-mantle.ap-south-1.api.aws
Asie-Pacifique (Sydney) ap-southeast-2 bedrock-mantle.ap-southeast-2.api.aws
Asie-Pacifique (Tokyo) ap-northeast-1 bedrock-mantle.ap-northeast-1.api.aws
Europe (Francfort) eu-central-1 bedrock-mantle.eu-central-1.api.aws
Europe (Irlande) eu-west-1 bedrock-mantle.eu-west-1.api.aws
Europe (Londres) eu-west-2 bedrock-mantle.eu-west-2.api.aws
Europe (Milan) eu-south-1 bedrock-mantle.eu-south-1.api.aws
Europe (Stockholm) eu-north-1 bedrock-mantle.eu-north-1.api.aws
Amérique du Sud (São Paulo) sa-east-1 bedrock-mantle.sa-east-1.api.aws
AWS GovCloud (US-West) us-gov-west-1 bedrock-mantle.us-gov-west-1.api.aws

Conditions préalables

Avant d'utiliser OpenAI les API, assurez-vous de disposer des éléments suivants :

  • Authentification — Vous pouvez vous authentifier en utilisant :

    • Clé d'API Amazon Bedrock (requise pour le OpenAI SDK)

    • AWS informations d'identification (prises en charge pour les requêtes HTTP)

  • OpenAISDK (facultatif) — Installez le SDK OpenAI Python si vous utilisez SDK-based des requêtes.

  • Variables d'environnement — Définissez les variables d'environnement suivantes :

    • OPENAI_API_KEY— Paramétrez votre clé d'API Amazon Bedrock

    • OPENAI_BASE_URL— Définissez le point de terminaison Amazon Bedrock pour votre région (par exemple, https://bedrock-runtime.us-east-1.amazonaws.com/openai/v1 ouhttps://bedrock-mantle.us-east-1.api.aws/v1)

  • Autorisations  : les actions dont vous avez besoin dépendent du terminal. Activébedrock-mantle, l'inférence autorisebedrock-mantle:CreateInference. Activébedrock-runtime, il autorise à la fois bedrock:InvokeModel sur la cible d'inférence et sur le projet par défaut de votre compte, et la gestion des réponses stockées autorise bedrock:GetInvokebedrock:CancelInvoke, et bedrock:DeleteInvoke sur ce projet. Pour obtenir des exemples de stratégie, consultez Conditions préalables à l’exécution de l’inférence de modèle.

Modèles API

L'API Models vous permet de découvrir les modèles disponibles dans Amazon Bedrock, optimisé par Mantle. Utilisez cette API pour récupérer la liste des modèles que vous pouvez utiliser avec l'API Responses. Pour plus de détails sur l'API, consultez la documentation sur OpenAI les modèles.

Liste des modèles disponibles

Pour répertorier les modèles disponibles, choisissez l'onglet correspondant à votre méthode préférée, puis procédez comme suit :

IA ouverte SDK (Python)
# List all available models using the OpenAI SDK # Requires OPENAI_API_KEY and OPENAI_BASE_URL environment variables from openai import OpenAI client = OpenAI() models = client.models.list() for model in models.data: print(model.id)
HTTP request

Faites une demande GET à l'adresse suivante /v1/models :

# List all available models # Requires OPENAI_API_KEY and OPENAI_BASE_URL environment variables curl -X GET $OPENAI_BASE_URL/models \ -H "Authorization: Bearer $OPENAI_API_KEY"

API de réponses

L'API Responses fournit une gestion dynamique des conversations avec prise en charge du streaming, du traitement en arrière-plan et des interactions multi-tours. Pour plus de détails sur l'API, consultez la documentation sur OpenAI les réponses.

Note

Tous les modèles ne prennent pas en charge l'API Responses. Pour savoir quels modèles prennent en charge l'API Responses, consultezCompatibilité des API par modèle.

Comment l'API Responses enregistre l'état des conversations

L'API Responses peut utiliser l'état stocké pour activer des conversations à plusieurs tours et vous permettre de référencer les tours précédents via le previous_response_id paramètre. Le stockage est activé par défaut mais peut être désactivé par demande via le store paramètre. Les réponses stockées sont classées par projet. Une réponse d'un projet ne peut pas être utilisée comme réponse précédente ou lue dans un second projet. Pour plus d'informations sur les projets, consultezProjets (OpenAI-compatible).

  • Lorsque store cette valeur est définie true (par défaut), Amazon Bedrock conserve la réponse, y compris l'entrée et la sortie, pendant 30 jours. Pendant cette fenêtre, vous pouvez enchaîner les demandes de suivi en transmettant previous_response_id et récupérer la réponse GET /v1/responses/{id} en bedrock-mantle activant ou GET /openai/v1/responses/{id} en activantbedrock-runtime. Après 30 jours, la réponse est automatiquement supprimée et n'est plus récupérable.

  • Quand store c'est false le cas, Amazon Bedrock ne conserve aucune donnée provenant de la demande ou de la réponse. Le previous_response_id paramètre ne peut pas être utilisé pour poursuivre la conversation.

La valeur par défaut correspond true à la spécification de l'API OpenAI Responses. Les clients qui ne souhaitent pas qu'Amazon Bedrock conserve les données de conversation doivent définir explicitement la valeur « store À chaque demande », ou définir le mode de conservation des données du compte false sur «none, ce qui rejette store=true purement et simplement toute demande explicite ». Pour de plus amples informations, veuillez consulter Conservation des données.

Les données stockées sont cryptées au repos et limitées à la ressource Projet du AWS compte appelant. Les données sont stockées uniquement pour répondre à vos demandes et ne sont ni utilisées ni conservées à d'autres fins. Activébedrock-mantle, il est conservé dans l'adresse à Région AWS laquelle la demande a été envoyée. Activébedrock-runtime, une demande qui utilise l'inférence interrégionale peut être traitée dans une autre Région AWS, et la réponse est stockée dans la région qui l'a traitée. Ainsi, une demande utilisant un profil d'inférence global peut stocker des données dans n'importe quelle région commerciale vers laquelle le profil est acheminé. Si vous avez des exigences en matière de résidence des données, utilisez un profil d'inférence géographique plutôt qu'un profil global.

Demande de base

Pour créer une réponse, choisissez l'onglet correspondant à votre méthode préférée, puis suivez les étapes suivantes :

IA ouverte SDK (Python)
# Create a basic response using the OpenAI SDK # Requires OPENAI_API_KEY and OPENAI_BASE_URL environment variables from openai import OpenAI client = OpenAI() response = client.responses.create( model="openai.gpt-oss-120b", input=[ {"role": "user", "content": "Hello! How can you help me today?"} ] ) print(response)
HTTP request

Envoyez une requête POST à l'adresse suivante /v1/responses :

# Create a basic response # Requires OPENAI_API_KEY and OPENAI_BASE_URL environment variables curl -X POST $OPENAI_BASE_URL/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer $OPENAI_API_KEY" \ -d '{ "model": "openai.gpt-oss-120b", "input": [ {"role": "user", "content": "Hello! How can you help me today?"} ] }'

Diffusez les réponses

Pour recevoir les événements de réponse de manière incrémentielle, choisissez l'onglet correspondant à votre méthode préférée, puis procédez comme suit :

IA ouverte SDK (Python)
# Stream response events incrementally using the OpenAI SDK # Requires OPENAI_API_KEY and OPENAI_BASE_URL environment variables from openai import OpenAI client = OpenAI() stream = client.responses.create( model="openai.gpt-oss-120b", input=[{"role": "user", "content": "Tell me a story"}], stream=True ) for event in stream: print(event)
HTTP request

Envoyez une requête POST à /v1/responses avec stream set to true :

# Stream response events incrementally # Requires OPENAI_API_KEY and OPENAI_BASE_URL environment variables curl -X POST $OPENAI_BASE_URL/responses \ -H "Content-Type: application/json" \ -H "Authorization: Bearer $OPENAI_API_KEY" \ -d '{ "model": "openai.gpt-oss-120b", "input": [ {"role": "user", "content": "Tell me a story"} ], "stream": true }'

Utilisation de l'API Responses sur le point de terminaison Bedrock-Runtime

L'API bedrock-runtime Responses utilise le même format de demande et de réponse que surbedrock-mantle, de sorte que le OpenAI SDK fonctionne sur l'un ou l'autre. Ce qui change, c'est l'URL de base, les ID de modèle, les autorisations et un petit nombre de comportements décrits dans cette section.

URL de base et chemins

Définissez votre URL de base surhttps://bedrock-runtime.region.amazonaws.com/openai/v1. L'API est diffusée sur les chemins suivants :

  • POST /openai/v1/responses— créer une réponse.

  • GET /openai/v1/responses/{id}— récupérer une réponse enregistrée.

  • POST /openai/v1/responses/{id}/cancel— annuler une réponse qui est toujours en cours.

  • DELETE /openai/v1/responses/{id}— supprime une réponse enregistrée.

Identifiants des modèles

Désignez un profil d'inférence interrégional comme modèle, et non un identifiant de modèle de base. Les modèles OpenAI GPT utilisent les global. profils us. et dans les régions commerciales et les us-gov. profils dans les régions AWS GovCloud (États-Unis), us.openai.gpt-5.6-sol par exemple. In-Region l'inférence n'est pas disponible pour ces modèles sur ce point de terminaison. Pour l'identifiant de profil de chaque modèle, consultez sa fiche modèle dansLes modèles en un coup d'œil, et pour savoir comment fonctionne le routage, voirAcheminez les demandes d'inférence de modèles entre Régions AWS avec inférence interrégionale.

Autorisations

La création d'une réponse autorise deux ressources : bedrock:InvokeModel (oubedrock:InvokeModelWithResponseStream) sur la cible d'inférence, comme le fait toute demande d'inférence, et bedrock:InvokeModel sur le projet par défaut de votre compte. La récupération, l'annulation et la suppression d'une réponse stockée autorisentbedrock:GetInvoke, et bedrock:DeleteInvoke respectivementbedrock:CancelInvoke, chacun d'entre eux à participer au projet. Les ID de réponse individuels ne sont pas des ressources IAM.

Deux clés de condition permettent à une politique relative à l'une des ressources de contraindre l'autre. L'autorisation de cible d'inférence et l'autorisation de projet portent la valeur du profil d'inférence ou du modèle de base désigné par votre demandebedrock:ModelArn, mais jamais les modèles de destination vers lesquels un profil interrégional est acheminé. bedrock:ProjectArn Pour obtenir des exemples de stratégie, consultez Conditions préalables à l’exécution de l’inférence de modèle.

Différences de comportement

  • Les demandes sont toujours synchrones. background=trueest rejeté avec une erreur 400. Le store paramètre n'est pas affecté et conserve sa valeur par défauttrue, de sorte que les conversations multi-tours stockées fonctionnent normalement.

  • modelest requis pour chaque demande, y compris celle qui fournitprevious_response_id. Cela diffère de la spécification de l'API OpenAI Responses et debedrock-mantle, où le modèle peut être omis et hérité de la réponse précédente. Le modèle fait partie de l'objet pour lequel la demande est autorisée, il doit donc être nommé dans la demande elle-même.

  • Server-side l'utilisation des outils et les outils préconfigurés ne sont pas disponibles, y compris la recherche Recherche sur le Web sur le Web. Client-side l'utilisation de l'outil fonctionne sur les deux terminaux.

  • Seul le projet par défaut est pris en charge. L'OpenAI-Projecten-tête est accepté uniquement en tant default qu'ARN de votre projet par défaut ; toute autre valeur est rejetée. Consultez Projets (OpenAI-compatible).

  • Les profils d'inférence d'applications ne sont pas pris en charge. Une demande qui en désigne une comme cible d'inférence est rejetée avec une erreur 400. Les profils d'inférence système, géographique et global fonctionnent normalement.

  • Les garde-fous ne s'appliquent pas à l'API Responses. Pour appliquer un garde-fou à un modèle GPT sur ce point de terminaison, appelez plutôt l'API Converse.

  • Une réponse stockée appartient à Région AWS celui qui l'a servie. Le récupérer, l'annuler ou le supprimer, ainsi que la poursuite de la conversation avecprevious_response_id, sont tous gérés par cette région. Un identifiant de réponse introuvable (parce qu'il n'a jamais existé, appartient à un autre compte ou n'a jamais été enregistré) renvoie la même erreur 404 dans tous les cas.

Surveillance et coûts

Chaque demande étant synchrone, la journalisation des invocations CloudWatch des métriques et des modèles fonctionne pour l'API Responses de la même manière que pour les autres API d'inférence de ce point de terminaison, y compris pour les demandes de streaming. L'utilisation est attribuée à la cible d'inférence, exactement comme c'est le cas pour Converse. Le projet par défaut n'est jamais l'ancre de facturation. InvokeModel Consultez Suivez l'utilisation et les coûts dans Amazon Bedrock.