View a markdown version of this page

Points de terminaison pris en charge par Amazon Bedrock - Amazon Bedrock

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Points de terminaison pris en charge par Amazon Bedrock

Amazon Bedrock prend en charge différents points de terminaison pour effectuer des opérations d'inférence.

Opérations d'inférence

Pour les nouvelles applications, nous recommandons le bedrock-runtime terminal. Il prend en charge les Bedrock-native InvokeModel API Converse, les API OpenAI-compatible Responses and Chat Completions et l'API Anthropic Messages, et c'est là que les fonctionnalités d'Amazon Bedrock telles que Guardrails, le routage rapide intelligent et l'inférence interrégionale sont disponibles. Acheminez les demandes d'inférence de modèles entre Régions AWS avec inférence interrégionale Amazon Bedrock prend également en charge un deuxième point de terminaisonbedrock-mantle, qui offre actuellement des fonctionnalités supplémentaires telles que l'utilisation d'outils côté serveur et préconfigurés (y compris la recherche sur le Web), l'inférence asynchrone avec background=true et la création de projets et d'espaces de travail. Projets (OpenAI-compatible) Espaces de travail () Anthropic-compatible Pour savoir quel point de terminaison est compatible avec chaque modèle, consultezDisponibilité des terminaux par modèle.

Point de terminaison API prises en charge Description
bedrock-runtime.{region}.amazonaws.com (recommandé) InvokeModel/Converse/Compléments de chat/API de réponses /API de messages Region-specific points de terminaison pour effectuer des demandes d'inférence pour les modèles hébergés dans Amazon Bedrock à l'aide des API. InvokeModel/Converse/Chat Completions/Responses/Messages Pour plus d'informations sur les Bedrock-native opérations, consultez la section Opérations de l'API Amazon Bedrock Runtime. Les OpenAI-compatible API sont appelées sur les /openai/v1 chemins de ce terminal plutôt que via les AWS SDK.
bedrock-mantle.{region}.api.aws API de réponses/API de complétion des discussions/API de messages Region-specific points de terminaison pour effectuer des demandes d'inférence pour les modèles hébergés dans Amazon Bedrock à l'aide des OpenAI-compatible points de terminaison et de l'API Anthropic Messages.

Les applications existantes qui utilisent bedrock-mantle continuent d'être entièrement prises en charge et n'ont pas besoin d'être modifiées. Les deux points de terminaison vous permettent d'intégrer une base de code du SDK OpenAI existante à Amazon Bedrock en modifiant uniquement l'URL de base et la clé d'API, et les deux prennent en charge les API Responses et Chat Completions ainsi que l' OpenAI-compatible API Anthropic Messages.

Les tableaux suivants comparent ce qui est disponible sur chaque terminal.

Note

L'API Messages est disponible sur les deux terminaux, mais les deux surfaces ne prennent pas en charge les mêmes fonctionnalités. En particulier, les sorties structurées (le output_config.format paramètre) ne sont pas prises en charge sur bedrock-mantle : les demandes qui incluent output_config.format sont rejetées avec une erreur 400. Pour utiliser des sorties structurées avec des modèles Anthropic Claude, appelez Converse ou les InvokeModel API. bedrock-runtime

Note

L'API Responses est également disponible sur les deux terminaux sans prise en charge identique des fonctionnalités. Sous bedrock-runtime :

  • Les demandes sont toujours synchrones. background=trueest rejeté avec une erreur 400. Le store paramètre n'est pas affecté et conserve sa valeur par défauttrue, de sorte que les conversations multi-tours stockées fonctionnent normalement.

  • Server-side l'utilisation des outils et les outils préconfigurés ne sont pas disponibles, y compris la recherche Recherche sur le Web sur le Web. Client-side l'utilisation de l'outil fonctionne sur les deux terminaux.

  • Seul le projet par défaut est pris en charge. Consultez Projets (OpenAI-compatible).

  • Une réponse stockée appartient à Région AWS celui qui l'a servie. Le récupérer, l'annuler ou le supprimer, ainsi que la poursuite de la conversation avecprevious_response_id, sont tous gérés par cette région.

Note

Activébedrock-runtime, l'API Responses attribue l'utilisation par le principal IAM uniquement. Per-request le balisage des métadonnées et les profils d'inférence d'applications n'y sont pas disponibles : une demande qui désigne un profil d'inférence d'application comme cible d'inférence est rejetée avec une erreur 400. Cela n'affecte pas l'inférence interrégionale : les profils d'inférence géographiques et globaux définis par le système fonctionnent normalement.

Disponibilité des fonctionnalités de Bedrock
Fonctionnalité bedrock-runtime bedrock-mantle
Rambardes
Mise en cache rapide
Routage rapide intelligent
Note

La prise en charge rapide de la mise en cache bedrock-mantle dépend du modèle spécifique. Consultez chaque fiche modèle ci-dessous Les modèles en un coup d'œil pour plus de détails.

Approche du débit et des quotas

Chaque terminal utilise une approche différente pour gérer le débit.

  • bedrock-runtime— Dans de nombreux services multi-locataires traditionnels, l'architecture est conçue autour de quotas par compte afin de gérer un accès équitable aux ressources partagées. C'est l'approche utilisée avecbedrock-runtime. Chaque modèle possède des quotas de débit fixes (RPM et TPM) pour lesquels vous pouvez demander des augmentations. Pour en savoir plus, consultez Quotas pour le paramètre d'exécution fondamental.

  • bedrock-mantle— Ce terminal est conçu avec des mécanismes avancés de planification et de mise en file d'attente qui assurent une distribution équitable tout en prenant en charge des limites de débit initiales plus élevées. Cette conception permet également bedrock-mantle d'héberger un large éventail de modèles et de fournir l'ensemble des fonctionnalités disponibles dans le catalogue de modèles. Dans la plupart des cas, les demandes sont traitées immédiatement. Dans certains cas, une demande peut être brièvement mise en file d'attente pendant que les charges de travail en vol sont terminées et que le débit est disponible. Pour plus d’informations, consultez Quotas pour la limite entre le substrat rocheux et le manteau et Meilleures pratiques en matière de mise à l'échelle et de débit.

Tarification

Per-token le prix d'un même modèle est identique sur bedrock-runtime etbedrock-mantle. Choisissez un terminal en fonction des API et des fonctionnalités dont vous avez besoin, et non des coûts. Pour connaître les tarifs actuels, consultez la rubrique Tarification d'Amazon Bedrock.

Quand choisir chaque point de terminaison

Commencez par le bedrock-runtime moment où vous voulez :

  • Appelez les API OpenAI-compatible Responses ou Chat Completions, ou l'API Anthropic Messages.

  • Utilisez les API Bedrock-native InvokeModel ou Converse.

  • Utilisez les fonctionnalités d'Amazon Bedrock qui ne sont disponibles que sur ce terminal, telles que les Guardrails et le routage rapide intelligent.

  • Utilisez l'inférence interrégionale pour acheminer les demandes à travers une zone géographique ou à l'échelle mondiale.

À utiliser bedrock-mantle lorsque vous souhaitez :

Les deux terminaux peuvent être utilisés ensemble à partir de la même application, à choisir selon le cas d'utilisation.

Réduisez les coûts de sortie des données grâce aux points de terminaison de l'interface VPC

Si vous appelez Amazon Bedrock depuis un VPC, pensez à utiliser des points de terminaison d'interface VPC (AWS PrivateLink) pour maintenir le trafic au sein du réseau AWS et éviter les frais de sortie de données associés aux passerelles NAT ou Internet.