Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Points de terminaison pris en charge par Amazon Bedrock
Amazon Bedrock prend en charge différents points de terminaison pour effectuer des opérations d'inférence.
Opérations d'inférence
Pour les nouvelles applications, nous recommandons le bedrock-runtime terminal. Il prend en charge les Bedrock-native InvokeModel API Converse, les API OpenAI-compatible Responses and Chat Completions et l'API Anthropic Messages, et c'est là que les fonctionnalités d'Amazon Bedrock telles que Guardrails, le routage rapide intelligent et l'inférence interrégionale sont disponibles. Acheminez les demandes d'inférence de modèles entre Régions AWS avec inférence interrégionale Amazon Bedrock prend également en charge un deuxième point de terminaisonbedrock-mantle, qui offre actuellement des fonctionnalités supplémentaires telles que l'utilisation d'outils côté serveur et préconfigurés (y compris la recherche sur le Web), l'inférence asynchrone avec background=true et la création de projets et d'espaces de travail. Projets (OpenAI-compatible) Espaces de travail () Anthropic-compatible Pour savoir quel point de terminaison est compatible avec chaque modèle, consultezDisponibilité des terminaux par modèle.
| Point de terminaison | API prises en charge | Description |
|---|---|---|
bedrock-runtime.{region}.amazonaws.com (recommandé) |
InvokeModel/Converse/Compléments de chat/API de réponses /API de messages | Region-specific points de terminaison pour effectuer des demandes d'inférence pour les modèles hébergés dans Amazon Bedrock à l'aide des API. InvokeModel/Converse/Chat Completions/Responses/Messages Pour plus d'informations sur les Bedrock-native opérations, consultez la section Opérations de l'API Amazon Bedrock Runtime. Les OpenAI-compatible API sont appelées sur les /openai/v1 chemins de ce terminal plutôt que via les AWS SDK. |
bedrock-mantle.{region}.api.aws |
API de réponses/API de complétion des discussions/API de messages | Region-specific points de terminaison pour effectuer des demandes d'inférence pour les modèles hébergés dans Amazon Bedrock à l'aide des OpenAI-compatible points de terminaison et de l'API Anthropic Messages. |
Les applications existantes qui utilisent bedrock-mantle continuent d'être entièrement prises en charge et n'ont pas besoin d'être modifiées. Les deux points de terminaison vous permettent d'intégrer une base de code du SDK OpenAI existante à Amazon Bedrock en modifiant uniquement l'URL de base et la clé d'API, et les deux prennent en charge les API Responses et Chat Completions ainsi que l' OpenAI-compatible API Anthropic Messages.
Les tableaux suivants comparent ce qui est disponible sur chaque terminal.
| API | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| InvokeModel | ||
| Conversation/ ConverseStream | ||
| Complétions du graphique () OpenAI-compatible | ||
| API de réponses (OpenAI-compatible) | ||
| API de messagerie (Anthropic-native) |
Note
L'API Messages est disponible sur les deux terminaux, mais les deux surfaces ne prennent pas en charge les mêmes fonctionnalités. En particulier, les sorties structurées (le output_config.format paramètre) ne sont pas prises en charge sur bedrock-mantle : les demandes qui incluent output_config.format sont rejetées avec une erreur 400. Pour utiliser des sorties structurées avec des modèles Anthropic Claude, appelez Converse ou les InvokeModel API. bedrock-runtime
Note
L'API Responses est également disponible sur les deux terminaux sans prise en charge identique des fonctionnalités. Sous bedrock-runtime :
Les demandes sont toujours synchrones.
background=trueest rejeté avec une erreur 400. Lestoreparamètre n'est pas affecté et conserve sa valeur par défauttrue, de sorte que les conversations multi-tours stockées fonctionnent normalement.Server-side l'utilisation des outils et les outils préconfigurés ne sont pas disponibles, y compris la recherche Recherche sur le Web sur le Web. Client-side l'utilisation de l'outil fonctionne sur les deux terminaux.
Seul le projet par défaut est pris en charge. Consultez Projets (OpenAI-compatible).
Une réponse stockée appartient à Région AWS celui qui l'a servie. Le récupérer, l'annuler ou le supprimer, ainsi que la poursuite de la conversation avec
previous_response_id, sont tous gérés par cette région.
| Capacité | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Cross-region inférence (profils géographiques et mondiaux) | ||
| Gestion dynamique des conversations | ||
| Inférence asynchrone (longue durée) | ||
| Client-side utilisation de l'outil | ||
| Server-side utilisation de l'outil | ||
| Pre-configured outils prêts à l'emploi | ||
| Projets | Projet par défaut uniquement | |
| Espaces de travail |
| Élément | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Authentification AWS Sigv4 | ||
| Clé d'API Bedrock (fonctionne également avec le SDK OpenAI) | ||
| Attribution d'utilisation | IAM principal, balisage des métadonnées par demande, profils d'inférence des applications Profils d’inférence d’applications | Projets, espaces de travail |
Note
Activébedrock-runtime, l'API Responses attribue l'utilisation par le principal IAM uniquement. Per-request le balisage des métadonnées et les profils d'inférence d'applications n'y sont pas disponibles : une demande qui désigne un profil d'inférence d'application comme cible d'inférence est rejetée avec une erreur 400. Cela n'affecte pas l'inférence interrégionale : les profils d'inférence géographiques et globaux définis par le système fonctionnent normalement.
| Fonctionnalité | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Rambardes | ||
| Mise en cache rapide | ||
| Routage rapide intelligent |
Note
La prise en charge rapide de la mise en cache bedrock-mantle dépend du modèle spécifique. Consultez chaque fiche modèle ci-dessous Les modèles en un coup d'œil pour plus de détails.
Approche du débit et des quotas
Chaque terminal utilise une approche différente pour gérer le débit.
-
bedrock-runtime— Dans de nombreux services multi-locataires traditionnels, l'architecture est conçue autour de quotas par compte afin de gérer un accès équitable aux ressources partagées. C'est l'approche utilisée avecbedrock-runtime. Chaque modèle possède des quotas de débit fixes (RPM et TPM) pour lesquels vous pouvez demander des augmentations. Pour en savoir plus, consultez Quotas pour le paramètre d'exécution fondamental. -
bedrock-mantle— Ce terminal est conçu avec des mécanismes avancés de planification et de mise en file d'attente qui assurent une distribution équitable tout en prenant en charge des limites de débit initiales plus élevées. Cette conception permet égalementbedrock-mantled'héberger un large éventail de modèles et de fournir l'ensemble des fonctionnalités disponibles dans le catalogue de modèles. Dans la plupart des cas, les demandes sont traitées immédiatement. Dans certains cas, une demande peut être brièvement mise en file d'attente pendant que les charges de travail en vol sont terminées et que le débit est disponible. Pour plus d’informations, consultez Quotas pour la limite entre le substrat rocheux et le manteau et Meilleures pratiques en matière de mise à l'échelle et de débit.
Tarification
Per-token le prix d'un même modèle est identique sur bedrock-runtime etbedrock-mantle. Choisissez un terminal en fonction des API et des fonctionnalités dont vous avez besoin, et non des coûts. Pour connaître les tarifs actuels, consultez la rubrique Tarification
Quand choisir chaque point de terminaison
Commencez par le bedrock-runtime moment où vous voulez :
Appelez les API OpenAI-compatible Responses ou Chat Completions, ou l'API Anthropic Messages.
Utilisez les API Bedrock-native InvokeModel ou Converse.
Utilisez les fonctionnalités d'Amazon Bedrock qui ne sont disponibles que sur ce terminal, telles que les Guardrails et le routage rapide intelligent.
Utilisez l'inférence interrégionale pour acheminer les demandes à travers une zone géographique ou à l'échelle mondiale.
À utiliser bedrock-mantle lorsque vous souhaitez :
Créez des flux de travail agentiques à l'aide d'outils côté serveur ou d'outils préconfigurés, y compris la recherche sur le Web. Recherche sur le Web
Exécutez des charges de travail d'inférence asynchrones ou de longue durée, y compris des demandes de réponses avec.
background=trueCréez Projets (OpenAI-compatible) ou Espaces de travail () Anthropic-compatible isolez les charges de travail et suivez les coûts et l'utilisation au niveau de l'application.
Utilisez un modèle disponible uniquement sur
bedrock-mantle. Consultez Disponibilité des terminaux par modèle.
Les deux terminaux peuvent être utilisés ensemble à partir de la même application, à choisir selon le cas d'utilisation.
Réduisez les coûts de sortie des données grâce aux points de terminaison de l'interface VPC
Si vous appelez Amazon Bedrock depuis un VPC, pensez à utiliser des points de terminaison d'interface VPC (AWS PrivateLink) pour maintenir le trafic au sein du réseau AWS et éviter les frais de sortie de données associés aux passerelles NAT ou Internet.