View a markdown version of this page

Cibles d'inférence - Amazon Bedrock AgentCore

Cibles d'inférence

Vous pouvez ajouter des cibles d'inférence à votre passerelle pour acheminer le trafic LLM vers les fournisseurs de modèles. La passerelle agit comme une couche proxy LLM unifiée, permettant aux clients de se connecter à un seul point de terminaison et d'acheminer les demandes vers le fournisseur de modèle approprié en fonction du modèle spécifié dans la demande. Les cibles d'inférence fournissent un routage basé sur des modèles, une abstraction des informations d'identification et une gouvernance centralisée pour le trafic LLM entre plusieurs fournisseurs.

L'ajout de cibles d'inférence à votre passerelle est utile lorsque vous souhaitez :

  • Fournissez un point de terminaison unique qui achemine vers plusieurs fournisseurs de modèles (tels qu'Amazon Bedrock, OpenAI, Anthropic ou OpenAI-compatible d'autres services) sans obliger les clients à gérer des configurations spécifiques au fournisseur.

  • Gestion abstraite des informations d'identification afin que les clients s'authentifient auprès de la passerelle tandis que la passerelle s'authentifie auprès des fournisseurs en leur nom.

  • Appliquez une gouvernance centralisée via Amazon Bedrock Guardrails et Amazon Bedrock AgentCore Policy de manière cohérente pour tous les appels LLM, quel que soit le fournisseur.

  • Utilisez le SDK OpenAI ou le SDK Anthropic directement avec le point de terminaison de la passerelle, en passant d'un modèle à l'autre en modifiant la chaîne du modèle.

  • Répertoriez les modèles disponibles chez tous les fournisseurs configurés via un seul point de terminaison agrégé.

Les cibles d'inférence utilisent la inference clé dans la configuration cible. Vous pouvez configurer une cible d'inférence de deux manières :

  • Connecteur : Zero-configuration configuration pour les fournisseurs de modèles pris en charge. Recommandé pour la plupart des cas d'utilisation.

  • Fournisseur : contrôle explicite du point de terminaison, des mappages de modèles et des opérations. À utiliser lorsque vous devez personnaliser le comportement de routage.

Les rubriques suivantes décrivent chaque type de configuration en détail.