Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Third-party évaluateurs
AgentCore Evaluations propose des évaluateurs issus DeepEval de bibliothèques AutoEval open source. Si vous utilisez déjà ces bibliothèques, vous pouvez exécuter les mêmes métriques dans AgentCore Evaluations. Le service gère l'hébergement et le code d'évaluation pour vous. Avec l'option gérée, le service sélectionne également le modèle et exécute l'inférence, de la même manière que pour les évaluateurs intégrés.
Il existe deux manières de faire appel à des évaluateurs tiers :
-
Géré : sélectionnez un évaluateur tiers par identifiant et déployez-le. Le service l'exécute, sélectionne le modèle et gère la version de la bibliothèque.
-
Personnalisé : créez un évaluateur qui exécute la logique d'un évaluateur existant (un évaluateur intégré ou un évaluateur tiers géré) sur votre propre modèle et inférence. Pour plus d'informations, voir Évaluateurs personnalisés dérivés d'un évaluateur de base.
Qualité de l'évaluateur
AgentCore les évaluateurs intégrés sont testés et évalués en termes de performances. DeepEval et AutoEval sont des évaluateurs open source, et nous ne prétendons pas à leur qualité.
Rubriques
Identité de l'évaluateur
Ensemble, deux champs permettent d'identifier chaque évaluateur, y compris les évaluateurs tiers :
-
evaluatorType— Le type de ressource : qui la fournit et comment.BuiltinetThirdPartysont des évaluateurs globaux AWS gérés que vous référencez mais que vous ne créez pas.CustomCustomCode, etCustomDerivedsont des évaluateurs que vous créez. -
provider— D'où vient la logique d'évaluation :AWSpour les évaluateurs AWS créés par des auteurs,AutoEvalpour les bibliothèques tierces correspondantes,DeepEvalouCustompour un évaluateur que vous avez créé vous-même.
Les deux champs étant indépendants, chaque évaluateur est une (evaluatorType, provider) paire :
| Evaluateur | Type d'évaluateur | provider |
|---|---|---|
|
Intégré géré |
|
|
|
Tierce partie gérée |
|
|
|
Evaluateur personnalisé dérivé d'un outil intégré |
|
|
|
Evaluateur personnalisé dérivé d'un évaluateur tiers |
|
|
|
Evaluateur personnalisé basé sur un code |
|
|
|
LLM-as-a-judge Evaluateur personnalisé |
|
|
L'ID d'un évaluateur tiers géré suit le ThirdParty.<Provider>.<Metric> format, par exemple, ou. ThirdParty.DeepEval.TaskCompletion ThirdParty.AutoEval.Security Ce format reflète le Builtin.<Metric> format utilisé pour les évaluateurs intégrés de première partie.
Découvrez les évaluateurs disponibles
Third-party les évaluateurs sont renvoyés par l'ListEvaluatorsAPI en même temps que les évaluateurs intégrés de première partie et tous les évaluateurs personnalisés de votre compte.
{ "evaluators": [ { "evaluatorId": "Builtin.Helpfulness", "evaluatorType": "Builtin", "provider": "AWS", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.DeepEval.TaskCompletion", "evaluatorType": "ThirdParty", "provider": "DeepEval", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.AutoEval.Security", "evaluatorType": "ThirdParty", "provider": "AutoEval", "level": "TRACE", "status": "ACTIVE" } ] }
Évaluateurs tiers gérés
Utilisez un évaluateur tiers géré exactement comme un évaluateur intégré : sélectionnez-le par identifiant et le service l'exécute sur un modèle qu'il exploite. Vous ne fournissez pas de modèle, d'invite ou de configuration.
-
Modèle : les évaluateurs tiers gérés s'exécutent sur le même modèle que les évaluateurs intégrés dans Amazon Bedrock. AgentCore Il n'y a aucun champ de modèle ni aucune configuration de modèle à définir.
-
Versionnage : aucune version n'est sélectionnée pour les évaluateurs tiers gérés. Le service exécute la version de la bibliothèque qu'il a validée et gère lui-même les mises à niveau.
Vous pouvez transmettre l'identifiant d'un évaluateur tiers géré partout où vous transmettriez un identifiant d'évaluateur intégré :
-
On-demand évaluation — Transmettez l'ID dans la demande
Evaluated'API. -
Évaluation en ligne : ajoutez l'ID à la
evaluatorsliste d'une configuration d'évaluation en ligne. Il se mélange librement aux évaluateurs intégrés et personnalisés et est régi par les mêmes règles d'échantillonnage et de filtrage. -
Évaluation par lots : transmettez l'identifiant dans la
evaluatorsliste d'une tâche d'évaluation par lots.
L'exemple suivant exécute un évaluateur tiers géré avec l'EvaluateAPI :
import boto3 client = boto3.client('bedrock-agentcore') response = client.evaluate( evaluatorId="ThirdParty.DeepEval.TaskCompletion", evaluationInput={"sessionSpans": session_span_logs} ) for result in response["evaluationResults"]: print(f"Value: {result.get('value')}") print(f"Explanation: {result.get('explanation', '')}")
Évaluateurs personnalisés dérivés d'un évaluateur de base
Utilisez un évaluateur dérivé personnalisé pour exécuter un évaluateur existant (un évaluateur tiers intégré ou géré) sur votre propre modèle. Au lieu d'utiliser le modèle choisi par le service, vous fournissez le modèle et les paramètres d'inférence. L'évaluateur de base fournit l'invite et la notation. Cela ne s'applique qu'aux LLM-based évaluateurs.
Pour créer un évaluateur dérivé personnalisé, spécifiez le derived membre de evaluatorConfig avec l'ID de l'évaluateur de base et la configuration de votre modèle. Enregistrez les informations suivantes sous derived_evaluator_config.json :
{ "derived": { "baseEvaluatorId": "ThirdParty.DeepEval.TaskCompletion", "modelConfig": { "bedrockEvaluatorModelConfig": { "modelId": "global.anthropic.claude-sonnet-4-5-20250929-v1:0", "inferenceConfig": { "temperature": 0.0, "topP": 1.0, "maxTokens": 2048 } } } } }
Vous pouvez également dériver un évaluateur personnalisé à partir d'un évaluateur intégré en définissant baseEvaluatorId un Builtin.
ID au lieu d'un ThirdParty. ID.
Créez l'évaluateur à l'aide de l' AWS interface de ligne de commande :
aws bedrock-agentcore-control create-evaluator \ --evaluator-name 'my_task_completion' \ --evaluator-config file://derived_evaluator_config.json
L'évaluateur qui en résulte est evaluatorType réglé sur. CustomDerived Le service dérive provider automatiquement de l'évaluateur de base : AWS pour une Builtin.
base, ou du nom du fournisseur pour une ThirdParty. base. Vous ne level le définissez pas : le service le dérive de l'évaluateur de base et il est activé en lecture seule. GetEvaluator Vous ne définissez pas non plus instructions ou ratingScale parce que l'évaluateur de base possède les deux.
Après avoir créé l'évaluateur, utilisez-le exactement comme n'importe quel autre évaluateur personnalisé : transmettez son identifiant d'évaluateur àEvaluate, ou ajoutez-le à la evaluators liste d'une évaluation en ligne ou par lots.
-
Modèle : n'importe quel modèle Bedrock, complet.
bedrockEvaluatorModelConfig -
Propriété de l'inférence : le modèle s'exécute à l'aide de votre propre AWS compte et de vos informations d'identification : le rôle d'exécution pour l'évaluation en ligne ou les informations d'identification de l'appelant pour l'évaluation à la demande. C'est la principale différence par rapport à un évaluateur tiers géré, dans lequel le service exécute le modèle de ses propres capacités.
-
Appropriation de la qualité : Parce que vous choisissez le modèle, la qualité de l'évaluation reflète ce choix. Le service ne valide pas le modèle par rapport à chaque métrique.
Résultats
Third-party les évaluateurs renvoient la même forme de résultat que les évaluateurs intégrés et personnalisés, aux mêmes emplacements. Pour plus d'informations, voir Résultats et résultats.
Groupe initial d'évaluateurs
Les évaluateurs suivants sont disponibles au lancement.
DeepEval
| Métrique | Ce qu'il vérifie |
|---|---|
|
Écart |
Si le résultat présente un biais sexiste, politique, racial ou géographique. |
|
Toxicité |
Si le résultat contient des attaques, des moqueries, de la haine ou des menaces. |
|
fuite PII |
Si la réponse expose des informations personnelles. |
|
Résumé |
Si le résumé est fidèle et complet. |
|
TaskCompletion |
Si l'agent a atteint l'objectif de l'utilisateur. |
|
ConversationCompleteness |
Si toutes les demandes des utilisateurs au cours de la conversation ont été prises en compte. |
|
KnowledgeRetention |
Si l'agent s'est souvenu des informations partagées précédemment. |
|
TurnRelevancy |
Si chaque réponse reste pertinente par rapport aux tours précédents. |
|
GoalAccuracy |
Si l'agent a atteint ses objectifs au cours d'une conversation en plusieurs étapes. |
|
ToolUse |
Si l'agent a choisi le bon outil et transmis les bons arguments. |
AutoEval
| Métrique | Ce qu'il vérifie |
|---|---|
|
Sécurité |
Si la réponse est malveillante. |
|
Humour |
Si la réponse est drôle. |
|
Possible |
Si l'agent a tenté de trouver une solution ou déclaré la tâche impossible. |
Console
Dans le sélecteur d'évaluateurs, les évaluateurs tiers apparaissent dans leur propre section d'Third-party évaluateurs, regroupés par fournisseur, séparément des groupes d'évaluateurs intégrés. Cette section est réduite par défaut.
Pour créer un évaluateur personnalisé dérivé d'un évaluateur de base, utilisez le flux Create custom evaluator existant et choisissez Third-party library comme type de définition d'évaluateur. Cette option supprime les sections d'instructions et d'échelle indiquées LLM-as-a-judge, car l'évaluateur de base est propriétaire de l'invite et de la notation. Choisissez une bibliothèque et une métrique, puis indiquez le modèle et les paramètres d'inférence. Le niveau d'évaluation est affiché en lecture seule, défini par la métrique.