Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Third-party evaluadores
AgentCore Evaluations ofrece evaluadores de las bibliotecas de código AutoEval abierto DeepEval y de código abierto. Si ya usa estas bibliotecas, puede ejecutar las mismas métricas en AgentCore Evaluations. El servicio gestiona el código de alojamiento y evaluación por ti. Con la opción gestionada, el servicio también selecciona el modelo y ejecuta la inferencia, del mismo modo que lo hace con los evaluadores integrados.
Hay dos maneras de usar evaluadores de terceros:
-
Administrado: seleccione un evaluador externo por ID e impleméntelo. El servicio lo ejecuta, selecciona el modelo y administra la versión de la biblioteca.
-
Personalizado: cree un evaluador que ejecute la lógica de un evaluador existente (un evaluador externo integrado o administrado) según su propio modelo e inferencia. Para obtener más información, consulte Evaluadores personalizados derivados de un evaluador base.
Calidad del evaluador
AgentCore los evaluadores integrados se prueban y comparan para comprobar su rendimiento. DeepEval y AutoEval son evaluadores de código abierto, y no hacemos afirmaciones sobre su calidad.
Temas
Identidad del evaluador
Dos campos juntos identifican a cada evaluador, incluidos los evaluadores externos:
-
evaluatorType— El tipo de recurso: quién lo proporciona y cómo.BuiltinyThirdPartyson evaluadores globales AWS gestionados a los que se hace referencia pero no se crean.CustomCustomCode, yCustomDerivedson evaluadores que usted crea. -
provider— De dónde proviene la lógica de evaluación:AWSpara evaluadores creados por el AWS propio autor,DeepEvaloAutoEvalpara las bibliotecas de terceros correspondientes, o para un evaluador creadoCustompor usted mismo.
Los dos campos son independientes, por lo que cada evaluador es un par: (evaluatorType, provider)
| Evaluador | Tipo de evaluador | proveedor |
|---|---|---|
|
Administrado integrado |
|
|
|
Gestionado por terceros |
|
|
|
Evaluador personalizado derivado de un integrado |
|
|
|
Evaluador personalizado derivado de un evaluador externo |
|
|
|
Evaluador personalizado basado en código |
|
|
|
Evaluador personalizado LLM-as-a-judge |
|
|
El identificador de un evaluador externo gestionado sigue el ThirdParty.<Provider>.<Metric> formato, por ejemplo, o. ThirdParty.DeepEval.TaskCompletion ThirdParty.AutoEval.Security Esto refleja el Builtin.<Metric> formato que se utiliza para los evaluadores integrados de primera mano.
Descubra los evaluadores disponibles
Third-party La ListEvaluators API devuelve los evaluadores junto con los evaluadores propios integrados y cualquier evaluador personalizado de tu cuenta.
{ "evaluators": [ { "evaluatorId": "Builtin.Helpfulness", "evaluatorType": "Builtin", "provider": "AWS", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.DeepEval.TaskCompletion", "evaluatorType": "ThirdParty", "provider": "DeepEval", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.AutoEval.Security", "evaluatorType": "ThirdParty", "provider": "AutoEval", "level": "TRACE", "status": "ACTIVE" } ] }
Evaluadores externos gestionados
Utilice un evaluador externo gestionado exactamente igual que un evaluador integrado: selecciónelo por ID y el servicio lo ejecutará según el modelo que utilice. No se proporciona un modelo, una solicitud o una configuración.
-
Modelo: los evaluadores externos gestionados utilizan el mismo modelo que los evaluadores integrados en Amazon Bedrock. AgentCore No hay ningún campo de modelo ni ninguna configuración de modelo que establecer.
-
Control de versiones: los evaluadores gestionados de terceros no pueden seleccionar la versión. El servicio ejecuta la versión de biblioteca que ha validado y administra las actualizaciones por sí mismo.
Puedes pasar un identificador de evaluador externo gestionado a cualquier lugar en el que pasarías un identificador de evaluador integrado:
-
On-demand evaluación: introduce el ID en la solicitud de
EvaluateAPI. -
Evaluación en línea: añada el ID a la
evaluatorslista de una configuración de evaluación en línea. Se combina libremente con los evaluadores integrados y personalizados, y se rige por las mismas reglas de muestreo y filtrado. -
Evaluación por lotes: introduzca el identificador en la
evaluatorslista de un trabajo de evaluación por lotes.
En el siguiente ejemplo, se ejecuta un evaluador externo administrado con la Evaluate API:
import boto3 client = boto3.client('bedrock-agentcore') response = client.evaluate( evaluatorId="ThirdParty.DeepEval.TaskCompletion", evaluationInput={"sessionSpans": session_span_logs} ) for result in response["evaluationResults"]: print(f"Value: {result.get('value')}") print(f"Explanation: {result.get('explanation', '')}")
Evaluadores personalizados derivados de un evaluador base
Usa un evaluador derivado personalizado para ejecutar un evaluador existente (un evaluador externo integrado o administrado) en tu propio modelo. En lugar de usar el modelo que elige el servicio, usted proporciona el modelo y los parámetros de inferencia. El evaluador base proporciona la indicación y la puntuación. Esto se aplica solo a los LLM-based evaluadores.
Para crear un evaluador derivado personalizado, especifique el derived miembro de evaluatorConfig con el ID del evaluador base y la configuración de su modelo. Guarde lo siguiente como derived_evaluator_config.json:
{ "derived": { "baseEvaluatorId": "ThirdParty.DeepEval.TaskCompletion", "modelConfig": { "bedrockEvaluatorModelConfig": { "modelId": "global.anthropic.claude-sonnet-4-5-20250929-v1:0", "inferenceConfig": { "temperature": 0.0, "topP": 1.0, "maxTokens": 2048 } } } } }
También puede derivar un evaluador personalizado a partir de un evaluador integrado configurándolo como un baseEvaluatorId Builtin.
identificador en lugar de un identificador. ThirdParty.
Cree el evaluador con la CLI: AWS
aws bedrock-agentcore-control create-evaluator \ --evaluator-name 'my_task_completion' \ --evaluator-config file://derived_evaluator_config.json
El evaluador resultante se ha evaluatorType establecido en. CustomDerived El servicio se deriva provider automáticamente del evaluador base: AWS en el caso de una Builtin.
base, o el nombre del proveedor de una base. ThirdParty. Tú no lo configuraslevel: el servicio lo deriva del evaluador base y es de solo lectura. GetEvaluator Tampoco se establece instructions o ratingScale porque el evaluador base es el propietario de ambos.
Después de crear el evaluador, utilícelo igual que cualquier otro evaluador personalizado: pase su identificador de evaluador a uno o agréguelo a Evaluate la evaluators lista de una evaluación en línea o por lotes.
-
Modelo: cualquier modelo de Bedrock, establecido hasta el final.
bedrockEvaluatorModelConfig -
Propiedad de la inferencia: el modelo se ejecuta con su propia AWS cuenta y credenciales: la función de ejecución para la evaluación en línea o las credenciales de la persona que llama para la evaluación bajo demanda. Esta es la diferencia clave con respecto a un evaluador externo gestionado, en el que el servicio ejecuta el modelo por sí mismo.
-
Propiedad de la calidad: dado que usted elige el modelo, la calidad de la evaluación refleja esa elección. El servicio no valida el modelo en función de cada métrica.
Resultados
Third-party los evaluadores devuelven la misma forma de resultado que los evaluadores integrados y personalizados, en las mismas ubicaciones. Para obtener más información, consulte Resultados y resultados.
Conjunto inicial de evaluadores
Los siguientes evaluadores están disponibles en el momento del lanzamiento.
DeepEval
| Métrica | ¿Qué comprueba? |
|---|---|
|
Sesgo |
Si el resultado muestra sesgos de género, políticos, raciales o geográficos. |
|
Toxicidad |
Si el resultado contiene ataques, burlas, odio o amenazas. |
|
Pii Leakage |
Si la respuesta expone información personal. |
|
Resumen |
Si el resumen es fiel y completo. |
|
TaskCompletion |
Si el agente logró el objetivo del usuario. |
|
ConversationCompleteness |
Si se atendieron todas las solicitudes de los usuarios durante la conversación. |
|
KnowledgeRetention |
Si el agente recordó la información que había compartido anteriormente. |
|
TurnRelevancy |
Si cada respuesta sigue siendo relevante en relación con los turnos anteriores. |
|
GoalAccuracy |
Si el agente logró sus objetivos en una conversación de varios turnos. |
|
ToolUse |
Si el agente eligió la herramienta adecuada y presentó los argumentos correctos. |
AutoEval
| Métrica | ¿Qué comprueba? |
|---|---|
|
Seguridad |
Si la respuesta es malintencionada. |
|
Humor |
Si la respuesta es divertida. |
|
Posible |
Si el agente intentó encontrar una solución o declaró que la tarea era imposible. |
Consola
En el selector de evaluadores, los evaluadores externos aparecen en su propia sección de Third-party evaluadores, agrupados por proveedor y separados de los grupos de evaluadores integrados. Esta sección está contraída de forma predeterminada.
Para crear un evaluador personalizado derivado de un evaluador base, utilice el flujo existente de creación de evaluadores personalizados y elija Third-party biblioteca como tipo de definición del evaluador. Esta opción elimina las secciones de instrucción y escala que se muestran LLM-as-a-judge, ya que el evaluador base es el propietario del aviso y de la puntuación. Elija una biblioteca y una métrica y, a continuación, proporcione el modelo y los parámetros de inferencia. El nivel de evaluación se muestra como de solo lectura, establecido por la métrica.