View a markdown version of this page

Third-party evaluadores - Base amazónica AgentCore

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Third-party evaluadores

AgentCore Evaluations ofrece evaluadores de las bibliotecas de código AutoEval abierto DeepEval y de código abierto. Si ya usa estas bibliotecas, puede ejecutar las mismas métricas en AgentCore Evaluations. El servicio gestiona el código de alojamiento y evaluación por ti. Con la opción gestionada, el servicio también selecciona el modelo y ejecuta la inferencia, del mismo modo que lo hace con los evaluadores integrados.

Hay dos maneras de usar evaluadores de terceros:

  • Administrado: seleccione un evaluador externo por ID e impleméntelo. El servicio lo ejecuta, selecciona el modelo y administra la versión de la biblioteca.

  • Personalizado: cree un evaluador que ejecute la lógica de un evaluador existente (un evaluador externo integrado o administrado) según su propio modelo e inferencia. Para obtener más información, consulte Evaluadores personalizados derivados de un evaluador base.

Calidad del evaluador

AgentCore los evaluadores integrados se prueban y comparan para comprobar su rendimiento. DeepEval y AutoEval son evaluadores de código abierto, y no hacemos afirmaciones sobre su calidad.

Identidad del evaluador

Dos campos juntos identifican a cada evaluador, incluidos los evaluadores externos:

  • evaluatorType— El tipo de recurso: quién lo proporciona y cómo. Builtiny ThirdParty son evaluadores globales AWS gestionados a los que se hace referencia pero no se crean. CustomCustomCode, y CustomDerived son evaluadores que usted crea.

  • provider— De dónde proviene la lógica de evaluación: AWS para evaluadores creados por el AWS propio autor, DeepEval o AutoEval para las bibliotecas de terceros correspondientes, o para un evaluador creado Custom por usted mismo.

Los dos campos son independientes, por lo que cada evaluador es un par: (evaluatorType, provider)

Evaluador Tipo de evaluador proveedor

Administrado integrado

Builtin

AWS

Gestionado por terceros

ThirdParty

DeepEval o AutoEval

Evaluador personalizado derivado de un integrado

CustomDerived

AWS

Evaluador personalizado derivado de un evaluador externo

CustomDerived

DeepEval o AutoEval

Evaluador personalizado basado en código

CustomCode

Custom

Evaluador personalizado LLM-as-a-judge

Custom

Custom

El identificador de un evaluador externo gestionado sigue el ThirdParty.<Provider>.<Metric> formato, por ejemplo, o. ThirdParty.DeepEval.TaskCompletion ThirdParty.AutoEval.Security Esto refleja el Builtin.<Metric> formato que se utiliza para los evaluadores integrados de primera mano.

Descubra los evaluadores disponibles

Third-party La ListEvaluators API devuelve los evaluadores junto con los evaluadores propios integrados y cualquier evaluador personalizado de tu cuenta.

{ "evaluators": [ { "evaluatorId": "Builtin.Helpfulness", "evaluatorType": "Builtin", "provider": "AWS", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.DeepEval.TaskCompletion", "evaluatorType": "ThirdParty", "provider": "DeepEval", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.AutoEval.Security", "evaluatorType": "ThirdParty", "provider": "AutoEval", "level": "TRACE", "status": "ACTIVE" } ] }

Evaluadores externos gestionados

Utilice un evaluador externo gestionado exactamente igual que un evaluador integrado: selecciónelo por ID y el servicio lo ejecutará según el modelo que utilice. No se proporciona un modelo, una solicitud o una configuración.

  • Modelo: los evaluadores externos gestionados utilizan el mismo modelo que los evaluadores integrados en Amazon Bedrock. AgentCore No hay ningún campo de modelo ni ninguna configuración de modelo que establecer.

  • Control de versiones: los evaluadores gestionados de terceros no pueden seleccionar la versión. El servicio ejecuta la versión de biblioteca que ha validado y administra las actualizaciones por sí mismo.

Puedes pasar un identificador de evaluador externo gestionado a cualquier lugar en el que pasarías un identificador de evaluador integrado:

  • On-demand evaluación: introduce el ID en la solicitud de Evaluate API.

  • Evaluación en línea: añada el ID a la evaluators lista de una configuración de evaluación en línea. Se combina libremente con los evaluadores integrados y personalizados, y se rige por las mismas reglas de muestreo y filtrado.

  • Evaluación por lotes: introduzca el identificador en la evaluators lista de un trabajo de evaluación por lotes.

En el siguiente ejemplo, se ejecuta un evaluador externo administrado con la Evaluate API:

import boto3 client = boto3.client('bedrock-agentcore') response = client.evaluate( evaluatorId="ThirdParty.DeepEval.TaskCompletion", evaluationInput={"sessionSpans": session_span_logs} ) for result in response["evaluationResults"]: print(f"Value: {result.get('value')}") print(f"Explanation: {result.get('explanation', '')}")

Evaluadores personalizados derivados de un evaluador base

Usa un evaluador derivado personalizado para ejecutar un evaluador existente (un evaluador externo integrado o administrado) en tu propio modelo. En lugar de usar el modelo que elige el servicio, usted proporciona el modelo y los parámetros de inferencia. El evaluador base proporciona la indicación y la puntuación. Esto se aplica solo a los LLM-based evaluadores.

Para crear un evaluador derivado personalizado, especifique el derived miembro de evaluatorConfig con el ID del evaluador base y la configuración de su modelo. Guarde lo siguiente como derived_evaluator_config.json:

{ "derived": { "baseEvaluatorId": "ThirdParty.DeepEval.TaskCompletion", "modelConfig": { "bedrockEvaluatorModelConfig": { "modelId": "global.anthropic.claude-sonnet-4-5-20250929-v1:0", "inferenceConfig": { "temperature": 0.0, "topP": 1.0, "maxTokens": 2048 } } } } }

También puede derivar un evaluador personalizado a partir de un evaluador integrado configurándolo como un baseEvaluatorId Builtin. identificador en lugar de un identificador. ThirdParty.

Cree el evaluador con la CLI: AWS

aws bedrock-agentcore-control create-evaluator \ --evaluator-name 'my_task_completion' \ --evaluator-config file://derived_evaluator_config.json

El evaluador resultante se ha evaluatorType establecido en. CustomDerived El servicio se deriva provider automáticamente del evaluador base: AWS en el caso de una Builtin. base, o el nombre del proveedor de una base. ThirdParty. Tú no lo configuraslevel: el servicio lo deriva del evaluador base y es de solo lectura. GetEvaluator Tampoco se establece instructions o ratingScale porque el evaluador base es el propietario de ambos.

Después de crear el evaluador, utilícelo igual que cualquier otro evaluador personalizado: pase su identificador de evaluador a uno o agréguelo a Evaluate la evaluators lista de una evaluación en línea o por lotes.

  • Modelo: cualquier modelo de Bedrock, establecido hasta el final. bedrockEvaluatorModelConfig

  • Propiedad de la inferencia: el modelo se ejecuta con su propia AWS cuenta y credenciales: la función de ejecución para la evaluación en línea o las credenciales de la persona que llama para la evaluación bajo demanda. Esta es la diferencia clave con respecto a un evaluador externo gestionado, en el que el servicio ejecuta el modelo por sí mismo.

  • Propiedad de la calidad: dado que usted elige el modelo, la calidad de la evaluación refleja esa elección. El servicio no valida el modelo en función de cada métrica.

Resultados

Third-party los evaluadores devuelven la misma forma de resultado que los evaluadores integrados y personalizados, en las mismas ubicaciones. Para obtener más información, consulte Resultados y resultados.

Conjunto inicial de evaluadores

Los siguientes evaluadores están disponibles en el momento del lanzamiento.

DeepEval

Métrica ¿Qué comprueba?

Sesgo

Si el resultado muestra sesgos de género, políticos, raciales o geográficos.

Toxicidad

Si el resultado contiene ataques, burlas, odio o amenazas.

Pii Leakage

Si la respuesta expone información personal.

Resumen

Si el resumen es fiel y completo.

TaskCompletion

Si el agente logró el objetivo del usuario.

ConversationCompleteness

Si se atendieron todas las solicitudes de los usuarios durante la conversación.

KnowledgeRetention

Si el agente recordó la información que había compartido anteriormente.

TurnRelevancy

Si cada respuesta sigue siendo relevante en relación con los turnos anteriores.

GoalAccuracy

Si el agente logró sus objetivos en una conversación de varios turnos.

ToolUse

Si el agente eligió la herramienta adecuada y presentó los argumentos correctos.

AutoEval

Métrica ¿Qué comprueba?

Seguridad

Si la respuesta es malintencionada.

Humor

Si la respuesta es divertida.

Posible

Si el agente intentó encontrar una solución o declaró que la tarea era imposible.

Consola

En el selector de evaluadores, los evaluadores externos aparecen en su propia sección de Third-party evaluadores, agrupados por proveedor y separados de los grupos de evaluadores integrados. Esta sección está contraída de forma predeterminada.

Para crear un evaluador personalizado derivado de un evaluador base, utilice el flujo existente de creación de evaluadores personalizados y elija Third-party biblioteca como tipo de definición del evaluador. Esta opción elimina las secciones de instrucción y escala que se muestran LLM-as-a-judge, ya que el evaluador base es el propietario del aviso y de la puntuación. Elija una biblioteca y una métrica y, a continuación, proporcione el modelo y los parámetros de inferencia. El nivel de evaluación se muestra como de solo lectura, establecido por la métrica.