View a markdown version of this page

Evaluación de lotes - Base amazónica AgentCore

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Evaluación de lotes

La evaluación por lotes hace que los evaluadores comprueben varias sesiones de agentes en un solo trabajo con una orquestación del lado del servidor. A diferencia de la evaluación bajo demanda, en la que usted recopila los intervalos y llama usted mismo a la API Evaluate, la evaluación por lotes gestiona el descubrimiento de las sesiones, la recopilación de intervalos y la puntuación desde el punto de vista del servicio. Usted envía un trabajo y el servicio procesa todas las sesiones coincidentes y devuelve los resultados agregados.

Utilice la evaluación por lotes cuando necesite:

  • Mida una línea base antes de realizar cambios en las instrucciones, las herramientas o el modelo de su agente.

  • Valide las mejoras comparando las puntuaciones antes y después de un cambio de configuración.

  • Ejecute pruebas de regresión en un conjunto seleccionado de sesiones o escenarios.

  • Supervise la calidad periódicamente en las sesiones de producción desde un período de tiempo específico.

Cómo funciona

Un trabajo de evaluación por lotes sigue este flujo:

  1. Para iniciar un trabajo, especifique un origen de sesión (dónde encontrar las sesiones de los agentes) y una configuración de evaluación (qué evaluadores ejecutar). Si lo desea, puede proporcionar metadatos básicos para la puntuación basada en referencias.

  2. El servicio descubre las sesiones a partir de CloudWatch los registros en función de los grupos de registros y los filtros que especifique.

  3. El servicio ejecuta evaluadores para cada sesión descubierta. Cada evaluador puntúa cada sesión de forma independiente. Si se proporciona una verdad básica, los evaluadores que apoyan la puntuación basada en referencias la utilizan.

  4. Votas para obtener resultados. La transición del trabajo es PENDING → IN_PROGRESS → COMPLETED (oFAILED). Cuando está completa, la respuesta incluye resúmenes agregados con las puntuaciones medias de cada evaluador, el recuento de sesiones y el uso de fichas.

  5. Per-session los detalles están disponibles en CloudWatch los registros en la ubicación especificada outputDataConfig en la respuesta.

Comparación con otros tipos de evaluación

Aspecto On-demand Online Lote

Desencadenador

Caller-initiated, sincrónico

Continuo, impulsado por eventos

Caller-initiated, asincrónico

Fuente de sesión

La persona que llama proporciona intervalos en línea

Observa un grupo de registros

El servicio descubre a partir de CloudWatch los registros

Alcance

Sesión única

Todas las sesiones coinciden con las reglas de muestreo

Varias sesiones (intervalo de tiempo, identificadores de sesión o grupo de registro completo)

Verdad fundamental

Vía evaluationReferenceInputs

No compatible

Vía sessionMetadata con información básica

Resultados

Respuesta sincrónica

CloudWatch métricas y paneles

Agregue resúmenes con promedios por evaluador, además de detalles por sesión en CloudWatch

Caso de uso

Dev-time comprobaciones aleatorias, CI/CD

Monitoreo de la producción

Medición de referencia, pre/post comparación y pruebas de regresión