View a markdown version of this page

Evaluación de lotes - Amazon Bedrock AgentCore

Evaluación de lotes

La evaluación por lotes ejecuta los evaluadores en varias sesiones de agentes en un solo trabajo con una organización del lado del servidor. A diferencia de la evaluación bajo demanda, en la que se recopilan los intervalos y se denomina usted mismo a la API de evaluación, la evaluación por lotes gestiona la detección de las sesiones, la recopilación de intervalos y la puntuación por completo desde el punto de vista del servicio. Usted envía un trabajo y el servicio procesa todas las sesiones coincidentes y devuelve los resultados agregados.

Utilice la evaluación por lotes cuando necesite:

  • Mida una línea base antes de realizar cambios en el mensaje, las herramientas o el modelo de su agente.

  • Valide las mejoras comparando las puntuaciones antes y después de un cambio de configuración.

  • Ejecute pruebas de regresión en un conjunto seleccionado de sesiones o escenarios.

  • Supervise la calidad periódicamente en todas las sesiones de producción desde un intervalo de tiempo específico.

Cómo funciona

Un trabajo de evaluación de lotes sigue este flujo:

  1. Para iniciar un trabajo, especifique una fuente de sesión (dónde encontrar las sesiones de los agentes) y una configuración de evaluación (qué evaluadores ejecutar). Si lo desea, puede proporcionar metadatos fiables para la puntuación basada en referencias.

  2. El servicio descubre las sesiones de CloudWatch los registros en función de los grupos de registros y los filtros que especifique.

  3. El servicio ejecuta evaluadores para cada sesión detectada. Cada evaluador puntúa cada sesión de forma independiente. Si se proporciona información básica, los evaluadores que apoyan la puntuación basada en referencias la utilizan.

  4. Usted sondea para obtener resultados. El trabajo pasa de PENDINGIN_PROGRESSCOMPLETED (oFAILED). Cuando esté completa, la respuesta incluye resúmenes agregados con las puntuaciones medias por evaluador, los recuentos de sesiones y el uso de fichas.

  5. Per-session Los detalles están disponibles en CloudWatch los registros en la ubicación especificada outputDataConfig en la respuesta.

Comparación con otros tipos de evaluación

Aspecto On-demand Online Lote

Desencadenador

Caller-initiated, sincrónico

Continuo, impulsado por eventos

Caller-initiated, asíncrono

Origen de la sesión

La persona que llama proporciona intervalos en línea

Observa un grupo de registros

El servicio lo descubre a partir de CloudWatch los registros

Alcance

Sesión única

Todas las sesiones cumplen las reglas de muestreo

Varias sesiones (intervalo de tiempo, identificadores de sesión o grupo de registro completo)

¿Verdad fundamental

Vía evaluationReferenceInputs

No compatible

Vía sessionMetadata con verdad básica en línea

Resultados

Respuesta sincrónica

CloudWatch métricas y cuadros de mando

Agregue resúmenes con promedios por evaluador y detalles por sesión en CloudWatch

Caso de uso

Dev-time controles puntuales, CI/CD

Monitoreo de la producción

Medición de referencia, pre/post comparación y pruebas de regresión