Evaluación de lotes
La evaluación por lotes ejecuta los evaluadores en varias sesiones de agentes en un solo trabajo con una organización del lado del servidor. A diferencia de la evaluación bajo demanda, en la que se recopilan los intervalos y se denomina usted mismo a la API de evaluación, la evaluación por lotes gestiona la detección de las sesiones, la recopilación de intervalos y la puntuación por completo desde el punto de vista del servicio. Usted envía un trabajo y el servicio procesa todas las sesiones coincidentes y devuelve los resultados agregados.
Utilice la evaluación por lotes cuando necesite:
-
Mida una línea base antes de realizar cambios en el mensaje, las herramientas o el modelo de su agente.
-
Valide las mejoras comparando las puntuaciones antes y después de un cambio de configuración.
-
Ejecute pruebas de regresión en un conjunto seleccionado de sesiones o escenarios.
-
Supervise la calidad periódicamente en todas las sesiones de producción desde un intervalo de tiempo específico.
Cómo funciona
Un trabajo de evaluación de lotes sigue este flujo:
-
Para iniciar un trabajo, especifique una fuente de sesión (dónde encontrar las sesiones de los agentes) y una configuración de evaluación (qué evaluadores ejecutar). Si lo desea, puede proporcionar metadatos fiables para la puntuación basada en referencias.
-
El servicio descubre las sesiones de CloudWatch los registros en función de los grupos de registros y los filtros que especifique.
-
El servicio ejecuta evaluadores para cada sesión detectada. Cada evaluador puntúa cada sesión de forma independiente. Si se proporciona información básica, los evaluadores que apoyan la puntuación basada en referencias la utilizan.
-
Usted sondea para obtener resultados. El trabajo pasa de
PENDING→IN_PROGRESS→COMPLETED(oFAILED). Cuando esté completa, la respuesta incluye resúmenes agregados con las puntuaciones medias por evaluador, los recuentos de sesiones y el uso de fichas. -
Per-session Los detalles están disponibles en CloudWatch los registros en la ubicación especificada
outputDataConfigen la respuesta.
Comparación con otros tipos de evaluación
| Aspecto | On-demand | Online | Lote |
|---|---|---|---|
|
Desencadenador |
Caller-initiated, sincrónico |
Continuo, impulsado por eventos |
Caller-initiated, asíncrono |
|
Origen de la sesión |
La persona que llama proporciona intervalos en línea |
Observa un grupo de registros |
El servicio lo descubre a partir de CloudWatch los registros |
|
Alcance |
Sesión única |
Todas las sesiones cumplen las reglas de muestreo |
Varias sesiones (intervalo de tiempo, identificadores de sesión o grupo de registro completo) |
|
¿Verdad fundamental |
Vía |
No compatible |
Vía |
|
Resultados |
Respuesta sincrónica |
CloudWatch métricas y cuadros de mando |
Agregue resúmenes con promedios por evaluador y detalles por sesión en CloudWatch |
|
Caso de uso |
Dev-time controles puntuales, CI/CD |
Monitoreo de la producción |
Medición de referencia, pre/post comparación y pruebas de regresión |