Évaluation des lots
L'évaluation par lots exécute les évaluateurs sur plusieurs sessions d'agent dans le cadre d'une seule tâche avec une orchestration côté serveur. Contrairement à l'évaluation à la demande où vous collectez les intervalles et appelez vous-même l'API Evaluate, l'évaluation par lots gère la découverte des sessions, la collecte des intervalles et la notation entièrement du côté du service. Vous soumettez une tâche, et le service traite toutes les sessions correspondantes et renvoie des résultats agrégés.
Utilisez l'évaluation par lots lorsque vous devez :
-
Mesurez une base de référence avant d'apporter des modifications à l'invite, aux outils ou au modèle de votre agent.
-
Validez les améliorations en comparant les scores avant et après un changement de configuration.
-
Exécutez des tests de régression sur un ensemble de sessions ou de scénarios sélectionnés.
-
Surveillez régulièrement la qualité au cours des sessions de production à partir d'une fenêtre temporelle spécifique.
Fonctionnement
Une tâche d'évaluation par lots suit ce flux :
-
Vous démarrez une tâche en spécifiant une source de session (où trouver les sessions d'agent) et une configuration d'évaluation (quels évaluateurs exécuter). Vous pouvez éventuellement fournir des métadonnées de base pour la notation basée sur des références.
-
Le service découvre les sessions à partir CloudWatch des journaux en fonction des groupes de journaux et des filtres que vous spécifiez.
-
Le service exécute des évaluateurs pour chaque session découverte. Chaque évaluateur note chaque session de manière indépendante. Si une vérité de base est fournie, les évaluateurs qui soutiennent la notation basée sur les références l'utilisent.
-
Vous interrogez pour obtenir des résultats. Le poste passe par
PENDING→IN_PROGRESS→COMPLETED(ouFAILED). Une fois complète, la réponse inclut des résumés agrégés avec les scores moyens par évaluateur, le nombre de sessions et l'utilisation des jetons. -
Per-session les détails sont disponibles dans CloudWatch les journaux à l'emplacement indiqué
outputDataConfigdans la réponse.
Comparaison avec d'autres types d'évaluation
| Aspect | On-demand | En ligne | Par lots |
|---|---|---|---|
|
Déclencheur |
Caller-initiated, synchrone |
En continu, piloté par les événements |
Caller-initiated, asynchrone |
|
Source de session |
L'appelant fournit des intervalles en ligne |
Surveille un groupe de logs |
Le service découvre à partir CloudWatch des journaux |
|
Scope |
Séance unique |
Toutes les sessions correspondent aux règles d'échantillonnage |
Sessions multiples (plage horaire, ID de session ou groupe de journalisation complet) |
|
Vérité fondamentale |
Via |
Non pris en charge |
Via |
|
Résultats |
Réponse synchrone |
CloudWatch métriques et tableaux de bord |
Résumés agrégés avec des moyennes par évaluateur, ainsi que des informations détaillées par session dans CloudWatch |
|
Cas d’utilisation |
Dev-time contrôles ponctuels, CI/CD |
Surveillance en production |
Mesure de référence, pre/post comparaison, tests de régression |