Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Évaluation des lots
L'évaluation par lots exécute des évaluateurs sur plusieurs sessions d'agent dans le cadre d'une seule tâche avec une orchestration côté serveur. Contrairement à l'évaluation à la demande où vous collectez des spans et appelez vous-même l'API Evaluate, l'évaluation par lots gère la découverte des sessions, la collecte des spans et la notation entièrement du côté du service. Vous soumettez une tâche et le service traite toutes les sessions correspondantes et renvoie des résultats agrégés.
Utilisez l'évaluation par lots lorsque vous devez :
-
Mesurez une base de référence avant d'apporter des modifications à l'invite, aux outils ou au modèle de votre agent.
-
Validez les améliorations en comparant les scores avant et après un changement de configuration.
-
Exécutez des tests de régression sur un ensemble de sessions ou de scénarios sélectionnés.
-
Surveillez la qualité périodiquement au cours des sessions de production à partir d'une fenêtre temporelle spécifique.
Fonctionnement
Une tâche d'évaluation par lots suit ce flux :
-
Vous démarrez une tâche en spécifiant une source de session (où trouver les sessions d'agent) et une configuration d'évaluation (quels évaluateurs exécuter). Vous pouvez éventuellement fournir des métadonnées de base pour la notation basée sur les références.
-
Le service découvre les sessions à partir CloudWatch des journaux en fonction des groupes de journaux et des filtres que vous spécifiez.
-
Le service exécute des évaluateurs pour chaque session découverte. Chaque évaluateur note chaque session indépendamment. Si la véracité du terrain est fournie, les évaluateurs qui soutiennent la notation basée sur les références l'utilisent.
-
Vous interrogez pour obtenir des résultats. Le poste passe par
PENDING→IN_PROGRESS→COMPLETED(ouFAILED). Une fois complète, la réponse inclut des résumés agrégés avec les scores moyens par évaluateur, le nombre de sessions et l'utilisation des jetons. -
Per-session le détail est disponible dans CloudWatch les journaux à l'emplacement spécifié
outputDataConfigdans la réponse.
Comparaison avec d'autres types d'évaluation
| Aspect | On-demand | En ligne | Par lots |
|---|---|---|---|
|
Déclencheur |
Caller-initiated, synchrone |
Continu, piloté par les événements |
Caller-initiated, asynchrone |
|
Source de la session |
L'appelant fournit des intervalles en ligne |
Surveille un groupe de journaux |
Le service découvre à partir CloudWatch des journaux |
|
Scope |
Séance unique |
Toutes les sessions correspondent aux règles d'échantillonnage |
Sessions multiples (plage horaire, ID de session ou groupe de journaux complet) |
|
La vérité sur le terrain |
Via |
Non pris en charge |
Via |
|
Résultats |
Réponse synchrone |
CloudWatch indicateurs et tableaux de bord |
Résumés agrégés avec les moyennes par évaluateur, plus les détails par session dans CloudWatch |
|
Cas d’utilisation |
Dev-time contrôles ponctuels, CI/CD |
Surveillance en production |
Mesure de référence, pre/post comparaison, tests de régression |