View a markdown version of this page

Évaluation des lots - Amazon Bedrock AgentCore

Évaluation des lots

L'évaluation par lots exécute les évaluateurs sur plusieurs sessions d'agent dans le cadre d'une seule tâche avec une orchestration côté serveur. Contrairement à l'évaluation à la demande où vous collectez les intervalles et appelez vous-même l'API Evaluate, l'évaluation par lots gère la découverte des sessions, la collecte des intervalles et la notation entièrement du côté du service. Vous soumettez une tâche, et le service traite toutes les sessions correspondantes et renvoie des résultats agrégés.

Utilisez l'évaluation par lots lorsque vous devez :

  • Mesurez une base de référence avant d'apporter des modifications à l'invite, aux outils ou au modèle de votre agent.

  • Validez les améliorations en comparant les scores avant et après un changement de configuration.

  • Exécutez des tests de régression sur un ensemble de sessions ou de scénarios sélectionnés.

  • Surveillez régulièrement la qualité au cours des sessions de production à partir d'une fenêtre temporelle spécifique.

Fonctionnement

Une tâche d'évaluation par lots suit ce flux :

  1. Vous démarrez une tâche en spécifiant une source de session (où trouver les sessions d'agent) et une configuration d'évaluation (quels évaluateurs exécuter). Vous pouvez éventuellement fournir des métadonnées de base pour la notation basée sur des références.

  2. Le service découvre les sessions à partir CloudWatch des journaux en fonction des groupes de journaux et des filtres que vous spécifiez.

  3. Le service exécute des évaluateurs pour chaque session découverte. Chaque évaluateur note chaque session de manière indépendante. Si une vérité de base est fournie, les évaluateurs qui soutiennent la notation basée sur les références l'utilisent.

  4. Vous interrogez pour obtenir des résultats. Le poste passe par PENDINGIN_PROGRESSCOMPLETED (ouFAILED). Une fois complète, la réponse inclut des résumés agrégés avec les scores moyens par évaluateur, le nombre de sessions et l'utilisation des jetons.

  5. Per-session les détails sont disponibles dans CloudWatch les journaux à l'emplacement indiqué outputDataConfig dans la réponse.

Comparaison avec d'autres types d'évaluation

Aspect On-demand En ligne Par lots

Déclencheur

Caller-initiated, synchrone

En continu, piloté par les événements

Caller-initiated, asynchrone

Source de session

L'appelant fournit des intervalles en ligne

Surveille un groupe de logs

Le service découvre à partir CloudWatch des journaux

Scope

Séance unique

Toutes les sessions correspondent aux règles d'échantillonnage

Sessions multiples (plage horaire, ID de session ou groupe de journalisation complet)

Vérité fondamentale

Via evaluationReferenceInputs

Non pris en charge

Via sessionMetadata avec Ground Truth en ligne

Résultats

Réponse synchrone

CloudWatch métriques et tableaux de bord

Résumés agrégés avec des moyennes par évaluateur, ainsi que des informations détaillées par session dans CloudWatch

Cas d’utilisation

Dev-time contrôles ponctuels, CI/CD

Surveillance en production

Mesure de référence, pre/post comparaison, tests de régression