View a markdown version of this page

Évaluation des lots - Base rocheuse de l'Amazonie AgentCore

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Évaluation des lots

L'évaluation par lots exécute des évaluateurs sur plusieurs sessions d'agent dans le cadre d'une seule tâche avec une orchestration côté serveur. Contrairement à l'évaluation à la demande où vous collectez des spans et appelez vous-même l'API Evaluate, l'évaluation par lots gère la découverte des sessions, la collecte des spans et la notation entièrement du côté du service. Vous soumettez une tâche et le service traite toutes les sessions correspondantes et renvoie des résultats agrégés.

Utilisez l'évaluation par lots lorsque vous devez :

  • Mesurez une base de référence avant d'apporter des modifications à l'invite, aux outils ou au modèle de votre agent.

  • Validez les améliorations en comparant les scores avant et après un changement de configuration.

  • Exécutez des tests de régression sur un ensemble de sessions ou de scénarios sélectionnés.

  • Surveillez la qualité périodiquement au cours des sessions de production à partir d'une fenêtre temporelle spécifique.

Fonctionnement

Une tâche d'évaluation par lots suit ce flux :

  1. Vous démarrez une tâche en spécifiant une source de session (où trouver les sessions d'agent) et une configuration d'évaluation (quels évaluateurs exécuter). Vous pouvez éventuellement fournir des métadonnées de base pour la notation basée sur les références.

  2. Le service découvre les sessions à partir CloudWatch des journaux en fonction des groupes de journaux et des filtres que vous spécifiez.

  3. Le service exécute des évaluateurs pour chaque session découverte. Chaque évaluateur note chaque session indépendamment. Si la véracité du terrain est fournie, les évaluateurs qui soutiennent la notation basée sur les références l'utilisent.

  4. Vous interrogez pour obtenir des résultats. Le poste passe par PENDING → IN_PROGRESS → COMPLETED (ouFAILED). Une fois complète, la réponse inclut des résumés agrégés avec les scores moyens par évaluateur, le nombre de sessions et l'utilisation des jetons.

  5. Per-session le détail est disponible dans CloudWatch les journaux à l'emplacement spécifié outputDataConfig dans la réponse.

Comparaison avec d'autres types d'évaluation

Aspect On-demand En ligne Par lots

Déclencheur

Caller-initiated, synchrone

Continu, piloté par les événements

Caller-initiated, asynchrone

Source de la session

L'appelant fournit des intervalles en ligne

Surveille un groupe de journaux

Le service découvre à partir CloudWatch des journaux

Scope

Séance unique

Toutes les sessions correspondent aux règles d'échantillonnage

Sessions multiples (plage horaire, ID de session ou groupe de journaux complet)

La vérité sur le terrain

Via evaluationReferenceInputs

Non pris en charge

Via sessionMetadata avec vérité terrestre en ligne

Résultats

Réponse synchrone

CloudWatch indicateurs et tableaux de bord

Résumés agrégés avec les moyennes par évaluateur, plus les détails par session dans CloudWatch

Cas d’utilisation

Dev-time contrôles ponctuels, CI/CD

Surveillance en production

Mesure de référence, pre/post comparaison, tests de régression