View a markdown version of this page

Évaluation d’un jeu de données - Amazon Bedrock AgentCore

Évaluation d’un jeu de données

Note

L'évaluation du jeu de données est en version préliminaire publique. Les fonctionnalités et les API peuvent changer avant leur disponibilité générale.

Les évaluations des ensembles de données vous permettent d'exécuter votre agent par rapport à un ensemble de scénarios et d'évaluer automatiquement les résultats. Au lieu d'appeler manuellement votre agent, de collecter des spans et d'appeler l'API Evaluate, un exécuteur de jeux de données orchestre l'ensemble du cycle de vie en un seul appel : invoque l'agent, attend l'ingestion de la télémétrie et évalue.

Cela est utile pour les tests de régression, les ensembles de données de référence, les CI/CD pipelines, les mesures de référence et les pre/post comparaisons après des modifications de configuration.

Le AgentCore SDK fournit deux exécuteurs de jeux de données qui partagent le même schéma de jeu de données et le même format Ground Truth, mais qui diffèrent quant à l'endroit où l'évaluation a lieu :

  • On-demand dataset runner (OnDemandEvaluationDatasetRunner) — Collecte des intervalles et appelle l'API Evaluate côté client. Idéal pour les itérations au moment du développement et les petits ensembles de données.

  • Batch dataset runner (BatchEvaluationRunner) : délègue la collecte et l'évaluation du span au service via l'API d'évaluation par lots. Idéal pour les grands ensembles de données et les lignes de base de production.

Choisir un coureur

Aspect On-demand coureur Batch Runner

Collection Span

SDK-side via AgentSpanCollector

Server-side; le service lit CloudWatch directement depuis

Évaluer les appels d'API

Appels du SDK evaluate() par évaluateur et par scénario

Le SDK appelle startBatchEvaluation() une fois

Modèle d'exécution

Pipeline triphasé synchrone (invoquer, attendre, évaluer)

Pipeline asynchrone en quatre phases (invoquer, attendre, soumettre, interroger)

Résultats

Structuré EvaluationResult avec des informations détaillées par scénario et par évaluateur

Agréger BatchEvaluationSummary avec les moyennes par évaluateur, plus le détail par session dans CloudWatch

Idéal pour

Dev-time itération, petits ensembles de données CI/CD, lorsque vous avez besoin de détails immédiats par scénario

Mesure de référence, grands ensembles de données, pre/post comparaison, lorsque les scores agrégés sont suffisants

Conditions préalables

Les deux coureurs ont besoin de :

  • Python 3.10 et versions ultérieures

  • Un agent déployé sur AgentCore Runtime avec l'observabilité activée, ou un agent créé avec un framework compatible configuré avec AgentCore Observability. Frameworks pris en charge :

    • Agents à mèches

    • LangGraph avec opentelemetry-instrumentation-langchain ou openinference-instrumentation-langchain

  • Recherche de transactions activée dans CloudWatch ; voir Activer la recherche de transactions

  • Le AgentCore SDK installé : pip install bedrock-agentcore

  • AWS informations d'identification configurées avec des autorisations pour bedrock-agentcorebedrock-agentcore-control, et logs (CloudWatch)