Évaluation d’un jeu de données
Note
L'évaluation du jeu de données est en version préliminaire publique. Les fonctionnalités et les API peuvent changer avant leur disponibilité générale.
Les évaluations des ensembles de données vous permettent d'exécuter votre agent par rapport à un ensemble de scénarios et d'évaluer automatiquement les résultats. Au lieu d'appeler manuellement votre agent, de collecter des spans et d'appeler l'API Evaluate, un exécuteur de jeux de données orchestre l'ensemble du cycle de vie en un seul appel : invoque l'agent, attend l'ingestion de la télémétrie et évalue.
Cela est utile pour les tests de régression, les ensembles de données de référence, les CI/CD pipelines, les mesures de référence et les pre/post comparaisons après des modifications de configuration.
Le AgentCore SDK fournit deux exécuteurs de jeux de données qui partagent le même schéma de jeu de données et le même format Ground Truth, mais qui diffèrent quant à l'endroit où l'évaluation a lieu :
-
On-demand dataset runner (
OnDemandEvaluationDatasetRunner) — Collecte des intervalles et appelle l'API Evaluate côté client. Idéal pour les itérations au moment du développement et les petits ensembles de données. -
Batch dataset runner (
BatchEvaluationRunner) : délègue la collecte et l'évaluation du span au service via l'API d'évaluation par lots. Idéal pour les grands ensembles de données et les lignes de base de production.
Choisir un coureur
| Aspect | On-demand coureur | Batch Runner |
|---|---|---|
|
Collection Span |
SDK-side via |
Server-side; le service lit CloudWatch directement depuis |
|
Évaluer les appels d'API |
Appels du SDK |
Le SDK appelle |
|
Modèle d'exécution |
Pipeline triphasé synchrone (invoquer, attendre, évaluer) |
Pipeline asynchrone en quatre phases (invoquer, attendre, soumettre, interroger) |
|
Résultats |
Structuré |
Agréger |
|
Idéal pour |
Dev-time itération, petits ensembles de données CI/CD, lorsque vous avez besoin de détails immédiats par scénario |
Mesure de référence, grands ensembles de données, pre/post comparaison, lorsque les scores agrégés sont suffisants |
Conditions préalables
Les deux coureurs ont besoin de :
-
Python 3.10 et versions ultérieures
-
Un agent déployé sur AgentCore Runtime avec l'observabilité activée, ou un agent créé avec un framework compatible configuré avec AgentCore Observability. Frameworks pris en charge :
-
Agents à mèches
-
LangGraph avec
opentelemetry-instrumentation-langchainouopeninference-instrumentation-langchain
-
-
Recherche de transactions activée dans CloudWatch ; voir Activer la recherche de transactions
-
Le AgentCore SDK installé :
pip install bedrock-agentcore -
AWS informations d'identification configurées avec des autorisations pour
bedrock-agentcorebedrock-agentcore-control, etlogs(CloudWatch)