Valutazione di set di dati
Nota
La valutazione del set di dati è in anteprima pubblica. Le funzionalità e le API possono cambiare prima della disponibilità generale.
Le valutazioni dei set di dati consentono di utilizzare l'agente in base a una serie di scenari e di valutare automaticamente i risultati. Invece di richiamare manualmente l'agente, raccogliere gli intervalli e chiamare l'API Evaluate, un Dataset Runner orchestra l'intero ciclo di vita in una singola chiamata: richiama l'agente, attende l'inserimento della telemetria ed effettua la valutazione.
Ciò è utile per i test di regressione, i set di dati di riferimento, le pipeline, la misurazione di base e il confronto dopo le modifiche alla configurazione. CI/CD pre/post
L' AgentCore SDK fornisce due strumenti per la creazione di set di dati che condividono lo stesso schema del set di dati e lo stesso formato di base, ma differiscono per dove avviene la valutazione:
-
On-demand dataset runner (
OnDemandEvaluationDatasetRunner): raccoglie gli intervalli e chiama l'API Evaluate sul lato client. Ideale per iterazioni in fase di sviluppo e set di dati di piccole dimensioni. -
Batch dataset runner (
BatchEvaluationRunner): delega la raccolta e la valutazione degli intervalli al servizio tramite l'API di valutazione batch. Ideale per set di dati di grandi dimensioni e linee di base di produzione.
Scegliere un corridore
| Aspetto | On-demand corridore | Batch runner |
|---|---|---|
|
Collezione Span |
SDK-side tramite |
Server-side; il servizio legge direttamente da CloudWatch |
|
Valuta le chiamate API |
Chiamate SDK |
L'SDK chiama una volta |
|
Modello di esecuzione |
Pipeline sincrona trifase (invoca, attendi, valuta) |
Pipeline asincrona a quattro fasi (invoke, wait, submit, poll) |
|
Risultati |
|
Aggrega |
|
Ideale per |
Dev-time iterazione, piccoli set di dati, quando sono necessari CI/CD immediatamente i dettagli per scenario |
Misurazione di base, set di dati di grandi dimensioni, pre/post confronto, quando i punteggi aggregati sono sufficienti |
Prerequisiti
Entrambi i corridori richiedono:
-
Python 3.10 e versioni successive
-
Un agente distribuito su AgentCore Runtime con l'osservabilità abilitata o un agente creato con un framework supportato configurato con Observability. AgentCore Framework supportati:
-
Agenti Strands
-
LangGraph con
opentelemetry-instrumentation-langchainoopeninference-instrumentation-langchain
-
-
Ricerca nelle transazioni abilitata in CloudWatch; vedi Abilitare la ricerca nelle transazioni
-
L' AgentCore SDK installato:
pip install bedrock-agentcore -
AWS credenziali configurate con le autorizzazioni per
bedrock-agentcorebedrock-agentcore-control, e ()logsCloudWatch