View a markdown version of this page

Valutazione di set di dati - Amazon Bedrock AgentCore

Valutazione di set di dati

Nota

La valutazione del set di dati è in anteprima pubblica. Le funzionalità e le API possono cambiare prima della disponibilità generale.

Le valutazioni dei set di dati consentono di utilizzare l'agente in base a una serie di scenari e di valutare automaticamente i risultati. Invece di richiamare manualmente l'agente, raccogliere gli intervalli e chiamare l'API Evaluate, un Dataset Runner orchestra l'intero ciclo di vita in una singola chiamata: richiama l'agente, attende l'inserimento della telemetria ed effettua la valutazione.

Ciò è utile per i test di regressione, i set di dati di riferimento, le pipeline, la misurazione di base e il confronto dopo le modifiche alla configurazione. CI/CD pre/post

L' AgentCore SDK fornisce due strumenti per la creazione di set di dati che condividono lo stesso schema del set di dati e lo stesso formato di base, ma differiscono per dove avviene la valutazione:

  • On-demand dataset runner (OnDemandEvaluationDatasetRunner): raccoglie gli intervalli e chiama l'API Evaluate sul lato client. Ideale per iterazioni in fase di sviluppo e set di dati di piccole dimensioni.

  • Batch dataset runner (BatchEvaluationRunner): delega la raccolta e la valutazione degli intervalli al servizio tramite l'API di valutazione batch. Ideale per set di dati di grandi dimensioni e linee di base di produzione.

Scegliere un corridore

Aspetto On-demand corridore Batch runner

Collezione Span

SDK-side tramite AgentSpanCollector

Server-side; il servizio legge direttamente da CloudWatch

Valuta le chiamate API

Chiamate SDK evaluate() per valutatore per scenario

L'SDK chiama una volta startBatchEvaluation()

Modello di esecuzione

Pipeline sincrona trifase (invoca, attendi, valuta)

Pipeline asincrona a quattro fasi (invoke, wait, submit, poll)

Risultati

EvaluationResultStrutturato con dettagli per scenario e per valutatore

Aggrega BatchEvaluationSummary con le medie per valutatore e i dettagli per sessione in CloudWatch

Ideale per

Dev-time iterazione, piccoli set di dati, quando sono necessari CI/CD immediatamente i dettagli per scenario

Misurazione di base, set di dati di grandi dimensioni, pre/post confronto, quando i punteggi aggregati sono sufficienti

Prerequisiti

Entrambi i corridori richiedono: