View a markdown version of this page

Valutazione in batch - Amazon Bedrock AgentCore

Valutazione in batch

La valutazione in batch esegue le valutazioni su più sessioni di agenti in un unico processo con orchestrazione lato server. A differenza della valutazione su richiesta, in cui si raccolgono gli intervalli e si richiama personalmente l'API Evaluate, la valutazione in batch gestisce l'individuazione delle sessioni, la raccolta degli intervalli e il punteggio interamente sul lato del servizio. L'utente invia un lavoro e il servizio elabora tutte le sessioni corrispondenti e restituisce risultati aggregati.

Utilizza la valutazione in batch quando devi:

  • Misura una linea di base prima di apportare modifiche al prompt, agli strumenti o al modello del tuo agente.

  • Convalida i miglioramenti confrontando i punteggi prima e dopo una modifica della configurazione.

  • Esegui test di regressione su un set curato di sessioni o scenari.

  • Monitora periodicamente la qualità tra le sessioni di produzione da una finestra temporale specifica.

Come funziona

Un processo di valutazione in batch segue questo flusso:

  1. Si avvia un lavoro specificando un'origine della sessione (dove trovare le sessioni degli agenti) e una configurazione di valutazione (quali valutatori eseguire). Facoltativamente, puoi fornire metadati di base per il punteggio basato sui riferimenti.

  2. Il servizio rileva le sessioni dai CloudWatch registri in base ai gruppi di log e ai filtri specificati.

  3. Il servizio esegue valutazioni per ogni sessione rilevata. Ogni valutatore assegna un punteggio a ogni sessione in modo indipendente. Se viene fornita una verità fondamentale, la utilizzano i valutatori che supportano il punteggio basato sui riferimenti.

  4. Fai un sondaggio per ottenere risultati. Il lavoro passa da PENDING IN_PROGRESSCOMPLETED (oFAILED). Una volta completata, la risposta include riepiloghi aggregati con i punteggi medi per valutatore, il conteggio delle sessioni e l'utilizzo dei token.

  5. Per-session i dettagli sono disponibili in CloudWatch Logs nella posizione specificata nella risposta. outputDataConfig

Confronto con altri tipi di valutazione

Aspetto On-demand Online Archiviazione

Trigger

Caller-initiated, sincrono

Continuo, basato sugli eventi

Caller-initiated, asincrono

Fonte della sessione

Il chiamante fornisce intervalli in linea

Guarda un gruppo di log

Il servizio rileva dai registri CloudWatch

Scope

Sessione singola

Tutte le sessioni corrispondono alle regole di campionamento

Sessioni multiple (intervallo di tempo, ID di sessione o gruppo di log completo)

Verità fondamentale

Tramite evaluationReferenceInputs

Non supportata

Via sessionMetadata con inline ground truth

Risultati

Risposta sincrona

CloudWatch metriche e dashboard

Riepiloghi aggregati con medie per valutatore e dettagli per sessione in CloudWatch

Caso d’uso

Dev-time controlli a campione, CI/CD

Monitoraggio della produzione

Misurazione di base, pre/post confronto, test di regressione