Valutazione in batch
La valutazione in batch esegue le valutazioni su più sessioni di agenti in un unico processo con orchestrazione lato server. A differenza della valutazione su richiesta, in cui si raccolgono gli intervalli e si richiama personalmente l'API Evaluate, la valutazione in batch gestisce l'individuazione delle sessioni, la raccolta degli intervalli e il punteggio interamente sul lato del servizio. L'utente invia un lavoro e il servizio elabora tutte le sessioni corrispondenti e restituisce risultati aggregati.
Utilizza la valutazione in batch quando devi:
-
Misura una linea di base prima di apportare modifiche al prompt, agli strumenti o al modello del tuo agente.
-
Convalida i miglioramenti confrontando i punteggi prima e dopo una modifica della configurazione.
-
Esegui test di regressione su un set curato di sessioni o scenari.
-
Monitora periodicamente la qualità tra le sessioni di produzione da una finestra temporale specifica.
Come funziona
Un processo di valutazione in batch segue questo flusso:
-
Si avvia un lavoro specificando un'origine della sessione (dove trovare le sessioni degli agenti) e una configurazione di valutazione (quali valutatori eseguire). Facoltativamente, puoi fornire metadati di base per il punteggio basato sui riferimenti.
-
Il servizio rileva le sessioni dai CloudWatch registri in base ai gruppi di log e ai filtri specificati.
-
Il servizio esegue valutazioni per ogni sessione rilevata. Ogni valutatore assegna un punteggio a ogni sessione in modo indipendente. Se viene fornita una verità fondamentale, la utilizzano i valutatori che supportano il punteggio basato sui riferimenti.
-
Fai un sondaggio per ottenere risultati. Il lavoro passa da
PENDINGIN_PROGRESS→COMPLETED(oFAILED). Una volta completata, la risposta include riepiloghi aggregati con i punteggi medi per valutatore, il conteggio delle sessioni e l'utilizzo dei token. -
Per-session i dettagli sono disponibili in CloudWatch Logs nella posizione specificata nella risposta.
outputDataConfig
Confronto con altri tipi di valutazione
| Aspetto | On-demand | Online | Archiviazione |
|---|---|---|---|
|
Trigger |
Caller-initiated, sincrono |
Continuo, basato sugli eventi |
Caller-initiated, asincrono |
|
Fonte della sessione |
Il chiamante fornisce intervalli in linea |
Guarda un gruppo di log |
Il servizio rileva dai registri CloudWatch |
|
Scope |
Sessione singola |
Tutte le sessioni corrispondono alle regole di campionamento |
Sessioni multiple (intervallo di tempo, ID di sessione o gruppo di log completo) |
|
Verità fondamentale |
Tramite |
Non supportata |
Via |
|
Risultati |
Risposta sincrona |
CloudWatch metriche e dashboard |
Riepiloghi aggregati con medie per valutatore e dettagli per sessione in CloudWatch |
|
Caso d’uso |
Dev-time controlli a campione, CI/CD |
Monitoraggio della produzione |
Misurazione di base, pre/post confronto, test di regressione |