Comprensione dei risultati e dei risultati
I risultati della valutazione in batch sono disponibili in due livelli: riepiloghi aggregati nella risposta dell'API e dettagli per sessione nei registri. CloudWatch
Risultati aggregati
Al termine di una valutazione in batch, la GetBatchEvaluation risposta include un evaluationResults oggetto con riepiloghi aggregati.
Conteggi delle sessioni
| Campo | Description |
|---|---|
|
|
Numero di sessioni valutate con successo da tutti i valutatori. |
|
|
Numero di sessioni in cui almeno un valutatore ha avuto esito negativo. |
|
|
Numero di sessioni ancora in fase di valutazione (0 quando il processo è completo). |
|
|
Numero totale di sessioni scoperte dall'origine della sessione. |
|
|
Numero di sessioni ignorate per la valutazione. Il servizio valuta fino a 500 sessioni per job. Se vengono rilevate più di 500 sessioni, il servizio seleziona le 500 sessioni più recenti e ignora le altre. |
Per-evaluator riassunti
Ogni voce evaluatorSummaries fornisce metriche aggregate per un valutatore:
| Campo | Description |
|---|---|
|
|
ID breve (ad esempio,). |
|
|
Punteggio medio in tutte le sessioni valutate. L'intervallo dipende dal valutatore (in genere 0—1). |
|
|
Numero di sessioni che questo valutatore ha ottenuto con successo. |
|
|
Numero di sessioni in cui questo valutatore ha restituito un errore. |
Esempio di risposta
{ "batchEvaluationId": "12345678-1234-1234-1234-123456789012", "status": "COMPLETED", "evaluationResults": { "numberOfSessionsCompleted": 47, "numberOfSessionsFailed": 3, "numberOfSessionsIgnored": 0, "totalNumberOfSessions": 50, "evaluatorSummaries": [ { "evaluatorId": "Builtin.GoalSuccessRate", "statistics": { "averageScore": 0.72 }, "totalEvaluated": 47, "totalFailed": 0 }, { "evaluatorId": "Builtin.Helpfulness", "statistics": { "averageScore": 0.81 }, "totalEvaluated": 47, "totalFailed": 0 } ] } }
Per-session dettagli in Logs CloudWatch
Il outputConfig campo nella GetBatchEvaluation risposta specifica una posizione dei CloudWatch registri in cui i risultati per sessione e per valutatore vengono scritti come eventi. OpenTelemetry
{ "outputConfig": { "cloudWatchConfig": { "logGroupName": "/aws/bedrock-agentcore/evaluations/batch", "logStreamName": "12345678-1234-1234-1234-123456789012" } } }
Ogni evento nel flusso di log contiene dettagli per turno e per valutatore:
| Campo | Description |
|---|---|
|
|
Punteggio numerico per questo turno. |
|
|
Etichetta categorica (ad esempio |
|
|
LLM-generated ragionamento della partitura. |
Per leggere questi eventi, usa l'API CloudWatch Logs:
import boto3 logs_client = boto3.client("logs", region_name="us-west-2") response = logs_client.get_log_events( logGroupName="/aws/bedrock-agentcore/evaluations/batch", logStreamName="12345678-1234-1234-1234-123456789012", ) for event in response["events"]: print(event["message"])
Interpretazione dei punteggi
I punteggi della valutazione in batch seguono le stesse convenzioni della valutazione su richiesta:
-
Punteggi numerici (
value): l'intervallo dipende dal valutatore. La maggior parte dei valutatori integrati ottengono punteggi da 0 a 1, dove più alto è meglio. -
Etichette (
label): descrizioni categoriche del punteggio. Ad esempio,Builtin.Helpfulnessrestituisce etichette comeVery Helpful,Somewhat Helpful,Not Helpful.
Gestione degli errori
Job-level errori
Se il processo di valutazione del batch fallisce completamente, status viene visualizzato FAILED e errorDetails contiene uno o più messaggi di errore che descrivono cosa è andato storto. Cause comuni:
-
Nessuna sessione trovata nella fonte specificata.
-
Nome del gruppo di CloudWatch log o del servizio non valido.
Session-level errori
Le singole sessioni possono fallire mentre l'intero processo ha esito positivo. Il numberOfSessionsFailed conteggio evaluationResults indica quante sessioni hanno avuto errori. Per-session gli errori vengono registrati nell'output CloudWatch dei registri.
Evaluator-level errori
In una sessione valutata con successo, i singoli valutatori possono fallire. Il totalFailed conteggio riportato nel riepilogo di ogni valutatore indica a quante sessioni il valutatore non è riuscito a ottenere un punteggio. Le cause più comuni includono intervalli non validi o la mancanza di attributi obbligatori.
Confronto dei risultati tra le esecuzioni
Un flusso di lavoro comune consiste nell'eseguire la valutazione in batch prima e dopo una modifica (aggiornamento rapido, scambio di modello, modifica dello strumento) e confrontare i punteggi aggregati:
# After running two batch evaluations baseline = client.get_batch_evaluation(batchEvaluationId=baseline_id) treatment = client.get_batch_evaluation(batchEvaluationId=treatment_id) baseline_summaries = { s["evaluatorId"]: s["statistics"]["averageScore"] for s in baseline["evaluationResults"]["evaluatorSummaries"] } treatment_summaries = { s["evaluatorId"]: s["statistics"]["averageScore"] for s in treatment["evaluationResults"]["evaluatorSummaries"] } print(f"{'Evaluator':<35} {'Baseline':>10} {'Treatment':>10} {'Delta':>10}") print("=" * 67) for eid in baseline_summaries: b = baseline_summaries[eid] t = treatment_summaries.get(eid, 0) delta = t - b print(f"{eid:<35} {b:>10.4f} {t:>10.4f} {delta:>+10.4f}")
Visualizzazione dei risultati dalla CLI
Oltre all'GetBatchEvaluationAPI, la AgentCore CLI restituisce gli stessi risultati:
-
agentcore view batch-evaluation <batch-evaluation-id>— visualizza un singolo lavoro e i relativi risultati (aggiungi--jsonper l'output non elaborato). -
agentcore batch-evaluations history— elenca i lavori di valutazione in batch (i lavori in esecuzione vengono aggiornati dal servizio; aggiungi--json). -
agentcore run batch-evaluation … --json— restituisce lo stessoevaluatorSummariesoggettobatchEvaluationIdevaluationResults//mostrato nell'esempio JSON precedente.
# View a single batch evaluation job and its results agentcore view batch-evaluation 12345678-1234-1234-1234-123456789012 --json # List batch evaluation jobs (running jobs are refreshed from the service) agentcore batch-evaluations history --json
Nota
Il flag del comando run per la selezione dei valutatori è -e, --evaluator <ids…> (o--evaluator-arn <arns…>).