View a markdown version of this page

Comprensione dei risultati e dei risultati - Amazon Bedrock AgentCore

Comprensione dei risultati e dei risultati

I risultati della valutazione in batch sono disponibili in due livelli: riepiloghi aggregati nella risposta dell'API e dettagli per sessione nei registri. CloudWatch

Risultati aggregati

Al termine di una valutazione in batch, la GetBatchEvaluation risposta include un evaluationResults oggetto con riepiloghi aggregati.

Conteggi delle sessioni

Campo Description

numberOfSessionsCompleted

Numero di sessioni valutate con successo da tutti i valutatori.

numberOfSessionsFailed

Numero di sessioni in cui almeno un valutatore ha avuto esito negativo.

numberOfSessionsInProgress

Numero di sessioni ancora in fase di valutazione (0 quando il processo è completo).

totalNumberOfSessions

Numero totale di sessioni scoperte dall'origine della sessione.

numberOfSessionsIgnored

Numero di sessioni ignorate per la valutazione. Il servizio valuta fino a 500 sessioni per job. Se vengono rilevate più di 500 sessioni, il servizio seleziona le 500 sessioni più recenti e ignora le altre.

Per-evaluator riassunti

Ogni voce evaluatorSummaries fornisce metriche aggregate per un valutatore:

Campo Description

evaluatorId

ID breve (ad esempio,). Builtin.GoalSuccessRate

statistics.averageScore

Punteggio medio in tutte le sessioni valutate. L'intervallo dipende dal valutatore (in genere 0—1).

totalEvaluated

Numero di sessioni che questo valutatore ha ottenuto con successo.

totalFailed

Numero di sessioni in cui questo valutatore ha restituito un errore.

Esempio di risposta

{ "batchEvaluationId": "12345678-1234-1234-1234-123456789012", "status": "COMPLETED", "evaluationResults": { "numberOfSessionsCompleted": 47, "numberOfSessionsFailed": 3, "numberOfSessionsIgnored": 0, "totalNumberOfSessions": 50, "evaluatorSummaries": [ { "evaluatorId": "Builtin.GoalSuccessRate", "statistics": { "averageScore": 0.72 }, "totalEvaluated": 47, "totalFailed": 0 }, { "evaluatorId": "Builtin.Helpfulness", "statistics": { "averageScore": 0.81 }, "totalEvaluated": 47, "totalFailed": 0 } ] } }

Per-session dettagli in Logs CloudWatch

Il outputConfig campo nella GetBatchEvaluation risposta specifica una posizione dei CloudWatch registri in cui i risultati per sessione e per valutatore vengono scritti come eventi. OpenTelemetry

{ "outputConfig": { "cloudWatchConfig": { "logGroupName": "/aws/bedrock-agentcore/evaluations/batch", "logStreamName": "12345678-1234-1234-1234-123456789012" } } }

Ogni evento nel flusso di log contiene dettagli per turno e per valutatore:

Campo Description

gen_ai.evaluation.score.value

Punteggio numerico per questo turno.

gen_ai.evaluation.score.label

Etichetta categorica (ad esempioPASS,Very Helpful).

gen_ai.evaluation.explanation

LLM-generated ragionamento della partitura.

Per leggere questi eventi, usa l'API CloudWatch Logs:

import boto3 logs_client = boto3.client("logs", region_name="us-west-2") response = logs_client.get_log_events( logGroupName="/aws/bedrock-agentcore/evaluations/batch", logStreamName="12345678-1234-1234-1234-123456789012", ) for event in response["events"]: print(event["message"])

Interpretazione dei punteggi

I punteggi della valutazione in batch seguono le stesse convenzioni della valutazione su richiesta:

  • Punteggi numerici (value): l'intervallo dipende dal valutatore. La maggior parte dei valutatori integrati ottengono punteggi da 0 a 1, dove più alto è meglio.

  • Etichette (label): descrizioni categoriche del punteggio. Ad esempio, Builtin.Helpfulness restituisce etichette comeVery Helpful,Somewhat Helpful,Not Helpful.

Gestione degli errori

Job-level errori

Se il processo di valutazione del batch fallisce completamente, status viene visualizzato FAILED e errorDetails contiene uno o più messaggi di errore che descrivono cosa è andato storto. Cause comuni:

  • Nessuna sessione trovata nella fonte specificata.

  • Nome del gruppo di CloudWatch log o del servizio non valido.

Session-level errori

Le singole sessioni possono fallire mentre l'intero processo ha esito positivo. Il numberOfSessionsFailed conteggio evaluationResults indica quante sessioni hanno avuto errori. Per-session gli errori vengono registrati nell'output CloudWatch dei registri.

Evaluator-level errori

In una sessione valutata con successo, i singoli valutatori possono fallire. Il totalFailed conteggio riportato nel riepilogo di ogni valutatore indica a quante sessioni il valutatore non è riuscito a ottenere un punteggio. Le cause più comuni includono intervalli non validi o la mancanza di attributi obbligatori.

Confronto dei risultati tra le esecuzioni

Un flusso di lavoro comune consiste nell'eseguire la valutazione in batch prima e dopo una modifica (aggiornamento rapido, scambio di modello, modifica dello strumento) e confrontare i punteggi aggregati:

# After running two batch evaluations baseline = client.get_batch_evaluation(batchEvaluationId=baseline_id) treatment = client.get_batch_evaluation(batchEvaluationId=treatment_id) baseline_summaries = { s["evaluatorId"]: s["statistics"]["averageScore"] for s in baseline["evaluationResults"]["evaluatorSummaries"] } treatment_summaries = { s["evaluatorId"]: s["statistics"]["averageScore"] for s in treatment["evaluationResults"]["evaluatorSummaries"] } print(f"{'Evaluator':<35} {'Baseline':>10} {'Treatment':>10} {'Delta':>10}") print("=" * 67) for eid in baseline_summaries: b = baseline_summaries[eid] t = treatment_summaries.get(eid, 0) delta = t - b print(f"{eid:<35} {b:>10.4f} {t:>10.4f} {delta:>+10.4f}")

Visualizzazione dei risultati dalla CLI

Oltre all'GetBatchEvaluationAPI, la AgentCore CLI restituisce gli stessi risultati:

  • agentcore view batch-evaluation <batch-evaluation-id>— visualizza un singolo lavoro e i relativi risultati (aggiungi --json per l'output non elaborato).

  • agentcore batch-evaluations history— elenca i lavori di valutazione in batch (i lavori in esecuzione vengono aggiornati dal servizio; aggiungi--json).

  • agentcore run batch-evaluation …​ --json— restituisce lo stesso evaluatorSummaries oggetto batchEvaluationIdevaluationResults//mostrato nell'esempio JSON precedente.

# View a single batch evaluation job and its results agentcore view batch-evaluation 12345678-1234-1234-1234-123456789012 --json # List batch evaluation jobs (running jobs are refreshed from the service) agentcore batch-evaluations history --json
Nota

Il flag del comando run per la selezione dei valutatori è -e, --evaluator <ids…​> (o--evaluator-arn <arns…​>).