View a markdown version of this page

Ottieni risultati di valutazione in batch - Amazon Bedrock AgentCore

Ottieni risultati di valutazione in batch

Recupera lo stato e i risultati di un processo di valutazione in batch. Esegui il polling di questa operazione finché il lavoro non raggiunge lo stato terminale (COMPLETED,FAILED, oSTOPPED).

Esempi di codice

Esempio
AgentCore CLI

Il --wait flag controlla il agentcore run batch-evaluation comportamento:

  • Con--wait: il comando si blocca finché il lavoro non raggiunge lo stato terminale.

  • Senza--wait: il comando avvia il lavoro e lo ritorna immediatamente. Il sondaggio sullo stato viene effettuato separatamente.

    # Start a job and block until it reaches a terminal state agentcore run batch-evaluation -r MyAgent -e Builtin.Correctness --wait # List previously started jobs (running jobs are refreshed from the service) agentcore batch-evaluations history # Check the status and results of a single job agentcore view batch-evaluation <batch-evaluation-id> # Non-interactive (JSON) output, the CLI analogue of a get_batch_evaluation polling loop agentcore view batch-evaluation <batch-evaluation-id> --json # Stop a running job agentcore stop batch-evaluation -i <batch-evaluation-id>

    Utilizza l'ID di valutazione batch dall'output della CLI di agentcore run batch-evaluation o dall'agentcore batch-evaluations historyelenco.

AWS SDK (boto3)
import time import boto3 client = boto3.client("bedrock-agentcore", region_name="us-west-2") # Poll until terminal state while True: result = client.get_batch_evaluation(batchEvaluationId=batch_eval_id) status = result["status"] print(f"Status: {status}") if status in ("COMPLETED", "COMPLETED_WITH_ERRORS", "FAILED", "STOPPED"): break time.sleep(30) # Display results if result.get("evaluationResults"): er = result["evaluationResults"] print(f"Sessions completed: {er.get('numberOfSessionsCompleted', 0)}") print(f"Sessions failed: {er.get('numberOfSessionsFailed', 0)}") print(f"Total sessions: {er.get('totalNumberOfSessions', 0)}") for summary in er.get("evaluatorSummaries", []): avg = summary.get("statistics", {}).get("averageScore") print(f" {summary['evaluatorId']}: {avg}")

Parametri della richiesta

Parametro Tipo Campo obbligatorio Descrizione

batchEvaluationId

Stringa

L'ID di valutazione del batch restituito daStartBatchEvaluation. Passato come parametro di percorso.

Risposta

Campo Tipo Description

batchEvaluationId

Stringa

L'ID di valutazione del batch.

batchEvaluationArn

Stringa

ARN della valutazione del batch.

batchEvaluationName

Stringa

Il nome del lavoro.

status

Stringa

Stato attuale:PENDING, IN_PROGRESSCOMPLETED,COMPLETED_WITH_ERRORS,FAILED,STOPPING,STOPPED,DELETING.

createdAt

Time stamp

Quando è stato creato il lavoro.

evaluators

List

I valutatori utilizzati.

outputConfig

Oggetto

CloudWatch Registra la destinazione per i dettagli per sessione. Contiene e. cloudWatchConfig.logGroupName cloudWatchConfig.logStreamName

evaluationResults

Oggetto

Presente quando il lavoro ha elaborato sessioni. Vedere Comprensione dei risultati e dell'output.

errorDetails

Elenco di stringhe

Messaggi di errore se il processo non è riuscito.

Campi EvaluationResults

Campo Tipo Description

numberOfSessionsCompleted

Numero intero

Numero di sessioni valutate con successo.

numberOfSessionsFailed

Numero intero

Numero di sessioni per le quali la valutazione non è riuscita.

numberOfSessionsInProgress

Numero intero

Numero di sessioni ancora in fase di valutazione.

totalNumberOfSessions

Numero intero

Numero totale di sessioni scoperte.

numberOfSessionsIgnored

Numero intero

Numero di sessioni ignorate per la valutazione. Il servizio valuta fino a 500 sessioni per job; se ne vengono rilevate altre, vengono selezionate le 500 più recenti.

evaluatorSummaries

List

Per-evaluator risultati aggregati.

campi EvaluatorSummaries

Campo Tipo Description

evaluatorId

Stringa

ID del valutatore (ad esempio,). Builtin.GoalSuccessRate

statistics.averageScore

Double

Punteggio medio in tutte le sessioni valutate.

totalEvaluated

Numero intero

Numero di sessioni ottenute da questo valutatore.

totalFailed

Numero intero

Numero di sessioni in cui questo valutatore ha avuto esito negativo.

Status, ciclo di vita

PENDING → IN_PROGRESS → COMPLETED
                      → COMPLETED_WITH_ERRORS
                      → FAILED
         STOPPING     → STOPPED
         DELETING
  • IN SOSPESO: il lavoro è stato accettato ed è in coda per l'elaborazione.

  • IN_PROGRESS — Il servizio sta rilevando le sessioni ed eseguendo i valutatori.

  • COMPLETATA: tutte le sessioni sono state valutate. I risultati sono disponibili.

  • COMPLETED_WITH_ERRORS — Il lavoro è terminato ma alcune sessioni hanno riscontrato errori. Sono disponibili risultati parziali.

  • FALLITO: il processo ha riscontrato un errore. Controlla errorDetails i dettagli.

  • INTERRUZIONE: è stata ricevuta una richiesta di interruzione. Il lavoro è agli sgoccioli.

  • INTERROTTO: il lavoro è stato interrotto prima del completamento. Potrebbero essere disponibili risultati parziali.

  • ELIMINAZIONE: il lavoro viene eliminato.

Errori

Errore Stato HTTP Description

ResourceNotFoundException

404

Nessuna valutazione in batch trovata con l'ID specificato.

ValidationException

400

Formato ID di valutazione batch non valido.

AccessDeniedException

403

Autorizzazioni insufficienti.

ThrottlingException

429

Frequenza di richiesta superata.

InternalServerException

500

Service-side errore.