View a markdown version of this page

Ergebnisse der Chargenauswertung abrufen - Amazon Grundgestein AgentCore

Ergebnisse der Chargenauswertung abrufen

Rufen Sie den Status und die Ergebnisse eines Batch-Bewertungsauftrags ab. Rufen Sie diesen Vorgang ab, bis der Job einen Terminalstatus (COMPLETEDFAILED, oderSTOPPED) erreicht.

Codebeispiele

Beispiel
AgentCore CLI

Das --wait Flag steuert, wie agentcore run batch-evaluation sich das Verhalten verhält:

  • Mit--wait: Der Befehl wird blockiert, bis der Job einen Terminalstatus erreicht.

  • Ohne--wait: Der Befehl startet den Job und kehrt sofort zurück. Sie fragen den Status separat ab.

    # Start a job and block until it reaches a terminal state agentcore run batch-evaluation -r MyAgent -e Builtin.Correctness --wait # List previously started jobs (running jobs are refreshed from the service) agentcore batch-evaluations history # Check the status and results of a single job agentcore view batch-evaluation <batch-evaluation-id> # Non-interactive (JSON) output, the CLI analogue of a get_batch_evaluation polling loop agentcore view batch-evaluation <batch-evaluation-id> --json # Stop a running job agentcore stop batch-evaluation -i <batch-evaluation-id>

    Verwenden Sie die Batch-Evaluierungs-ID aus der CLI-Ausgabe von agentcore run batch-evaluation oder aus der agentcore batch-evaluations history Liste.

AWS SDK (boto3)
import time import boto3 client = boto3.client("bedrock-agentcore", region_name="us-west-2") # Poll until terminal state while True: result = client.get_batch_evaluation(batchEvaluationId=batch_eval_id) status = result["status"] print(f"Status: {status}") if status in ("COMPLETED", "COMPLETED_WITH_ERRORS", "FAILED", "STOPPED"): break time.sleep(30) # Display results if result.get("evaluationResults"): er = result["evaluationResults"] print(f"Sessions completed: {er.get('numberOfSessionsCompleted', 0)}") print(f"Sessions failed: {er.get('numberOfSessionsFailed', 0)}") print(f"Total sessions: {er.get('totalNumberOfSessions', 0)}") for summary in er.get("evaluatorSummaries", []): avg = summary.get("statistics", {}).get("averageScore") print(f" {summary['evaluatorId']}: {avg}")

Anforderungsparameter

Parameter Typ Erforderlich Beschreibung

batchEvaluationId

Zeichenfolge

Ja

Die von zurückgegebene Batch-Evaluierungs-IDStartBatchEvaluation. Als Pfadparameter übergeben.

Antwort

Feld Typ Description

batchEvaluationId

Zeichenfolge

Die ID der Batch-Auswertung.

batchEvaluationArn

Zeichenfolge

ARN der Chargenauswertung.

batchEvaluationName

Zeichenfolge

Der Jobname.

status

Zeichenfolge

Aktueller Status:PENDING,IN_PROGRESS,COMPLETED,COMPLETED_WITH_ERRORS,FAILED,STOPPING,STOPPED,DELETING.

createdAt

Zeitstempel

Wann der Job erstellt wurde.

evaluators

Auflisten

Die verwendeten Evaluatoren.

outputConfig

Objekt

CloudWatch Protokolliert das Ziel für Details pro Sitzung. Enthält cloudWatchConfig.logGroupName und. cloudWatchConfig.logStreamName

evaluationResults

Objekt

Anwesend, wenn der Job Sitzungen verarbeitet hat. Weitere Informationen finden Sie unter Ergebnisse und Ergebnisse verstehen.

errorDetails

Liste von Zeichenfolgen

Fehlermeldungen, wenn der Job fehlgeschlagen ist.

Felder für EvaluationResults

Feld Typ Description

numberOfSessionsCompleted

Ganzzahl

Anzahl der erfolgreich ausgewerteten Sitzungen.

numberOfSessionsFailed

Ganzzahl

Anzahl der Sitzungen, bei denen die Bewertung nicht bestanden hat.

numberOfSessionsInProgress

Ganzzahl

Anzahl der Sitzungen, die noch ausgewertet werden.

totalNumberOfSessions

Ganzzahl

Gesamtzahl der entdeckten Sitzungen.

numberOfSessionsIgnored

Ganzzahl

Anzahl der Sitzungen, die bei der Auswertung ignoriert wurden. Der Dienst wertet bis zu 500 Sitzungen pro Job aus. Wenn mehr gefunden werden, werden die letzten 500 ausgewählt.

evaluatorSummaries

Auflisten

Per-evaluator aggregierte Ergebnisse.

Felder von EvaluatorSummaries

Feld Typ Description

evaluatorId

Zeichenfolge

Evaluator-ID (zum Beispiel). Builtin.GoalSuccessRate

statistics.averageScore

Double

Durchschnittliche Punktzahl aller bewerteten Sitzungen.

totalEvaluated

Ganzzahl

Anzahl der Sitzungen, die dieser Prüfer bewertet hat.

totalFailed

Ganzzahl

Anzahl der Sitzungen, bei denen dieser Evaluator versagt hat.

Lebenszyklus des Status

PENDING → IN_PROGRESS → COMPLETED
                      → COMPLETED_WITH_ERRORS
                      → FAILED
         STOPPING     → STOPPED
         DELETING
  • AUSSTEHEND — Der Job wurde akzeptiert und befindet sich in der Warteschlange zur Bearbeitung.

  • IN_PROGRESS — Der Dienst erkennt Sitzungen und führt Evaluatoren aus.

  • ABGESCHLOSSEN — Alle Sitzungen wurden bewertet. Die Ergebnisse sind verfügbar.

  • COMPLETED_WITH_ERRORS — Der Job wurde abgeschlossen, aber in einigen Sitzungen traten Fehler auf. Teilergebnisse sind verfügbar.

  • FEHLGESCHLAGEN — Bei dem Job ist ein Fehler aufgetreten. Suchen Sie errorDetails nach Einzelheiten.

  • STOPPEN — Eine Stopp-Anfrage wurde empfangen. Der Job wird beendet.

  • GESTOPPT — Der Job wurde vor Abschluss gestoppt. Möglicherweise sind Teilergebnisse verfügbar.

  • LÖSCHEN — Der Job wird gelöscht.

Fehler

Fehler HTTP-Status Description

ResourceNotFoundException

404

Es wurde keine Batch-Auswertung mit der angegebenen ID gefunden.

ValidationException

400

Ungültiges ID-Format für die Batch-Auswertung.

AccessDeniedException

403

Unzureichende Berechtigungen.

ThrottlingException

429

Die Anforderungsrate wurde überschritten.

InternalServerException

500

Service-side Fehler.