View a markdown version of this page

Obtenez les résultats de l'évaluation par lots - Amazon Bedrock AgentCore

Obtenez les résultats de l'évaluation par lots

Récupérez le statut et les résultats d'une tâche d'évaluation par lots. Interrogez cette opération jusqu'à ce que la tâche atteigne un état terminal (COMPLETEDFAILED, ouSTOPPED).

Exemples de code

Exemple
AgentCore CLI

Le --wait drapeau contrôle le agentcore run batch-evaluation comportement :

  • Avec --wait : la commande se bloque jusqu'à ce que la tâche atteigne l'état terminal.

  • Sans --wait : la commande démarre la tâche et revient immédiatement. Vous demandez le statut séparément.

    # Start a job and block until it reaches a terminal state agentcore run batch-evaluation -r MyAgent -e Builtin.Correctness --wait # List previously started jobs (running jobs are refreshed from the service) agentcore batch-evaluations history # Check the status and results of a single job agentcore view batch-evaluation <batch-evaluation-id> # Non-interactive (JSON) output, the CLI analogue of a get_batch_evaluation polling loop agentcore view batch-evaluation <batch-evaluation-id> --json # Stop a running job agentcore stop batch-evaluation -i <batch-evaluation-id>

    Utilisez l'ID d'évaluation du lot indiqué dans la sortie CLI de agentcore run batch-evaluation ou dans la agentcore batch-evaluations history liste.

AWS SDK (boto3)
import time import boto3 client = boto3.client("bedrock-agentcore", region_name="us-west-2") # Poll until terminal state while True: result = client.get_batch_evaluation(batchEvaluationId=batch_eval_id) status = result["status"] print(f"Status: {status}") if status in ("COMPLETED", "COMPLETED_WITH_ERRORS", "FAILED", "STOPPED"): break time.sleep(30) # Display results if result.get("evaluationResults"): er = result["evaluationResults"] print(f"Sessions completed: {er.get('numberOfSessionsCompleted', 0)}") print(f"Sessions failed: {er.get('numberOfSessionsFailed', 0)}") print(f"Total sessions: {er.get('totalNumberOfSessions', 0)}") for summary in er.get("evaluatorSummaries", []): avg = summary.get("statistics", {}).get("averageScore") print(f" {summary['evaluatorId']}: {avg}")

Paramètres de demande

Paramètre Type Obligatoire Description

batchEvaluationId

String

Oui

L'ID d'évaluation du lot renvoyé parStartBatchEvaluation. Transmis en tant que paramètre de chemin.

Réponse

Champ Type Description

batchEvaluationId

String

ID d'évaluation du lot.

batchEvaluationArn

String

ARN de l'évaluation par lots.

batchEvaluationName

String

Le nom du poste.

status

String

État actuel :PENDING,IN_PROGRESS,COMPLETED,COMPLETED_WITH_ERRORS,FAILED,STOPPING,STOPPED,DELETING.

createdAt

Horodatage

Date de création de l'emploi.

evaluators

List

Les évaluateurs utilisés.

outputConfig

Objet

CloudWatch Enregistre la destination pour les détails par session. Contient cloudWatchConfig.logGroupName etcloudWatchConfig.logStreamName.

evaluationResults

Objet

Présent lorsque la tâche a traité des sessions. Voir Comprendre les résultats et les sorties.

errorDetails

Liste de chaînes

Messages d'erreur en cas d'échec de la tâche.

Champs de résultats d'évaluation

Champ Type Description

numberOfSessionsCompleted

Entier

Nombre de sessions évaluées avec succès.

numberOfSessionsFailed

Entier

Nombre de sessions dont l'évaluation a échoué.

numberOfSessionsInProgress

Entier

Nombre de sessions toujours en cours d'évaluation.

totalNumberOfSessions

Entier

Nombre total de sessions découvertes.

numberOfSessionsIgnored

Entier

Nombre de sessions ignorées pour évaluation. Le service évalue jusqu'à 500 sessions par tâche ; si d'autres sont découvertes, les 500 plus récentes sont sélectionnées.

evaluatorSummaries

List

Per-evaluator résultats agrégés.

Champs de résumé de l'évaluateur

Champ Type Description

evaluatorId

String

ID de l'évaluateur (par exemple,Builtin.GoalSuccessRate).

statistics.averageScore

Double

Note moyenne pour toutes les sessions évaluées.

totalEvaluated

Entier

Nombre de séances notées par cet évaluateur.

totalFailed

Entier

Nombre de sessions où cet évaluateur a échoué.

Cycle de vie des statuts

PENDING → IN_PROGRESS → COMPLETED
                      → COMPLETED_WITH_ERRORS
                      → FAILED
         STOPPING     → STOPPED
         DELETING
  • EN ATTENTE — La tâche a été acceptée et est en attente de traitement.

  • IN_PROGRESS — Le service découvre les sessions et exécute des évaluateurs.

  • TERMINÉ — Toutes les sessions ont été évaluées. Les résultats sont disponibles.

  • COMPLETED_WITH_ERRORS — Le travail est terminé mais certaines sessions ont rencontré des erreurs. Des résultats partiels sont disponibles.

  • ÉCHEC — La tâche a rencontré une erreur. Vérifiez errorDetails les détails.

  • ARRÊT — Une demande d'arrêt a été reçue. Le travail touche à sa fin.

  • STOPPÉ — La tâche a été arrêtée avant d'être terminée. Des résultats partiels peuvent être disponibles.

  • SUPPRESSION — La tâche est en cours de suppression.

Erreurs

Erreur Statut HTTP Description

ResourceNotFoundException

404

Aucune évaluation du lot n'a été trouvée avec l'ID spécifié.

ValidationException

400

Format d'ID d'évaluation par lots non valide.

AccessDeniedException

403

Autorisations insuffisantes.

ThrottlingException

429

Taux de demandes dépassé.

InternalServerException

500

Service-side erreur.