View a markdown version of this page

Obtenir les résultats de l'évaluation par lots - Base rocheuse de l'Amazonie AgentCore

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Obtenir les résultats de l'évaluation par lots

Récupérez le statut et les résultats d'une tâche d'évaluation par lots. Interrogez cette opération jusqu'à ce que la tâche atteigne l'état terminal (COMPLETEDFAILED, ouSTOPPED).

Exemples de code

Exemple
AgentCore CLI

Le --wait drapeau contrôle le agentcore run batch-evaluation comportement :

  • Avec --wait : la commande bloque jusqu'à ce que la tâche atteigne l'état terminal.

  • Sans --wait : la commande démarre la tâche et revient immédiatement. Vous effectuez un sondage pour le statut séparément.

    # Start a job and block until it reaches a terminal state agentcore run batch-evaluation -r MyAgent -e Builtin.Correctness --wait # List previously started jobs (running jobs are refreshed from the service) agentcore batch-evaluations history # Check the status and results of a single job agentcore view batch-evaluation <batch-evaluation-id> # Non-interactive (JSON) output, the CLI analogue of a get_batch_evaluation polling loop agentcore view batch-evaluation <batch-evaluation-id> --json # Stop a running job agentcore stop batch-evaluation -i <batch-evaluation-id>

    Utilisez l'ID d'évaluation par lots figurant sur la sortie CLI de agentcore run batch-evaluation ou depuis la agentcore batch-evaluations history liste.

AWS SDK (boto3)
import time import boto3 client = boto3.client("bedrock-agentcore", region_name="us-west-2") # Poll until terminal state while True: result = client.get_batch_evaluation(batchEvaluationId=batch_eval_id) status = result["status"] print(f"Status: {status}") if status in ("COMPLETED", "COMPLETED_WITH_ERRORS", "FAILED", "STOPPED"): break time.sleep(30) # Display results if result.get("evaluationResults"): er = result["evaluationResults"] print(f"Sessions completed: {er.get('numberOfSessionsCompleted', 0)}") print(f"Sessions failed: {er.get('numberOfSessionsFailed', 0)}") print(f"Total sessions: {er.get('totalNumberOfSessions', 0)}") for summary in er.get("evaluatorSummaries", []): avg = summary.get("statistics", {}).get("averageScore") print(f" {summary['evaluatorId']}: {avg}")

Paramètres de demande

Paramètre Type Obligatoire Description

batchEvaluationId

Chaîne

Oui

L'ID d'évaluation du lot renvoyé parStartBatchEvaluation. Transmis en tant que paramètre de chemin.

Réponse

Champ Type Description

batchEvaluationId

Chaîne

L'ID d'évaluation du lot.

batchEvaluationArn

Chaîne

ARN de l'évaluation du lot.

batchEvaluationName

Chaîne

Le nom du poste.

status

Chaîne

État actuel :PENDING, IN_PROGRESSCOMPLETED,COMPLETED_WITH_ERRORS,FAILED,STOPPING,STOPPED,DELETING.

createdAt

Horodatage

Quand l'emploi a été créé.

evaluators

List

Les évaluateurs utilisés.

outputConfig

Objet

CloudWatch Destination des journaux pour les détails par session. Contient cloudWatchConfig.logGroupName etcloudWatchConfig.logStreamName.

evaluationResults

Objet

Présent lorsque la tâche a traité des sessions. Consultez la section Comprendre les résultats et les résultats.

errorDetails

Liste de chaînes

Messages d'erreur en cas d'échec de la tâche.

Champs relatifs aux résultats de l'évaluation

Champ Type Description

numberOfSessionsCompleted

Entier

Nombre de sessions évaluées avec succès.

numberOfSessionsFailed

Entier

Nombre de sessions qui ont échoué à l'évaluation.

numberOfSessionsInProgress

Entier

Nombre de sessions toujours en cours d'évaluation.

totalNumberOfSessions

Entier

Nombre total de sessions découvertes.

numberOfSessionsIgnored

Entier

Nombre de sessions ignorées pour l'évaluation. Le service évalue jusqu'à 500 sessions par tâche ; si d'autres sont découvertes, les 500 plus récentes sont sélectionnées.

evaluatorSummaries

List

Per-evaluator résultats agrégés.

Champs Evaluator/Résumés

Champ Type Description

evaluatorId

Chaîne

ID de l'évaluateur (par exemple,Builtin.GoalSuccessRate).

statistics.averageScore

Double

Note moyenne pour toutes les sessions évaluées.

totalEvaluated

Entier

Nombre de sessions notées par cet évaluateur.

totalFailed

Entier

Nombre de sessions au cours desquelles cet évaluateur a échoué.

Cycle de vie du statut

PENDING → IN_PROGRESS → COMPLETED
                      → COMPLETED_WITH_ERRORS
                      → FAILED
         STOPPING     → STOPPED
         DELETING
  • EN ATTENTE — La tâche a été acceptée et est en attente de traitement.

  • IN_PROGRESS — Le service découvre les sessions et exécute des évaluateurs.

  • TERMINÉ — Toutes les sessions ont été évaluées. Les résultats sont disponibles.

  • COMPLETED_WITH_ERRORS — Le travail s'est terminé mais certaines sessions ont rencontré des erreurs. Des résultats partiels sont disponibles.

  • ÉCHEC — La tâche a rencontré une erreur. Vérifiez errorDetails les détails.

  • ARRÊT — Une demande d'arrêt a été reçue. Le travail touche à sa fin.

  • ARRÊTÉ — La tâche a été arrêtée avant d'être terminée. Des résultats partiels peuvent être disponibles.

  • SUPPRESSION — La tâche est en cours de suppression.

Erreurs

Erreur Statut HTTP Description

ResourceNotFoundException

404

Aucune évaluation de lot n'a été trouvée avec l'ID spécifié.

ValidationException

400

Format d'ID d'évaluation des lots non valide.

AccessDeniedException

403

Autorisations insuffisantes.

ThrottlingException

429

Taux de demandes dépassé.

InternalServerException

500

Service-side erreur.