View a markdown version of this page

Obtenga los resultados de la evaluación de lotes - Amazon Bedrock AgentCore

Obtenga los resultados de la evaluación de lotes

Recupere el estado y los resultados de un trabajo de evaluación de lotes. Sondee esta operación hasta que la tarea alcance un estado terminal (COMPLETED,FAILED, oSTOPPED).

Ejemplos de código

ejemplo
AgentCore CLI

El --wait indicador controla cómo agentcore run batch-evaluation se comporta:

  • Con--wait: el comando se bloquea hasta que la tarea alcanza un estado terminal.

  • Sin--wait: el comando inicia el trabajo y lo devuelve inmediatamente. El estado se consulta por separado.

    # Start a job and block until it reaches a terminal state agentcore run batch-evaluation -r MyAgent -e Builtin.Correctness --wait # List previously started jobs (running jobs are refreshed from the service) agentcore batch-evaluations history # Check the status and results of a single job agentcore view batch-evaluation <batch-evaluation-id> # Non-interactive (JSON) output, the CLI analogue of a get_batch_evaluation polling loop agentcore view batch-evaluation <batch-evaluation-id> --json # Stop a running job agentcore stop batch-evaluation -i <batch-evaluation-id>

    Utilice el ID de evaluación del lote de la salida CLI de agentcore run batch-evaluation o de la agentcore batch-evaluations history lista.

AWS SDK (boto3)
import time import boto3 client = boto3.client("bedrock-agentcore", region_name="us-west-2") # Poll until terminal state while True: result = client.get_batch_evaluation(batchEvaluationId=batch_eval_id) status = result["status"] print(f"Status: {status}") if status in ("COMPLETED", "COMPLETED_WITH_ERRORS", "FAILED", "STOPPED"): break time.sleep(30) # Display results if result.get("evaluationResults"): er = result["evaluationResults"] print(f"Sessions completed: {er.get('numberOfSessionsCompleted', 0)}") print(f"Sessions failed: {er.get('numberOfSessionsFailed', 0)}") print(f"Total sessions: {er.get('totalNumberOfSessions', 0)}") for summary in er.get("evaluatorSummaries", []): avg = summary.get("statistics", {}).get("averageScore") print(f" {summary['evaluatorId']}: {avg}")

Parámetros de solicitud

Parámetro Tipo Obligatorio Descripción

batchEvaluationId

Cadena

El identificador de evaluación del lote devuelto porStartBatchEvaluation. Pasado como parámetro de ruta.

Respuesta

Campo Tipo Description (Descripción)

batchEvaluationId

Cadena

El identificador de evaluación del lote.

batchEvaluationArn

Cadena

ARN de la evaluación del lote.

batchEvaluationName

Cadena

El nombre del trabajo.

status

Cadena

Estado actual:PENDING,IN_PROGRESS,COMPLETED,COMPLETED_WITH_ERRORS,FAILED, STOPPINGSTOPPED,DELETING.

createdAt

Timestamp

Cuándo se creó el trabajo.

evaluators

Enumeración

Los evaluadores usaron.

outputConfig

Objeto

CloudWatch Registra el destino para obtener detalles por sesión. Contiene cloudWatchConfig.logGroupName y. cloudWatchConfig.logStreamName

evaluationResults

Objeto

Está presente cuando el trabajo ha procesado las sesiones. Consulte Descripción de los resultados y la producción.

errorDetails

Lista de cadenas

Mensajes de error si el trabajo ha fallado.

Campos de resultados de evaluación

Campo Tipo Description (Descripción)

numberOfSessionsCompleted

Entero

Número de sesiones evaluadas correctamente.

numberOfSessionsFailed

Entero

Número de sesiones que no pasaron la evaluación.

numberOfSessionsInProgress

Entero

Número de sesiones que aún se están evaluando.

totalNumberOfSessions

Entero

Número total de sesiones descubiertas.

numberOfSessionsIgnored

Entero

Número de sesiones ignoradas para la evaluación. El servicio evalúa hasta 500 sesiones por trabajo; si se descubren más, se seleccionan las 500 más recientes.

evaluatorSummaries

Enumeración

Per-evaluator resultados agregados.

Campos de evaluador/sumarios

Campo Tipo Description (Descripción)

evaluatorId

Cadena

ID de evaluador (por ejemplo,). Builtin.GoalSuccessRate

statistics.averageScore

Double

Puntuación media en todas las sesiones evaluadas.

totalEvaluated

Entero

Número de sesiones que obtuvo este evaluador.

totalFailed

Entero

Número de sesiones en las que este evaluador falló.

Estado, ciclo de vida

PENDING → IN_PROGRESS → COMPLETED
                      → COMPLETED_WITH_ERRORS
                      → FAILED
         STOPPING     → STOPPED
         DELETING
  • PENDIENTE: el trabajo se ha aceptado y está en cola para su procesamiento.

  • IN_PROGRESS: el servicio detecta las sesiones y ejecuta los evaluadores.

  • COMPLETADA: se han evaluado todas las sesiones. Los resultados están disponibles.

  • COMPLETED_WITH_ERRORS: el trabajo ha finalizado, pero se han producido errores en algunas sesiones. Hay resultados parciales disponibles.

  • FALLIDO: el trabajo detectó un error. Compruebe errorDetails los detalles.

  • DETENER: se ha recibido una solicitud de parada. El trabajo se está acabando.

  • DETENIDO: el trabajo se detuvo antes de completarse. Es posible que haya resultados parciales disponibles.

  • ELIMINAR: se está eliminando el trabajo.

Errores

Error Estado HTTP Description (Descripción)

ResourceNotFoundException

404

No se encontró ninguna evaluación de lote con el ID especificado.

ValidationException

400

Formato de ID de evaluación de lote no válido.

AccessDeniedException

403

Permisos insuficientes.

ThrottlingException

429

Se superó la tasa de solicitudes.

InternalServerException

500

Service-side error.