View a markdown version of this page

Obtenha os resultados da avaliação em lote - Amazon Bedrock AgentCore

Obtenha os resultados da avaliação em lote

Recupere o status e os resultados de um trabalho de avaliação em lote. Pesquise essa operação até que a tarefa atinja um estado terminal (COMPLETEDFAILED, ouSTOPPED).

Exemplos de código

exemplo
AgentCore CLI

A --wait bandeira controla como se agentcore run batch-evaluation comporta:

  • Com--wait: o comando bloqueia até que o trabalho atinja um estado terminal.

  • Sem--wait: o comando inicia o trabalho e retorna imediatamente. Você pesquisa o status separadamente.

    # Start a job and block until it reaches a terminal state agentcore run batch-evaluation -r MyAgent -e Builtin.Correctness --wait # List previously started jobs (running jobs are refreshed from the service) agentcore batch-evaluations history # Check the status and results of a single job agentcore view batch-evaluation <batch-evaluation-id> # Non-interactive (JSON) output, the CLI analogue of a get_batch_evaluation polling loop agentcore view batch-evaluation <batch-evaluation-id> --json # Stop a running job agentcore stop batch-evaluation -i <batch-evaluation-id>

    Use o ID de avaliação do lote da saída da CLI de agentcore run batch-evaluation ou da agentcore batch-evaluations history lista.

AWS SDK (boto3)
import time import boto3 client = boto3.client("bedrock-agentcore", region_name="us-west-2") # Poll until terminal state while True: result = client.get_batch_evaluation(batchEvaluationId=batch_eval_id) status = result["status"] print(f"Status: {status}") if status in ("COMPLETED", "COMPLETED_WITH_ERRORS", "FAILED", "STOPPED"): break time.sleep(30) # Display results if result.get("evaluationResults"): er = result["evaluationResults"] print(f"Sessions completed: {er.get('numberOfSessionsCompleted', 0)}") print(f"Sessions failed: {er.get('numberOfSessionsFailed', 0)}") print(f"Total sessions: {er.get('totalNumberOfSessions', 0)}") for summary in er.get("evaluatorSummaries", []): avg = summary.get("statistics", {}).get("averageScore") print(f" {summary['evaluatorId']}: {avg}")

Parâmetros de solicitação

Parâmetro Tipo Obrigatório Descrição

batchEvaluationId

String

Sim

O ID de avaliação do lote retornado porStartBatchEvaluation. Passado como parâmetro de caminho.

Resposta

Campo Tipo Description

batchEvaluationId

String

O ID de avaliação do lote.

batchEvaluationArn

String

ARN da avaliação do lote.

batchEvaluationName

String

O nome do trabalho.

status

String

Status atual: PENDINGIN_PROGRESS,COMPLETED,,COMPLETED_WITH_ERRORS,FAILED,STOPPING,STOPPED,DELETING.

createdAt

Timestamp

Quando o trabalho foi criado.

evaluators

Lista

Os avaliadores usaram.

outputConfig

Objeto

CloudWatch Destino de registros para detalhes por sessão. Contém cloudWatchConfig.logGroupName cloudWatchConfig.logStreamName e.

evaluationResults

Objeto

Presente quando o trabalho tiver sessões processadas. Consulte Entendendo os resultados e a saída.

errorDetails

Lista de strings

Mensagens de erro se o trabalho falhar.

Campos de resultados da avaliação

Campo Tipo Description

numberOfSessionsCompleted

Inteiro

Número de sessões avaliadas com sucesso.

numberOfSessionsFailed

Inteiro

Número de sessões que falharam na avaliação.

numberOfSessionsInProgress

Inteiro

Número de sessões ainda sendo avaliadas.

totalNumberOfSessions

Inteiro

Número total de sessões descobertas.

numberOfSessionsIgnored

Inteiro

Número de sessões ignoradas para avaliação. O serviço avalia até 500 sessões por trabalho; se mais forem descobertas, as 500 mais recentes serão selecionadas.

evaluatorSummaries

Lista

Per-evaluator resultados agregados.

Campos de resumos do avaliador

Campo Tipo Description

evaluatorId

String

ID do avaliador (por exemplo,Builtin.GoalSuccessRate).

statistics.averageScore

Duplo

Pontuação média em todas as sessões avaliadas.

totalEvaluated

Inteiro

Número de sessões que esse avaliador pontuou.

totalFailed

Inteiro

Número de sessões em que esse avaliador falhou.

Ciclo de vida do status

PENDING → IN_PROGRESS → COMPLETED
                      → COMPLETED_WITH_ERRORS
                      → FAILED
         STOPPING     → STOPPED
         DELETING
  • PENDENTE — O trabalho foi aceito e está na fila para processamento.

  • IN_PROGRESS — O serviço está descobrindo sessões e executando avaliadores.

  • CONCLUÍDO — Todas as sessões foram avaliadas. Os resultados estão disponíveis.

  • COMPLETED_WITH_ERRORS — O trabalho foi concluído, mas algumas sessões encontraram erros. Resultados parciais estão disponíveis.

  • FALHA — O trabalho encontrou um erro. Verifique errorDetails os detalhes.

  • PARANDO — Uma solicitação de parada foi recebida. O trabalho está acabando.

  • PARADO — O trabalho foi interrompido antes da conclusão. Resultados parciais podem estar disponíveis.

  • EXCLUSÃO — O trabalho está sendo excluído.

Erros

Erro Status HTTP Description

ResourceNotFoundException

404

Nenhuma avaliação de lote foi encontrada com o ID especificado.

ValidationException

400

Formato de ID de avaliação de lote inválido.

AccessDeniedException

403

Permissões insuficientes.

ThrottlingException

429

Taxa de solicitações excedida.

InternalServerException

500

Service-side erro.