View a markdown version of this page

Avaliação em lote - Amazon Bedrock AgentCore

Avaliação em lote

A avaliação em lote executa avaliadores em várias sessões de agentes em um único trabalho com orquestração do lado do servidor. Ao contrário da avaliação sob demanda, na qual você mesmo coleta os períodos e chama a API de avaliação, a avaliação em lote trata da descoberta da sessão, da coleta de intervalos e da pontuação inteiramente no lado do serviço. Você envia um trabalho e o serviço processa todas as sessões correspondentes e retorna resultados agregados.

Use a avaliação em lote quando precisar:

  • Meça uma linha de base antes de fazer alterações no prompt, nas ferramentas ou no modelo do seu agente.

  • Valide as melhorias comparando as pontuações antes e depois de uma alteração na configuração.

  • Execute testes de regressão em um conjunto organizado de sessões ou cenários.

  • Monitore a qualidade periodicamente em todas as sessões de produção a partir de uma janela de tempo específica.

Como funciona

Um trabalho de avaliação em lote segue esse fluxo:

  1. Você inicia um trabalho especificando uma origem da sessão (onde encontrar as sessões do agente) e uma configuração de avaliação (quais avaliadores executar). Opcionalmente, você fornece metadados de verdade básica para pontuação baseada em referência.

  2. O serviço descobre sessões do CloudWatch Logs com base nos grupos de registros e filtros que você especifica.

  3. O serviço executa avaliadores em cada sessão descoberta. Cada avaliador pontua cada sessão de forma independente. Se a verdade básica for fornecida, os avaliadores que apóiam a pontuação baseada em referência a usarão.

  4. Você faz uma pesquisa para obter resultados. O trabalho passa por PENDINGIN_PROGRESSCOMPLETED (ouFAILED). Quando concluída, a resposta inclui resumos agregados com pontuações médias por avaliador, contagens de sessões e uso de tokens.

  5. Per-session os detalhes estão disponíveis em CloudWatch Logs no local especificado outputDataConfig na resposta.

Comparação com outros tipos de avaliação

Aspecto On-demand On-line Batch

Trigger

Caller-initiated, síncrono

Contínuo, orientado por eventos

Caller-initiated, assíncrono

Fonte da sessão

O chamador fornece extensões em linha

Observa um grupo de registros

O serviço descobre a partir do Logs CloudWatch

Escopo

Sessão única

Todas as sessões correspondem às regras de amostragem

Várias sessões (intervalo de tempo, IDs de sessão ou grupo de registros completo)

Verdade fundamental

Via evaluationReferenceInputs

Não compatível

Via sessionMetadata com verdade básica em linha

Resultados

Resposta síncrona

CloudWatch métricas e painéis

Resumos agregados com médias por avaliador, além de detalhes por sessão em CloudWatch

Caso de uso

Dev-time verificações pontuais, CI/CD

Monitoramento da produção

Medição de linha de base, pre/post comparação, teste de regressão