View a markdown version of this page

Avaliação em lote - Base da Amazônia AgentCore

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Avaliação em lote

A avaliação em lote executa os avaliadores em várias sessões de agentes em um único trabalho com orquestração do lado do servidor. Diferentemente da avaliação sob demanda, na qual você mesmo coleta períodos e chama a API Evaluate, a avaliação em lote lida com a descoberta de sessões, a coleta de períodos e a pontuação inteiramente no lado do serviço. Você envia um trabalho e o serviço processa todas as sessões correspondentes e retorna resultados agregados.

Use a avaliação em lote quando precisar:

  • Meça uma linha de base antes de fazer alterações no prompt, nas ferramentas ou no modelo do seu agente.

  • Valide as melhorias comparando as pontuações antes e depois de uma alteração na configuração.

  • Execute testes de regressão em um conjunto selecionado de sessões ou cenários.

  • Monitore a qualidade periodicamente nas sessões de produção a partir de uma janela de tempo específica.

Como funciona

Um trabalho de avaliação em lote segue esse fluxo:

  1. Você inicia um trabalho especificando uma fonte de sessão (onde encontrar as sessões do agente) e uma configuração de avaliação (quais avaliadores devem ser executados). Opcionalmente, você fornece metadados reais para pontuação baseada em referência.

  2. O serviço descobre sessões de CloudWatch registros com base nos grupos de registros e filtros que você especifica.

  3. O serviço executa avaliadores em cada sessão descoberta. Cada avaliador pontua cada sessão de forma independente. Se a verdade básica for fornecida, os avaliadores que apoiam a pontuação baseada em referências a usam.

  4. Você pesquisa para obter resultados. O trabalho passa por PENDING → IN_PROGRESS → COMPLETED (ouFAILED). Quando concluída, a resposta inclui resumos agregados com pontuações médias por avaliador, contagens de sessões e uso de tokens.

  5. Per-session os detalhes estão disponíveis em CloudWatch Registros no local especificado outputDataConfig na resposta.

Comparação com outros tipos de avaliação

Aspecto On-demand On-line Batch

Trigger

Caller-initiated, síncrono

Contínuo, orientado por eventos

Caller-initiated, assíncrono

Fonte da sessão

O chamador fornece intervalos em linha

Observa um grupo de registros

O serviço descobre a partir de registros CloudWatch

Escopo

Sessão única

Todas as sessões correspondem às regras de amostragem

Várias sessões (intervalo de tempo, IDs de sessão ou grupo de log completo)

Verdade fundamental

Via evaluationReferenceInputs

Não compatível

Via sessionMetadata com verdade fundamentada em linha

Resultados

Resposta síncrona

CloudWatch métricas e painéis

Resumos agregados com médias por avaliador, além de detalhes por sessão em CloudWatch

Caso de uso

Dev-time verificações pontuais, CI/CD

Monitoramento da produção

Medição de linha de base, pre/post comparação, teste de regressão