As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Avaliação em lote
A avaliação em lote executa os avaliadores em várias sessões de agentes em um único trabalho com orquestração do lado do servidor. Diferentemente da avaliação sob demanda, na qual você mesmo coleta períodos e chama a API Evaluate, a avaliação em lote lida com a descoberta de sessões, a coleta de períodos e a pontuação inteiramente no lado do serviço. Você envia um trabalho e o serviço processa todas as sessões correspondentes e retorna resultados agregados.
Use a avaliação em lote quando precisar:
-
Meça uma linha de base antes de fazer alterações no prompt, nas ferramentas ou no modelo do seu agente.
-
Valide as melhorias comparando as pontuações antes e depois de uma alteração na configuração.
-
Execute testes de regressão em um conjunto selecionado de sessões ou cenários.
-
Monitore a qualidade periodicamente nas sessões de produção a partir de uma janela de tempo específica.
Como funciona
Um trabalho de avaliação em lote segue esse fluxo:
-
Você inicia um trabalho especificando uma fonte de sessão (onde encontrar as sessões do agente) e uma configuração de avaliação (quais avaliadores devem ser executados). Opcionalmente, você fornece metadados reais para pontuação baseada em referência.
-
O serviço descobre sessões de CloudWatch registros com base nos grupos de registros e filtros que você especifica.
-
O serviço executa avaliadores em cada sessão descoberta. Cada avaliador pontua cada sessão de forma independente. Se a verdade básica for fornecida, os avaliadores que apoiam a pontuação baseada em referências a usam.
-
Você pesquisa para obter resultados. O trabalho passa por
PENDING→IN_PROGRESS→COMPLETED(ouFAILED). Quando concluída, a resposta inclui resumos agregados com pontuações médias por avaliador, contagens de sessões e uso de tokens. -
Per-session os detalhes estão disponíveis em CloudWatch Registros no local especificado
outputDataConfigna resposta.
Comparação com outros tipos de avaliação
| Aspecto | On-demand | On-line | Batch |
|---|---|---|---|
|
Trigger |
Caller-initiated, síncrono |
Contínuo, orientado por eventos |
Caller-initiated, assíncrono |
|
Fonte da sessão |
O chamador fornece intervalos em linha |
Observa um grupo de registros |
O serviço descobre a partir de registros CloudWatch |
|
Escopo |
Sessão única |
Todas as sessões correspondem às regras de amostragem |
Várias sessões (intervalo de tempo, IDs de sessão ou grupo de log completo) |
|
Verdade fundamental |
Via |
Não compatível |
Via |
|
Resultados |
Resposta síncrona |
CloudWatch métricas e painéis |
Resumos agregados com médias por avaliador, além de detalhes por sessão em CloudWatch |
|
Caso de uso |
Dev-time verificações pontuais, CI/CD |
Monitoramento da produção |
Medição de linha de base, pre/post comparação, teste de regressão |