

# Avaliação em lote
<a name="batch-evaluations"></a>

A avaliação em lote executa avaliadores em várias sessões de agentes em um único trabalho com orquestração do lado do servidor. Ao contrário da avaliação sob demanda, na qual você mesmo coleta os períodos e chama a API de avaliação, a avaliação em lote trata da descoberta da sessão, da coleta de intervalos e da pontuação inteiramente no lado do serviço. Você envia um trabalho e o serviço processa todas as sessões correspondentes e retorna resultados agregados.

Use a avaliação em lote quando precisar:
+  **Meça uma linha de base** antes de fazer alterações no prompt, nas ferramentas ou no modelo do seu agente.
+  **Valide as melhorias** comparando as pontuações antes e depois de uma alteração na configuração.
+  **Execute testes de regressão** em um conjunto organizado de sessões ou cenários.
+  **Monitore a qualidade periodicamente** em todas as sessões de produção a partir de uma janela de tempo específica.

<a name="batch-evaluations-how-it-works"></a> **Como funciona** 

Um trabalho de avaliação em lote segue esse fluxo:

1.  **Você inicia um trabalho** especificando uma origem da sessão (onde encontrar as sessões do agente) e uma configuração de avaliação (quais avaliadores executar). Opcionalmente, você fornece metadados de verdade básica para pontuação baseada em referência.

1.  **O serviço descobre sessões** do CloudWatch Logs com base nos grupos de registros e filtros que você especifica.

1.  **O serviço executa avaliadores** em cada sessão descoberta. Cada avaliador pontua cada sessão de forma independente. Se a verdade básica for fornecida, os avaliadores que apóiam a pontuação baseada em referência a usarão.

1.  **Você faz uma pesquisa para obter resultados.** O trabalho passa por `PENDING` → `IN_PROGRESS` → `COMPLETED` (ou`FAILED`). Quando concluída, a resposta inclui resumos agregados com pontuações médias por avaliador, contagens de sessões e uso de tokens.

1.  **Per-session os detalhes** estão disponíveis em CloudWatch Logs no local especificado `outputDataConfig` na resposta.

<a name="batch-evaluations-comparison"></a> **Comparação com outros tipos de avaliação** 


| Aspecto | On-demand | On-line | Batch | 
| --- | --- | --- | --- | 
| Trigger | Caller-initiated, síncrono | Contínuo, orientado por eventos | Caller-initiated, assíncrono | 
| Fonte da sessão | O chamador fornece extensões em linha | Observa um grupo de registros | O serviço descobre a partir do Logs CloudWatch  | 
| Escopo | Sessão única | Todas as sessões correspondem às regras de amostragem | Várias sessões (intervalo de tempo, IDs de sessão ou grupo de registros completo) | 
| Verdade fundamental | Via `evaluationReferenceInputs`  | Não compatível | Via `sessionMetadata` com verdade básica em linha | 
| Resultados | Resposta síncrona | CloudWatch métricas e painéis | Resumos agregados com médias por avaliador, além de detalhes por sessão em CloudWatch | 
| Caso de uso | Dev-time verificações pontuais, CI/CD | Monitoramento da produção | Medição de linha de base, pre/post comparação, teste de regressão | 

**Topics**
+ [Pré-requisitos](batch-evaluations-prereqs.md)
+ [Começando com a avaliação em lote](batch-evaluations-getting-started.md)
+ [Iniciar avaliação do lote](batch-evaluations-start.md)
+ [Obtenha os resultados da avaliação em lote](batch-evaluations-get.md)
+ [Listar avaliações em lote](batch-evaluations-list.md)
+ [Interromper a avaliação do lote](batch-evaluations-stop.md)
+ [Excluir avaliação em lote](batch-evaluations-delete.md)
+ [Entendendo os resultados e a produção](batch-evaluations-results.md)
+ [Criptografia de avaliação em lote](batch-evaluations-encryption.md)