View a markdown version of this page

Third-party avaliadores - Base da Amazônia AgentCore

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Third-party avaliadores

AgentCore Evaluations oferece avaliadores de bibliotecas de código AutoEval aberto DeepEval e bibliotecas. Se você já usa essas bibliotecas, pode executar as mesmas métricas AgentCore nas Avaliações. O serviço gerencia o código de hospedagem e avaliação para você. Com a opção gerenciada, o serviço também seleciona o modelo e executa a inferência, da mesma forma que faz com avaliadores integrados.

Há duas maneiras de usar avaliadores terceirizados:

  • Gerenciado — selecione um avaliador terceirizado por ID e implante-o. O serviço o executa, seleciona o modelo e gerencia a versão da biblioteca.

  • Personalizado — Crie um avaliador que execute a lógica de um avaliador existente — um avaliador externo integrado ou gerenciado — em seu próprio modelo e inferência. Para obter mais informações, consulte Avaliadores personalizados derivados de um avaliador básico.

Qualidade do avaliador

AgentCore avaliadores integrados são testados e comparados quanto ao desempenho. DeepEval e AutoEval somos avaliadores de código aberto, e não fazemos afirmações sobre sua qualidade.

Identidade do avaliador

Dois campos juntos identificam cada avaliador, incluindo avaliadores terceirizados:

  • evaluatorType— O tipo de recurso: quem o fornece e como. Builtine ThirdParty são avaliadores globais AWS gerenciados que você faz referência, mas não cria. Custom,CustomCode, e CustomDerived são avaliadores que você cria.

  • provider— De onde vem a lógica de avaliação: AWS para avaliadores AWS de autoria, para as bibliotecas terceirizadas correspondentes DeepEval ou AutoEval Custom para um avaliador de sua autoria.

Os dois campos são independentes, então cada avaliador é um (evaluatorType, provider) par:

Avaliador Tipo de avaliador provider

Gerenciado embutido

Builtin

AWS

Gerenciado por terceiros

ThirdParty

DeepEval ou AutoEval

Avaliador personalizado derivado de um embutido

CustomDerived

AWS

Avaliador personalizado derivado de um avaliador terceirizado

CustomDerived

DeepEval ou AutoEval

Avaliador personalizado baseado em código

CustomCode

Custom

LLM-as-a-judge Avaliador personalizado

Custom

Custom

O ID de um avaliador terceirizado gerenciado segue o ThirdParty.<Provider>.<Metric> formato, por exemplo, ou. ThirdParty.DeepEval.TaskCompletion ThirdParty.AutoEval.Security Isso reflete o Builtin.<Metric> formato usado para avaliadores integrados primários.

Descubra os avaliadores disponíveis

Third-party os avaliadores são retornados pela ListEvaluators API junto com avaliadores integrados primários e quaisquer avaliadores personalizados em sua conta.

{ "evaluators": [ { "evaluatorId": "Builtin.Helpfulness", "evaluatorType": "Builtin", "provider": "AWS", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.DeepEval.TaskCompletion", "evaluatorType": "ThirdParty", "provider": "DeepEval", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.AutoEval.Security", "evaluatorType": "ThirdParty", "provider": "AutoEval", "level": "TRACE", "status": "ACTIVE" } ] }

Avaliadores terceirizados gerenciados

Use um avaliador terceirizado gerenciado exatamente como um avaliador integrado: selecione-o por ID e o serviço o executará em um modelo que ele opera. Você não fornece um modelo, solicitação ou configuração.

  • Modelo: avaliadores terceirizados gerenciados são executados no mesmo modelo dos avaliadores integrados no Amazon Bedrock. AgentCore Não há campo de modelo nem configuração de modelo para definir.

  • Controle de versão: não há seleção de versão para avaliadores terceirizados gerenciados. O serviço executa a versão da biblioteca que ela validou e gerencia as atualizações por si só.

Você pode passar a ID de um avaliador terceirizado gerenciado em qualquer lugar em que passaria uma ID de avaliador embutida:

  • On-demand avaliação — passe o ID na solicitação da Evaluate API.

  • Avaliação on-line — Adicione o ID à evaluators lista de uma configuração de avaliação on-line. Ele se mistura livremente com avaliadores integrados e personalizados e é regido pelas mesmas regras de amostragem e filtragem.

  • Avaliação em lote — Passe o ID na evaluators lista de um trabalho de avaliação em lote.

O exemplo a seguir executa um avaliador terceirizado gerenciado com a Evaluate API:

import boto3 client = boto3.client('bedrock-agentcore') response = client.evaluate( evaluatorId="ThirdParty.DeepEval.TaskCompletion", evaluationInput={"sessionSpans": session_span_logs} ) for result in response["evaluationResults"]: print(f"Value: {result.get('value')}") print(f"Explanation: {result.get('explanation', '')}")

Avaliadores personalizados derivados de um avaliador básico

Use um avaliador derivado personalizado para executar um avaliador existente — um avaliador externo integrado ou gerenciado — em seu próprio modelo. Em vez de usar o modelo escolhido pelo serviço, você fornece o modelo e os parâmetros de inferência. O avaliador básico fornece o aviso e a pontuação. Isso se aplica somente aos LLM-based avaliadores.

Para criar um avaliador derivado personalizado, especifique o derived membro de evaluatorConfig com a ID do avaliador base e a configuração do seu modelo. Salve o seguinte como derived_evaluator_config.json:

{ "derived": { "baseEvaluatorId": "ThirdParty.DeepEval.TaskCompletion", "modelConfig": { "bedrockEvaluatorModelConfig": { "modelId": "global.anthropic.claude-sonnet-4-5-20250929-v1:0", "inferenceConfig": { "temperature": 0.0, "topP": 1.0, "maxTokens": 2048 } } } } }

Você também pode derivar um avaliador personalizado de um avaliador integrado baseEvaluatorId definindo como uma Builtin. ID em vez de uma ID. ThirdParty.

Crie o avaliador com a AWS CLI:

aws bedrock-agentcore-control create-evaluator \ --evaluator-name 'my_task_completion' \ --evaluator-config file://derived_evaluator_config.json

O avaliador resultante evaluatorType definiu como. CustomDerived O serviço deriva provider automaticamente do avaliador base: AWS para uma Builtin. base ou o nome do provedor para uma ThirdParty. base. Você não define level — o serviço é derivado do avaliador básico e está ativado somente para leitura. GetEvaluator Você também não define instructions ou ratingScale porque o avaliador básico é o proprietário de ambos.

Depois de criar o avaliador, use-o exatamente como qualquer outro avaliador personalizado: passe seu ID de avaliador ou adicione-o à Evaluate evaluators lista de uma avaliação on-line ou em lote.

  • Modelo: Qualquer modelo Bedrock, configuradobedrockEvaluatorModelConfig.

  • Propriedade da inferência: o modelo é executado usando sua própria AWS conta e credenciais — a função de execução para avaliação on-line ou as credenciais do chamador para avaliação sob demanda. Essa é a principal diferença de um avaliador terceirizado gerenciado, em que o serviço executa o modelo em sua própria capacidade.

  • Propriedade da qualidade: como você escolhe o modelo, a qualidade da avaliação reflete essa escolha. O serviço não valida o modelo em relação a cada métrica.

Resultados

Third-party os avaliadores retornam a mesma forma de resultado que os avaliadores integrados e personalizados, nos mesmos locais. Para obter mais informações, consulte Resultados e resultados.

Conjunto inicial de avaliadores

Os seguintes avaliadores estão disponíveis no lançamento.

DeepEval

Métrica O que ele verifica

Desvio

Se a saída mostra preconceitos de gênero, políticos, raciais ou geográficos.

Toxicidade

Se a saída contém ataques, zombaria, ódio ou ameaças.

Vazamento de PII

Se a resposta expõe informações pessoais.

Resumo

Se o resumo é fiel e abrangente.

TaskCompletion

Se o agente atingiu a meta do usuário.

ConversationCompleteness

Se todas as solicitações do usuário durante a conversa foram atendidas.

KnowledgeRetention

Se o agente se lembrou das informações compartilhadas anteriormente.

TurnRelevancy

Se cada resposta permanece relevante para os turnos anteriores.

GoalAccuracy

Se o agente atingiu suas metas em uma conversa de vários turnos.

ToolUse

Se o agente escolheu a ferramenta certa e passou os argumentos corretos.

AutoEval

Métrica O que ele verifica

Segurança

Se a resposta é maliciosa.

Humor

Se a resposta é engraçada.

Possível

Se o agente tentou uma solução ou declarou a tarefa impossível.

Console

No seletor de avaliadores, avaliadores terceirizados aparecem em sua própria seção de Third-party avaliadores, agrupados por provedor, separados dos grupos de avaliadores integrados. Essa seção está fechada por padrão.

Para criar um avaliador personalizado derivado de um avaliador básico, use o fluxo Criar avaliador personalizado existente e escolha a Third-party biblioteca como o tipo de definição do avaliador. Essa opção remove as seções de instrução e escala mostradas LLM-as-a-judge, pois o avaliador básico é o proprietário do prompt e da pontuação. Escolha uma biblioteca e uma métrica e, em seguida, forneça o modelo e os parâmetros de inferência. O nível de avaliação é exibido somente para leitura, definido pela métrica.