As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Third-party avaliadores
AgentCore Evaluations oferece avaliadores de bibliotecas de código AutoEval aberto DeepEval e bibliotecas. Se você já usa essas bibliotecas, pode executar as mesmas métricas AgentCore nas Avaliações. O serviço gerencia o código de hospedagem e avaliação para você. Com a opção gerenciada, o serviço também seleciona o modelo e executa a inferência, da mesma forma que faz com avaliadores integrados.
Há duas maneiras de usar avaliadores terceirizados:
-
Gerenciado — selecione um avaliador terceirizado por ID e implante-o. O serviço o executa, seleciona o modelo e gerencia a versão da biblioteca.
-
Personalizado — Crie um avaliador que execute a lógica de um avaliador existente — um avaliador externo integrado ou gerenciado — em seu próprio modelo e inferência. Para obter mais informações, consulte Avaliadores personalizados derivados de um avaliador básico.
Qualidade do avaliador
AgentCore avaliadores integrados são testados e comparados quanto ao desempenho. DeepEval e AutoEval somos avaliadores de código aberto, e não fazemos afirmações sobre sua qualidade.
Tópicos
Identidade do avaliador
Dois campos juntos identificam cada avaliador, incluindo avaliadores terceirizados:
-
evaluatorType— O tipo de recurso: quem o fornece e como.BuiltineThirdPartysão avaliadores globais AWS gerenciados que você faz referência, mas não cria.Custom,CustomCode, eCustomDerivedsão avaliadores que você cria. -
provider— De onde vem a lógica de avaliação:AWSpara avaliadores AWS de autoria, para as bibliotecas terceirizadas correspondentesDeepEvalouAutoEvalCustompara um avaliador de sua autoria.
Os dois campos são independentes, então cada avaliador é um (evaluatorType, provider) par:
| Avaliador | Tipo de avaliador | provider |
|---|---|---|
|
Gerenciado embutido |
|
|
|
Gerenciado por terceiros |
|
|
|
Avaliador personalizado derivado de um embutido |
|
|
|
Avaliador personalizado derivado de um avaliador terceirizado |
|
|
|
Avaliador personalizado baseado em código |
|
|
|
LLM-as-a-judge Avaliador personalizado |
|
|
O ID de um avaliador terceirizado gerenciado segue o ThirdParty.<Provider>.<Metric> formato, por exemplo, ou. ThirdParty.DeepEval.TaskCompletion ThirdParty.AutoEval.Security Isso reflete o Builtin.<Metric> formato usado para avaliadores integrados primários.
Descubra os avaliadores disponíveis
Third-party os avaliadores são retornados pela ListEvaluators API junto com avaliadores integrados primários e quaisquer avaliadores personalizados em sua conta.
{ "evaluators": [ { "evaluatorId": "Builtin.Helpfulness", "evaluatorType": "Builtin", "provider": "AWS", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.DeepEval.TaskCompletion", "evaluatorType": "ThirdParty", "provider": "DeepEval", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.AutoEval.Security", "evaluatorType": "ThirdParty", "provider": "AutoEval", "level": "TRACE", "status": "ACTIVE" } ] }
Avaliadores terceirizados gerenciados
Use um avaliador terceirizado gerenciado exatamente como um avaliador integrado: selecione-o por ID e o serviço o executará em um modelo que ele opera. Você não fornece um modelo, solicitação ou configuração.
-
Modelo: avaliadores terceirizados gerenciados são executados no mesmo modelo dos avaliadores integrados no Amazon Bedrock. AgentCore Não há campo de modelo nem configuração de modelo para definir.
-
Controle de versão: não há seleção de versão para avaliadores terceirizados gerenciados. O serviço executa a versão da biblioteca que ela validou e gerencia as atualizações por si só.
Você pode passar a ID de um avaliador terceirizado gerenciado em qualquer lugar em que passaria uma ID de avaliador embutida:
-
On-demand avaliação — passe o ID na solicitação da
EvaluateAPI. -
Avaliação on-line — Adicione o ID à
evaluatorslista de uma configuração de avaliação on-line. Ele se mistura livremente com avaliadores integrados e personalizados e é regido pelas mesmas regras de amostragem e filtragem. -
Avaliação em lote — Passe o ID na
evaluatorslista de um trabalho de avaliação em lote.
O exemplo a seguir executa um avaliador terceirizado gerenciado com a Evaluate API:
import boto3 client = boto3.client('bedrock-agentcore') response = client.evaluate( evaluatorId="ThirdParty.DeepEval.TaskCompletion", evaluationInput={"sessionSpans": session_span_logs} ) for result in response["evaluationResults"]: print(f"Value: {result.get('value')}") print(f"Explanation: {result.get('explanation', '')}")
Avaliadores personalizados derivados de um avaliador básico
Use um avaliador derivado personalizado para executar um avaliador existente — um avaliador externo integrado ou gerenciado — em seu próprio modelo. Em vez de usar o modelo escolhido pelo serviço, você fornece o modelo e os parâmetros de inferência. O avaliador básico fornece o aviso e a pontuação. Isso se aplica somente aos LLM-based avaliadores.
Para criar um avaliador derivado personalizado, especifique o derived membro de evaluatorConfig com a ID do avaliador base e a configuração do seu modelo. Salve o seguinte como derived_evaluator_config.json:
{ "derived": { "baseEvaluatorId": "ThirdParty.DeepEval.TaskCompletion", "modelConfig": { "bedrockEvaluatorModelConfig": { "modelId": "global.anthropic.claude-sonnet-4-5-20250929-v1:0", "inferenceConfig": { "temperature": 0.0, "topP": 1.0, "maxTokens": 2048 } } } } }
Você também pode derivar um avaliador personalizado de um avaliador integrado baseEvaluatorId definindo como uma Builtin.
ID em vez de uma ID. ThirdParty.
Crie o avaliador com a AWS CLI:
aws bedrock-agentcore-control create-evaluator \ --evaluator-name 'my_task_completion' \ --evaluator-config file://derived_evaluator_config.json
O avaliador resultante evaluatorType definiu como. CustomDerived O serviço deriva provider automaticamente do avaliador base: AWS para uma Builtin.
base ou o nome do provedor para uma ThirdParty. base. Você não define level — o serviço é derivado do avaliador básico e está ativado somente para leitura. GetEvaluator Você também não define instructions ou ratingScale porque o avaliador básico é o proprietário de ambos.
Depois de criar o avaliador, use-o exatamente como qualquer outro avaliador personalizado: passe seu ID de avaliador ou adicione-o à Evaluate evaluators lista de uma avaliação on-line ou em lote.
-
Modelo: Qualquer modelo Bedrock, configurado
bedrockEvaluatorModelConfig. -
Propriedade da inferência: o modelo é executado usando sua própria AWS conta e credenciais — a função de execução para avaliação on-line ou as credenciais do chamador para avaliação sob demanda. Essa é a principal diferença de um avaliador terceirizado gerenciado, em que o serviço executa o modelo em sua própria capacidade.
-
Propriedade da qualidade: como você escolhe o modelo, a qualidade da avaliação reflete essa escolha. O serviço não valida o modelo em relação a cada métrica.
Resultados
Third-party os avaliadores retornam a mesma forma de resultado que os avaliadores integrados e personalizados, nos mesmos locais. Para obter mais informações, consulte Resultados e resultados.
Conjunto inicial de avaliadores
Os seguintes avaliadores estão disponíveis no lançamento.
DeepEval
| Métrica | O que ele verifica |
|---|---|
|
Desvio |
Se a saída mostra preconceitos de gênero, políticos, raciais ou geográficos. |
|
Toxicidade |
Se a saída contém ataques, zombaria, ódio ou ameaças. |
|
Vazamento de PII |
Se a resposta expõe informações pessoais. |
|
Resumo |
Se o resumo é fiel e abrangente. |
|
TaskCompletion |
Se o agente atingiu a meta do usuário. |
|
ConversationCompleteness |
Se todas as solicitações do usuário durante a conversa foram atendidas. |
|
KnowledgeRetention |
Se o agente se lembrou das informações compartilhadas anteriormente. |
|
TurnRelevancy |
Se cada resposta permanece relevante para os turnos anteriores. |
|
GoalAccuracy |
Se o agente atingiu suas metas em uma conversa de vários turnos. |
|
ToolUse |
Se o agente escolheu a ferramenta certa e passou os argumentos corretos. |
AutoEval
| Métrica | O que ele verifica |
|---|---|
|
Segurança |
Se a resposta é maliciosa. |
|
Humor |
Se a resposta é engraçada. |
|
Possível |
Se o agente tentou uma solução ou declarou a tarefa impossível. |
Console
No seletor de avaliadores, avaliadores terceirizados aparecem em sua própria seção de Third-party avaliadores, agrupados por provedor, separados dos grupos de avaliadores integrados. Essa seção está fechada por padrão.
Para criar um avaliador personalizado derivado de um avaliador básico, use o fluxo Criar avaliador personalizado existente e escolha a Third-party biblioteca como o tipo de definição do avaliador. Essa opção remove as seções de instrução e escala mostradas LLM-as-a-judge, pois o avaliador básico é o proprietário do prompt e da pontuação. Escolha uma biblioteca e uma métrica e, em seguida, forneça o modelo e os parâmetros de inferência. O nível de avaliação é exibido somente para leitura, definido pela métrica.