As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Avalie o desempenho do agente com as avaliações do Amazon Bedrock AgentCore
O Amazon Bedrock AgentCore Evaluations fornece ferramentas de avaliação automatizadas para medir o quão bem seu agente ou suas ferramentas executam tarefas específicas, lidam com casos extremos e mantêm a consistência em diferentes entradas e contextos. O serviço permite a otimização baseada em dados e garante que seus agentes atendam aos padrões de qualidade antes e depois da implantação.
AgentCore As avaliações se integram a estruturas de agentes populares, incluindo Strands OpenTelemetry e LangGraph OpenInference com bibliotecas de instrumentação. Nos bastidores, os traços desses agentes são convertidos em um formato unificado e pontuados usando LLM-as-a-Judge técnicas para avaliadores integrados e personalizados.
Cada avaliador tem um nome de recurso exclusivo da Amazon (ARN) e uma política de recursos anexados a ele. Os ARNs dos avaliadores seguem os seguintes formatos:
arn:aws:bedrock-agentcore:::evaluator/Builtin.Helpfulness (for built-in evaluators)
arn:aws:bedrock-agentcore:region:account:evaluator/my-evaluator-id (for custom evaluators)
Built-in os avaliadores são públicos e acessíveis a todos os usuários. Os recursos de avaliação personalizados são privados e só podem ser acessados por usuários que tenham acesso explícito. Para conceder acesso, você pode usar políticas baseadas em recursos do IAM para avaliadores e configurações de avaliação e políticas baseadas em identidade do IAM para usuários e funções.
Por padrão, você pode criar até 1.000 configurações de avaliação por AWS região em uma AWS conta. O serviço suporta até 1 milhão de tokens de entrada e saída por minuto por conta para grandes regiões.