Avalie o desempenho dos agentes com o Amazon Bedrock AgentCore Evaluations
O Amazon Bedrock AgentCore Evaluations fornece ferramentas de avaliação automatizadas para medir o quão bem seu agente ou ferramentas executam tarefas específicas, lidam com casos extremos e mantêm a consistência em diferentes entradas e contextos. O serviço permite a otimização baseada em dados e garante que seus agentes atendam aos padrões de qualidade antes e depois da implantação.
AgentCore As avaliações se integram a estruturas de agentes populares, incluindo Strands OpenTelemetrye LangGraphOpenInferencecom bibliotecas de instrumentação. Nos bastidores, os traços desses agentes são convertidos em um formato unificado e pontuados usando LLM-as-a-Judge técnicas para avaliadores integrados e personalizados.
Cada avaliador tem um nome de recurso da Amazon (ARN) exclusivo e uma política de recursos anexada a ele. Os ARNs do avaliador seguem os seguintes formatos:
arn:aws:bedrock-agentcore:::evaluator/Builtin.Helpfulness (for built-in evaluators)
arn:aws:bedrock-agentcore:region:account:evaluator/my-evaluator-id (for custom evaluators)
Built-in os avaliadores são públicos e acessíveis a todos os usuários. Os recursos de avaliação personalizados são privados e só podem ser acessados por usuários que tenham acesso explícito. Para conceder acesso, você pode usar políticas baseadas em recursos do IAM para avaliadores e configurações de avaliação, e políticas baseadas em identidade do IAM para usuários e funções.
Por padrão, você pode criar até 1.000 configurações de avaliação por AWS região em uma AWS conta, com até 100 ativas a qualquer momento. O serviço suporta até 1 milhão de tokens de entrada e saída por minuto por conta para grandes regiões.