Evalúe el desempeño de los agentes con Amazon Bedrock AgentCore Evaluations
Amazon Bedrock AgentCore Evaluations proporciona herramientas de evaluación automatizadas para medir qué tan bien su agente o sus herramientas realizan tareas específicas, gestionan casos extremos y mantienen la coherencia en las diferentes entradas y contextos. El servicio permite una optimización basada en datos y garantiza que sus agentes cumplan con los estándares de calidad antes y después del despliegue.
AgentCore Evaluations se integra con los marcos de agentes más populares, como Strands, OpenTelemetryy LangGraphcon las bibliotecas de OpenInferenceinstrumentación. De forma clandestina, las trazas de estos agentes se convierten a un formato unificado y se puntúan utilizando LLM-as-a-Judge técnicas tanto para evaluadores integrados como personalizados.
Cada evaluador tiene un nombre de recurso de Amazon (ARN) único y una política de recursos adjuntos. Los ARN de los evaluadores siguen estos formatos:
arn:aws:bedrock-agentcore:::evaluator/Builtin.Helpfulness (for built-in evaluators)
arn:aws:bedrock-agentcore:region:account:evaluator/my-evaluator-id (for custom evaluators)
Built-in los evaluadores son públicos y accesibles para todos los usuarios. Los recursos de evaluación personalizados son privados y solo pueden acceder a ellos los usuarios a los que se les haya concedido acceso de forma explícita. Para conceder el acceso, puede utilizar las políticas de IAM basadas en los recursos para los evaluadores y las configuraciones de evaluación, y las políticas de IAM basadas en la identidad para los usuarios y las funciones.
De forma predeterminada, puede crear hasta 1000 configuraciones de evaluación por AWS región en una AWS cuenta, con hasta 100 activas en cualquier momento. El servicio admite hasta 1 millón de fichas de entrada y salida por minuto por cuenta en regiones grandes.