Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Evalúe el desempeño de los agentes con Amazon Bedrock AgentCore Evaluations
Amazon Bedrock AgentCore Evaluations proporciona herramientas de evaluación automatizadas para medir la eficacia con la que su agente o sus herramientas realizan tareas específicas, gestionan casos extremos y mantienen la coherencia en los diferentes insumos y contextos. El servicio permite la optimización basada en datos y garantiza que sus agentes cumplan con los estándares de calidad antes y después de la implementación.
AgentCore Evaluations se integra con los marcos de agentes más populares, como Strands, OpenTelemetry y LangGraph con bibliotecas de OpenInference instrumentación. De forma oculta, las trazas de estos agentes se convierten a un formato unificado y se puntúan utilizando LLM-as-a-Judge técnicas tanto para evaluadores integrados como personalizados.
Cada evaluador tiene un nombre de recurso de Amazon (ARN) único y una política de recursos adjuntos. Los ARN de los evaluadores siguen estos formatos:
arn:aws:bedrock-agentcore:::evaluator/Builtin.Helpfulness (for built-in evaluators)
arn:aws:bedrock-agentcore:region:account:evaluator/my-evaluator-id (for custom evaluators)
Built-in los evaluadores son públicos y están accesibles para todos los usuarios. Los recursos de evaluación personalizados son privados y solo pueden acceder a ellos los usuarios a los que se les haya concedido el acceso de forma explícita. Para conceder el acceso, puede usar políticas basadas en recursos de IAM para los evaluadores y las configuraciones de evaluación, y políticas basadas en la identidad de IAM para los usuarios y los roles.
De forma predeterminada, puede crear hasta 1000 configuraciones de evaluación por región en una cuenta. AWS AWS El servicio admite hasta 1 millón de tokens de entrada y salida por minuto por cuenta para regiones grandes.