使用 Amazon Bedrock AgentCore 评估来评估代理绩效
Amazon Bedrock AgentCore 评估提供自动评估工具,用于衡量您的代理或工具执行特定任务、处理边缘案例以及保持不同输入和上下文之间的一致性。该服务支持数据驱动的优化,并确保您的代理在部署前后都符合质量标准。
AgentCore 评估与流行的代理框架(包括 Strands 和 wit h OpenTelemetry以及LangGraphOpenInference仪器库)集成。在幕后,来自这些代理的痕迹被转换为统一的格式,并使用内置和自定义评估器的 LLM-as-a-Judge 技术进行评分。
每位评估者都有一个唯一的 Amazon 资源名称 (ARN) 和附加的资源政策。评估者 ARN 遵循以下格式:
arn:aws:bedrock-agentcore:::evaluator/Builtin.Helpfulness (for built-in evaluators)
arn:aws:bedrock-agentcore:region:account:evaluator/my-evaluator-id (for custom evaluators)
Built-in 评估者是公开的, 所有用户都可以访问。自定义评估资源是私有的,只有明确授予访问权限的用户才能访问。要授予访问权限,您可以对评估者和评估配置使用基于 IAM 资源的策略,对用户和角色使用基于 IAM 身份的策略。
默认情况下,在一个 AWS 账户中,每个 AWS 区域最多可以创建 1,000 个评估配置,在任何时间点最多可以创建 100 个处于活动状态。对于大型区域,该服务支持每个账户每分钟高达 100 万个输入和输出令牌。