View a markdown version of this page

使用亚马逊基岩 AgentCore 评估评估代理业绩 - 亚马逊基岩 AgentCore

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

使用亚马逊基岩 AgentCore 评估评估代理业绩

Amazon Bedrock AgentCore Evalutations 提供自动评估工具,用于衡量您的代理或工具执行特定任务、处理边缘案例以及保持不同输入和背景之间的一致性。该服务支持数据驱动的优化,并确保您的代理在部署前后都符合质量标准。

AgentCore 评估与流行的代理框架(包括 Strands)OpenTelemetry以及LangGraphOpenInference仪器库集成。在幕后,来自这些代理的跟踪被转换为统一格式,并使用内置和自定义评估器的 LLM-as-a-Judge 技术进行评分。

每个评估者都有唯一的亚马逊资源名称 (ARN) 和附加的资源政策。评估器 ARN 遵循以下格式:

arn:aws:bedrock-agentcore:::evaluator/Builtin.Helpfulness (for built-in evaluators)
arn:aws:bedrock-agentcore:region:account:evaluator/my-evaluator-id (for custom evaluators)

Built-in 评估人员是公开的,所有用户都可以访问。自定义评估资源是私有的,只能由明确获得访问权限的用户访问。要授予访问权限,您可以对评估者和评估配置使用基于 IAM 资源的策略,对用户和角色使用基于 IAM 身份的策略。

默认情况下,您最多可以在一个 AWS 账户中为每个 AWS 区域创建 1,000 个评估配置。对于大型区域,该服务每个账户每分钟最多支持 100 万个输入和输出令牌。