View a markdown version of this page

批量评估 - 亚马逊基岩 AgentCore

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

批量评估

批量评估通过服务器端编排在单个作业中针对多个代理会话运行评估器。与按需评估不同,在按需评估中,您可以收集跨度并自己调用评估 API,而批量评估则完全在服务端处理会话发现、跨度收集和评分。您提交任务,该服务会处理所有匹配的会话并返回汇总结果。

在需要时使用批量评估:

  • 在更改代理的提示、工具或模型之前,请先测量基线。

  • 通过比较配置更改前后的分数来验证改进。

  • 在一组精选的会话或场景中运行回归测试。

  • 在特定的时间窗口内定期监控各生产环节的质量。

工作原理

批量评估任务遵循以下流程:

  1. 您可以通过指定会话源(在哪里查找代理会话)和评估配置(运行哪些评估器)来启动作业。或者,您可以为基于参考的评分提供实况元数据。

  2. 该服务根据您指定的 CloudWatch 日志组和过滤器从日志中发现会话。

  3. 该服务针对每个发现的会话运行评估器。每位评估员对每个会话进行独立评分。如果提供了基本事实,则支持基于参考的评分的评估人员会使用这些数据。

  4. 你投票以获得结果。任务通过 PENDING IN_PROGRESS →COMPLETED(或FAILED)过渡。完成后,响应包含每个评估者的平均分数、会话次数和令牌使用情况的汇总摘要。

  5. Per-session 详细信息可在响应中指定的位置的 CloudWatch 日志outputDataConfig中找到。

与其他评估类型的比较

方面 On-demand 在线 Batch

触发器

Caller-initiated,同步

持续、以事件为导向

Caller-initiated,异步

会话来源

呼叫者提供内联跨度

监视日志组

服务从日志中 CloudWatch 发现

Scope

单次会话

所有匹配抽样规则的会话

多个会话(时间范围、会话 ID 或完整日志组)

地面真相

通过 evaluationReferenceInputs

不支持

sessionMetadata带有内联真相的 Via

结果

同步响应

CloudWatch 指标和仪表板

使用每个评估者的平均值汇总摘要,以及每个会话的详细信息 CloudWatch

使用案例

Dev-time 抽查, CI/CD

生产监控

基线测量、 pre/post 比较、回归测试