View a markdown version of this page

批量评估 - Amazon Bedrock AgentCore

批量评估

Batch 评估通过服务器端编排在单个作业中针对多个代理会话运行评估器。与按需评估不同,在按需评估中,您可以收集跨度并自己调用 Evaluate API,而批量评估则完全在服务端处理会话发现、跨度收集和评分。您提交作业,服务会处理所有匹配的会话并返回汇总结果。

在需要执行以下操作时使用批量评估:

  • 在更改代理@@ 的提示、工具或模型之前,请先测量基准

  • 通过比较配置更改前后的分数来@@ 验证改进

  • 在一组精心策划的会话或场景中@@ 运行回归测试

  • 从特定的时间窗口@@ 定期监控生产环节的质量

工作原理

批量评估作业遵循以下流程:

  1. 您可以通过指定会话来源(在哪里可以找到代理会话)和评估配置(运行哪些评估器)来启动作业。或者,您可以为基于参考的评分提供实况元数据。

  2. 该服务根据您指定的 CloudWatch 日志组和过滤器从日志中发现会话

  3. 该服务针对每个发现的会话运行评估器。每位评估者独立对每节课进行评分。如果提供了基本真相,则支持基于参考的评分的评估人员会使用该信息。

  4. 您通过民意调查结果。任务通过 PENDINGIN_PROGRESSCOMPLETED(或FAILED)过渡。完成后,响应将包括汇总摘要,包括每个评估者的平均分数、会话计数和代币使用情况。

  5. Per-session 详细信息可在响应中指定的位置的 CloudWatch 日志outputDataConfig中找到。

与其他评估类型的比较

方面 On-demand 在线 Batch

触发器

Caller-initiated,同步

连续、事件驱动

Caller-initiated,异步

会话来源

来电者提供内联跨度

监视日志组

服务从日志中 CloudWatch 发现

Scope

单次会话

所有符合采样规则的会话

多个会话(时间范围、会话 ID 或完整日志组)

实地真相

通过 evaluationReferenceInputs

不支持

sessionMetadata带有内联基础真相的 Via

结果

同步响应

CloudWatch 指标和仪表板

汇总摘要,包括每个评估者的平均值,再加上每个会话的详细信息 CloudWatch

使用案例

Dev-time 抽查, CI/CD

生产监控

基线测量、 pre/post 比较、回归测试