批量评估
Batch 评估通过服务器端编排在单个作业中针对多个代理会话运行评估器。与按需评估不同,在按需评估中,您可以收集跨度并自己调用 Evaluate API,而批量评估则完全在服务端处理会话发现、跨度收集和评分。您提交作业,服务会处理所有匹配的会话并返回汇总结果。
在需要执行以下操作时使用批量评估:
-
在更改代理@@ 的提示、工具或模型之前,请先测量基准。
-
通过比较配置更改前后的分数来@@ 验证改进。
-
在一组精心策划的会话或场景中@@ 运行回归测试。
-
从特定的时间窗口@@ 定期监控生产环节的质量。
工作原理
批量评估作业遵循以下流程:
-
您可以通过指定会话来源(在哪里可以找到代理会话)和评估配置(运行哪些评估器)来启动作业。或者,您可以为基于参考的评分提供实况元数据。
-
该服务根据您指定的 CloudWatch 日志组和过滤器从日志中发现会话。
-
该服务针对每个发现的会话运行评估器。每位评估者独立对每节课进行评分。如果提供了基本真相,则支持基于参考的评分的评估人员会使用该信息。
-
您通过民意调查结果。任务通过
PENDING→IN_PROGRESS→COMPLETED(或FAILED)过渡。完成后,响应将包括汇总摘要,包括每个评估者的平均分数、会话计数和代币使用情况。 -
Per-session 详细信息可在响应中指定的位置的 CloudWatch 日志
outputDataConfig中找到。
与其他评估类型的比较
| 方面 | On-demand | 在线 | Batch |
|---|---|---|---|
|
触发器 |
Caller-initiated,同步 |
连续、事件驱动 |
Caller-initiated,异步 |
|
会话来源 |
来电者提供内联跨度 |
监视日志组 |
服务从日志中 CloudWatch 发现 |
|
Scope |
单次会话 |
所有符合采样规则的会话 |
多个会话(时间范围、会话 ID 或完整日志组) |
|
实地真相 |
通过 |
不支持 |
|
|
结果 |
同步响应 |
CloudWatch 指标和仪表板 |
汇总摘要,包括每个评估者的平均值,再加上每个会话的详细信息 CloudWatch |
|
使用案例 |
Dev-time 抽查, CI/CD |
生产监控 |
基线测量、 pre/post 比较、回归测试 |