本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
数据集评估
注意
数据集评估处于公共预览阶段。在正式发布之前,功能和 API 可能会发生变化。
数据集评估允许您针对一组场景运行代理并自动评估结果。数据集运行器不是手动调用代理、收集跨度和调用 Evaluate API,而是通过一次调用来协调整个生命周期:调用代理、等待遥测数据提取和评估。
这对于回归测试、基准数据集、 CI/CD 管道、基线测量和配置更改后的 pre/post 比较很有用。
AgentCore SDK 提供了两个数据集运行器,它们共享相同的数据集架构和真实数据格式,但评估的地点不同:
-
On-demand dataset runner (
OnDemandEvaluationDatasetRunner) — 收集跨度并在客户端调用 Evaluate API。最适合开发时迭代和小型数据集。 -
批处理数据集运行器 (
BatchEvaluationRunner) — 委托人通过批量评估 API 向服务进行收集和评估。最适合大型数据集和生产基线。
选择跑步者
| 方面 | On-demand 跑步者 | 批量运行器 |
|---|---|---|
|
跨度系列 |
SDK-side 通过 |
Server-side; 服务 CloudWatch 直接从中读取 |
|
评估 API 调用 |
|
SDK 调用 |
|
执行模型 |
同步三相流水线(调用、等待、评估) |
异步四阶段流水线(调用、等待、提交、轮询) |
|
结果 |
|
|
|
适用于 |
Dev-time 迭代 CI/CD,小型数据集,当您需要立即提供每个场景的详细信息时 |
基线测量、大型数据集、 pre/post 比较,当总分数足够时 |
先决条件
两位跑步者都需要:
-
Python 3.10+
-
使用支持的框架和仪器库构建的代理。有关支持的框架和工具库的更多信息,请参阅支持的代理框架。
-
在 AgentCore Runtime 上部署且启用了可观察性的代理,或者使用配置了可AgentCore 观测性(包括事务搜索)的受支持框架构建的代理。有关遥测设置的更多信息,请参阅遥测设置和交付。
-
安装的 AgentCore SDK:
pip install bedrock-agentcore -
AWS 使用
bedrock-agentcorebedrock-agentcore-control、和logs(CloudWatch) 的权限配置的证书