View a markdown version of this page

数据集评估 - 亚马逊基岩 AgentCore

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

数据集评估

注意

数据集评估处于公共预览阶段。在正式发布之前,功能和 API 可能会发生变化。

数据集评估允许您针对一组场景运行代理并自动评估结果。数据集运行器不是手动调用代理、收集跨度和调用 Evaluate API,而是通过一次调用来协调整个生命周期:调用代理、等待遥测数据提取和评估。

这对于回归测试、基准数据集、 CI/CD 管道、基线测量和配置更改后的 pre/post 比较很有用。

AgentCore SDK 提供了两个数据集运行器,它们共享相同的数据集架构和真实数据格式,但评估的地点不同:

  • On-demand dataset runner (OnDemandEvaluationDatasetRunner) — 收集跨度并在客户端调用 Evaluate API。最适合开发时迭代和小型数据集。

  • 批处理数据集运行器 (BatchEvaluationRunner) — 委托人通过批量评估 API 向服务进行收集和评估。最适合大型数据集和生产基线。

选择跑步者

方面 On-demand 跑步者 批量运行器

跨度系列

SDK-side 通过 AgentSpanCollector

Server-side; 服务 CloudWatch 直接从中读取

评估 API 调用

evaluate()每个评估者对每个场景的 SDK 调用次数

SDK 调用startBatchEvaluation()一次

执行模型

同步三相流水线(调用、等待、评估)

异步四阶段流水线(调用、等待、提交、轮询)

结果

EvaluationResult以每个场景、每个评估者的详细信息构成

BatchEvaluationSummary使用每个评估者的平均值以及每个会话的详细信息进行汇总 CloudWatch

适用于

Dev-time 迭代 CI/CD,小型数据集,当您需要立即提供每个场景的详细信息时

基线测量、大型数据集、 pre/post 比较,当总分数足够时

先决条件

两位跑步者都需要:

  • Python 3.10+

  • 使用支持的框架和仪器库构建的代理。有关支持的框架和工具库的更多信息,请参阅支持的代理框架。

  • 在 AgentCore Runtime 上部署且启用了可观察性的代理,或者使用配置了可AgentCore 观测性(包括事务搜索)的受支持框架构建的代理。有关遥测设置的更多信息,请参阅遥测设置和交付。

  • 安装的 AgentCore SDK:pip install bedrock-agentcore

  • AWS 使用bedrock-agentcorebedrock-agentcore-control、和 logs (CloudWatch) 的权限配置的证书