資料集評估
注意
資料集評估為公開預覽。在一般可用性之前,功能和 APIs 可能會變更。
資料集評估可讓您根據一組案例執行代理程式,並自動評估結果。資料集執行器不會手動叫用您的代理程式、收集範圍和呼叫評估 API,而是在單一呼叫中協調整個生命週期:叫用代理程式、等待遙測擷取和評估。
這適用於迴歸測試、基準資料集、CI/CD 管道、基準測量,以及組態變更後的前後比較。
AgentCore SDK 提供兩個資料集執行器,這些執行器共用相同的資料集結構描述和 Ground Truth 格式,但評估發生的位置不同:
-
隨需資料集執行器 (
OnDemandEvaluationDatasetRunner) — 收集範圍並呼叫評估 API 用戶端。最適合用於開發時間反覆運算和小型資料集。 -
批次資料集執行器 (
BatchEvaluationRunner) — 透過批次評估 API 將範圍收集和評估委派給服務。最適合大型資料集和生產基準。
選擇執行器
| 面向 | 隨需執行器 | 批次執行器 |
|---|---|---|
|
跨度集合 |
透過 的 SDK 端 |
伺服器端;服務直接從 CloudWatch 讀取 |
|
評估 API 呼叫 |
|
SDK 呼叫 |
|
執行模型 |
同步三階段管道 (叫用、等待、評估) |
非同步四階段管道 (叫用、等待、提交、輪詢) |
|
結果 |
|
|
|
最適合 |
當您立即需要每個案例的詳細資訊時,開發時間反覆運算、CI/CD、小型資料集 |
當彙總分數足夠時,基準測量、大型資料集、前後比較 |
先決條件
兩個執行器都需要:
-
Python 3.10+
-
在啟用可觀測性的 AgentCore 執行時間上部署的代理程式,或使用 AgentCore Observability 設定的支援架構建置的代理程式。支援的架構:
-
Strands 代理程式
-
使用
opentelemetry-instrumentation-langchain或 的 LangGraphopeninference-instrumentation-langchain
-
-
CloudWatch 中啟用的交易搜尋;請參閱啟用交易搜尋
-
已安裝 AgentCore SDK:
pip install bedrock-agentcore -
AWS 使用
bedrock-agentcore、bedrock-agentcore-control和logs(CloudWatch) 許可設定的憑證