View a markdown version of this page

資料集評估 - Amazon Bedrock AgentCore

資料集評估

注意

資料集評估為公開預覽。在一般可用性之前,功能和 APIs 可能會變更。

資料集評估可讓您根據一組案例執行代理程式,並自動評估結果。資料集執行器不會手動叫用您的代理程式、收集範圍和呼叫評估 API,而是在單一呼叫中協調整個生命週期:叫用代理程式、等待遙測擷取和評估。

這適用於迴歸測試、基準資料集、CI/CD 管道、基準測量,以及組態變更後的前後比較。

AgentCore SDK 提供兩個資料集執行器,這些執行器共用相同的資料集結構描述和 Ground Truth 格式,但評估發生的位置不同:

  • 需資料集執行器 (OnDemandEvaluationDatasetRunner) — 收集範圍並呼叫評估 API 用戶端。最適合用於開發時間反覆運算和小型資料集。

  • 批次資料集執行器 (BatchEvaluationRunner) — 透過批次評估 API 將範圍收集和評估委派給服務。最適合大型資料集和生產基準。

選擇執行器

面向 隨需執行器 批次執行器

跨度集合

透過 的 SDK 端 AgentSpanCollector

伺服器端;服務直接從 CloudWatch 讀取

評估 API 呼叫

evaluate() 每個案例每個評估器的 SDK 呼叫數

SDK 呼叫startBatchEvaluation()一次

執行模型

同步三階段管道 (叫用、等待、評估)

非同步四階段管道 (叫用、等待、提交、輪詢)

結果

EvaluationResult 以每個案例、每個評估者的詳細資訊建構

BatchEvaluationSummary 彙總每個評估器平均值,加上 CloudWatch 中的每個工作階段詳細資訊

最適合

當您立即需要每個案例的詳細資訊時,開發時間反覆運算、CI/CD、小型資料集

當彙總分數足夠時,基準測量、大型資料集、前後比較

先決條件

兩個執行器都需要:

  • Python 3.10+

  • 在啟用可觀測性的 AgentCore 執行時間上部署的代理程式,或使用 AgentCore Observability 設定的支援架構建置的代理程式。支援的架構:

    • Strands 代理程式

    • 使用 opentelemetry-instrumentation-langchain或 的 LangGraph openinference-instrumentation-langchain

  • CloudWatch 中啟用的交易搜尋;請參閱啟用交易搜尋

  • 已安裝 AgentCore SDK: pip install bedrock-agentcore

  • AWS 使用 bedrock-agentcorebedrock-agentcore-controllogs(CloudWatch) 許可設定的憑證