View a markdown version of this page

批次評估 - Amazon Bedrock AgentCore

批次評估

批次評估會在具有伺服器端協同運作的單一任務中,針對多個代理程式工作階段執行評估程式。與收集跨度並自行呼叫評估 API 的隨需評估不同,批次評估會完全在服務端處理工作階段探索、跨度收集和評分。您提交任務,服務會處理所有相符的工作階段,並傳回彙總結果。

當您需要執行下列動作時,請使用批次評估:

  • 在變更客服人員的提示、工具或模型之前,測量基準

  • 透過比較組態變更前後的分數來驗證改進

  • 在一組精選的工作階段或案例中執行迴歸測試

  • 從特定時段定期監控生產工作階段的品質。

運作方式

批次評估任務遵循此流程:

  1. 您可以透過指定工作階段來源 (尋找代理程式工作階段的位置) 和評估組態 (要執行的評估器) 來啟動任務。或者,您可以提供以參考為基礎的評分的 Ground Truth 中繼資料。

  2. 服務會根據您指定的日誌群組和篩選條件,從 CloudWatch Logs 探索工作階段。 CloudWatch

  3. 服務會對每個探索的工作階段執行評估者。每個評估者會獨立計算每個工作階段的分數。如果提供 Ground Truth,則支援參考式評分的評估者會使用它。

  4. 您可以輪詢結果。任務會透過 PENDING → → IN_PROGRESS COMPLETED(或 FAILED) 轉換。完成後,回應會包含彙總摘要,其中包含每個評估者的平均分數、工作階段計數和字符用量。

  5. 每個工作階段的詳細資訊可在 CloudWatch Logs 的回應outputDataConfig中指定的位置取得。

與其他評估類型的比較

面向 隨需 線上 批次

觸發條件

來電者起始、同步

持續、事件驅動

來電者起始、非同步

工作階段來源

來電者提供內嵌跨度

監看日誌群組

CloudWatch Logs 的服務探索

Scope (範圍)

單一工作階段

符合抽樣規則的所有工作階段

多個工作階段 (時間範圍、工作階段 IDs或完整日誌群組)

Ground 事實

透過 evaluationReferenceInputs

不支援

透過 sessionMetadata與內嵌地面真相

結果

同步回應

CloudWatch 指標和儀表板

具有每個評估器平均值的彙總摘要,加上 CloudWatch 中的每個工作階段詳細資訊

使用案例

開發時間 Spot 檢查、CI/CD

生產監控

基準測量、前後比較、迴歸測試