批次評估
批次評估會在具有伺服器端協同運作的單一任務中,針對多個代理程式工作階段執行評估程式。與收集跨度並自行呼叫評估 API 的隨需評估不同,批次評估會完全在服務端處理工作階段探索、跨度收集和評分。您提交任務,服務會處理所有相符的工作階段,並傳回彙總結果。
當您需要執行下列動作時,請使用批次評估:
-
在變更客服人員的提示、工具或模型之前,測量基準。
-
透過比較組態變更前後的分數來驗證改進。
-
在一組精選的工作階段或案例中執行迴歸測試。
-
從特定時段定期監控生產工作階段的品質。
運作方式
批次評估任務遵循此流程:
-
您可以透過指定工作階段來源 (尋找代理程式工作階段的位置) 和評估組態 (要執行的評估器) 來啟動任務。或者,您可以提供以參考為基礎的評分的 Ground Truth 中繼資料。
-
服務會根據您指定的日誌群組和篩選條件,從 CloudWatch Logs 探索工作階段。 CloudWatch
-
服務會對每個探索的工作階段執行評估者。每個評估者會獨立計算每個工作階段的分數。如果提供 Ground Truth,則支援參考式評分的評估者會使用它。
-
您可以輪詢結果。任務會透過
PENDING→ →IN_PROGRESSCOMPLETED(或FAILED) 轉換。完成後,回應會包含彙總摘要,其中包含每個評估者的平均分數、工作階段計數和字符用量。 -
每個工作階段的詳細資訊可在 CloudWatch Logs 的回應
outputDataConfig中指定的位置取得。
與其他評估類型的比較
| 面向 | 隨需 | 線上 | 批次 |
|---|---|---|---|
|
觸發條件 |
來電者起始、同步 |
持續、事件驅動 |
來電者起始、非同步 |
|
工作階段來源 |
來電者提供內嵌跨度 |
監看日誌群組 |
CloudWatch Logs 的服務探索 |
|
Scope (範圍) |
單一工作階段 |
符合抽樣規則的所有工作階段 |
多個工作階段 (時間範圍、工作階段 IDs或完整日誌群組) |
|
Ground 事實 |
透過 |
不支援 |
透過 |
|
結果 |
同步回應 |
CloudWatch 指標和儀表板 |
具有每個評估器平均值的彙總摘要,加上 CloudWatch 中的每個工作階段詳細資訊 |
|
使用案例 |
開發時間 Spot 檢查、CI/CD |
生產監控 |
基準測量、前後比較、迴歸測試 |