評估術語
了解關鍵概念和術語對於有效使用 AgentCore Evaluations 至關重要。下列術語定義代理程式評估中涉及的核心元件和程序。
代理程式架構
代理程式架構提供基本元件,用於建置、協調和執行代理程式型應用程式。架構定義步驟、工具、控制流程和記憶體管理等結構。常見的產業架構包括 Strands Agents
AgentCore Evaluations 目前支援 Strands Agents 和 LangGraph 代理程式架構。
檢測程式庫
檢測程式庫會記錄代理程式在執行期間產生的遙測。此遙測可包含追蹤、跨度、工具呼叫、模型調用和中繼步驟。OpenTelemetry 和 OpenInference 等程式庫提供標準化 APIs 和語意慣例,可讓您以最少的程式碼變更擷取代理程式行為。追蹤收集和評估需要檢測。
AgentCore Evaluations 目前支援 OpenTelemetry 和 OpenInference 做為檢測程式庫。
檢測代理程式
檢測代理程式會自動從應用程式程式碼擷取遙測,處理它,並將其匯出至後端服務以進行儲存或評估。ADOT (AWS Distro for OpenTelemetry) 等工具提供廠商中立、生產就緒的自動檢測代理程式,可動態注入位元組碼,在不變更程式碼的情況下擷取追蹤。代理程式是啟用自動評估的關鍵元件。
AgentCore Evaluations 目前支援 ADOT (AWS Distro for OpenTelemetry) 做為檢測代理程式。
Session (工作階段)
工作階段代表來自單一使用者或工作流程之相關互動的邏輯分組。工作階段可能包含一或多個追蹤。工作階段可協助您檢視和評估跨多步驟互動的客服人員行為,而不是專注於個別請求。
追蹤
追蹤是單一代理程式執行或請求的完整記錄。追蹤包含一或多個跨度,代表在該執行期間執行的個別操作。追蹤提供客服人員決策和工具用量end-to-end可見性。
工具呼叫
工具呼叫是代表客服人員叫用外部 函數、API 或 功能的跨度。工具呼叫通常會擷取資訊,例如工具名稱、輸入參數、執行時間和輸出。工具呼叫詳細資訊可用來評估客服人員是否正確且有效率地選取和使用工具。
參考免費大型語言模型 (LLMs做為判斷
大型語言模型 (LLMs作為判斷,是指使用大型語言模型 (LLM) 來自動評估客服人員或其他模型輸出的品質、正確性或有效性的評估方法。與其依賴手動檢閱或規則型檢查,LLM 會以評估條件提示,並根據正在評估的輸入和輸出產生分數、標籤或說明。與依賴 Ground-truth 資料的傳統評估不同,LLM-as-a-judge 方法依賴模型的內部知識進行判斷。此方法可跨大量客服人員互動或模型回應,進行可擴展、一致且可自訂的定性評估,例如正確性、推理品質或指令遵循。