使用 Amazon Bedrock AgentCore 評估來評估代理程式效能
Amazon Bedrock AgentCore Evaluations 提供自動化評估工具,可測量您的代理程式或工具執行特定任務、處理邊緣案例,以及維持不同輸入和內容之間的一致性。此服務可啟用資料驅動最佳化,並確保您的代理程式在部署前後都符合品質標準。
AgentCore Evaluations 與熱門代理程式架構整合,包括 Strands 和 LangGraph 與 OpenTelemetry 和 OpenInference 檢測程式庫。在幕後,來自這些代理程式的追蹤會轉換為統一格式,並使用 LLM-as-a-Judge 技術對內建和自訂評估器進行評分。
每個評估者都有唯一的 Amazon Resource Name (ARN) 和資源政策。評估器 ARNs遵循下列格式:
arn:aws:bedrock-agentcore:::evaluator/Builtin.Helpfulness (for built-in evaluators)
arn:aws:bedrock-agentcore:region:account:evaluator/my-evaluator-id (for custom evaluators)
內建評估器是公開的,可供所有使用者存取。自訂評估資源是私有的,只能由明確授予存取權的使用者存取。若要授予存取權,您可以針對評估者和評估組態使用 IAM 資源型政策,以及針對使用者和角色使用 IAM 身分型政策。
依預設,您最多可以建立 AWS 帳戶中每個 AWS 區域 1,000 個評估組態,且任何時間點最多可以啟用 100 個評估組態。此服務支援大型區域每個帳戶每分鐘最多 100 萬個輸入和輸出字符。