View a markdown version of this page

评估术语 - Amazon Bedrock AgentCore

评估术语

了解关键概念和术语对于有效使用 AgentCore 评估至关重要。以下术语定义了代理评估中涉及的核心组件和流程。

代理框架

代理框架为构建、编排和运行基于代理的应用程序提供了基础组件。框架定义了步骤、工具、控制流和内存管理等结构。常见的行业框架包括 Strands Agen ts LangGraph等。这些框架有助于标准化代理的构造方式,并使其更易于仪表和评估。

AgentCore 评估目前支持 Strands Agents 和LangGraph代理框架。

仪器库

仪器库记录您的代理在执行期间生成的遥测数据。这种遥测可以包括轨迹、跨度、工具调用、模型调用和中间步骤。OpenTelemetry和之类的库OpenInference提供标准化的 API 和语义约定,允许您以最少的代码更改来捕获代理行为。追踪收集和评估需要仪器。

AgentCore 评估目前支持OpenTelemetryOpenInference作为仪器库。

仪器代理

仪器代理会自动从应用程序代码中捕获遥测数据,对其进行处理,然后将其导出到后端服务进行存储或评估。诸如 ADOT(AWS Distro for OpenTelemetry)之类的工具提供了一个供应商中立、可用于生产的自动检测代理,该代理可以动态注入字节码以捕获跟踪,而无需更改代码。代理是实现自动评估的关键组件。

AgentCore 评估目前支持 ADOT(AWS 发行版 OpenTelemetry)作为仪器代理。

会话

会话指单个用户或工作流相关交互行为的逻辑集合。一个会话可能包含一个或多个跟踪。会话可帮助您查看和评估多步交互中的代理行为,而不是专注于单个请求。

跟踪

跟踪数据为代理单次执行任务或处理请求的完整记录。一条跟踪包含一个或多个跨度,这些跨度表示该执行期间执行的各个操作。跟踪提供对代理决策和工具使用情况的端到端可见性。

工具调用

工具调用是一个跨度,表示代理对外部函数、API 或功能的调用。工具调用跨度通常会捕获工具名称、输入参数、执行时间和输出等信息。工具调用详细信息用于评估代理是否正确有效地选择和使用了工具。

参考免费大型语言模型 (LLM) 作为评委

作为评委的大型语言模型 (LLM) 是指一种使用大型语言模型 (LLM) 自动评估代理或其他模型输出的质量、正确性或有效性的评估方法。法学硕士不是依赖人工审查或基于规则的检查,而是被提示评估标准,并根据正在评估的输入和输出生成分数、标签或解释。与依赖真实数据的传统评估不同, LLM-as-a-judge 方法依赖于模型的内部知识来做出判断。这种方法可以对大量代理交互或模型响应进行可扩展、一致和可自定义的定性评估,例如正确性、推理质量或教学依从性。