

# 评估术语
<a name="evaluations-terminology"></a>

了解关键概念和术语对于有效使用 AgentCore 评估至关重要。以下术语定义了代理评估中涉及的核心组件和流程。

**Topics**
+ [代理框架](#agent-framework)
+ [仪器库](#instrumentation-library)
+ [仪器代理](#instrumentation-agent)
+ [会话](#session)
+ [跟踪](#trace)
+ [工具调用](#tool-call)
+ [参考免费大型语言模型 (LLM) 作为评委](#llms-as-judges)

## 代理框架
<a name="agent-framework"></a>

代理框架为构建、编排和运行基于代理的应用程序提供了基础组件。框架定义了步骤、工具、控制流和内存管理等结构。常见的行业框架包括 [Strands Agen](https://strandsagents.com/latest/) ts **LangGraph**等。这些框架有助于标准化代理的构造方式，并使其更易于仪表和评估。

AgentCore 评估目前支持 Strands Agents 和**LangGraph**代理框架。

## 仪器库
<a name="instrumentation-library"></a>

仪器库记录您的代理在执行期间生成的遥测数据。这种遥测可以包括轨迹、跨度、工具调用、模型调用和中间步骤。**OpenTelemetry**和之类的库**OpenInference**提供标准化的 API 和语义约定，允许您以最少的代码更改来捕获代理行为。追踪收集和评估需要仪器。

AgentCore 评估目前支持**OpenTelemetry**并**OpenInference**作为仪器库。

## 仪器代理
<a name="instrumentation-agent"></a>

仪器代理会自动从应用程序代码中捕获遥测数据，对其进行处理，然后将其导出到后端服务进行存储或评估。诸如 **ADOT（AWS Distro for OpenTelemetry）之类的**工具提供了一个供应商中立、可用于生产的自动检测代理，该代理可以动态注入字节码以捕获跟踪，而无需更改代码。代理是实现自动评估的关键组件。

AgentCore 评估目前支持 **ADOT（AWS 发行版 OpenTelemetry）**作为仪器代理。

## 会话
<a name="session"></a>

会话指单个用户或工作流相关交互行为的逻辑集合。一个会话可能包含一个或多个跟踪。会话可帮助您查看和评估多步交互中的代理行为，而不是专注于单个请求。

## 跟踪
<a name="trace"></a>

跟踪数据为代理单次执行任务或处理请求的完整记录。一条跟踪包含一个或多个跨度，这些跨度表示该执行期间执行的各个操作。跟踪提供对代理决策和工具使用情况的端到端可见性。

## 工具调用
<a name="tool-call"></a>

工具调用是一个跨度，表示代理对外部函数、API 或功能的调用。工具调用跨度通常会捕获工具名称、输入参数、执行时间和输出等信息。工具调用详细信息用于评估代理是否正确有效地选择和使用了工具。

## 参考免费大型语言模型 (LLM) 作为评委
<a name="llms-as-judges"></a>

作为评委的大型语言模型 (LLM) 是指一种使用大型语言模型 (LLM) 自动评估代理或其他模型输出的质量、正确性或有效性的评估方法。法学硕士不是依赖人工审查或基于规则的检查，而是被提示评估标准，并根据正在评估的输入和输出生成分数、标签或解释。与依赖真实数据的传统评估不同， LLM-as-a-judge 方法依赖于模型的内部知识来做出判断。这种方法可以对大量代理交互或模型响应进行可扩展、一致和可自定义的定性评估，例如正确性、推理质量或教学依从性。