

# 평가 용어
<a name="evaluations-terminology"></a>

AgentCore 평가를 효과적으로 사용하려면 주요 개념과 용어를 이해하는 것이 중요합니다. 다음 용어는 에이전트 평가와 관련된 핵심 구성 요소와 프로세스를 정의합니다.

**Topics**
+ [에이전트 프레임워크](#agent-framework)
+ [계측 라이브러리](#instrumentation-library)
+ [계측 에이전트](#instrumentation-agent)
+ [세션](#session)
+ [추적](#trace)
+ [도구 호출](#tool-call)
+ [무료 대형 언어 모델(LLMs)을 판사로 참조](#llms-as-judges)

## 에이전트 프레임워크
<a name="agent-framework"></a>

에이전트 프레임워크는 에이전트 기반 애플리케이션을 구축, 오케스트레이션 및 실행하기 위한 기본 구성 요소를 제공합니다. 프레임워크는 단계, 도구, 제어 흐름 및 메모리 관리와 같은 구조를 정의합니다. 일반적인 산업 프레임워크에는 [Strands 에이전트](https://strandsagents.com/latest/) , **LangGraph** 등이 포함됩니다. 이러한 프레임워크는 에이전트의 구성 방식을 표준화하고 에이전트를 더 쉽게 구성하고 평가할 수 있도록 합니다.

AgentCore 평가는 현재 Strands 에이전트 및 **LangGraph** 에이전트 프레임워크를 지원합니다.

## 계측 라이브러리
<a name="instrumentation-library"></a>

계측 라이브러리는 실행 중에 에이전트가 생성한 원격 측정을 기록합니다. 이 원격 측정에는 트레이스, 스팬, 도구 호출, 모델 호출 및 중간 단계가 포함될 수 있습니다. **OpenTelemetry** 및 **OpenInference**와 같은 라이브러리는 코드 변경을 최소화하면서 에이전트 동작을 캡처할 수 있는 표준화된 APIs 및 의미 체계 규칙을 제공합니다. 트레이스 수집 및 평가를 위해서는 계측이 필요합니다.

AgentCore Evaluations는 현재 **OpenTelemetry** 및 **OpenInference**를 계측 라이브러리로 지원합니다.

## 계측 에이전트
<a name="instrumentation-agent"></a>

계측 에이전트는 애플리케이션 코드에서 원격 측정을 자동으로 캡처하고 처리하여 저장 또는 평가를 위해 백엔드 서비스로 내보냅니다. **ADOT(AWS Distro for OpenTelemetry)**와 같은 도구는 코드 변경 없이 트레이스를 캡처하기 위해 바이트코드를 동적으로 주입하는 공급업체 중립적인 프로덕션 지원 자동 계측 에이전트를 제공합니다. 에이전트는 자동 평가를 활성화하는 데 중요한 구성 요소입니다.

AgentCore Evaluations는 현재 **ADOT(AWS Distro for OpenTelemetry)**를 계측 에이전트로 지원합니다.

## 세션
<a name="session"></a>

세션은 단일 사용자 또는 워크플로의 관련된 상호 작용을 논리적으로 그룹화한 것입니다. 세션에는 하나 이상의 추적이 포함될 수 있습니다. 세션은 개별 요청에 집중하는 대신 다단계 상호 작용에서 에이전트 동작을 보고 평가하는 데 도움이 됩니다.

## 추적
<a name="trace"></a>

트레이스는 단일 에이전트 실행 또는 요청에 대한 전체 레코드입니다. 추적에는 해당 실행 중에 수행된 개별 작업을 나타내는 하나 이상의 스팬이 포함됩니다. 트레이스는 에이전트 결정 및 도구 사용에 대한 end-to-end 가시성을 제공합니다.

## 도구 호출
<a name="tool-call"></a>

도구 호출은 에이전트의 외부 함수, API 또는 기능 호출을 나타내는 스팬입니다. 도구 호출 범위는 일반적으로 도구 이름, 입력 파라미터, 실행 시간 및 출력과 같은 정보를 캡처합니다. 도구 호출 세부 정보는 에이전트가 도구를 정확하고 효율적으로 선택했는지 여부를 평가하는 데 사용됩니다.

## 무료 대형 언어 모델(LLMs)을 판사로 참조
<a name="llms-as-judges"></a>

대형 언어 모델(LLMs)은 대형 언어 모델(LLM)을 사용하여 에이전트 또는 다른 모델의 출력의 품질, 정확성 또는 효과를 자동으로 평가하는 평가 방법을 말합니다. 수동 검토 또는 규칙 기반 검사에 의존하는 대신 LLM에 평가 기준이 표시되고 평가 중인 입력 및 출력에 따라 점수, 레이블 또는 설명이 생성됩니다. 실측 데이터에 의존하는 기존 평가와 달리 LLM-as-a-judge 메서드는 모델의 내부 지식에 의존하여 판단합니다. 이 접근 방식을 사용하면 많은 수의 에이전트 상호 작용 또는 모델 응답에서 정확성, 추론 품질 또는 지침 준수와 같은 확장 가능하고 일관되며 사용자 지정 가능한 정성적 평가를 수행할 수 있습니다.