평가 용어
AgentCore 평가를 효과적으로 사용하려면 주요 개념과 용어를 이해하는 것이 중요합니다. 다음 용어는 에이전트 평가와 관련된 핵심 구성 요소와 프로세스를 정의합니다.
에이전트 프레임워크
에이전트 프레임워크는 에이전트 기반 애플리케이션을 구축, 오케스트레이션 및 실행하기 위한 기본 구성 요소를 제공합니다. 프레임워크는 단계, 도구, 제어 흐름 및 메모리 관리와 같은 구조를 정의합니다. 일반적인 산업 프레임워크에는 Strands 에이전트
AgentCore 평가는 현재 Strands 에이전트 및 LangGraph 에이전트 프레임워크를 지원합니다.
계측 라이브러리
계측 라이브러리는 실행 중에 에이전트가 생성한 원격 측정을 기록합니다. 이 원격 측정에는 트레이스, 스팬, 도구 호출, 모델 호출 및 중간 단계가 포함될 수 있습니다. OpenTelemetry 및 OpenInference와 같은 라이브러리는 코드 변경을 최소화하면서 에이전트 동작을 캡처할 수 있는 표준화된 APIs 및 의미 체계 규칙을 제공합니다. 트레이스 수집 및 평가를 위해서는 계측이 필요합니다.
AgentCore Evaluations는 현재 OpenTelemetry 및 OpenInference를 계측 라이브러리로 지원합니다.
계측 에이전트
계측 에이전트는 애플리케이션 코드에서 원격 측정을 자동으로 캡처하고 처리하여 저장 또는 평가를 위해 백엔드 서비스로 내보냅니다. ADOT(AWS Distro for OpenTelemetry)와 같은 도구는 코드 변경 없이 트레이스를 캡처하기 위해 바이트코드를 동적으로 주입하는 공급업체 중립적인 프로덕션 지원 자동 계측 에이전트를 제공합니다. 에이전트는 자동 평가를 활성화하는 데 중요한 구성 요소입니다.
AgentCore Evaluations는 현재 ADOT(AWS Distro for OpenTelemetry)를 계측 에이전트로 지원합니다.
세션
세션은 단일 사용자 또는 워크플로의 관련된 상호 작용을 논리적으로 그룹화한 것입니다. 세션에는 하나 이상의 추적이 포함될 수 있습니다. 세션은 개별 요청에 집중하는 대신 다단계 상호 작용에서 에이전트 동작을 보고 평가하는 데 도움이 됩니다.
추적
트레이스는 단일 에이전트 실행 또는 요청에 대한 전체 레코드입니다. 추적에는 해당 실행 중에 수행된 개별 작업을 나타내는 하나 이상의 스팬이 포함됩니다. 트레이스는 에이전트 결정 및 도구 사용에 대한 end-to-end 가시성을 제공합니다.
도구 호출
도구 호출은 에이전트의 외부 함수, API 또는 기능 호출을 나타내는 스팬입니다. 도구 호출 범위는 일반적으로 도구 이름, 입력 파라미터, 실행 시간 및 출력과 같은 정보를 캡처합니다. 도구 호출 세부 정보는 에이전트가 도구를 정확하고 효율적으로 선택했는지 여부를 평가하는 데 사용됩니다.
무료 대형 언어 모델(LLMs)을 판사로 참조
대형 언어 모델(LLMs)은 대형 언어 모델(LLM)을 사용하여 에이전트 또는 다른 모델의 출력의 품질, 정확성 또는 효과를 자동으로 평가하는 평가 방법을 말합니다. 수동 검토 또는 규칙 기반 검사에 의존하는 대신 LLM에 평가 기준이 표시되고 평가 중인 입력 및 출력에 따라 점수, 레이블 또는 설명이 생성됩니다. 실측 데이터에 의존하는 기존 평가와 달리 LLM-as-a-judge 메서드는 모델의 내부 지식에 의존하여 판단합니다. 이 접근 방식을 사용하면 많은 수의 에이전트 상호 작용 또는 모델 응답에서 정확성, 추론 품질 또는 지침 준수와 같은 확장 가능하고 일관되며 사용자 지정 가능한 정성적 평가를 수행할 수 있습니다.