데이터세트 평가
참고
데이터 세트 평가는 공개 미리 보기에 있습니다. 기능 및 APIs 정식 출시 전에 변경될 수 있습니다.
데이터세트 평가를 사용하면 일련의 시나리오에 대해 에이전트를 실행하고 결과를 자동으로 평가할 수 있습니다. 데이터 세트 실행기는 에이전트를 수동으로 호출하고, 스팬을 수집하고, 평가 API를 호출하는 대신 에이전트를 호출하고, 원격 측정 수집을 기다리고, 평가하는 단일 호출로 전체 수명 주기를 오케스트레이션합니다.
이는 회귀 테스트, 벤치마크 데이터 세트, CI/CD 파이프라인, 기준 측정 및 구성 변경 후 사전/사후 비교에 유용합니다.
AgentCore SDK는 동일한 데이터 세트 스키마와 실제 형식을 공유하지만 평가가 수행되는 위치가 다른 두 개의 데이터 세트 실행기를 제공합니다.
-
온디맨드 데이터 세트 실행기(
OnDemandEvaluationDatasetRunner) - 스팬을 수집하고 API 클라이언트 측에서 평가를 호출합니다. 개발 시간 반복 및 소규모 데이터 세트에 가장 적합합니다. -
배치 데이터 세트 실행기(
BatchEvaluationRunner) - 배치 평가 API를 통해 서비스에 대한 스팬 수집 및 평가를 위임합니다. 대규모 데이터 세트 및 프로덕션 기준에 가장 적합합니다.
러너 선택
| 속성 | 온디맨드 러너 | 배치 실행기 |
|---|---|---|
|
스팬 컬렉션 |
를 통한 SDK 측 |
서버 측, CloudWatch에서 직접 읽는 서비스 |
|
API 호출 평가 |
시나리오 |
SDK 호출 |
|
실행 모델 |
동기식 3단계 파이프라인(호출, 대기, 평가) |
비동기식 4단계 파이프라인(호출, 대기, 제출, 폴링) |
|
결과 |
시나리오 |
CloudWatch에서 평가자 |
|
최적의 용도 |
시나리오별 세부 정보가 즉시 필요한 경우 개발 시간 반복, CI/CD, 소규모 데이터 세트 |
기준선 측정, 대규모 데이터 세트, 사전/사후 비교, 집계 점수로 충분할 때 |
사전 조건
두 실행기 모두 다음이 필요합니다.
-
Python 3.10 이상
-
관찰성이 활성화된 AgentCore 런타임에 배포된 에이전트 또는 AgentCore 관찰성으로 구성된 지원되는 프레임워크로 구축된 에이전트. 지원되는 프레임워크:
-
Strands Agents
-
opentelemetry-instrumentation-langchain또는를 사용한 LangGraphopeninference-instrumentation-langchain
-
-
CloudWatch에서 활성화된 트랜잭션 검색, 트랜잭션 검색 활성화 참조
-
AgentCore SDK 설치:
pip install bedrock-agentcore -
AWS
bedrock-agentcore,bedrock-agentcore-control및logs(CloudWatch)에 대한 권한으로 구성된 자격 증명