배치 평가
배치 평가는 서버 측 오케스트레이션을 통해 단일 작업에서 여러 에이전트 세션에 대해 평가자를 실행합니다. 스팬을 수집하고 직접 평가 API를 호출하는 온디맨드 평가와 달리 배치 평가는 전적으로 서비스 측에서 세션 검색, 스팬 수집 및 점수를 처리합니다. 작업을 제출하면 서비스가 일치하는 모든 세션을 처리하고 집계 결과를 반환합니다.
다음과 같은 경우 배치 평가를 사용합니다.
-
에이전트의 프롬프트, 도구 또는 모델을 변경하기 전에 기준을 측정합니다.
-
구성 변경 전후의 점수를 비교하여 개선 사항을 검증합니다.
-
큐레이션된 세션 또는 시나리오 세트에서 회귀 테스트를 실행합니다.
-
특정 기간 동안 프로덕션 세션 전반에 걸쳐 품질을 주기적으로 모니터링합니다.
작동 방식
배치 평가 작업은 다음 흐름을 따릅니다.
-
세션 소스(에이전트 세션을 찾을 위치)와 평가 구성(실행할 평가자)을 지정하여 작업을 시작합니다. 선택적으로 참조 기반 점수 평가를 위한 실측 메타데이터를 제공합니다.
-
서비스는 지정한 로그 그룹 및 필터를 기반으로 CloudWatch Logs에서 세션을 검색합니다. CloudWatch
-
서비스는 검색된 각 세션에 대해 평가자를 실행합니다. 각 평가자는 각 세션을 독립적으로 채점합니다. 실측 정보가 제공되면 참조 기반 점수를 지원하는 평가자가 이를 사용합니다.
-
결과를 폴링합니다. 작업은
PENDING→IN_PROGRESS→COMPLETED(또는 )를 통해 전환됩니다FAILED. 완료되면 응답에는 평가자당 평균 점수, 세션 수 및 토큰 사용량이 포함된 집계 요약이 포함됩니다. -
세션별 세부 정보는 응답에서에 지정된 위치의 CloudWatch Logs
outputDataConfig에서 확인할 수 있습니다.
다른 평가 유형과의 비교
| 속성 | 온디맨드 | 온라인 | 배치 |
|---|---|---|---|
|
트리거 |
호출자 시작, 동기식 |
지속적인 이벤트 기반 |
호출자 시작, 비동기식 |
|
세션 소스 |
호출자가 인라인으로 스팬 제공 |
로그 그룹 감시 |
CloudWatch Logs에서 검색되는 서비스 |
|
Scope |
단일 세션 |
샘플링 규칙과 일치하는 모든 세션 |
다중 세션(시간 범위, 세션 IDs 또는 전체 로그 그룹) |
|
실측 정보 |
경유 |
지원되지 않음 |
인라인 실측을 |
|
결과 |
동기식 응답 |
CloudWatch 지표 및 대시보드 |
CloudWatch에서 평가자당 평균과 세션당 세부 정보로 요약 집계 |
|
사용 사례: |
개발 시간 스팟 검사, CI/CD |
프로덕션 모니터링 |
기준 측정, 사전/사후 비교, 회귀 테스트 |