View a markdown version of this page

배치 평가 - Amazon Bedrock AgentCore

배치 평가

배치 평가는 서버 측 오케스트레이션을 통해 단일 작업에서 여러 에이전트 세션에 대해 평가자를 실행합니다. 스팬을 수집하고 직접 평가 API를 호출하는 온디맨드 평가와 달리 배치 평가는 전적으로 서비스 측에서 세션 검색, 스팬 수집 및 점수를 처리합니다. 작업을 제출하면 서비스가 일치하는 모든 세션을 처리하고 집계 결과를 반환합니다.

다음과 같은 경우 배치 평가를 사용합니다.

  • 에이전트의 프롬프트, 도구 또는 모델을 변경하기 전에 기준을 측정합니다.

  • 구성 변경 전후의 점수를 비교하여 개선 사항을 검증합니다.

  • 큐레이션된 세션 또는 시나리오 세트에서 회귀 테스트를 실행합니다.

  • 특정 기간 동안 프로덕션 세션 전반에 걸쳐 품질을 주기적으로 모니터링합니다.

작동 방식

배치 평가 작업은 다음 흐름을 따릅니다.

  1. 세션 소스(에이전트 세션을 찾을 위치)와 평가 구성(실행할 평가자)을 지정하여 작업을 시작합니다. 선택적으로 참조 기반 점수 평가를 위한 실측 메타데이터를 제공합니다.

  2. 서비스는 지정한 로그 그룹 및 필터를 기반으로 CloudWatch Logs에서 세션을 검색합니다. CloudWatch

  3. 서비스는 검색된 각 세션에 대해 평가자를 실행합니다. 각 평가자는 각 세션을 독립적으로 채점합니다. 실측 정보가 제공되면 참조 기반 점수를 지원하는 평가자가 이를 사용합니다.

  4. 결과를 폴링합니다. 작업은 PENDINGIN_PROGRESSCOMPLETED (또는 )를 통해 전환됩니다FAILED. 완료되면 응답에는 평가자당 평균 점수, 세션 수 및 토큰 사용량이 포함된 집계 요약이 포함됩니다.

  5. 세션별 세부 정보는 응답에서에 지정된 위치의 CloudWatch LogsoutputDataConfig에서 확인할 수 있습니다.

다른 평가 유형과의 비교

속성 온디맨드 온라인 배치

트리거

호출자 시작, 동기식

지속적인 이벤트 기반

호출자 시작, 비동기식

세션 소스

호출자가 인라인으로 스팬 제공

로그 그룹 감시

CloudWatch Logs에서 검색되는 서비스

Scope

단일 세션

샘플링 규칙과 일치하는 모든 세션

다중 세션(시간 범위, 세션 IDs 또는 전체 로그 그룹)

실측 정보

경유 evaluationReferenceInputs

지원되지 않음

인라인 실측을 sessionMetadata 통해

결과

동기식 응답

CloudWatch 지표 및 대시보드

CloudWatch에서 평가자당 평균과 세션당 세부 정보로 요약 집계

사용 사례:

개발 시간 스팟 검사, CI/CD

프로덕션 모니터링

기준 측정, 사전/사후 비교, 회귀 테스트