View a markdown version of this page

Amazon Bedrock AgentCore 평가를 사용하여 에이전트 성능 평가 - Amazon Bedrock AgentCore

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

Amazon Bedrock AgentCore 평가를 사용하여 에이전트 성능 평가

Amazon Bedrock AgentCore Evaluations는 에이전트 또는 도구가 특정 작업을 얼마나 잘 수행하고 엣지 케이스를 처리하며 다양한 입력 및 컨텍스트에서 일관성을 유지하는지 측정하는 자동화된 평가 도구를 제공합니다. 이 서비스는 데이터 기반 최적화를 활성화하고 에이전트가 배포 전후에 품질 표준을 충족하도록 합니다.

AgentCore Evaluations는 OpenTelemetry 및 OpenInference OpenInference 계측 라이브러리와 함께 Strands 및 LangGraph를 비롯한 인기 있는 에이전트 프레임워크와 통합됩니다. 후드 아래에서 이러한 에이전트의 트레이스는 통합 형식으로 변환되고 기본 제공 평가자와 사용자 지정 평가자 모두에 대해 LLM-as-a-Judge 기법을 사용하여 점수가 매겨집니다.

각 평가자에는 고유한 Amazon 리소스 이름(ARN)과 리소스 정책이 연결되어 있습니다. 평가자 ARNs 다음 형식을 따릅니다.

arn:aws:bedrock-agentcore:::evaluator/Builtin.Helpfulness (for built-in evaluators)
arn:aws:bedrock-agentcore:region:account:evaluator/my-evaluator-id (for custom evaluators)

기본 제공 평가자는 퍼블릭이며 모든 사용자가 액세스할 수 있습니다. 사용자 지정 평가 리소스는 비공개이며 액세스 권한이 명시적으로 부여된 사용자만 액세스할 수 있습니다. 액세스 권한을 부여하려면 평가자 및 평가 구성에 IAM 리소스 기반 정책을 사용하고 사용자 및 역할에 IAM 자격 증명 기반 정책을 사용할 수 있습니다.

기본적으로 AWS 계정에서 AWS 리전당 최대 1,000개의 평가 구성을 생성할 수 있습니다. 이 서비스는 대규모 리전에 대해 계정당 분당 최대 1백만 개의 입력 및 출력 토큰을 지원합니다.