View a markdown version of this page

Amazon Bedrock AgentCore 평가를 사용하여 에이전트 성능 평가 - Amazon Bedrock AgentCore

Amazon Bedrock AgentCore 평가를 사용하여 에이전트 성능 평가

Amazon Bedrock AgentCore Evaluations는 에이전트 또는 도구가 특정 작업을 얼마나 잘 수행하고 엣지 케이스를 처리하며 다양한 입력 및 컨텍스트에서 일관성을 유지하는지 측정하는 자동화된 평가 도구를 제공합니다. 이 서비스는 데이터 기반 최적화를 활성화하고 에이전트가 배포 전후에 품질 표준을 충족하도록 합니다.

AgentCore Evaluations는 OpenTelemetry 및 OpenInference OpenInference 계측 라이브러리와 함께 StrandsLangGraph를 비롯한 인기 있는 에이전트 프레임워크와 통합됩니다. 후드 아래에서 이러한 에이전트의 트레이스는 통합 형식으로 변환되고 기본 제공 평가자와 사용자 지정 평가자 모두에 대해 LLM-as-a-Judge 기법을 사용하여 점수가 매겨집니다.

각 평가자에는 고유한 Amazon 리소스 이름(ARN)과 리소스 정책이 연결되어 있습니다. 평가자 ARNs 다음 형식을 따릅니다.

arn:aws:bedrock-agentcore:::evaluator/Builtin.Helpfulness (for built-in evaluators)
arn:aws:bedrock-agentcore:region:account:evaluator/my-evaluator-id (for custom evaluators)

기본 제공 평가자는 퍼블릭이며 모든 사용자가 액세스할 수 있습니다. 사용자 지정 평가 리소스는 비공개이며 액세스 권한이 명시적으로 부여된 사용자만 액세스할 수 있습니다. 액세스 권한을 부여하려면 평가자 및 평가 구성에 IAM 리소스 기반 정책을 사용하고 사용자 및 역할에 IAM 자격 증명 기반 정책을 사용할 수 있습니다.

기본적으로 AWS 계정에서 AWS 리전당 최대 1,000개의 평가 구성을 생성할 수 있으며, 언제든지 최대 100개의 평가 구성이 활성화됩니다. 이 서비스는 대규모 리전에 대해 계정당 분당 최대 1백만 개의 입력 및 출력 토큰을 지원합니다.