기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
타사 평가자
AgentCore Evaluations는 DeepEval 및 AutoEval 오픈 소스 라이브러리의 평가자를 제공합니다. 이러한 라이브러리를 이미 사용하는 경우 AgentCore 평가 내에서 동일한 지표를 실행할 수 있습니다. 서비스는 호스팅 및 평가 코드를 처리합니다. 관리형 옵션을 사용하면 서비스가 기본 제공 평가자와 동일한 방식으로 모델을 선택하고 추론을 실행합니다.
타사 평가자를 사용하는 방법에는 두 가지가 있습니다.
-
관리형 - ID별로 타사 평가자를 선택하고 배포합니다. 서비스는 이를 실행하고, 모델을 선택하고, 라이브러리 버전을 관리합니다.
-
사용자 지정 - 자체 모델 및 추론에서 기본 제공 또는 관리형 타사 평가자인 기존 평가자의 로직을 실행하는 평가자를 생성합니다. 자세한 내용은 기본 평가자에서 파생된 사용자 지정 평가자를 참조하세요.
평가자 품질
AgentCore 기본 제공 평가자는 성능을 테스트하고 벤치마킹합니다. DeepEval 및 AutoEval은 오픈 소스 평가자이므로 품질에 대한 클레임을 하지 않습니다.
평가자 자격 증명
두 필드를 함께 사용하여 타사 평가자를 포함한 모든 평가자를 식별합니다.
-
evaluatorType- 리소스의 종류: 누가 리소스와 방법을 제공합니다.Builtin및ThirdParty는 사용자가 참조하지만 생성하지 않는 AWS관리형 글로벌 평가자입니다.Custom,CustomCode및CustomDerived는 사용자가 생성하는 평가자입니다. -
providerAWS- 평가 로직의 출처는 작성자AWS,DeepEvalAutoEval해당 타사 라이브러리 또는 직접 작성한Custom평가자입니다.
두 필드는 독립적이므로 각 평가자는 한 (evaluatorType, provider) 쌍입니다.
| 평가자 | evaluatorType | 공급자 |
|---|---|---|
|
관리형 내장 |
|
|
|
관리형 타사 |
|
|
|
기본 제공에서 파생된 사용자 지정 평가자 |
|
|
|
타사 평가자로부터 파생된 사용자 지정 평가자 |
|
|
|
사용자 지정 코드 기반 평가자 |
|
|
|
사용자 지정 LLM-as-a-judge 평가자 |
|
|
관리형 타사 평가자의 ID는 ThirdParty.<Provider>.<Metric> 형식을 따릅니다. 예: ThirdParty.DeepEval.TaskCompletion 또는 ThirdParty.AutoEval.Security. 이는 자사 내장 평가자에 사용되는 Builtin.<Metric> 형식을 미러링합니다.
사용 가능한 평가자 검색
타사 평가자는 ListEvaluators API에서 자사 기본 제공 평가자 및 계정의 사용자 지정 평가자와 함께 반환됩니다.
{ "evaluators": [ { "evaluatorId": "Builtin.Helpfulness", "evaluatorType": "Builtin", "provider": "AWS", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.DeepEval.TaskCompletion", "evaluatorType": "ThirdParty", "provider": "DeepEval", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.AutoEval.Security", "evaluatorType": "ThirdParty", "provider": "AutoEval", "level": "TRACE", "status": "ACTIVE" } ] }
관리형 타사 평가자
기본 제공 평가자와 똑같이 관리형 타사 평가자를 사용합니다. ID로 선택하면 서비스가 운영하는 모델에서 이를 실행합니다. 모델, 프롬프트 또는 구성을 제공하지 않습니다.
-
모델: 관리형 타사 평가자는 Amazon Bedrock AgentCore의 기본 제공 평가자와 동일한 모델에서 실행됩니다. 설정할 모델 필드와 모델 구성이 없습니다.
-
버전 관리: 관리형 타사 평가자를 위한 버전 선택은 없습니다. 서비스는 검증한 라이브러리 버전을 실행하고 업그레이드 자체를 관리합니다.
내장된 평가자 ID를 전달할 위치에 관리형 타사 평가자의 ID를 전달할 수 있습니다.
다음 예시에서는 Evaluate API를 사용하여 관리형 타사 평가자를 실행합니다.
import boto3 client = boto3.client('bedrock-agentcore') response = client.evaluate( evaluatorId="ThirdParty.DeepEval.TaskCompletion", evaluationInput={"sessionSpans": session_span_logs} ) for result in response["evaluationResults"]: print(f"Value: {result.get('value')}") print(f"Explanation: {result.get('explanation', '')}")
기본 평가자에서 파생된 사용자 지정 평가자
사용자 지정 파생 평가자를 사용하여 자체 모델에서 기본 제공 또는 관리형 타사 평가자인 기존 평가자를 실행합니다. 서비스가 선택하는 모델을 사용하는 대신 모델 및 추론 파라미터를 제공합니다. 기본 평가자는 프롬프트와 점수를 제공합니다. 이는 LLM 기반 평가자에게만 적용됩니다.
사용자 지정 파생 평가자를 생성하려면 기본 평가자의 ID와 모델 구성을 evaluatorConfig 사용하여의 derived 멤버를 지정합니다. 다음을 derived_evaluator_config.json으로 저장합니다.
{ "derived": { "baseEvaluatorId": "ThirdParty.DeepEval.TaskCompletion", "modelConfig": { "bedrockEvaluatorModelConfig": { "modelId": "global.anthropic.claude-sonnet-4-5-20250929-v1:0", "inferenceConfig": { "temperature": 0.0, "topP": 1.0, "maxTokens": 2048 } } } } }
를 Builtin. ID 대신 ThirdParty. ID로 설정하여 기본 제공 평가자로부터 사용자 지정 평가자를 도출baseEvaluatorId할 수도 있습니다.
AWS CLI를 사용하여 평가자를 생성합니다.
aws bedrock-agentcore-control create-evaluator \ --evaluator-name 'my_task_completion' \ --evaluator-config file://derived_evaluator_config.json
결과 평가자는를 로 evaluatorType 설정했습니다CustomDerived. 서비스는 기본 평가자, AWS 즉 기본 평가자 또는 Builtin. 기본 평가자의 공급자 이름에서 provider 자동으로 파생됩니다ThirdParty.. 를 설정하지 않은 경우 level- 서비스는 기본 평가기에서 추출하며에서 읽기 전용입니다GetEvaluator. 기본 평가자가 둘 다 소유하기 ratingScale 때문에 instructions 또는를 설정하지 않습니다.
평가자를 생성한 후 다른 사용자 지정 평가자와 똑같이 사용합니다. 즉, 평가자 ID를에 전달Evaluate하거나 온라인 또는 배치 평가 evaluators 목록에 추가합니다.
-
모델:를 통해 설정된 모든 Bedrock 모델
bedrockEvaluatorModelConfig. -
추론 소유권: 모델은 온라인 평가를 위한 실행 역할 또는 온디맨드 평가를 위한 호출자의 자격 증명인 자체 AWS 계정 및 자격 증명을 사용하여 실행됩니다. 이는 서비스가 자체 용량으로 모델을 실행하는 관리형 타사 평가자와의 주요 차이점입니다.
-
품질 소유권: 모델을 선택하기 때문에 평가 품질은 해당 선택을 반영합니다. 서비스는 각 지표에 대해 모델을 검증하지 않습니다.
결과
타사 평가자는 동일한 위치에서 기본 제공 평가자 및 사용자 지정 평가자와 동일한 결과 셰이프를 반환합니다. 자세한 내용은 결과 및 출력을 참조하세요.
초기 평가자 세트
시작 시 다음 평가자를 사용할 수 있습니다.
DeepEval
| 지표 | 확인 내용 |
|---|---|
|
편향 |
출력에 성별, 정치적, 인종적 또는 지리적 편향이 표시되는지 여부. |
|
유해성 |
출력에 공격, 모의, 증오 또는 위협이 포함되어 있는지 여부. |
|
PIILeakage |
응답이 개인 정보를 노출하는지 여부입니다. |
|
요약 |
요약이 충실하고 포괄적인지 여부. |
|
TaskCompletion |
에이전트가 사용자의 목표를 달성했는지 여부. |
|
ConversationCompleteness |
대화 전반의 모든 사용자 요청이 처리되었는지 여부입니다. |
|
KnowledgeRetention |
에이전트가 이전에 공유된 정보를 기억했는지 여부입니다. |
|
TurnRelevancy |
각 응답이 이전 턴과 관련이 있는지 여부입니다. |
|
GoalAccuracy |
에이전트가 멀티턴 대화에서 목표를 달성했는지 여부. |
|
ToolUse |
에이전트가 올바른 도구를 선택하고 올바른 인수를 전달했는지 여부입니다. |
AutoEval
| 지표 | 확인 내용 |
|---|---|
|
보안 |
응답이 악성인지 여부입니다. |
|
유머 |
응답이 재미있는지 여부입니다. |
|
가능한 |
에이전트가 솔루션을 시도했는지 아니면 작업을 불가능하게 선언했는지 여부입니다. |
콘솔
평가자 선택기에서 타사 평가자는 기본 제공 평가자 그룹과 별도로 공급자별로 그룹화된 자체 타사 평가자 섹션에 나타납니다. 이 섹션은 기본적으로 축소되어 있습니다.
기본 평가자에서 파생된 사용자 지정 평가자를 생성하려면 기존 사용자 지정 평가자 생성 흐름을 사용하고 타사 라이브러리를 평가자 정의 유형으로 선택합니다. 기본 평가자가 프롬프트와 점수를 소유하므로이 옵션은 LLM-as-a-judge에 표시된 지침 및 조정 섹션을 제거합니다. 라이브러리와 지표를 선택한 다음 모델 및 추론 파라미터를 제공합니다. 평가 수준은 지표에 의해 설정된 읽기 전용으로 표시됩니다.