翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
サードパーティー評価者
AgentCore Evaluations は、DeepEval および AutoEval オープンソースライブラリから評価者を提供します。これらのライブラリを既に使用している場合は、AgentCore Evaluations 内で同じメトリクスを実行できます。サービスはホスティングと評価コードをお客様に代わって処理します。マネージドオプションを使用すると、サービスは組み込み評価者の場合と同じ方法でモデルを選択し、推論を実行します。
サードパーティー評価者を使用するには、次の 2 つの方法があります。
-
マネージド – ID でサードパーティー評価者を選択し、デプロイします。サービスはそれを実行し、モデルを選択し、ライブラリのバージョンを管理します。
-
カスタム – 組み込みまたはマネージド型のサードパーティー評価者である既存の評価者のロジックを独自のモデルと推論で実行する評価者を作成します。詳細については、「ベースエバリュエーターから派生したカスタムエバリュエーター」を参照してください。
評価者の品質
AgentCore 組み込み評価者は、パフォーマンスについてテストおよびベンチマークされます。DeepEval と AutoEval はオープンソースの評価者であり、その品質については主張しません。
評価者 ID
2 つのフィールドが一緒になって、サードパーティーの評価者を含むすべての評価者を識別します。
-
evaluatorType- リソースの種類: リソースを提供するユーザーとその方法。BuiltinおよびThirdPartyは、参照するが作成しない AWSマネージド型グローバルエバリュエーターです。Custom、CustomCode、CustomDerivedは、作成するエバリュエーターです。 -
provider– 評価ロジックのソース:AWSAWSが作成した評価者DeepEvalAutoEval用、対応するサードパーティーライブラリ用、または自分で作成した評価者Custom用。
2 つのフィールドは独立しているため、各評価者は 1 つの(evaluatorType, provider)ペアです。
| 評価者 | evaluatorType | provider |
|---|---|---|
|
マネージド組み込み |
|
|
|
マネージドサードパーティー |
|
|
|
組み込み から派生したカスタム評価者 |
|
|
|
サードパーティー評価者から派生したカスタム評価者 |
|
|
|
カスタムコードベースの評価者 |
|
|
|
カスタム LLM-as-a-judge 評価者 |
|
|
マネージドサードパーティー評価者の ID は、 ThirdParty.DeepEval.TaskCompletionや などのThirdParty.<Provider>.<Metric>形式に従いますThirdParty.AutoEval.Security。これは、ファーストパーティの組み込み評価者に使用されるBuiltin.<Metric>形式を反映しています。
利用可能な評価者を確認する
サードパーティーの評価者は、アカウント内のサードパーティーの組み込み評価者およびカスタム評価者とともに ListEvaluators API によって返されます。
{ "evaluators": [ { "evaluatorId": "Builtin.Helpfulness", "evaluatorType": "Builtin", "provider": "AWS", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.DeepEval.TaskCompletion", "evaluatorType": "ThirdParty", "provider": "DeepEval", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.AutoEval.Security", "evaluatorType": "ThirdParty", "provider": "AutoEval", "level": "TRACE", "status": "ACTIVE" } ] }
マネージドサードパーティー評価者
マネージド型のサードパーティー評価者を組み込み評価者とまったく同じように使用します。ID で選択すると、サービスは運用するモデルで実行します。モデル、プロンプト、または設定を指定しません。
-
モデル: マネージドサードパーティー評価者は、Amazon Bedrock AgentCore の組み込み評価者と同じモデルで実行されます。モデルフィールドも、設定するモデル設定もありません。
-
バージョニング: マネージドサードパーティー評価者のバージョン選択はありません。このサービスは、検証したライブラリバージョンを実行し、アップグレード自体を管理します。
マネージドサードパーティー評価者の ID は、組み込み評価者 ID を渡す任意の場所に渡すことができます。
次の例では、 Evaluate API を使用してマネージドサードパーティー評価者を実行します。
import boto3 client = boto3.client('bedrock-agentcore') response = client.evaluate( evaluatorId="ThirdParty.DeepEval.TaskCompletion", evaluationInput={"sessionSpans": session_span_logs} ) for result in response["evaluationResults"]: print(f"Value: {result.get('value')}") print(f"Explanation: {result.get('explanation', '')}")
ベースエバリュエーターから派生したカスタムエバリュエーター
カスタム派生評価者を使用して、組み込みまたはマネージドのサードパーティー評価者である既存の評価者を独自のモデルで実行します。サービスが選択するモデルを使用する代わりに、モデルと推論パラメータを指定します。基本評価者はプロンプトとスコアリングを提供します。これは LLM ベースの評価者にのみ適用されます。
カスタム派生評価者を作成するには、基本評価者の ID とモデル設定evaluatorConfigで derivedのメンバーを指定します。次を derived_evaluator_config.json として保存します。
{ "derived": { "baseEvaluatorId": "ThirdParty.DeepEval.TaskCompletion", "modelConfig": { "bedrockEvaluatorModelConfig": { "modelId": "global.anthropic.claude-sonnet-4-5-20250929-v1:0", "inferenceConfig": { "temperature": 0.0, "topP": 1.0, "maxTokens": 2048 } } } } }
を Builtin. ID ではなく ThirdParty. ID baseEvaluatorIdに設定することで、組み込み評価者からカスタム評価者を取得することもできます。
AWS CLI を使用して評価者を作成します。
aws bedrock-agentcore-control create-evaluator \ --evaluator-name 'my_task_completion' \ --evaluator-config file://derived_evaluator_config.json
結果の評価者は を evaluatorTypeに設定しましたCustomDerived。サービスは、ベース評価者からprovider自動的に取得されます。ベースAWSの場合は 、Builtin. またはベースの場合はプロバイダー名ですThirdParty.。設定しない level— サービスはベースエバリュエーターから派生し、 では読み取り専用ですGetEvaluator。基本評価者が両方を所有ratingScaleしているため、 instructionsまたは も設定しません。
評価者を作成したら、他のカスタム評価者とまったく同じものを使用します。評価者 ID を に渡すかEvaluate、オンライン評価またはバッチ評価evaluatorsのリストに追加します。
-
モデル: Bedrock モデル。 で設定します
bedrockEvaluatorModelConfig。 -
推論の所有権: モデルは、オンライン評価の実行ロール、またはオンデマンド評価のための発信者の認証情報など、独自の AWS アカウントと認証情報を使用して実行されます。これは、サービスが独自の容量でモデルを実行するマネージドサードパーティー評価者との主な違いです。
-
品質の所有権: モデルを選択すると、評価品質はその選択を反映します。このサービスは、各メトリクスに対してモデルを検証しません。
結果
サードパーティーの評価者は、組み込みおよびカスタムの評価者と同じ結果シェイプを同じ場所に返します。詳細については、「結果と出力」を参照してください。
評価者の初期セット
起動時に以下の評価者が利用できます。
DeepEval
| メトリクス | チェックする事柄 |
|---|---|
|
Bias (バイアス) |
出力が性別、政治的、人種的、地理的バイアスを示しているかどうか。 |
|
有害性 |
出力に攻撃、嘲笑、憎悪、脅威が含まれているかどうか。 |
|
PIILeakage |
レスポンスで個人情報が公開されているかどうか。 |
|
要約 |
概要が忠実で包括的かどうか。 |
|
TaskCompletion |
エージェントがユーザーの目標を達成したかどうか。 |
|
ConversationCompleteness |
会話中のすべてのユーザーリクエストが対応されたかどうか。 |
|
KnowledgeRetention |
エージェントが以前に共有した情報を記憶しているかどうか。 |
|
TurnRelevancy |
各返信が前のターンに関連しているかどうか。 |
|
GoalAccuracy |
エージェントが複数ターンの会話で目標を達成したかどうか。 |
|
ToolUse |
エージェントが適切なツールを選択し、正しい引数を渡したかどうか。 |
AutoEval
| メトリクス | チェックする事柄 |
|---|---|
|
セキュリティ |
レスポンスが悪意のあるものであるかどうか。 |
|
ユーモア |
レスポンスが面白いかどうか。 |
|
可能 |
エージェントがソリューションを試みたか、タスクを不可能と宣言したか。 |
コンソール
評価者ピッカーでは、サードパーティー評価者は、組み込みの評価者グループとは別に、プロバイダー別にグループ化された独自のサードパーティー評価者セクションに表示されます。このセクションはデフォルトで折りたたまれています。
ベースエバリュエーターから派生したカスタムエバリュエーターを作成するには、既存のカスタムエバリュエーターの作成フローを使用し、エバリュエーター定義タイプとしてサードパーティーライブラリを選択します。このオプションは、LLM-as-a-judge に表示される命令セクションとスケールセクションを削除します。これは、基本評価者がプロンプトとスコアリングを所有しているためです。ライブラリとメトリクスを選択し、モデルと推論パラメータを指定します。評価レベルは読み取り専用で表示され、 メトリクスによって設定されます。