View a markdown version of this page

サードパーティー評価者 - Amazon Bedrock AgentCore

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

サードパーティー評価者

AgentCore Evaluations は、DeepEval および AutoEval オープンソースライブラリから評価者を提供します。これらのライブラリを既に使用している場合は、AgentCore Evaluations 内で同じメトリクスを実行できます。サービスはホスティングと評価コードをお客様に代わって処理します。マネージドオプションを使用すると、サービスは組み込み評価者の場合と同じ方法でモデルを選択し、推論を実行します。

サードパーティー評価者を使用するには、次の 2 つの方法があります。

  • マネージド – ID でサードパーティー評価者を選択し、デプロイします。サービスはそれを実行し、モデルを選択し、ライブラリのバージョンを管理します。

  • カスタム – 組み込みまたはマネージド型のサードパーティー評価者である既存の評価者のロジックを独自のモデルと推論で実行する評価者を作成します。詳細については、「ベースエバリュエーターから派生したカスタムエバリュエーター」を参照してください。

評価者の品質

AgentCore 組み込み評価者は、パフォーマンスについてテストおよびベンチマークされます。DeepEval と AutoEval はオープンソースの評価者であり、その品質については主張しません。

評価者 ID

2 つのフィールドが一緒になって、サードパーティーの評価者を含むすべての評価者を識別します。

  • evaluatorType - リソースの種類: リソースを提供するユーザーとその方法。 Builtinおよび ThirdPartyは、参照するが作成しない AWSマネージド型グローバルエバリュエーターです。Custom、CustomCode、 CustomDerivedは、作成するエバリュエーターです。

  • provider – 評価ロジックのソース: AWS AWSが作成した評価者DeepEvalAutoEval用、対応するサードパーティーライブラリ用、または自分で作成した評価者Custom用。

2 つのフィールドは独立しているため、各評価者は 1 つの(evaluatorType, provider)ペアです。

評価者 evaluatorType provider

マネージド組み込み

Builtin

AWS

マネージドサードパーティー

ThirdParty

DeepEval、または AutoEval

組み込み から派生したカスタム評価者

CustomDerived

AWS

サードパーティー評価者から派生したカスタム評価者

CustomDerived

DeepEval、または AutoEval

カスタムコードベースの評価者

CustomCode

Custom

カスタム LLM-as-a-judge 評価者

Custom

Custom

マネージドサードパーティー評価者の ID は、 ThirdParty.DeepEval.TaskCompletionや などのThirdParty.<Provider>.<Metric>形式に従いますThirdParty.AutoEval.Security。これは、ファーストパーティの組み込み評価者に使用されるBuiltin.<Metric>形式を反映しています。

利用可能な評価者を確認する

サードパーティーの評価者は、アカウント内のサードパーティーの組み込み評価者およびカスタム評価者とともに ListEvaluators API によって返されます。

{ "evaluators": [ { "evaluatorId": "Builtin.Helpfulness", "evaluatorType": "Builtin", "provider": "AWS", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.DeepEval.TaskCompletion", "evaluatorType": "ThirdParty", "provider": "DeepEval", "level": "TRACE", "status": "ACTIVE" }, { "evaluatorId": "ThirdParty.AutoEval.Security", "evaluatorType": "ThirdParty", "provider": "AutoEval", "level": "TRACE", "status": "ACTIVE" } ] }

マネージドサードパーティー評価者

マネージド型のサードパーティー評価者を組み込み評価者とまったく同じように使用します。ID で選択すると、サービスは運用するモデルで実行します。モデル、プロンプト、または設定を指定しません。

  • モデル: マネージドサードパーティー評価者は、Amazon Bedrock AgentCore の組み込み評価者と同じモデルで実行されます。モデルフィールドも、設定するモデル設定もありません。

  • バージョニング: マネージドサードパーティー評価者のバージョン選択はありません。このサービスは、検証したライブラリバージョンを実行し、アップグレード自体を管理します。

マネージドサードパーティー評価者の ID は、組み込み評価者 ID を渡す任意の場所に渡すことができます。

  • オンデマンド評価 – Evaluate API リクエストで ID を渡します。

  • オンライン評価 – オンライン評価設定evaluatorsのリストに ID を追加します。組み込みおよびカスタム評価者と自由に組み合わせられ、同じサンプリングおよびフィルタリングルールによって管理されます。

  • バッチ評価 – バッチ評価ジョブevaluatorsのリストで ID を渡します。

次の例では、 Evaluate API を使用してマネージドサードパーティー評価者を実行します。

import boto3 client = boto3.client('bedrock-agentcore') response = client.evaluate( evaluatorId="ThirdParty.DeepEval.TaskCompletion", evaluationInput={"sessionSpans": session_span_logs} ) for result in response["evaluationResults"]: print(f"Value: {result.get('value')}") print(f"Explanation: {result.get('explanation', '')}")

ベースエバリュエーターから派生したカスタムエバリュエーター

カスタム派生評価者を使用して、組み込みまたはマネージドのサードパーティー評価者である既存の評価者を独自のモデルで実行します。サービスが選択するモデルを使用する代わりに、モデルと推論パラメータを指定します。基本評価者はプロンプトとスコアリングを提供します。これは LLM ベースの評価者にのみ適用されます。

カスタム派生評価者を作成するには、基本評価者の ID とモデル設定evaluatorConfigで derivedのメンバーを指定します。次を derived_evaluator_config.json として保存します。

{ "derived": { "baseEvaluatorId": "ThirdParty.DeepEval.TaskCompletion", "modelConfig": { "bedrockEvaluatorModelConfig": { "modelId": "global.anthropic.claude-sonnet-4-5-20250929-v1:0", "inferenceConfig": { "temperature": 0.0, "topP": 1.0, "maxTokens": 2048 } } } } }

を Builtin. ID ではなく ThirdParty. ID baseEvaluatorIdに設定することで、組み込み評価者からカスタム評価者を取得することもできます。

AWS CLI を使用して評価者を作成します。

aws bedrock-agentcore-control create-evaluator \ --evaluator-name 'my_task_completion' \ --evaluator-config file://derived_evaluator_config.json

結果の評価者は を evaluatorTypeに設定しましたCustomDerived。サービスは、ベース評価者からprovider自動的に取得されます。ベースAWSの場合は 、Builtin. またはベースの場合はプロバイダー名ですThirdParty.。設定しない level— サービスはベースエバリュエーターから派生し、 では読み取り専用ですGetEvaluator。基本評価者が両方を所有ratingScaleしているため、 instructionsまたは も設定しません。

評価者を作成したら、他のカスタム評価者とまったく同じものを使用します。評価者 ID を に渡すかEvaluate、オンライン評価またはバッチ評価evaluatorsのリストに追加します。

  • モデル: Bedrock モデル。 で設定しますbedrockEvaluatorModelConfig。

  • 推論の所有権: モデルは、オンライン評価の実行ロール、またはオンデマンド評価のための発信者の認証情報など、独自の AWS アカウントと認証情報を使用して実行されます。これは、サービスが独自の容量でモデルを実行するマネージドサードパーティー評価者との主な違いです。

  • 品質の所有権: モデルを選択すると、評価品質はその選択を反映します。このサービスは、各メトリクスに対してモデルを検証しません。

結果

サードパーティーの評価者は、組み込みおよびカスタムの評価者と同じ結果シェイプを同じ場所に返します。詳細については、「結果と出力」を参照してください。

評価者の初期セット

起動時に以下の評価者が利用できます。

DeepEval

メトリクス チェックする事柄

Bias (バイアス)

出力が性別、政治的、人種的、地理的バイアスを示しているかどうか。

有害性

出力に攻撃、嘲笑、憎悪、脅威が含まれているかどうか。

PIILeakage

レスポンスで個人情報が公開されているかどうか。

要約

概要が忠実で包括的かどうか。

TaskCompletion

エージェントがユーザーの目標を達成したかどうか。

ConversationCompleteness

会話中のすべてのユーザーリクエストが対応されたかどうか。

KnowledgeRetention

エージェントが以前に共有した情報を記憶しているかどうか。

TurnRelevancy

各返信が前のターンに関連しているかどうか。

GoalAccuracy

エージェントが複数ターンの会話で目標を達成したかどうか。

ToolUse

エージェントが適切なツールを選択し、正しい引数を渡したかどうか。

AutoEval

メトリクス チェックする事柄

セキュリティ

レスポンスが悪意のあるものであるかどうか。

ユーモア

レスポンスが面白いかどうか。

可能

エージェントがソリューションを試みたか、タスクを不可能と宣言したか。

コンソール

評価者ピッカーでは、サードパーティー評価者は、組み込みの評価者グループとは別に、プロバイダー別にグループ化された独自のサードパーティー評価者セクションに表示されます。このセクションはデフォルトで折りたたまれています。

ベースエバリュエーターから派生したカスタムエバリュエーターを作成するには、既存のカスタムエバリュエーターの作成フローを使用し、エバリュエーター定義タイプとしてサードパーティーライブラリを選択します。このオプションは、LLM-as-a-judge に表示される命令セクションとスケールセクションを削除します。これは、基本評価者がプロンプトとスコアリングを所有しているためです。ライブラリとメトリクスを選択し、モデルと推論パラメータを指定します。評価レベルは読み取り専用で表示され、 メトリクスによって設定されます。