View a markdown version of this page

データセットの評価 - Amazon Bedrock AgentCore

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

データセットの評価

注記

データセットの評価はパブリックプレビューです。機能や APIs、一般提供前に変更される場合があります。

データセット評価を使用すると、一連のシナリオに対してエージェントを実行し、結果を自動的に評価できます。エージェントを手動で呼び出し、スパンを収集し、Evaluate API を呼び出す代わりに、データセットランナーは 1 回の呼び出しでライフサイクル全体をオーケストレーションします。エージェントを呼び出し、テレメトリの取り込みを待ち、評価します。

これは、回帰テスト、ベンチマークデータセット、CI/CD パイプライン、ベースライン測定、設定変更後の前後比較に役立ちます。

AgentCore SDK には、同じデータセットスキーマとグラウンドトゥルース形式を共有するが、評価が行われる場所が異なる 2 つのデータセットランナーが用意されています。

  • オンデマンドデータセットランナー (OnDemandEvaluationDatasetRunner) — スパンを収集し、API クライアント側で評価を呼び出します。開発時の反復や小さなデータセットに最適です。

  • バッチデータセットランナー (BatchEvaluationRunner) — バッチ評価 API を介してスパンの収集と評価をサービスに委任します。大規模なデータセットや本番稼働用ベースラインに最適です。

ランナーの選択

側面 オンデマンドランナー バッチランナー

スパンコレクション

経由の SDK 側 AgentSpanCollector

サーバー側、CloudWatch から直接読み取るサービス

API コールの評価

シナリオevaluate()ごとの評価者あたりの SDK 呼び出し数

SDK が 1 startBatchEvaluation()回呼び出す

実行モデル

同期 3 相パイプライン (呼び出し、待機、評価)

非同期 4 フェーズパイプライン (呼び出し、待機、送信、ポーリング)

結果

シナリオごと、評価者ごとの詳細EvaluationResultで構造化

CloudWatch で評価者ごとの平均とセッションごとの詳細BatchEvaluationSummaryを集計する

適しているチーム

シナリオごとの詳細がすぐに必要な場合、開発時の反復、CI/CD、小さなデータセット

ベースライン測定値、大きなデータセット、前後の比較、集計スコアが十分である場合

前提条件

どちらのランナーにも以下が必要です。

  • Python 3.10 以降

  • サポートされているフレームワークと計測ライブラリで構築されたエージェント。サポートされているフレームワークと計測ライブラリの詳細については、「サポートされているエージェントフレームワーク」を参照してください。

  • オブザーバビリティが有効になっている AgentCore ランタイムにデプロイされたエージェント、またはトランザクション検索を含む AgentCore オブザーバビリティで設定されたサポートされているフレームワークで構築されたエージェント。テレメトリのセットアップの詳細については、「テレメトリのセットアップと配信」を参照してください。

  • AgentCore SDK がインストールされました。 pip install bedrock-agentcore

  • AWS bedrock-agentcore、、bedrock-agentcore-controlおよび logs (CloudWatch) のアクセス許可で設定された 認証情報