翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
マルチターン強化学習
マルチターン強化学習 (RL) は、エージェントをトレーニングして、1 つの瞬間だけでなく、一連のステップにわたって適切な意思決定を行います。エージェントは環境を観察し、アクションを実行し、報酬を受け取り、新しい状態に移行して、このプロセスを多くの時間ステップで繰り返します。目標は、単独で 1 ステップを最適化するのではなく、シーケンス全体の累積報酬を最大化するポリシー (モデル動作) を学習することです。このアプローチは、複数ステップの推論タスクやエージェントタスクで言語モデルをトレーニングするためにますます使用され、モデルがツール呼び出し、コード実行、ウェブ検索などのアクションを数ターンにわたって実行し、シーケンス全体に基づいて報酬が与えられます。これは、報酬が一度に 1 つの出力に割り当てられるシングルターン RLHF/RLAIF とは異なります。
単純な例
サポートチケットを処理するカスタマーサービスエージェントであるとします。1 つのメッセージで解決することはありません。明確な質問をしたり、顧客のアカウントを検索したり、修正を試したり、問題がないか確認したり、問題がなければフォローアップを行ったりします。最終的に、顧客は満足した状態のままになるか、そうでない状態になります。時間の経過とともに、どのステップシーケンスが適切な解決につながる傾向があるかをよりよく認識できるようになります。
マルチターン RL はモデルを同じ方法でトレーニングします。1 つのレスポンスでモデルをグレーディングする代わりに、モデルは複数のステップにわたってタスクを実行し、シーケンス全体に基づいて報酬を得ることができます。このモデルは、会話の前半でどの決定が実際に重要だったかを学習します。
主要な用語
-
エージェント: システム内の意思決定エンティティ。現在の状況を観察し、実行するアクションを決定し、戦略を改善するために時間の経過とともに学習します。実際には、エージェントは AI モデルを使用していますが、両者は同じではありません。モデルは基盤となるニューラルネットワークであり、エージェントはそれを使用して認識、決定、行動するより広範なシステムです。簡単に言うと、チケットを処理するカスタマーサービス担当者です。
-
環境/エージェントアプリケーション: 会話履歴、顧客のアカウントの詳細、エージェントが使用できるツールなど、エージェントが操作するすべてのもの。簡単に言うと、サポートプラットフォーム、顧客、および販売者が利用できるすべての情報です。
-
状態: エージェントが次に何をすべきかを決定する前に観察した現在の状況のスナップショット。簡単に言うと、顧客の問題、すでに試されているもの、最新の返信など、販売者が現在わかっていることです。
-
アクション: 明確化のための質問、ツールの呼び出し、レスポンスの送信など、各ステップでエージェントが行うこと。簡単に言うと、質問しているか、何かを探しているか、修正を送信しているかにかかわらず、担当者の次の動きです。
-
報酬: 各ステップまたはタスクの終了時にエージェントが受け取るフィードバックシグナルは、状況を示します。簡単に言うと、顧客は満足しましたか? その結果が報酬です。
-
ポリシー: エージェントが学習した戦略。特定の状態を、良い結果につながる可能性が最も高いアクションにマッピングします。簡単に言うと、特定の状況で何が機能する傾向があるかを知る、経験から構築された担当者の知識です。
-
エピソード: 最初から最後までタスクを 1 回完全に実行します。簡単に言うと、お客様の最初のメッセージから解決まで、1 回のフルサポート会話です。
-
ターン: エピソード内の 1 回の交換。通常は、エージェントが実行する 1 つのアクションと、エージェントが環境から受け取るレスポンスです。会話では、これは 1 つのメッセージとその返信です。簡単に言うと、エージェントが質問をしたり、顧客が応答したりするなど、サポート会話の 1 つのステップです。
-
軌跡: エピソード全体で記録された状態、アクション、報酬の完全なシーケンス。これは、エージェントが何をしたか、その結果何が起こったかの完全な記録であり、報酬の計算とポリシーの更新に使用されます。簡単に言うと、エージェントが行ったすべての決定や展開方法など、サポート会話の最初から最後までのトランスクリプト全体です。
-
累積報酬: エピソードのすべてのステップで累積された合計報酬。エージェントが最終的に最大化しようとしているものです。簡単に言うと、1 つのステップがうまくいったかどうかだけでなく、会話全体がうまくいったかどうかもわかります。
マルチターン強化学習のユースケース
マルチターン RL は、1 つのレスポンスだけではタスクをうまく完了できない場合に適したアプローチです。ユースケースに一連のステップが含まれる場合、以前のステップに依存する決定は、マルチターン RL を検討する価値があります。
これを指すシグナルをいくつか示します。
-
タスクにはback-and-forthやり取りが必要です。モデルは質問し、情報を収集し、その過程で学んだことに基づいて適応する必要があります。1 つのプロンプト/レスポンスサイクルだけでは不十分です。例: 修正を提案する前にフォローアップの質問をして問題を診断するサポートエージェント。
-
結果の品質は一連のアクションによって異なります。最後に正しい回答を得るには、全体で適切な動きを行う必要があります。最終出力のみに報酬を与えるだけでは、そこにたどり着くためのパスが重要であれば十分ではありません。例: 複数のステップでコードを計画、書き込み、実行、デバッグするコーディングアシスタント。
-
モデルは複数のステップでツールを使用する必要があります。モデルは検索、APIs、コード実行などの外部ツールを呼び出し、1 つのツール呼び出しの結果が次の処理に影響します。例: 情報を検索し、結果を評価し、サマリーを生成する前にクエリを絞り込む調査アシスタント。
-
タスク中のミスは回復可能である必要があります。最初から間違ったパスにコミットするのではなく、何かが機能せず、正しいタイミングをモデルが認識するようにします。例: ソリューションを試し、それが機能しているかどうかを確認し、機能していない場合は別のアプローチを試すエージェント。
-
単一ターンのパフォーマンスは良好ですがend-to-endのタスク完了は不十分です。モデルが個々のステップを適切に処理しているが、それらを一貫した成功結果にまとめるのに苦労している場合、マルチターン RL はそのギャップを埋めるのに役立ちます。
サポートされているモデル、料金、リージョン
サポートされているモデル
| モデル | リージョン |
|---|---|
| Nova Lite 2.0 | IAD (us-east-1)、PDX (us-west-2) |
| GPT-OSS-20B | IAD (us-east-1)、PDX (us-west-2) |
| Gemma-4-31B-it | PDX (us-west-2) |
| Qwen 3.6 27B | PDX (us-west-2) |
料金
料金の詳細については、パブリック料金ページ
-
事前入力: 各トレーニングステップの開始時にモデルにフィードされた入力トークンを処理するコスト。これには、プロンプト、会話履歴、およびレスポンスを生成する前にモデルが受け取るコンテキストが含まれます。
-
サンプル: トレーニングのロールアウト中にモデルが生成するトークンのコスト。これは、モデルがレスポンスを生成する場所です。レスポンスは評価され、報酬シグナルの計算に使用されます。
-
トレーニング: バックワードパスのコスト。モデルの重みは報酬シグナルに基づいて更新されます。これは RL プロセスの中核的な学習ステップです。