翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
RFT
強化ファインチューニング (RFT) は、強化学習を使用して、明示的な入出力の例ではなく、報酬シグナルに基づいてモデルの動作を最適化します。Amazon SageMaker AI は、RLVR (検証可能な報酬による強化学習) と RLAIF (AI フィードバックによる強化学習) の 2 つの RFT バリアントをサポートしています。
RLVR
RLVR は、モデル出力が正しいかどうかをプログラムで検証するコードベースの報酬関数を使用します。客観的に正しい回答または間違った回答があるタスクに最適です。
どのようなときに使うか
タスクに検証可能な正しい回答 (数学、コード、事実に関する質問) がある
レスポンスの正確性を評価するスコアリング関数を記述できます。
事実の精度を向上させ、幻覚を減らしたい
データセット形式
各レコードには、プロンプトと報酬モデルのメタデータが含まれます。報酬関数は、トレーニング中にモデルが生成したレスポンスを評価します。
{ "data_source": "openai/gsm8k", "prompt": [ { "content": "Natalia sold clips to 48 of her friends in April, and then she sold half as many clips in May. How many clips did Natalia sell altogether in April and May? Let's think step by step and output the final answer after \"####\".", "role": "user" } ], "ability": "math", "reward_model": { "ground_truth": "72", "style": "rule" } }
必須フィールド:
prompt—roleおよび を使用したメッセージオブジェクトの配列contentreward_model.style— プログラムによる検証"rule"のために を に設定します。reward_model.ground_truth— 検証の正しい回答
プリセット報酬関数
gsm8k— 学年数検証prime_code— コードの正確性の検証prime_math— 数学的推論検証
RLVR LoRA ハイパーパラメータ
注記
次の表は、サーバーレスモデルのカスタマイズを使用する際に使用できるハイパーパラメータを示しています。その他のハイパーパラメータは、最適化されたデフォルトを使用して Amazon SageMaker AI によってプリセットされます。SageMaker AI トレーニングジョブまたは HyperPod を使用すると、レシピで使用できるハイパーパラメータの完全なリストにアクセスできます。レシピを取得し、すべてのハイパーパラメータにアクセスするには、SageMaker AI レシピリポジトリ
| パラメータ | タイプ | 必須? | 範囲/値 | 説明 |
|---|---|---|---|---|
preset_reward_function | string | 必須 | gsm8k、Prime_code、Prime_math | 検証用のプリセット報酬関数。 |
learning_rate | float | 必須 | 2007 年 1 月 7 日~2003 年 1 月 1 日 | 重みの更新のステップサイズ。RL に を低く設定します (例: 1e-5)。 |
lr_warmup_steps_ratio | float | 必須 | 0~1 | LR ウォームアップのステップの割合。 |
max_epochs | 整数 | 必須 | 1–100 | データセットを通過する の数。 |
global_batch_size | 整数 | 必須 | 128、256、512、1024 | オプティマイザステップあたりの合計サンプル数。 |
max_prompt_length | 整数 | 必須 | 512~16384 | プロンプト部分の最大トークン。 |
weight_decay | float | 必須 | 0.0–1.0 | L2 正則化係数。 |
clip_ratio | float | 必須 | 0.1~1.5 | GRPO クリッピングパラメータ。更新ごとにポリシーの変更を制限します。 |
kl_loss_coef | float | 必須 | 0~0.1 | KL 分岐ペナルティの重み。ポリシードリフトを防止します。 |
rollout_n | 整数 | 必須 | 1、2、4、8、16、32 | ロールアウト中のプロンプトあたりの候補レスポンス。 |
rollout_temperature | float | 必須 | 0.01~2.0 | ロールアウト生成の温度。 |
lora_rank | 整数 | 必須 | 8、16、32、64、128 | LoRA ランク。低ランクマトリックスのディメンション。 |
lora_alpha | 整数 | 必須 | 16、32、64、128、256 | LoRA スケーリング係数。有効な LR はアルファ/ランクとしてスケーリングされます。 |
warmup_steps | 整数 | 必須 | -1~100 | 絶対ウォームアップステップ (自動の場合は -1)。 |
min_lr | float | 必須 | 0.0–1.0 | 最小学習レートの下限。 |
clip_ratio_high | float | 必須 | 0.0~0.5 | クリッピングしきい値の上限。 |
clip_ratio_low | float | 必須 | 0.0~0.5 | クリッピングしきい値を低くします。 |
temperature | float | 必須 | 0.0~2.0 | 評価用のサンプリング温度。 |
use_kl_loss | boolean | 必須 | true、false | KL 分岐ペナルティを損失に追加します。 |
train_val_split_ratio | float | オプションです。 | 0.0–1.0 | トレーニング/検証の分割。 |
RLVR FFT ハイパーパラメータ
lora_rank および のない RLVR LoRA と同じパラメータlora_alpha。
RLAIF
RLAIF は、別の LLM を判事として使用して、自然言語の報酬プロンプトに基づいてモデルレスポンスを評価します。プログラムによる評価が難しい主観的な品質基準を持つタスクに最適です。
どのようなときに使うか
品質基準が主観的である (ヘルプフルネス、安全性、トーン)
自然言語で「良い」がどのように見えるかを記述できます。
人間の注釈が提供できる範囲を超えてフィードバックをスケールしたい
データセット形式
各レコードには、プロンプトと報酬モデルのメタデータが含まれます。LLM 判事は、トレーニング中にモデルが生成したレスポンスを評価します。
{ "data_source": "WeOpenML/PandaLM", "prompt": [ { "role": "user", "content": "Below are two responses for a given task...Evaluate the responses and generate a reference answer.\n\n### Instruction:\nCompare the given products..." } ], "ability": "pairwise-judging", "reward_model": { "style": "llmj", "ground_truth": "2\n\n### Reason: Response 2 provides a more detailed comparison..." } }
必須フィールド:
prompt—roleおよび を使用したメッセージオブジェクトの配列contentreward_model.style— LLM-as-judge"llmj"の場合は に設定reward_model.ground_truth— キャリブレーションの判断を参照する
審査員テンプレート
トレーニングコンテナには、次の事前設定された審査員テンプレートが用意されています。judge_prompt_template ハイパーパラメータを使用して 1 つ選択します。
cot.jinja— Chain-of-thought評価evaluate.jinja— 一般的な品質評価faithfulness.jinja— ソースマテリアルへの忠実度summarize.jinja— 要約品質grader.jinja— ルーブリックベースのグレーディング
RLAIF LoRA ハイパーパラメータ
RLVR LoRA と同じパラメータですが、次の違いがあります。
| パラメータ | タイプ | 必須? | 範囲/値 | 説明 |
|---|---|---|---|---|
judge_prompt_template | string | オプションです。 | cot.jinja, evaluate.jinja, faithfulness.jinja, summary.jinja, grader.jinja | LLM 判事評価のテンプレート。を置き換えますpreset_reward_function。 |
RLAIF FFT ハイパーパラメータ
lora_rank および のない RLAIF LoRA と同じパラメータlora_alpha。