翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
SFT
教師ありファインチューニングは、ラベル付き入出力ペアでモデルをトレーニングして、その動作を特定の例に合わせます。モデルは、トレーニングデータに一致するレスポンスを生成する方法を学習します。
どのようなときに使うか
ターゲットタスクに高品質のプロンプトとレスポンスのペアがある
モデルに特定のスタイル、形式、またはドメインの知識を学習させたい
明確に定義されたタスク (要約、分類、Q&A) に対して一貫した動作が必要である
達成事項
このモデルは、トレーニング例のパターンを模倣し、ラベル付きデータのスタイル、形式、コンテンツに一致する出力を生成する方法を学習します。
データセット形式
SFT は 2 つのデータセット形式をサポートしています。すべてのデータセットは JSONL 形式である必要があります (行ごとに 1 つの JSON オブジェクト)。どちらの形式でもsystemメッセージはオプションです。
形式 1: messages
会話をロールタグ付きメッセージのリストとして表します。含める場合、systemメッセージは最初の要素である必要があります。
{ "messages": [ {"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "..."} ] }
形式 2: prompt/completion
入力と期待される出力を個別のフィールドとして指定し、オプションのトップレベルsystemフィールドを指定します。
{ "system": "...", "prompt": "...", "completion": "..." }
注記
system メッセージはオプションです。プロンプトとレスポンススタイルの多様性を確保します。
ハイパーパラメータ
注記
次の表は、サーバーレスモデルのカスタマイズを使用する際に使用できるハイパーパラメータを示しています。その他のハイパーパラメータは、最適化されたデフォルトを使用して Amazon SageMaker AI によってプリセットされます。SageMaker AI トレーニングジョブまたは HyperPod を使用すると、レシピで使用できるハイパーパラメータの完全なリストにアクセスできます。レシピを取得し、すべてのハイパーパラメータにアクセスするには、SageMaker AI レシピリポジトリ
SFT LoRA
| パラメータ | タイプ | 必須? | 範囲/値 | 説明 |
|---|---|---|---|---|
max_epochs | integer | 必須 | 1–100 | トレーニングデータセットを通過する完全なパスの数。 |
global_batch_size | 整数 | 必須 | 8、16、32、64、128、256、512、1024 | すべてのインスタンスでオプティマイザステップごとに処理されたサンプルの合計。 |
learning_rate | float | 必須 | 5e-07-1e-04 | 最適化中の重み更新のステップサイズ。 |
lr_scheduler | string | 必須 | コサイン、定数 | トレーニング中の学習レート減衰スケジュール。 |
lr_warmup_steps_ratio | float | 必須 | 0~1 | 学習レートを 0 から増やした合計ステップの割合。 |
weight_decay | float | 必須 | 0.0–1.0 | L2 正則化係数。オーバーフィットを防ぐのに役立ちます。 |
gradient_clipping | boolean | 必須 | true、false | 基準がしきい値を超えた場合は、グラデーションをスケールダウンします。 |
gradient_clipping_threshold | float | 必須 | 0.0~5.0 | 最大許容勾配基準。 |
dataset_max_len | 整数 | 必須 | 256~131072 | トークンの最大シーケンス長。長いシーケンスは切り捨てられます。 |
seed | 整数 | 必須 | 0-2147483647 | 再現性のためのランダムシード。 |
logging_steps | 整数 | 必須 | 1–100 | オプティマイザステップでのメトリクスログ記録の頻度。 |
lora_rank | 整数 | 必須 | 8、16、32、64、128 | 低ランクマトリックスのディメンション。Lower = トレーニング可能なパラメータが少なくなります。 |
lora_dropout | float | 必須 | 0.0–1.0 | LoRA アダプターレイヤーのドロップアウト確率。 |
lora_alpha | 整数 | 必須 | 16、32、64、128、256 | LoRA スケーリング係数。有効な LR はアルファ/ランクとしてスケーリングされます。 |
merge_weights | boolean | 必須 | true、false | トレーニング後にLoRA重みをベースモデルにマージします。 |
train_val_split_ratio | float | オプションです。 | 0.0–1.0 | トレーニングと検証に割り当てられた割合。 |
temperature | float | 必須 | 0.0~2.0 | 評価用のサンプリング温度。 |
SFT FFT
| パラメータ | タイプ | 必須? | 範囲/値 | 説明 |
|---|---|---|---|---|
max_epochs | integer | 必須 | 1–100 | トレーニングデータセットを通過する完全なパスの数。 |
global_batch_size | 整数 | 必須 | 8、16、32、64、128、256、512、1024 | オプティマイザステップごとに処理されたサンプルの合計。 |
learning_rate | float | 必須 | 5e-07-1e-04 | 重みの更新のステップサイズ。 |
lr_scheduler | string | 必須 | コサイン、定数 | 学習レート減衰スケジュール。 |
lr_warmup_steps_ratio | float | 必須 | 0~1 | LR ウォームアップのステップの割合。 |
weight_decay | float | 必須 | 0.0–1.0 | L2 正則化係数。 |
gradient_clipping | boolean | 必須 | true、false | 基準がしきい値を超えた場合は、グラデーションをスケールダウンします。 |
gradient_clipping_threshold | float | 必須 | 0.0~5.0 | 最大許容勾配基準。 |
dataset_max_len | 整数 | 必須 | 256~131072 | トークンの最大シーケンス長。 |
max_response_length | 整数 | 必須 | 100~200,000 | 生成されたレスポンスの最大トークン数。 |
seed | 整数 | 必須 | 0-2147483647 | 再現性のためのランダムシード。 |
logging_steps | 整数 | 必須 | 1–100 | メトリクスログ記録の頻度。 |
train_val_split_ratio | float | オプションです。 | 0.0–1.0 | トレーニングと検証に割り当てられた割合。 |
temperature | float | 必須 | 0.0~2.0 | 評価用のサンプリング温度。 |