View a markdown version of this page

カスタマイズ手法 - Amazon SageMaker AI

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

カスタマイズ手法

カスタマイズ手法は、モデルがデータから学習する方法を定義します。各手法には異なるデータセット形式が必要で、独自のハイパーパラメータがあります。所有しているデータと達成したい動作に基づいて を選択します。

  • SFT (教師ありファインチューニング) — ラベル付きプロンプトとレスポンスのペアをトレーニングします。モデル固有のスタイル、形式、またはドメインの知識を教えるのに最適です。

  • DPO (直接設定の最適化) — 優先レスポンスペアと拒否レスポンスペアをトレーニングします。人間の好みに合わせて望ましくない出力を回避するのに最適です。

  • RFT (強化ファインチューニング) — コードベースの検証 (RLVR) または LLM 審査員 (RLAIF) の報酬シグナルを介して最適化します。事実の精度や主観的な品質を向上させるのに最適です。

  • マルチターン強化学習 (Multi-Turn Reinforcement Learning) — コンテキストが増大する複数ステップのエージェントタスク用にエージェントをトレーニングします。

  • 継続的なカスタマイズ (継続的なカスタマイズ) — 複数の手法を順番に連鎖させます (SFT → DPO → RLVR など)。LoRA トレーニングタイプが必要です。

各手法は、LoRA または FFT トレーニングタイプと組み合わせることができます。どちらを選択するかの詳細については、トレーニングタイプ「」を参照してください。