翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
カスタマイズ手法
カスタマイズ手法は、モデルがデータから学習する方法を定義します。各手法には異なるデータセット形式が必要で、独自のハイパーパラメータがあります。所有しているデータと達成したい動作に基づいて を選択します。
SFT (教師ありファインチューニング) — ラベル付きプロンプトとレスポンスのペアをトレーニングします。モデル固有のスタイル、形式、またはドメインの知識を教えるのに最適です。
DPO (直接設定の最適化) — 優先レスポンスペアと拒否レスポンスペアをトレーニングします。人間の好みに合わせて望ましくない出力を回避するのに最適です。
RFT (強化ファインチューニング) — コードベースの検証 (RLVR) または LLM 審査員 (RLAIF) の報酬シグナルを介して最適化します。事実の精度や主観的な品質を向上させるのに最適です。
マルチターン強化学習 (Multi-Turn Reinforcement Learning) — コンテキストが増大する複数ステップのエージェントタスク用にエージェントをトレーニングします。
継続的なカスタマイズ (継続的なカスタマイズ) — 複数の手法を順番に連鎖させます (SFT → DPO → RLVR など)。LoRA トレーニングタイプが必要です。
各手法は、LoRA または FFT トレーニングタイプと組み合わせることができます。どちらを選択するかの詳細については、トレーニングタイプ「」を参照してください。