

本文為英文版的機器翻譯版本，如內容有任何歧義或不一致之處，概以英文版為準。

# 強化微調 (RFT)
<a name="nova-hp-rft"></a>

強化微調 (RFT) 是一種技術，可透過回饋訊號 - 可測量的分數或獎勵指出回應品質 - 而不是直接監督並準確回答，來改善模型效能。與從輸入輸出對中學習的 SFT 不同，RFT 使用獎勵函數來評估模型回應，並反覆最佳化模型以最大化這些獎勵。RFT 同時支援單迴轉和多迴轉訓練：
+ **單迴轉 RFT**：模型會針對提示產生單一回應，而獎勵函數則會對該回應進行評分。最適合具有清晰每個回應品質指標的任務，例如數學、程式碼產生和結構化推理。
+ **多迴轉 RFT**：模型參與多步驟互動 （例如，使用工具的代理工作流程），獎勵函數會評估整體軌跡。最適合需要循序決策的複雜任務，例如多步驟問題解決、工具協同運作和對話客服人員。

**何時使用 RFT**  
當您可以定義明確、可衡量的成功條件，但難以提供確切正確的訓練輸出時，請使用 RFT。RFT 的理想時機：
+ 您有一個可靠的獎勵函數，可以透過程式設計方式評估模型輸出
+ 您需要使模型行為符合特定偏好設定或限制條件
+ 收集高品質的標籤範例非常昂貴或不切實際
+ 存在多個有效的解決方案，但有些解決方案明顯優於其他解決方案 （創造性寫入、程式碼最佳化、複雜推理）

RFT 在可以客觀測量輸出品質的網域中表現卓越：數學問題解決、程式碼產生、科學推理、結構化資料分析、多步驟推理、工具使用量，以及具有特定限制的複雜工作流程。

**支援的模型**  
單迴轉和多迴轉 RFT 適用於下列 Amazon Nova 模型：
+ Nova 2.0 （精簡型）

**何時使用單迴轉 RFT 與多迴轉 RFT**  
當任務是一次性交換時，選擇單迴轉 RFT：模型會收到提示，並產生可自行評分的單一回應，無需追蹤中繼工具呼叫或環境狀態。這適合使用案例，例如分類、擷取、網域特定問答、摘要、內容管制，或任何具有可驗證答案的任務 （完全相符、F1、結構描述驗證、最終輸出上的規則型或 LLM 判斷檢查）。它更簡單、更便宜且執行速度更快，因為每個推展都是單一世代，並且最終會計算一次獎勵。

當任務需要模型在數個步驟中充當代理程式時，請選擇多迴轉 RFT：呼叫工具、讀取和變更狀態，以及適應傳回的內容，然後才能判斷結果。這適合代理式工作流程，例如工具使用序列、多步驟故障診斷、對話助理或任何成功取決於軌跡的任務 （輪流的動作順序和正確性），而不只是最終答案。

經驗法則：如果任務可以從單一模型輸出進行評分，而沒有工具呼叫或不斷發展的狀態，請使用單迴轉 RFT；如果成功取決於對工具或具狀態環境的一系列動作，請使用多迴轉 RFT。

**何時使用 Nova 1.0 與 Nova 2.0**  
RFT 僅適用於 Nova 2.0 Lite。對於 Nova 1.0 模型，請使用直接偏好最佳化 (DPO) 或近端政策最佳化 (PPO) 作為替代對齊技術。

**原因模式**  
Amazon Nova 2.0 支援 RFT 訓練期間的推理模式。下列模式可供使用：
+ **無**：無推理 （省略 reasoning\_effort 欄位）
+ **低**：最低推理開銷
+ **高**：推理功能上限 （指定 reasoning\_effort 時預設為預設值）

**注意**  
RFT 沒有媒體選項。如果組態中沒有 reasoning\_effort 欄位，則會停用推理。