

本文為英文版的機器翻譯版本，如內容有任何歧義或不一致之處，概以英文版為準。

# 多迴轉強化學習
<a name="model-customize-mtrl"></a>

多迴轉強化學習 (RL) 會訓練客服人員在一系列的步驟中做出良好的決策，而不只是在單一時刻。代理程式會觀察其環境、採取動作、獲得獎勵並移至新狀態，並在許多時間步驟中重複此程序。目標是學習政策 （模型行為），將整個序列的累積獎勵最大化，而不是單獨最佳化任何一個步驟。此方法越來越常用於訓練多步驟推理和代理程式任務的語言模型，其中模型會跨數個回合採取工具呼叫、程式碼執行或 Web 搜尋等動作，並根據整個序列進行獎勵。這與單迴轉 RLHF/RLAIF 不同，其中獎勵一次指派給一個輸出。

## 簡單類比
<a name="model-customize-mtrl-analogy"></a>

假設您是處理支援票證的客服人員。您不會在一個訊息中解析它。您詢問釐清問題、查詢客戶的帳戶、嘗試修正、檢查是否正常運作，以及追蹤是否正常運作。最後，客戶會留下滿意或沒有。隨著時間的推移，您會更好地識別哪些步驟序列往往導致良好的解決方案。

多轉 RL 以相同的方式訓練模型。它不會在單一回應上為模型評分，而是讓模型跨多個步驟執行任務，並根據整個序列來獎勵它。此模型會了解對話中稍早哪些決策實際上很重要。

## 重要術語
<a name="model-customize-mtrl-terminology"></a>
+ **代理程式：**系統中的決策實體。它會觀察目前的情況、決定要採取的動作，並隨著時間學習以改善其策略。實際上，代理程式是由 AI 模型提供支援，但兩者並不相同。模型是基礎神經網路；代理程式是更廣泛的系統，使用它來感知、決定和採取行動。*簡單來說：處理票證的客戶服務代表。*
+ **環境/基因應用程式：**客服人員與之互動的所有內容，包括對話歷史記錄、客戶帳戶詳細資訊，以及客服人員可以使用的任何工具。*簡單來說：支援平台、客戶，以及代表可用的所有資訊。*
+ **狀態：**客服人員在決定接下來要做什麼之前，所觀察目前情況的快照。*簡單來說：代表目前知道的內容，例如客戶的問題、已嘗試過的內容，以及最新的回覆。*
+ **動作：**客服人員在每個步驟中執行的動作，例如詢問釐清問題、呼叫工具或傳送回應。*簡單來說：代表的下一步，無論是提出問題、查閱內容或傳送修正。*
+ **獎勵：**客服人員在每個步驟或任務結束時收到的意見回饋訊號，指出情況如何。*簡單來說：客戶是否感到滿意？ 該結果是獎勵。*
+ **政策：**客服人員學到的策略。它將指定狀態映射到最有可能帶來良好結果的動作。*簡單來說：代表的知識從經驗累積而來，知道在給定情況下哪些因素容易起作用。*
+ **片段：**從頭到尾完整執行任務。*簡單來說：一次完整的支援對話，從客戶的第一則訊息到解決方案。*
+ **轉彎：**片段內的單一交換，通常由代理程式採取的一個動作，以及從環境收到的回應。在對話中，這是一則訊息及其回覆。*簡單來說：支援對話中的一個步驟，例如詢問問題的客服人員和客戶回應。*
+ **軌跡：**在整個片段中記錄的完整狀態、動作和獎勵序列。這是客服人員所做和結果的完整記錄，用於計算獎勵並更新政策。*簡單來說：支援對話從頭到尾的整個文字記錄，包括客服人員所做的每個決策，以及事情的展開方式。*
+ **累積獎勵：**在事件中的所有步驟中累積的總獎勵，也就是客服人員最終嘗試最大化的項目。*簡單來說：不只是一個步驟是否順利，而是整個對話整體是否順利。*

## 多迴轉強化學習的使用案例
<a name="model-customize-mtrl-use-cases"></a>

當單一回應不足以完成任務集時，多迴轉 RL 是正確的方法。如果您的使用案例涉及一系列步驟，則值得考慮依賴先前步驟的決策，多迴轉 RL。

以下是一些指向它的訊號：
+ **您的任務需要back-and-forth互動：**模型需要提出問題、收集資訊，並根據其在過程中學到的內容進行調整。單一提示回應週期不夠。範例：支援代理程式，透過在建議修正之前詢問後續問題來診斷問題。
+ **結果的品質取決於一系列動作：**在結尾取得正確的答案需要在整個過程中進行正確的移動。如果取得輸出的路徑很重要，則僅獎勵最終輸出是不夠的。範例：編碼助理，可跨多個步驟規劃、寫入、執行和偵錯程式碼。
+ **模型需要跨多個步驟使用工具：**模型會呼叫外部工具，例如搜尋、APIs或程式碼執行，而一個工具呼叫的結果會影響它接下來的動作。範例：在產生摘要之前搜尋資訊、評估結果並精簡其查詢的研究助理。
+ **任務中出現的錯誤應該是可復原的：**您希望模型在某件事無法正常運作且課程正確時識別，而不是從一開始就遞交至錯誤的路徑。範例：嘗試解決方案的代理程式，檢查它是否有效，如果它無效，則嘗試不同的方法。
+ **您看到良好的單迴轉效能，但end-to-end任務完成不佳：**如果您的模型處理良好的個別步驟，但難以將它們串連在一起，形成一致、成功的成果，多迴轉 RL 可以協助彌補該差距。

## 支援的模型、定價和區域
<a name="model-customize-mtrl-supported"></a>

### 支援的模型
<a name="model-customize-mtrl-supported-models"></a>


| 模型 | 區域 | 
| --- | --- | 
| Nova Lite 2.0 | IAD (us-east-1)、PDX (us-west-2) | 
| GPT-OSS-20B | IAD (us-east-1)、PDX (us-west-2) | 
| Gemma-4-31B-it | PDX (us-west-2) | 
| Qwen 3.6 27B | PDX (us-west-2) | 

### 定價
<a name="model-customize-mtrl-pricing"></a>

如需完整定價詳細資訊，請參閱[公有定價頁面](https://aws.amazon.com/sagemaker/ai/pricing/)。費用以三個維度為基礎：
+ **預先填充：**在每個訓練步驟開始時處理饋送至模型的輸入字符的成本。這包括提示、對話歷史記錄，以及模型在產生回應之前收到的任何內容。
+ **範例：**模型在訓練推展期間產生的字符成本。這是模型產生其回應的地方，然後評估並用來計算獎勵訊號。
+ **訓練：**向後傳遞的成本，其中模型的權重會根據獎勵訊號更新。這是 RL 程序中的核心學習步驟。

## 主題
<a name="w2aac29c15c13"></a>
+  [先決條件](model-customize-mtrl-prereqs.md) 
+  [準備您的代理程式](model-customize-mtrl-agent.md) 
+  [建立資產以進行多迴轉強化學習](model-customize-mtrl-assets.md) 
+  [訓練任務提交](model-customize-mtrl-job.md) 
+  [模型評估](model-customize-mtrl-evaluation.md) 
+  [模型部署](model-customize-mtrl-deployment.md) 
+  [超參數參考](model-customize-mtrl-hyperparams.md) 
+  [為多迴轉 RL 任務設定 VPC](model-customize-mtrl-vpc.md) 
+  [用於多迴轉強化學習的靜態加密](model-customize-mtrl-encryption-at-rest.md) 
+  [疑難排解](model-customize-mtrl-troubleshooting.md) 
+  [配額](model-customize-mtrl-quotas.md) 
+  [範例資料集和教學課程](model-customize-mtrl-samples.md) 