View a markdown version of this page

多迴轉強化學習 - Amazon SageMaker AI

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

多迴轉強化學習

多迴轉強化學習 (RL) 會訓練客服人員在一系列的步驟中做出良好的決策,而不只是在單一時刻。代理程式會觀察其環境、採取動作、獲得獎勵並移至新狀態,並在許多時間步驟中重複此程序。目標是學習政策 (模型行為),將整個序列的累積獎勵最大化,而不是單獨最佳化任何一個步驟。此方法越來越常用於訓練多步驟推理和代理程式任務的語言模型,其中模型會跨數個回合採取工具呼叫、程式碼執行或 Web 搜尋等動作,並根據整個序列進行獎勵。這與單迴轉 RLHF/RLAIF 不同,其中獎勵一次指派給一個輸出。

簡單類比

假設您是處理支援票證的客服人員。您不會在一個訊息中解析它。您詢問釐清問題、查詢客戶的帳戶、嘗試修正、檢查是否正常運作,以及追蹤是否正常運作。最後,客戶會留下滿意或沒有。隨著時間的推移,您會更好地識別哪些步驟序列往往導致良好的解決方案。

多轉 RL 以相同的方式訓練模型。它不會在單一回應上為模型評分,而是讓模型跨多個步驟執行任務,並根據整個序列來獎勵它。此模型會了解對話中稍早哪些決策實際上很重要。

重要術語

  • 代理程式:系統中的決策實體。它會觀察目前的情況、決定要採取的動作,並隨著時間學習以改善其策略。實際上,代理程式是由 AI 模型提供支援,但兩者並不相同。模型是基礎神經網路;代理程式是更廣泛的系統,使用它來感知、決定和採取行動。簡單來說:處理票證的客戶服務代表。

  • 環境/基因應用程式:客服人員與之互動的所有內容,包括對話歷史記錄、客戶帳戶詳細資訊,以及客服人員可以使用的任何工具。簡單來說:支援平台、客戶,以及代表可用的所有資訊。

  • 狀態:客服人員在決定接下來要做什麼之前,所觀察目前情況的快照。簡單來說:代表目前知道的內容,例如客戶的問題、已嘗試過的內容,以及最新的回覆。

  • 動作:客服人員在每個步驟中執行的動作,例如詢問釐清問題、呼叫工具或傳送回應。簡單來說:代表的下一步,無論是提出問題、查閱內容或傳送修正。

  • 獎勵:客服人員在每個步驟或任務結束時收到的意見回饋訊號,指出情況如何。簡單來說:客戶是否感到滿意? 該結果是獎勵。

  • 政策:客服人員學到的策略。它將指定狀態映射到最有可能帶來良好結果的動作。簡單來說:代表的知識從經驗累積而來,知道在給定情況下哪些因素容易起作用。

  • 片段:從頭到尾完整執行任務。簡單來說:一次完整的支援對話,從客戶的第一則訊息到解決方案。

  • 轉彎:片段內的單一交換,通常由代理程式採取的一個動作,以及從環境收到的回應。在對話中,這是一則訊息及其回覆。簡單來說:支援對話中的一個步驟,例如詢問問題的客服人員和客戶回應。

  • 軌跡:在整個片段中記錄的完整狀態、動作和獎勵序列。這是客服人員所做和結果的完整記錄,用於計算獎勵並更新政策。簡單來說:支援對話從頭到尾的整個文字記錄,包括客服人員所做的每個決策,以及事情的展開方式。

  • 累積獎勵:在事件中的所有步驟中累積的總獎勵,也就是客服人員最終嘗試最大化的項目。簡單來說:不只是一個步驟是否順利,而是整個對話整體是否順利。

多迴轉強化學習的使用案例

當單一回應不足以完成任務集時,多迴轉 RL 是正確的方法。如果您的使用案例涉及一系列步驟,則值得考慮依賴先前步驟的決策,多迴轉 RL。

以下是一些指向它的訊號:

  • 您的任務需要back-and-forth互動:模型需要提出問題、收集資訊,並根據其在過程中學到的內容進行調整。單一提示回應週期不夠。範例:支援代理程式,透過在建議修正之前詢問後續問題來診斷問題。

  • 結果的品質取決於一系列動作:在結尾取得正確的答案需要在整個過程中進行正確的移動。如果取得輸出的路徑很重要,則僅獎勵最終輸出是不夠的。範例:編碼助理,可跨多個步驟規劃、寫入、執行和偵錯程式碼。

  • 模型需要跨多個步驟使用工具:模型會呼叫外部工具,例如搜尋、APIs或程式碼執行,而一個工具呼叫的結果會影響它接下來的動作。範例:在產生摘要之前搜尋資訊、評估結果並精簡其查詢的研究助理。

  • 任務中出現的錯誤應該是可復原的:您希望模型在某件事無法正常運作且課程正確時識別,而不是從一開始就遞交至錯誤的路徑。範例:嘗試解決方案的代理程式,檢查它是否有效,如果它無效,則嘗試不同的方法。

  • 您看到良好的單迴轉效能,但end-to-end任務完成不佳:如果您的模型處理良好的個別步驟,但難以將它們串連在一起,形成一致、成功的成果,多迴轉 RL 可以協助彌補該差距。

支援的模型、定價和區域

支援的模型

模型 區域
Nova Lite 2.0 IAD (us-east-1)、PDX (us-west-2)
GPT-OSS-20B IAD (us-east-1)、PDX (us-west-2)
Gemma-4-31B-it PDX (us-west-2)
Qwen 3.6 27B PDX (us-west-2)

定價

如需完整定價詳細資訊,請參閱公有定價頁面。費用以三個維度為基礎:

  • 預先填充:在每個訓練步驟開始時處理饋送至模型的輸入字符的成本。這包括提示、對話歷史記錄,以及模型在產生回應之前收到的任何內容。

  • 範例:模型在訓練推展期間產生的字符成本。這是模型產生其回應的地方,然後評估並用來計算獎勵訊號。

  • 訓練:向後傳遞的成本,其中模型的權重會根據獎勵訊號更新。這是 RL 程序中的核心學習步驟。

主題