本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
Multi-turn 强化学习
Multi-turn 强化学习 (RL) 训练代理人在一系列步骤中做出正确的决策,而不仅仅是在一个瞬间。代理观察其环境,采取行动,获得奖励,然后移动到新的状态,在许多时间步骤中重复此过程。目标是学习一种策略(模型行为),该策略可以在整个序列中最大限度地提高累积奖励,而不是孤立地针对任何一个步骤进行优化。这种方法越来越多地用于在多步推理和代理任务上训练语言模型,在这种任务中,模型在多个回合中执行工具调用、代码执行或网络搜索等操作,并根据整个序列获得奖励。这与单回合不同 RLHF/RLAIF,在单回合中,奖励一次分配给一个输出。
一个简单的比喻
想象一下,您是一名处理支持请求的客户服务代理。您无法在一封邮件中解决这个问题。你问一些澄清问题,查看客户的账户,尝试修复,检查它是否奏效,如果没有,则进行跟进。最后,客户要么满意,要么不满意。随着时间的推移,你会更好地识别哪个步骤顺序往往会带来良好的解决方案。
Multi-turn RL 以同样的方式训练模型。它不是根据单个响应对模型进行评分,而是让模型跨多个步骤完成任务,并根据整个序列对其进行奖励。该模型会了解对话前期的哪些决定真正重要。
关键术语
-
代理:系统中的决策实体。它观察当前形势,决定采取什么行动,并随着时间的推移学习以改进其策略。实际上,代理由 AI 模型提供支持,但两者并不相同。模型是底层的神经网络;代理是使用它来感知、决策和行动的更广泛的系统。简而言之:处理票证的客户服务代表。
-
Environment/Agentic 应用程序:代理与之互动的所有内容,包括对话历史记录、客户的账户详细信息以及代理可以使用的任何工具。简而言之:支持平台、客户以及销售代表可用的所有信息。
-
状态:代理在决定下一步做什么之前观察到的当前情况的快照。简单来说:销售代表现在知道什么,例如客户的问题、已经尝试过的内容以及最新的回复。
-
操作:代理在每个步骤中执行的操作,例如询问澄清问题、调用工具或发送回复。简而言之:销售代表的下一步行动,无论是问问题、查找内容还是发送修复程序。
-
奖励:代理在每一步或任务结束时收到的反馈信号,表明事情进展如何。简而言之:客户是否满意? 结果就是回报。
-
策略:代理人学到的策略。它将给定状态映射到最有可能带来良好结果的操作。简而言之:销售代表的知识是从经验中积累的,他们知道在给定情况下什么往往行得通。
-
剧集:从头到尾完成一项任务。简而言之:一次全面的支持对话,从客户的第一条消息到解决方案。
-
回合:剧集中的单次交换,通常是代理采取的一项操作及其从环境中收到的响应。在对话中,这是一条消息及其回复。简而言之:在支持对话中迈出一步,比如客服人员提问,客户回答。
-
轨迹:整个剧集中记录的状态、动作和奖励的完整序列。它是代理人所做的事情和结果的完整记录,用于计算奖励和更新政策。简而言之:从头到尾的支持对话的完整记录,包括代理做出的每一个决定以及事情的进展情况。
-
累积奖励:在剧集中所有步骤中累积的总奖励,这是代理人最终想要最大化的奖励。简而言之:不仅仅是一步是否顺利,还包括整个对话总体上是否顺利。
多回合强化学习的用例
Multi-turn 当单个响应不足以很好地完成任务时,RL 是正确的方法。如果你的用例涉及一系列步骤,而决策取决于先前的步骤,那么多回合 RL 值得考虑。
以下是一些指向它的信号:
-
你的任务需要来回互动:模型需要提问、收集信息,并根据一路上学到的内容进行调整。单一的提示-响应周期是不够的。示例:支持人员在提出修复建议之前通过询问后续问题来诊断问题。
-
结果的质量取决于一系列行动:最后要获得正确的答案需要在整个过程中采取正确的行动。如果实现目标的道路很重要,那么仅奖励最终产出是不够的。示例:一个跨多个步骤规划、编写、运行和调试代码的编码助手。
-
模型需要在多个步骤中使用工具:模型调用外部工具,例如搜索、API 或代码执行,而一个工具调用的结果会影响其接下来的工作。示例:研究助理在生成摘要之前搜索信息、评估结果并完善其查询。
-
任务中途的错误应该是可以恢复的:你希望模型识别出何时出现问题并纠正方向,而不是从一开始就走一条错误的道路。示例:代理尝试解决方案,检查其是否有效,如果不起作用,则尝试其他方法。
-
你看到的单回合表现不错,但端到端任务完成率却很差:如果你的模型可以很好地处理各个步骤,但很难将它们组合成连贯的成功结果,那么多回合 RL 可以帮助弥合这一差距。
支持的型号、定价和区域
支持的模型
| 模型 | Region |
|---|---|
| Nova Lite 2.0 | IAD (us-east-1)、PDX (us-west-2) |
| GPT-OSS-20B | IAD (us-east-1)、PDX (us-west-2) |
| Gemma-4-31B-it | PDX (us-west-2) |
| Qwen 3.6 27B | PDX (us-west-2) |
定价
要了解完整的定价详情,请参阅公开定价页面
-
预填充:处理在每个训练步骤开始时输入到模型的输入令牌的成本。这包括提示、对话历史记录以及模型在生成响应之前收到的任何上下文。
-
示例:模型在训练推出期间生成的代币成本。这是模型生成响应的地方,然后对响应进行评估并用于计算奖励信号。
-
训练:向后传球的成本,模型的权重根据奖励信号更新。这是 RL 过程中的核心学习步骤。