View a markdown version of this page

Multi-turn 强化学习 - 亚马逊 SageMaker AI

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

Multi-turn 强化学习

Multi-turn 强化学习 (RL) 训练代理人在一系列步骤中做出正确的决策,而不仅仅是在一个瞬间。代理观察其环境,采取行动,获得奖励,然后移动到新的状态,在许多时间步骤中重复此过程。目标是学习一种策略(模型行为),该策略可以在整个序列中最大限度地提高累积奖励,而不是孤立地针对任何一个步骤进行优化。这种方法越来越多地用于在多步推理和代理任务上训练语言模型,在这种任务中,模型在多个回合中执行工具调用、代码执行或网络搜索等操作,并根据整个序列获得奖励。这与单回合不同 RLHF/RLAIF,在单回合中,奖励一次分配给一个输出。

一个简单的比喻

想象一下,您是一名处理支持请求的客户服务代理。您无法在一封邮件中解决这个问题。你问一些澄清问题,查看客户的账户,尝试修复,检查它是否奏效,如果没有,则进行跟进。最后,客户要么满意,要么不满意。随着时间的推移,你会更好地识别哪个步骤顺序往往会带来良好的解决方案。

Multi-turn RL 以同样的方式训练模型。它不是根据单个响应对模型进行评分,而是让模型跨多个步骤完成任务,并根据整个序列对其进行奖励。该模型会了解对话前期的哪些决定真正重要。

关键术语

  • 代理:系统中的决策实体。它观察当前形势,决定采取什么行动,并随着时间的推移学习以改进其策略。实际上,代理由 AI 模型提供支持,但两者并不相同。模型是底层的神经网络;代理是使用它来感知、决策和行动的更广泛的系统。简而言之:处理票证的客户服务代表。

  • Environment/Agentic 应用程序:代理与之互动的所有内容,包括对话历史记录、客户的账户详细信息以及代理可以使用的任何工具。简而言之:支持平台、客户以及销售代表可用的所有信息。

  • 状态:代理在决定下一步做什么之前观察到的当前情况的快照。简单来说:销售代表现在知道什么,例如客户的问题、已经尝试过的内容以及最新的回复。

  • 操作:代理在每个步骤中执行的操作,例如询问澄清问题、调用工具或发送回复。简而言之:销售代表的下一步行动,无论是问问题、查找内容还是发送修复程序。

  • 奖励:代理在每一步或任务结束时收到的反馈信号,表明事情进展如何。简而言之:客户是否满意? 结果就是回报。

  • 策略:代理人学到的策略。它将给定状态映射到最有可能带来良好结果的操作。简而言之:销售代表的知识是从经验中积累的,他们知道在给定情况下什么往往行得通。

  • 剧集:从头到尾完成一项任务。简而言之:一次全面的支持对话,从客户的第一条消息到解决方案。

  • 回合:剧集中的单次交换,通常是代理采取的一项操作及其从环境中收到的响应。在对话中,这是一条消息及其回复。简而言之:在支持对话中迈出一步,比如客服人员提问,客户回答。

  • 轨迹:整个剧集中记录的状态、动作和奖励的完整序列。它是代理人所做的事情和结果的完整记录,用于计算奖励和更新政策。简而言之:从头到尾的支持对话的完整记录,包括代理做出的每一个决定以及事情的进展情况。

  • 累积奖励:在剧集中所有步骤中累积的总奖励,这是代理人最终想要最大化的奖励。简而言之:不仅仅是一步是否顺利,还包括整个对话总体上是否顺利。

多回合强化学习的用例

Multi-turn 当单个响应不足以很好地完成任务时,RL 是正确的方法。如果你的用例涉及一系列步骤,而决策取决于先前的步骤,那么多回合 RL 值得考虑。

以下是一些指向它的信号:

  • 你的任务需要来回互动:模型需要提问、收集信息,并根据一路上学到的内容进行调整。单一的提示-响应周期是不够的。示例:支持人员在提出修复建议之前通过询问后续问题来诊断问题。

  • 结果的质量取决于一系列行动:最后要获得正确的答案需要在整个过程中采取正确的行动。如果实现目标的道路很重要,那么仅奖励最终产出是不够的。示例:一个跨多个步骤规划、编写、运行和调试代码的编码助手。

  • 模型需要在多个步骤中使用工具:模型调用外部工具,例如搜索、API 或代码执行,而一个工具调用的结果会影响其接下来的工作。示例:研究助理在生成摘要之前搜索信息、评估结果并完善其查询。

  • 任务中途的错误应该是可以恢复的:你希望模型识别出何时出现问题并纠正方向,而不是从一开始就走一条错误的道路。示例:代理尝试解决方案,检查其是否有效,如果不起作用,则尝试其他方法。

  • 你看到的单回合表现不错,但端到端任务完成率却很差:如果你的模型可以很好地处理各个步骤,但很难将它们组合成连贯的成功结果,那么多回合 RL 可以帮助弥合这一差距。

支持的型号、定价和区域

支持的模型

模型 Region
Nova Lite 2.0 IAD (us-east-1)、PDX (us-west-2)
GPT-OSS-20B IAD (us-east-1)、PDX (us-west-2)
Gemma-4-31B-it PDX (us-west-2)
Qwen 3.6 27B PDX (us-west-2)

定价

要了解完整的定价详情,请参阅公开定价页面。费用基于三个维度:

  • 预填充:处理在每个训练步骤开始时输入到模型的输入令牌的成本。这包括提示、对话历史记录以及模型在生成响应之前收到的任何上下文。

  • 示例:模型在训练推出期间生成的代币成本。这是模型生成响应的地方,然后对响应进行评估并用于计算奖励信号。

  • 训练:向后传球的成本,模型的权重根据奖励信号更新。这是 RL 过程中的核心学习步骤。

主题