Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning
本综述通过将算法设计分为 MDP 构建、探索和学习阶段,提出了一个用于大语言模型强化学习的模块化框架,揭示了研究在无评论家策略梯度(critic-free policy gradients)和蒙特卡洛方法(Monte Carlo methods)方面存在显著的研究偏差,同时强调了在基于价值(value-based)、离策(off-policy)以及自助法(bootstrapping)技术领域尚未被充分探索的机遇。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个非常聪明但极其刻板的(大语言模型,即 LLM)学生如何写一篇完美的论文、解决一道复杂的数学题或编写一段代码。你不能在他们每输入一个词时都给出一个分数,而是要等到他们完成整个任务后,才说:“做得好!”或者“再试一次。”
这就是人工智能中**强化学习(Reinforcement Learning, RL)**的核心挑战:当你只能在最后才得到反馈,且这种反馈是延迟且稀疏的时候,你该如何教导一个学生?
这篇论文是一份巨大的“地图”或“综述”,它整理了研究人员试图解决这一问题的各种方法。作者认为,虽然目前大家都在使用一些流行的技术(如 PPO 和 GRPO),但来自机器人技术和游戏 AI 世界的整个工具箱中,还有许多尚未尝试过的技术。他们将这个问题分解为四个主要阶段,就像盖房子一样:
1. 打下基础:定义游戏(构建 MDP)
在 AI 开始学习之前,你必须定义游戏的规则。论文称之为创建“马尔可夫决策过程”(Markov Decision Process, MDP)。
- 奖励(成绩): 这是最重要的部分。如果你告诉 AI “要乐于助人”,你如何衡量这一点?
- 论文的洞察: 大多数人使用“奖励模型”(一个通过预测人类喜好而训练的第二个 AI)或简单的规则(例如,“代码是否运行成功?”)。
- 陷阱: 有时 AI 会以一种“聪明”但错误的方式行事。如果你奖励它写长回答,它可能会为了获得高分而写一堆废话。这被称为奖励作弊(Reward Hacking)。论文警告说,如果你的规则不完美,AI 会找到漏洞。
- 状态(上下文): AI 需要知道它已经写了什么。通常,这只是目前为止的文本。但如果文本变得太长,AI 就会感到不堪重负。一些研究人员正尝试对过去的内容进行总结或隐藏部分内容,以保持 AI 的专注。
- 动作(下一个词): 通常,AI 可以从它的词典中选择任何词。一些研究人员正试图限制这种选择(例如,强制 AI 只能选择符合特定语法的词),以使学习更容易。
- 结束(终止): AI 何时停止?通常,当它输入一个特殊的“句子结束”标记时,它就会停止。但有时 AI 会说得太多。论文指出,研究人员正在实验一些方法,以便在不直接切断 AI 的情况下告诉它:“当你完成时就停下来。”
2. 猜测的艺术:探索(Exploration)
AI 起初一无所知。它必须尝试不同的做法来观察哪些有效。这被称为探索。
- 温度(掷骰子): 想象 AI 正在选择一个词。如果你将“温度”设置得较低,它会选择最安全、最显而易见的词。如果你将其设置得较高,它会进行更狂野的猜测。这是让 AI 尝试新事物最简单的方法。
- 熵(“不要无聊”奖励): 为了防止 AI 陷入重复说同样安全词汇的循环,研究人员会增加一个关于“不确定性”或“多样性”的奖励。这就像告诉学生:“如果你尝试不同的方法,即使可能会失败,我也会给你额外的加分。”
- 好奇心(内在动力): 如果 AI 仅仅因为尝试了它从未见过的事物而获得奖励,会怎样?有些方法会给 AI 一个“好奇心得分”,奖励它尝试新的路径,即使它还没有得到完美的答案。
- 树搜索(“如果……会怎样”的游戏): 与其一次只写一句话,不如想象 AI 像树一样分支。它写出三句不同的句子,观察它们的走向,然后选择最好的路径。这就像棋手在思考三步之后的棋局。
- 课程学习(阶梯): 不要从博士论文开始。从幼儿园的故事开始。这种方法先教 AI 简单的题目,然后逐渐增加难度,这样它就不会感到气馁。
3. 学习过程:AI 如何改进
一旦 AI 尝试了一些事情并得到了反馈,它究竟是如何学习的呢?论文将其归纳为四个大类:
- 无模型 vs. 基于模型(Model-Free vs. Model-Based):
- 无模型: AI 只记住“我做了 X,得到了好成绩。下次我再做 X。”它通过试错来学习。这是目前大多数 AI 的做法。
- 基于模型: AI 首先尝试建立一个关于世界的心理地图(“如果我说 X,通常会发生 Y”),然后根据这个地图进行规划。这更难,但效率更高。
- 基于价值、基于策略 vs. 演员-评论家(Value-Based vs. Policy-Based vs. Actor-Critic):
- 基于策略: AI 只是学习一套旨在获得好成绩的习惯(“策略”)。
- 基于价值: AI 在行动之前,先学习预测“当前情况有多好?”
- 演员-评论家: 一种团队协作方式。一部分(演员/Actor)决定做什么,第二部分(评论家/Critic)判断该决定有多好。论文指出,虽然“演员-评论家”是机器人领域的金标准,但目前大多数 AI 研究人员使用的是“无评论家”的方法,因为这类方法在大型计算机上运行成本更低。
- 同策略 vs. 异策略(On-Policy vs. Off-Policy):
- 同策略: AI 只从它刚刚做的精确事情中学习。如果它犯了错,它会丢弃这些数据并重新尝试。这很安全但很浪费。
- 异策略: AI 从它过去的错误和成功中学习,即使它现在使用的是略微不同的策略。这就像学生复习旧试卷以从错误中学习。论文指出,尽管这在其他领域是一个巨大的优势,但目前很少有 AI 研究人员在这样做。
- 信用分配(谁该获得荣誉?):
- 如果 AI 写了一篇 100 词的论文并得到了“A”,哪 5 个词是最重要的?
- 当前的默认做法: 大多数方法只是说“整篇论文做得好!”,并将功劳平等地分配给每一个词。
- 差距: 论文认为,我们需要更好的方法来确定究竟是哪些词导致了成功,特别是在处理长篇、复杂的推理任务时。
4. 大局观:缺失了什么?
作者的主要结论是,该领域是不平衡的。
- 拥挤处: 几乎所有人都在使用相同的几种工具(无评论家方法、蒙特卡洛信用分配)。这就像城市里的每个人都在同一条路上驾驶同一款型号的汽车。
- 空置地: 在强化学习的世界里,存在着许多宽阔平坦的道路(如异策略学习、基于价值的方法和自助法/Bootstrapping),但在 AI 的世界里,这些路完全是空的。
- 机遇: 论文建议,通过借鉴强化学习广泛领域中这些“被遗忘”的技术,我们或许能够让 AI 更好地推理、学得更快,并且在不需要那么多计算能力的情况下处理更难的任务。
简而言之: 这篇论文是在呼吁停止重复造轮子。它说:“我们正在使用非常狭窄的工具集来训练 AI。在其他领域,有一个充满强大工具的仓库,我们应该开始尝试它们。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。