← 最新论文
💻 computer science

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

本综述通过将算法设计分为 MDP 构建、探索和学习阶段,提出了一个用于大语言模型强化学习的模块化框架,揭示了研究在无评论家策略梯度(critic-free policy gradients)和蒙特卡洛方法(Monte Carlo methods)方面存在显著的研究偏差,同时强调了在基于价值(value-based)、离策(off-policy)以及自助法(bootstrapping)技术领域尚未被充分探索的机遇。

原作者: Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievsk
发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievski, Shujian Yu, Aske Plaat, Zhaochun Ren, Mark Hoogendoorn, Vincent François-Lavet

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明但极其刻板的(大语言模型,即 LLM)学生如何写一篇完美的论文、解决一道复杂的数学题或编写一段代码。你不能在他们每输入一个词时都给出一个分数,而是要等到他们完成整个任务后,才说:“做得好!”或者“再试一次。”

这就是人工智能中**强化学习(Reinforcement Learning, RL)**的核心挑战:当你只能在最后才得到反馈,且这种反馈是延迟且稀疏的时候,你该如何教导一个学生?

这篇论文是一份巨大的“地图”或“综述”,它整理了研究人员试图解决这一问题的各种方法。作者认为,虽然目前大家都在使用一些流行的技术(如 PPO 和 GRPO),但来自机器人技术和游戏 AI 世界的整个工具箱中,还有许多尚未尝试过的技术。他们将这个问题分解为四个主要阶段,就像盖房子一样:

1. 打下基础:定义游戏(构建 MDP)

在 AI 开始学习之前,你必须定义游戏的规则。论文称之为创建“马尔可夫决策过程”(Markov Decision Process, MDP)。

  • 奖励(成绩): 这是最重要的部分。如果你告诉 AI “要乐于助人”,你如何衡量这一点?
    • 论文的洞察: 大多数人使用“奖励模型”(一个通过预测人类喜好而训练的第二个 AI)或简单的规则(例如,“代码是否运行成功?”)。
    • 陷阱: 有时 AI 会以一种“聪明”但错误的方式行事。如果你奖励它写长回答,它可能会为了获得高分而写一堆废话。这被称为奖励作弊(Reward Hacking)。论文警告说,如果你的规则不完美,AI 会找到漏洞。
  • 状态(上下文): AI 需要知道它已经写了什么。通常,这只是目前为止的文本。但如果文本变得太长,AI 就会感到不堪重负。一些研究人员正尝试对过去的内容进行总结或隐藏部分内容,以保持 AI 的专注。
  • 动作(下一个词): 通常,AI 可以从它的词典中选择任何词。一些研究人员正试图限制这种选择(例如,强制 AI 只能选择符合特定语法的词),以使学习更容易。
  • 结束(终止): AI 何时停止?通常,当它输入一个特殊的“句子结束”标记时,它就会停止。但有时 AI 会说得太多。论文指出,研究人员正在实验一些方法,以便在不直接切断 AI 的情况下告诉它:“当你完成时就停下来。”

2. 猜测的艺术:探索(Exploration)

AI 起初一无所知。它必须尝试不同的做法来观察哪些有效。这被称为探索

  • 温度(掷骰子): 想象 AI 正在选择一个词。如果你将“温度”设置得较低,它会选择最安全、最显而易见的词。如果你将其设置得较高,它会进行更狂野的猜测。这是让 AI 尝试新事物最简单的方法。
  • 熵(“不要无聊”奖励): 为了防止 AI 陷入重复说同样安全词汇的循环,研究人员会增加一个关于“不确定性”或“多样性”的奖励。这就像告诉学生:“如果你尝试不同的方法,即使可能会失败,我也会给你额外的加分。”
  • 好奇心(内在动力): 如果 AI 仅仅因为尝试了它从未见过的事物而获得奖励,会怎样?有些方法会给 AI 一个“好奇心得分”,奖励它尝试新的路径,即使它还没有得到完美的答案。
  • 树搜索(“如果……会怎样”的游戏): 与其一次只写一句话,不如想象 AI 像树一样分支。它写出三句不同的句子,观察它们的走向,然后选择最好的路径。这就像棋手在思考三步之后的棋局。
  • 课程学习(阶梯): 不要从博士论文开始。从幼儿园的故事开始。这种方法先教 AI 简单的题目,然后逐渐增加难度,这样它就不会感到气馁。

3. 学习过程:AI 如何改进

一旦 AI 尝试了一些事情并得到了反馈,它究竟是如何学习的呢?论文将其归纳为四个大类:

  • 无模型 vs. 基于模型(Model-Free vs. Model-Based):
    • 无模型: AI 只记住“我做了 X,得到了好成绩。下次我再做 X。”它通过试错来学习。这是目前大多数 AI 的做法。
    • 基于模型: AI 首先尝试建立一个关于世界的心理地图(“如果我说 X,通常会发生 Y”),然后根据这个地图进行规划。这更难,但效率更高。
  • 基于价值、基于策略 vs. 演员-评论家(Value-Based vs. Policy-Based vs. Actor-Critic):
    • 基于策略: AI 只是学习一套旨在获得好成绩的习惯(“策略”)。
    • 基于价值: AI 在行动之前,先学习预测“当前情况有多好?”
    • 演员-评论家: 一种团队协作方式。一部分(演员/Actor)决定做什么,第二部分(评论家/Critic)判断该决定有多好。论文指出,虽然“演员-评论家”是机器人领域的金标准,但目前大多数 AI 研究人员使用的是“无评论家”的方法,因为这类方法在大型计算机上运行成本更低。
  • 同策略 vs. 异策略(On-Policy vs. Off-Policy):
    • 同策略: AI 只从它刚刚做的精确事情中学习。如果它犯了错,它会丢弃这些数据并重新尝试。这很安全但很浪费。
    • 异策略: AI 从它过去的错误和成功中学习,即使它现在使用的是略微不同的策略。这就像学生复习旧试卷以从错误中学习。论文指出,尽管这在其他领域是一个巨大的优势,但目前很少有 AI 研究人员在这样做。
  • 信用分配(谁该获得荣誉?):
    • 如果 AI 写了一篇 100 词的论文并得到了“A”,哪 5 个词是最重要的?
    • 当前的默认做法: 大多数方法只是说“整篇论文做得好!”,并将功劳平等地分配给每一个词。
    • 差距: 论文认为,我们需要更好的方法来确定究竟是哪些词导致了成功,特别是在处理长篇、复杂的推理任务时。

4. 大局观:缺失了什么?

作者的主要结论是,该领域是不平衡的

  • 拥挤处: 几乎所有人都在使用相同的几种工具(无评论家方法、蒙特卡洛信用分配)。这就像城市里的每个人都在同一条路上驾驶同一款型号的汽车。
  • 空置地: 在强化学习的世界里,存在着许多宽阔平坦的道路(如异策略学习、基于价值的方法和自助法/Bootstrapping),但在 AI 的世界里,这些路完全是空的。
  • 机遇: 论文建议,通过借鉴强化学习广泛领域中这些“被遗忘”的技术,我们或许能够让 AI 更好地推理、学得更快,并且在不需要那么多计算能力的情况下处理更难的任务。

简而言之: 这篇论文是在呼吁停止重复造轮子。它说:“我们正在使用非常狭窄的工具集来训练 AI。在其他领域,有一个充满强大工具的仓库,我们应该开始尝试它们。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →