← 最新论文
🤖 machine learning

ReLaX: Reasoning with Latent Exploration for Large Reasoning Models

该论文提出了 ReLaX 框架,通过利用 Koopman 算子理论线性化大推理模型的潜在动力学并引入动态谱分散(DSD)指标,有效解决了强化学习中的过度确定性问题,从而在多模态及文本推理基准上显著提升了模型的探索能力与推理性能。

原作者: Shimin Zhang, Xianwei Chen, Yufan Shen, Ziyuan Ye, Jibin Wu

发布于 2026-03-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Shimin Zhang, Xianwei Chen, Yufan Shen, Ziyuan Ye, Jibin Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 ReLaX 的新方法,旨在让大型人工智能模型(特别是那些擅长推理的模型)变得更聪明、更有创造力。

为了让你轻松理解,我们可以把训练一个 AI 模型想象成教一个学生做数学题

1. 现在的困境:学生变成了“死记硬背”的机器

目前,为了让 AI 学会推理,研究人员常用一种叫“强化学习”的方法。这就好比老师给学生出题,做对了给奖励,做错了没奖励。

  • 问题出在哪?
    刚开始,学生(AI)会尝试各种解题思路,有的很笨,有的很巧。但随着训练进行,为了稳拿高分,学生会变得极度保守
    • 比喻:这就好比学生发现,只要死记硬背一种“标准解题套路”,就能每次都拿 90 分。于是,他再也不去尝试新的、可能更优的解法了。
    • 后果:他的思维变得僵化(论文里叫“熵崩溃”),遇到稍微变通一点的题目就卡壳,甚至开始胡编乱造(幻觉),因为他只敢走那条最熟悉的老路。

2. 以前的尝试:只盯着“表面”

以前的改进方法,主要是盯着学生写出来的每一个字(Token)

  • 做法:老师强行规定:“你每句话必须多用几个生僻词”或者“你必须多写几种不同的开头”,以此强迫学生保持多样性。
  • 局限:这就像只盯着学生的字迹看。虽然字迹变花哨了,但他脑子里的解题逻辑可能还是僵化的。对于需要看图、看图表的复杂题目(多模态任务),这种“表面功夫”效果很差。

3. ReLaX 的突破:直接观察“大脑内部”的舞蹈

ReLaX 的作者认为,真正的问题不在于学生写了什么字,而在于他**大脑内部的思考过程(潜空间动态)**变得太死板了。

  • 核心创新:Koopman 算子(数学魔法)
    作者用了一种叫"Koopman 算子”的数学工具。

    • 比喻:想象学生的思考过程是一团乱糟糟的、看不见的“烟雾”(非线性动态)。Koopman 算子就像一副神奇的眼镜,戴上它,原本混乱的烟雾瞬间变成了一条条清晰、可预测的直线
    • 通过这副眼镜,研究人员可以量化学生大脑内部思维的“活跃度”和“多样性”。
  • 新指标:DSD(动态光谱分散度)
    作者发明了一个叫 DSD 的指标。

    • 比喻:如果把学生的大脑思维比作一个乐队。
      • 低 DSD:乐队里所有人都在唱同一个音符,单调乏味(思维僵化)。
      • 高 DSD:乐队里有小提琴、鼓、钢琴,大家配合默契但风格各异(思维灵活、充满探索性)。
    • ReLaX 的目标就是奖励那些“乐队演奏”更丰富、更多样化的时刻

4. ReLaX 是怎么工作的?

ReLaX 在训练过程中,不再只盯着最终答案对不对,而是实时监控学生大脑内部的“乐队演奏”:

  1. 戴上眼镜:用 Koopman 算子把 AI 黑盒子里的思考过程“线性化”(变清晰)。
  2. 测量活力:计算 DSD 分数。如果 AI 的思考路径太单一(像复读机),就给它“敲警钟”;如果它尝试了多种不同的思考路径(即使最后答案还没完全确定),就给予鼓励。
  3. 智能平衡:它很聪明,不会为了多样性而多样性。它只鼓励那些有希望拿高分的探索路径。如果一条路走不通,它就不鼓励;如果一条新路很有潜力,它就鼓励 AI 多走几步看看。

5. 结果如何?

实验证明,ReLaX 就像给 AI 装上了一个**“思维弹性训练器”**:

  • 更聪明:在数学、逻辑推理、看图说话等各种测试中,ReLaX 训练出来的模型表现都超过了以前的所有方法。
  • 更稳健:即使题目稍微变一下(比如数字变了、图里的细节变了),它也能灵活应对,而不是像以前那样死板地套用旧公式。
  • 通用性强:无论是纯文字模型,还是能看图的模型,ReLaX 都能发挥作用。

总结

简单来说,以前的 AI 训练像是在逼学生背标准答案,导致学生只会死记硬背。
ReLaX 则是通过一种数学魔法,直接观察并调节学生大脑内部的思考活力,鼓励它多尝试、多探索,从而真正学会了“举一反三”,成为了一个更灵活、更聪明的推理专家。

这就好比从“教学生怎么写字”升级到了“教学生怎么思考”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →