这篇论文介绍了一种名为 ReLaX 的新方法,旨在让大型人工智能模型(特别是那些擅长推理的模型)变得更聪明、更有创造力。
为了让你轻松理解,我们可以把训练一个 AI 模型想象成教一个学生做数学题。
1. 现在的困境:学生变成了“死记硬背”的机器
目前,为了让 AI 学会推理,研究人员常用一种叫“强化学习”的方法。这就好比老师给学生出题,做对了给奖励,做错了没奖励。
- 问题出在哪?
刚开始,学生(AI)会尝试各种解题思路,有的很笨,有的很巧。但随着训练进行,为了稳拿高分,学生会变得极度保守。
- 比喻:这就好比学生发现,只要死记硬背一种“标准解题套路”,就能每次都拿 90 分。于是,他再也不去尝试新的、可能更优的解法了。
- 后果:他的思维变得僵化(论文里叫“熵崩溃”),遇到稍微变通一点的题目就卡壳,甚至开始胡编乱造(幻觉),因为他只敢走那条最熟悉的老路。
2. 以前的尝试:只盯着“表面”
以前的改进方法,主要是盯着学生写出来的每一个字(Token)。
- 做法:老师强行规定:“你每句话必须多用几个生僻词”或者“你必须多写几种不同的开头”,以此强迫学生保持多样性。
- 局限:这就像只盯着学生的字迹看。虽然字迹变花哨了,但他脑子里的解题逻辑可能还是僵化的。对于需要看图、看图表的复杂题目(多模态任务),这种“表面功夫”效果很差。
3. ReLaX 的突破:直接观察“大脑内部”的舞蹈
ReLaX 的作者认为,真正的问题不在于学生写了什么字,而在于他**大脑内部的思考过程(潜空间动态)**变得太死板了。
4. ReLaX 是怎么工作的?
ReLaX 在训练过程中,不再只盯着最终答案对不对,而是实时监控学生大脑内部的“乐队演奏”:
- 戴上眼镜:用 Koopman 算子把 AI 黑盒子里的思考过程“线性化”(变清晰)。
- 测量活力:计算 DSD 分数。如果 AI 的思考路径太单一(像复读机),就给它“敲警钟”;如果它尝试了多种不同的思考路径(即使最后答案还没完全确定),就给予鼓励。
- 智能平衡:它很聪明,不会为了多样性而多样性。它只鼓励那些有希望拿高分的探索路径。如果一条路走不通,它就不鼓励;如果一条新路很有潜力,它就鼓励 AI 多走几步看看。
5. 结果如何?
实验证明,ReLaX 就像给 AI 装上了一个**“思维弹性训练器”**:
- 更聪明:在数学、逻辑推理、看图说话等各种测试中,ReLaX 训练出来的模型表现都超过了以前的所有方法。
- 更稳健:即使题目稍微变一下(比如数字变了、图里的细节变了),它也能灵活应对,而不是像以前那样死板地套用旧公式。
- 通用性强:无论是纯文字模型,还是能看图的模型,ReLaX 都能发挥作用。
总结
简单来说,以前的 AI 训练像是在逼学生背标准答案,导致学生只会死记硬背。
而 ReLaX 则是通过一种数学魔法,直接观察并调节学生大脑内部的思考活力,鼓励它多尝试、多探索,从而真正学会了“举一反三”,成为了一个更灵活、更聪明的推理专家。
这就好比从“教学生怎么写字”升级到了“教学生怎么思考”。
这篇论文提出了一种名为 ReLaX (Reasoning with Latent Exploration) 的新框架,旨在解决大型推理模型(LRMs)在基于可验证奖励的强化学习(RLVR)训练中面临的“探索 - 利用”权衡难题。
以下是该论文的详细技术总结:
1. 研究背景与问题 (Problem)
- 核心挑战: 现有的 RLVR 方法(如 GRPO)虽然提升了模型的推理能力,但往往导致策略分布过度集中,引发熵崩溃(Entropy Collapse)。模型过早地收敛到确定性策略,缺乏有效的探索,从而陷入局部最优,限制了推理能力的进一步提升。
- 现有方法的局限: 目前主流方法试图通过在Token 级别增加熵(如奖励重塑、熵正则化、锚定高熵 Token 等)来缓解这一问题。然而,这些方法存在两个主要缺陷:
- 内在冲突: 提高 Token 熵的目标与 RL 自然趋向低熵确定性策略的倾向相冲突。
- 表征不足: 对于多模态大语言模型(MLLMs),跨模态的内部计算与单模态文本输出之间存在错位。仅关注离散的 Token 统计信息无法准确反映模型底层的复杂计算过程,导致在多模态任务中泛化性差。
- 根本原因: 作者认为,熵崩溃只是表象,深层原因是模型控制 Token 生成的**内部计算过程(即潜在状态动力学)**逐渐失去了灵活性,收敛到了僵化的模式。
2. 方法论 (Methodology)
ReLaX 的核心思想是绕过 Token 空间,直接在模型的潜在动力学(Latent Dynamics)层面进行干预和探索。
A. 理论基础:Koopman 算子理论
为了对 LRMs 复杂的非线性潜在动力学进行可处理的分析和干预,作者引入了 Koopman 算子理论。
- 该理论允许将非线性系统的动力学映射到无限维的希尔伯特空间中,使其表现为线性演化。
- 通过构建 Koopman 字典(Koopman Dictionary),可以将模型的高维隐藏状态(Hidden States)线性化,从而能够分析其谱特性。
B. 核心指标:动态谱分散度 (Dynamic Spectral Dispersion, DSD)
作者提出了一个新的度量指标 DSD,用于量化模型内部计算的异质性(Heterogeneity)。
- 定义: DSD 定义为 Koopman 算子特征值模长的方差(DSD(x)=Var(∣Λ∣))。
- 物理意义:
- 高 DSD: 意味着潜在动力学谱分散,模型具有丰富的内在动态模式,能够产生多样化的潜在轨迹,代表良好的探索能力。
- 低 DSD: 意味着谱集中,模型陷入僵化、重复的计算模式,代表熵崩溃。
- 优势: DSD 直接探测模型内部的计算过程,而非表面的 Token 统计,因此能更本质地反映策略的探索能力。
C. 框架实现:ReLaX
ReLaX 将 DSD 整合到 GRPO 的目标函数中,具体包含以下步骤:
- Koopman 字典学习: 在训练初期,利用初始策略采样的潜在状态轨迹,训练一个神经 Koopman 字典(ResKoopNet),将非线性动力学线性化。训练完成后冻结该字典。
- DSD 正则化: 在策略优化过程中,计算每个轨迹的 DSD 分数。
- 目标函数设计:
- 优势塑形(Advantage Shaping): 仅对具有正优势(Positive Advantage)的轨迹施加 DSD 正则化,确保探索发生在能带来奖励的方向上,避免无效探索。
- 自适应 KL 正则化: 为了防止过度分散导致训练不稳定,仅对 DSD 超过特定阈值 ξ 的轨迹施加 KL 惩罚,平衡探索与稳定性。
- 最终目标函数: J(θ)=JGRPO(θ)+αL~xp+β∑DKL,其中 L~xp 是基于优势加权的 DSD 正则化项。
3. 主要贡献 (Key Contributions)
- 提出了 DSD 指标: 首次通过量化潜在动力学的异质性来表征策略探索,突破了仅依赖 Token 统计的局限。
- 构建了 ReLaX 框架: 结合 Koopman 算子理论和 DSD 正则化,提出了一种新的 RLVR 训练范式,有效缓解了 RLVR 中的性能饱和问题。
- 广泛的实验验证: 在 7 个多模态推理基准和 6 个纯文本数学推理基准上进行了测试,证明了 ReLaX 在 3B 和 7B 规模的模型上均优于现有的 Token 级方法。
4. 实验结果 (Results)
- 多模态推理 (VLMs):
- 基于 Qwen2.5-VL 的 ReLaX-7B 在 7 个多模态基准上的平均准确率达到了 53.2%,超越了之前的 SOTA 模型 VL-Rethinker-7B (52.5%)。
- 在 3B 规模上,ReLaX-VL-3B 的表现甚至超过了部分 7B 级别的模型。
- 训练动态: 实验显示,Vanilla GRPO 在训练初期熵和 DSD 迅速下降(陷入僵化),而 ReLaX 能维持较高的 DSD 和受控的熵,从而持续获得性能提升。
- 纯文本数学推理 (LLMs):
- 在 MATH500、AMC、AIME 等基准上,ReLaX 显著优于 GRPO 基线及其他变体(如 DAPO, KL-Cov, FR3E)。
- 例如,在 Qwen2.5-7B-Math 上,ReLaX 的平均分比之前的 SOTA (FR3E) 高出 6.3 分。
- 消融实验与定性分析:
- 证明了 DSD 正则化系数 α 和自适应 KL 机制的重要性。
- 定性案例: ReLaX 模型在自我验证时能调用正确的数学原理(如余弦定理),而仅增加 Token 熵的模型(如 R1-zero-Div)倾向于生成无意义的代码验证(幻觉)。在多模态任务中,ReLaX 对视觉细节变化的鲁棒性更强,而 Token 级方法容易因视觉线索误读而失败。
5. 意义与影响 (Significance)
- 范式转变: 论文证明了通过引导潜在空间(Latent Space)的探索比单纯干预 Token 空间更有效、更原则化。这为理解大模型的推理机制提供了新的视角。
- 解决多模态对齐难题: 由于 DSD 关注的是内部计算动力学,它天然地解决了多模态模型中跨模态计算与文本输出不匹配的问题,显著提升了 MLLMs 的推理泛化能力。
- 可扩展性: ReLaX 不依赖特定的模型架构,适用于不同规模(3B-7B+)和不同模态(文本/多模态)的基础模型,为构建更强大的通用推理模型(AGI)提供了一条可行的技术路径。
总结: ReLaX 通过利用 Koopman 算子理论将复杂的非线性潜在动力学线性化,并引入 DSD 指标来量化和调节模型的内部计算灵活性,成功解决了 RLVR 训练中的熵崩溃问题,显著提升了大型推理模型在复杂任务上的表现。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。