在人工智能飞速发展的世界中,新一代计算机系统已经出现,它们能够像人类一样观察并理解世界。这些大型多模态模型可以查看照片、观看视频或阅读图表,然后根据所见内容回答问题或解决问题。多年来,研究人员一直试图教会这些系统进行更深层次的思考,从简单的模式匹配转向真正的推理。实现这一目标的一种流行方法涉及一种训练技术,即只有当计算机能够通过长篇累牍的逐步解释证明其答案正确时,才会获得奖励。这种方法成功地鼓励了这些模型在开口说话之前先停顿并思考,在数学和逻辑谜题方面取得了令人印象深刻的成果。然而,尽管结果是显而易见的,但这种训练如何改变模型“大脑”的内部机制仍然是一个谜。科学家们尚未完全理解这种训练是如何改变模型处理信息的方式,特别是在它第一次观察图像时。
一个研究小组致力于通过在模型解决问题时观察其内部处理层来揭示这些隐藏的变化。他们发现,这种训练方法虽然有效,却在不经意间以一种特定且出人意料的方式转移了模型的内部焦点。当模型被训练去验证自己的答案时,其内部系统中通常非常自信且清晰的部分变得略显困惑或发生了改变。相比之下,那些天生具有不确定性或正在探索不同可能性的系统部分则基本保持原样。研究人员发现,这种在自信部分发生的特定偏移实际上阻碍了模型正确推理的能力。这就像是训练不小心扰乱了模型理解视觉世界时所使用的最可靠信号,迫使它依赖于不太确定的路径来得出结论。
为了解决这个问题,该团队开发了一种简单的新方法,称为“激活重放”(Activation Replay)。他们并没有选择重新训练整个模型(因为这会极其昂贵且耗时),而是找到了一种方法,在模型解决问题的瞬间,轻轻地将其推回原始、清晰的状态。当模型接收到图像时,研究人员会临时调整来自系统视觉部分的内部信号。他们通过从模型原始的、未经训练的版本中借用清晰、自信的信号,并将这些信号重放到经过训练的版本中来实现这一点。这个过程就像是一个校正机制,确保模型对图像的初步理解在开始其长链条推理之前保持锐利且可靠。研究人员在各种复杂任务上测试了这种方法,包括解决几何问题、在高分辨率图像中导航以寻找特定物体,以及推理视频中的事件序列。
结果显示,这种简单的调整在所有这些不同场景下都一致地提高了模型的性能。通过恢复初始视觉信号的清晰度,模型能够解决之前错过的难题,并避免其逐步推理过程中的错误。在一个关于一根线圈被塑造成圆形后又变成梯形的数学问题测试中,经过训练的模型最初在中间步骤中犯了一个错误,导致了错误的答案。使用这种新方法后,模型纠正了其内部推理路径,并得到了正确的解。研究人员还发现,这种方法有助于模型在多次尝试时生成更多样化的正确答案,这表明它不仅仅是在记忆单一路径,而是真正更好地理解了问题。这项工作表明,提升这些先进系统推理能力的关键或许并不总是更复杂的训练,而是保持模型对世界初始感知的清晰度。
技术摘要:通过激活重放(Activation Replay)提升大型多模态模型的推理能力
1. 问题陈述
基于可验证奖励的强化学习(RLVR)已成为增强大型多模态模型(LMM)推理能力的支配性后训练范式。尽管有效,但 RLVR 改变模型行为的底层机制仍不为人所知。具体而言,目前尚不清楚 RLVR 如何修改 LMM 的内部输入激活,以及这些修改是否会在某些语境下无意中阻碍推理。
作者假设 RLVR 诱发了意料之外的输入激活偏移,特别是影响了低熵激活,这可能会降低推理性能。此外,现有的 RLVR 方法经常面临“推理覆盖范围变窄”的问题,即模型提高了采样效率,但未能激发超出其基座模型之外的新颖推理能力,这可以通过 Pass@K 等指标得到证实。
2. 方法论:激活重放(Activation Replay)
为了解决这些问题,作者提出了激活重放(Activation Replay),这是一种全新的、无需训练的方法,旨在测试时提升多模态推理能力,而无需进行昂贵的策略优化或架构更改。
2.1. 核心机制
该方法通过在测试时操纵视觉标记(visual tokens)来调节 RLVR 后训练 LMM 的低熵激活,迫使其模仿配对的基座 LMM 的分布。
- 可学习标记: 该方法引入了一系列零初始化的可学习标记 {x1,x2,...,xn},这些标记被添加到 RLVR 模型的视觉输入标记中。
- 基于熵的选择: 该方法区分了低熵激活和高熵激活。利用基于基座 LMM 最大熵的动态阈值 τ,识别出低熵激活(如果 el,ib<max(hlb)∗τ,则 Ml,i=1)。
- 最小化 KL 散度: 通过优化这些可学习标记,以最小化基座 LMM 的低熵激活与 RLVR LMM 之间的 Kullback-Leibler (KL) 散度。更新规则为:
xi←xi−α∇xi(DKL(Pbase∥Prlvr)⋅Mi)
其中 α 控制引导强度。
- 测试时应用: 一旦完成优化,这些标记会在任何解码(贪婪搜索或采样)之前被添加到输入中,从而有效地在 RLVR 模型的正向传播过程中“重放”基座模型的低熵激活模式。
2.2. 理论基础
该设计基于两项经验观察:
- Logit Lens 分析: RLVR 会偏移顶层预测和标记级分布,其中低熵激活的偏移程度显著大于高熵激活。
- 扰动与干预研究:
- 扰动: 低熵激活上较小的 KL 散度偏移与正确推理路径的更低困惑度(perplexity)相关。
- 干预: 直接将基座模型的低熵激活注入 RLVR 模型可以提高性能,而注入高熵激活则会降低性能。这表明低熵激活在推理中起到了稳定作用,而 RLVR 可能破坏了这种作用。
3. 主要贡献
- 对 RLVR 效应的系统性调查: 作者详细分析了 RLVR 如何改变 LMM 输入激活,揭示了低熵激活相对于高熵激活受到了不成比例的偏移影响。
- 激活重放: 一种简单的、无需训练的方法,通过重放基座 LMM 的激活来在测试时操纵视觉标记,从而调节 RLVR 的低熵激活。
- 广泛的经验验证: 该方法在多种推理场景中得到了验证,包括数学推理、类 o3 的智能体视觉搜索以及视频推理。
- 缓解推理范围变窄: 该方法被证明可以提升 Pass@K 指标,解决了 RLVR 模型推理覆盖范围可能变窄的问题。
4. 实验结果
作者在多个 RLVR 后训练的 LMM(如 MMR1-Math, MM-Eureka, VL-Rethinker, DeepEyes, Video-R1)上,针对各种基准测试评估了激活重放的效果。
- 数学推理: 在包括 MathVerse, MathVision, WeMath 和 LogicVista 在内的各类数据集上均观察到一致的性能提升。例如,VL-Rethinker-7B 在 MathVerse 上提升了 +2.2,在 MathVision 上提升了 +2.9。
- 智能体推理: 在 HRBench(高分辨率视觉搜索)上,该方法将 DeepEyes-7B 在 H4 基准上的得分从 53.7 提高到了 56.3。
- 视频推理: 对于 Video-R1-7B,该方法在 VideoMMMU (+4.0), MLVU (+1.7) 和 VideoHolmes (+4.4) 上均取得了增益。
- Pass@K: 该方法显著提高了 Pass@K 分数(例如在 Pass@16 上有较大增幅),这表明它扩展了模型的推理边界,而非仅仅提高了采样效率。
- 消融研究:
- 阈值 (τ): 较低的阈值(选择更少、更严格的低熵激活)通常效果更好,证实了重放高熵激活可能会产生负面影响。
- 强度 (α): 较大的引导强度通常能提高性能,验证了核心假设。
5. 重要性与主张
本文声称,激活重放提供了一种切实高效的解决方案,可以在无需承担重新训练计算成本的情况下,增强后训练 LMM 的推理能力。通过识别出 RLVR 会无意中破坏对推理至关重要的低熵激活,作者展示了通过“重放”基座模型的稳定表示可以纠正这些偏差。
作者强调,其方法具有以下特点:
- 将推理增强与训练解耦: 它是一种事后的、测试时的干预手段。
- 跨模态泛化: 它对静态图像、多轮智能体任务以及时序视频推理均有效。
- 提高鲁棒性: 它通过稳定初始上下文处理,缓解了在某些 RLVR 模型中观察到的“过度思考”或推理失败现象。
这项工作表明,可以通过激活操纵来调节 RLVR 模型的“内部运作”,为超越传统策略优化的多模态推理优化提供了新的方向。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。