← 最新论文
💻 computer science

Boosting Reasoning in Large Multimodal Models via Activation Replay

本文提出了“激活回放”(Activation Replay),这是一种无需训练的方法,通过操纵视觉标记以回放来自基座模型的低熵激活,从而增强经由可验证奖励强化学习(RLVR)训练的大型多模态模型的推理能力,且无需进行昂贵的策略优化即可提升在多样化任务中的表现。

原作者: Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,新一代计算机系统已经出现,它们能够像人类一样观察并理解世界。这些大型多模态模型可以查看照片、观看视频或阅读图表,然后根据所见内容回答问题或解决问题。多年来,研究人员一直试图教会这些系统进行更深层次的思考,从简单的模式匹配转向真正的推理。实现这一目标的一种流行方法涉及一种训练技术,即只有当计算机能够通过长篇累牍的逐步解释证明其答案正确时,才会获得奖励。这种方法成功地鼓励了这些模型在开口说话之前先停顿并思考,在数学和逻辑谜题方面取得了令人印象深刻的成果。然而,尽管结果是显而易见的,但这种训练如何改变模型“大脑”的内部机制仍然是一个谜。科学家们尚未完全理解这种训练是如何改变模型处理信息的方式,特别是在它第一次观察图像时。

一个研究小组致力于通过在模型解决问题时观察其内部处理层来揭示这些隐藏的变化。他们发现,这种训练方法虽然有效,却在不经意间以一种特定且出人意料的方式转移了模型的内部焦点。当模型被训练去验证自己的答案时,其内部系统中通常非常自信且清晰的部分变得略显困惑或发生了改变。相比之下,那些天生具有不确定性或正在探索不同可能性的系统部分则基本保持原样。研究人员发现,这种在自信部分发生的特定偏移实际上阻碍了模型正确推理的能力。这就像是训练不小心扰乱了模型理解视觉世界时所使用的最可靠信号,迫使它依赖于不太确定的路径来得出结论。

为了解决这个问题,该团队开发了一种简单的新方法,称为“激活重放”(Activation Replay)。他们并没有选择重新训练整个模型(因为这会极其昂贵且耗时),而是找到了一种方法,在模型解决问题的瞬间,轻轻地将其推回原始、清晰的状态。当模型接收到图像时,研究人员会临时调整来自系统视觉部分的内部信号。他们通过从模型原始的、未经训练的版本中借用清晰、自信的信号,并将这些信号重放到经过训练的版本中来实现这一点。这个过程就像是一个校正机制,确保模型对图像的初步理解在开始其长链条推理之前保持锐利且可靠。研究人员在各种复杂任务上测试了这种方法,包括解决几何问题、在高分辨率图像中导航以寻找特定物体,以及推理视频中的事件序列。

结果显示,这种简单的调整在所有这些不同场景下都一致地提高了模型的性能。通过恢复初始视觉信号的清晰度,模型能够解决之前错过的难题,并避免其逐步推理过程中的错误。在一个关于一根线圈被塑造成圆形后又变成梯形的数学问题测试中,经过训练的模型最初在中间步骤中犯了一个错误,导致了错误的答案。使用这种新方法后,模型纠正了其内部推理路径,并得到了正确的解。研究人员还发现,这种方法有助于模型在多次尝试时生成更多样化的正确答案,这表明它不仅仅是在记忆单一路径,而是真正更好地理解了问题。这项工作表明,提升这些先进系统推理能力的关键或许并不总是更复杂的训练,而是保持模型对世界初始感知的清晰度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →