← 最新论文
💻 computer science

DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning

本文提出了DRIFT,这是一种轻量级微调方法,通过将预计算的推理先验注入梯度空间,将纯文本大语言模型的推理能力高效迁移至多模态模型,从而在显著降低计算成本的同时克服朴素参数合并的不稳定性并实现更优越的性能。

原作者: Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有两位截然不同的专家:

  1. 文字巫师:一位才华横溢的数学家,能解决复杂的逻辑谜题并写出逐步解题过程,但一生中从未见过任何图片。
  2. 视觉艺术家:一位才华横溢的艺术家,能完美描述照片、识别物体并理解图表,但在解决隐藏在图像中的数学问题时却感到吃力。

本文的目标是教导视觉艺术家如何像文字巫师那样思考,而无需让他们重返校园接受多年昂贵的训练。

问题:尝试“糟糕的联姻”

此前,研究人员试图通过简单地将这两位专家的“大脑”(即计算机权重)“合并”在一起来结合他们。他们认为:“如果我们混合 50% 的数学巫师大脑和 50% 的艺术家大脑,就能得到一个完美的‘数学 - 艺术家’。”

本文将这种做法称为朴素合并。作者发现,这通常会失败。这就像试图将喷气式发动机粘在自行车上。有时它能稍微起作用,但往往会导致自行车彻底损坏。“数学”部分会被“艺术”部分搞糊涂,而“艺术”部分则会忘记如何观察。最终得到的模型,在数学和视觉识别方面都比之前更差。

解决方案:DRIFT(指南针)

作者提出了一种名为DRIFT(用于微调的方向性推理注入)的新方法。他们不是将两个大脑物理地粘在一起,而是使用一个指南针

以下是该类比的工作原理:

  1. 映射差异:首先,研究人员观察文字巫师与视觉艺术家之间的差异。他们计算出一个“向量”(即方向箭头),该箭头精确地从“艺术家的思考方式”指向“巫师的思考方式”。这个箭头代表了推理先验
  2. 训练旅程:他们让视觉艺术家开始学习,使用一小套图片数学问题(仅 4,000 个示例,与通常所需的数百万个相比微不足道)。
  3. 指南针引导:当艺术家学习时,计算机计算出更新艺术家大脑的常规方式。但在进行更新之前,它会查看指南针(即推理先验)。它会温和地将艺术家的学习方向推向巫师的思考方式。
    • 它不会强迫艺术家变成巫师。
    • 它只是说:“嘿,当你解决这个问题时,试着按照巫师使用的这个特定方向去思考。”

为何这很重要

  • 速度:传统方法教导 AI 进行推理需要海量数据,并需超级计算机训练数天甚至数周。而 DRIFT 仅需约两小时
  • 效率:它不需要庞大的图片数学问题库。由于“指南针”(即预计算的方向)承担了大部分繁重工作,它只需要一小套高质量的示例。
  • 安全性:与“粘合”方法不同,DRIFT 不会破坏艺术家的视觉能力。论文表明,该模型在提升数学能力的同时,并未忘记如何描述图像。

结果

通过使用这个“指南针”来引导训练,视觉艺术家学会了像文字巫师一样逻辑地串联信息。论文证明,这种方法比试图将模型粘合在一起更有效,并且比使用海量数据集从头训练要快得多、便宜得多。

简而言之:DRIFT 不是强行将两个不同的大脑融合成一个混乱的团块,而是利用从另一个大脑创建的地图,温和地将一个大脑引向正确的方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →