← 最新论文
🤖 machine learning

FRISM: Fine-Grained Reasoning Injection via Subspace-Level Model Merging for Vision-Language Models

FRISM 是一种细粒度推理注入框架,它通过奇异值分解将大型推理模型的任务向量进行分解并自适应地调整子空间缩放系数,从而在保持视觉性能的同时有效提升推理能力。

原作者: Chenyu Huang, Peng Ye, Xudong Tan, Jinhan Mu, Shenghe Zheng, Li Shen, Tao Chen

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenyu Huang, Peng Ye, Xudong Tan, Jinhan Mu, Shenghe Zheng, Li Shen, Tao Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有两位截然不同的专家:

  1. 视觉艺术家:一个擅长观察图片、描述所见内容并从视觉角度理解世界的模型。但如果你问它一个棘手的数学问题,它可能只会猜测或给出一个简单答案。
  2. 逻辑巫师:一个擅长解决复杂谜题、进行数学运算并通过困难步骤进行推理的模型。但如果你给它看一张图片,它可能无法很好地“看见”它,或者会忽略视觉细节。

本文的目标是将这两位专家融合成一位超级专家,既能完美地看见,又能深入地思考

问题:“钝刀”方法

此前,科学家们试图通过将两个模型的“大脑”逐层平均来混合它们。这就像试图用勺子舀起“逻辑巫师”大脑的一层,然后一层层地倒入“视觉艺术家”的大脑中,以此混合一碗汤。

问题在于:这种方法太粗糙了。

  • 如果加入太多“逻辑”,模型就会开始忘记如何识别图像(它变成了一个失明的天才)。
  • 如果加入太少“逻辑”,模型虽然仍擅长看图像,却依然无法解决难题。
  • 这就像试图只通过调节音量旋钮来调谐收音机;你无法在消除杂音的同时获得完美的频道。

解决方案:FRISM(“手术刀”)

作者提出了一种名为FRISM的新方法。他们不使用一次性混合整个大脑的方式,而是采用一种称为**SVD(奇异值分解)**的技术。

类比:管弦乐队
想象“逻辑巫师”的大脑是一个演奏复杂交响乐的庞大管弦乐队。

  • 旧方法:你试图通过调高整个乐队的音量,让“视觉艺术家”演奏整首交响乐。这会淹没“视觉艺术家”自己的音乐。
  • FRISM 方法:FRISM 就像一位指挥家,能够将乐队分离为各个声部(小提琴、鼓、长笛等)。它意识到,逻辑中的“推理”部分主要由长笛演奏,而“视觉噪声”则由演奏。

FRISM 仔细聆听每个声部:

  1. 它识别出哪些“乐器”(子空间)对推理至关重要。
  2. 它轻轻调高“长笛”(推理)的音量,让“视觉艺术家”学会思考。
  3. 它保持“鼓”(视觉噪声)的安静,以免“视觉艺术家”失去其视觉能力。

如何在没有教师的情况下完成

通常,要教会一个模型进行推理,你需要成千上万个带有正确答案的示例(标注数据)。但作者并没有这些数据。

相反,他们使用了一种称为自蒸馏的巧妙技巧:

  • 他们将原始的“视觉艺术家”视为一位严格的教师。
  • 他们告诉新的“超级专家”(融合后的模型):“你必须学会像逻辑巫师那样思考,但你绝不能改变你描述图片的方式。如果你描述图片的方式发生了变化,你就失败了。”
  • 模型学会了吸收推理技能,同时严格保留其原有的视觉技能,整个过程无需人类对每个答案进行评分。

结果

论文表明,这种“手术式”方法比旧的“钝刀”混合方法效果好得多。

  • 更强的推理能力:新模型在解决数学和逻辑谜题方面表现更好。
  • 无视觉损失:与其他方法不同,它没有变得“失明”。它保留了与之前一样强的图像理解能力。
  • 高效性:它无需大量新的训练数据或昂贵的计算能力就实现了这一目标。

简而言之

FRISM 是一种聪明的方法,它通过从推理模型中精心挑选出仅属于“思考部分”的内容并注入其中,同时完全保留“视觉部分”不受干扰,从而教会视觉模型如何深入思考。这就像将两种食材粗暴地砸在一起,与小心翼翼地折叠一个精致的舒芙蕾之间的区别。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →