想象你有两位截然不同的专家:
- 视觉艺术家:一个擅长观察图片、描述所见内容并从视觉角度理解世界的模型。但如果你问它一个棘手的数学问题,它可能只会猜测或给出一个简单答案。
- 逻辑巫师:一个擅长解决复杂谜题、进行数学运算并通过困难步骤进行推理的模型。但如果你给它看一张图片,它可能无法很好地“看见”它,或者会忽略视觉细节。
本文的目标是将这两位专家融合成一位超级专家,既能完美地看见,又能深入地思考。
问题:“钝刀”方法
此前,科学家们试图通过将两个模型的“大脑”逐层平均来混合它们。这就像试图用勺子舀起“逻辑巫师”大脑的一层,然后一层层地倒入“视觉艺术家”的大脑中,以此混合一碗汤。
问题在于:这种方法太粗糙了。
- 如果加入太多“逻辑”,模型就会开始忘记如何识别图像(它变成了一个失明的天才)。
- 如果加入太少“逻辑”,模型虽然仍擅长看图像,却依然无法解决难题。
- 这就像试图只通过调节音量旋钮来调谐收音机;你无法在消除杂音的同时获得完美的频道。
解决方案:FRISM(“手术刀”)
作者提出了一种名为FRISM的新方法。他们不使用一次性混合整个大脑的方式,而是采用一种称为**SVD(奇异值分解)**的技术。
类比:管弦乐队
想象“逻辑巫师”的大脑是一个演奏复杂交响乐的庞大管弦乐队。
- 旧方法:你试图通过调高整个乐队的音量,让“视觉艺术家”演奏整首交响乐。这会淹没“视觉艺术家”自己的音乐。
- FRISM 方法:FRISM 就像一位指挥家,能够将乐队分离为各个声部(小提琴、鼓、长笛等)。它意识到,逻辑中的“推理”部分主要由长笛演奏,而“视觉噪声”则由鼓演奏。
FRISM 仔细聆听每个声部:
- 它识别出哪些“乐器”(子空间)对推理至关重要。
- 它轻轻调高“长笛”(推理)的音量,让“视觉艺术家”学会思考。
- 它保持“鼓”(视觉噪声)的安静,以免“视觉艺术家”失去其视觉能力。
如何在没有教师的情况下完成
通常,要教会一个模型进行推理,你需要成千上万个带有正确答案的示例(标注数据)。但作者并没有这些数据。
相反,他们使用了一种称为自蒸馏的巧妙技巧:
- 他们将原始的“视觉艺术家”视为一位严格的教师。
- 他们告诉新的“超级专家”(融合后的模型):“你必须学会像逻辑巫师那样思考,但你绝不能改变你描述图片的方式。如果你描述图片的方式发生了变化,你就失败了。”
- 模型学会了吸收推理技能,同时严格保留其原有的视觉技能,整个过程无需人类对每个答案进行评分。
结果
论文表明,这种“手术式”方法比旧的“钝刀”混合方法效果好得多。
- 更强的推理能力:新模型在解决数学和逻辑谜题方面表现更好。
- 无视觉损失:与其他方法不同,它没有变得“失明”。它保留了与之前一样强的图像理解能力。
- 高效性:它无需大量新的训练数据或昂贵的计算能力就实现了这一目标。
简而言之
FRISM 是一种聪明的方法,它通过从推理模型中精心挑选出仅属于“思考部分”的内容并注入其中,同时完全保留“视觉部分”不受干扰,从而教会视觉模型如何深入思考。这就像将两种食材粗暴地砸在一起,与小心翼翼地折叠一个精致的舒芙蕾之间的区别。
技术摘要:FRISM
问题陈述
视觉 - 语言模型(VLM)在感知任务中取得了显著成功,但往往缺乏大型推理模型(LRMs)所具备的复杂推理能力。虽然模型合并提供了一种参数高效的方式,无需昂贵的后训练即可将推理能力注入 VLM,但现有方法在粗粒度层级别上运作。这些方法通常将整个层视为原子单元,导致显著的权衡:增强推理能力往往会损害视觉感知能力,反之亦然。当前的逐层合并策略(例如 FRANK、IP-Merging)难以在同一层内解耦推理和视觉表示,导致两方面表现均次优。
方法论
作者提出了FRISM(基于子空间级别模型合并的细粒度推理注入),这是一个将合并范式从层级别转移到子空间级别的框架。
核心假设
FRISM 的动机源于观察:即使在单层内,推理能力和视觉表示也存在于参数空间中不同的子空间。因此,统一的逐层缩放系数是不够的;它不可避免地会将有益的推理(可能需要高幅度)与视觉噪声耦合在一起。
技术框架
FRISM 分两个阶段运行:
分解与初始化(阶段 1):
- 不再将 LRM 任务向量(τlrm)视为单一的整体更新,FRISM 使用**奇异值分解(SVD)**将其分解为正交子空间:U,S,V⊤=SVD(τlrm)。
- 奇异向量(U,V)和奇异值(S)被冻结,以保留推理任务的语义方向。
- 为每个子空间引入一个轻量级、可学习的门控参数 g,以自适应地调节注入强度。有效奇异值计算为 Seff=Sigmoid(g)⊙S。
- 合并后的层公式化为:θmerged=θvlm+λlrm⋅U(Seff)V⊤。
注入与训练(阶段 2):
- FRISM 采用无标签自蒸馏策略,配合双目标优化函数,消除了对稀缺多模态推理数据集的需求。
- 视觉保持(Ldistill): 最小化原始 VLM(教师)与合并模型(学生)在无标签视觉感知数据(例如 VizWiz)上输出分布之间的 Kullback-Leibler(KL)散度。这确保合并后的模型保留鲁棒的视觉理解能力。
- 推理最大化(Linject): 最大化注入子空间的谱幅度(−∑∥Seff∥2)。该项鼓励吸收由 LRM 任务向量定义的推理先验。
- 总目标: L=Ldistill+α⋅Linject。这充当一个谱滤波器,自动发现能在推理注入和视觉保持之间提供最佳权衡的子空间。
主要贡献
- 子空间级别合并范式: 本文通过从粗粒度层级别操作转向细粒度子空间级别调制,重新思考了模型合并。这使得能够精确识别和整合推理主导组件,而不会破坏视觉能力。
- 自适应 SVD 调制: FRISM 首次提出通过 SVD 分解 LRM 任务向量以进行推理注入,实现在视觉保持目标下对子空间的自适应重加权。
- 无标签自蒸馏: 作者设计了一种训练策略,依赖双目标优化(KL 散度最小化和谱幅度最大化)来实现稳定的推理迁移,而无需标记的 VL 推理数据集。
- 即插即用效率: 该方法具有极高的参数效率,仅需训练门控参数,同时保持基础模型和分解后的奇异向量冻结。
实验结果
在各种模型规模(3B、7B、32B)和架构(Qwen2.5-VL、ThinkLite-VL、InternVL)上,针对多样化基准进行了广泛实验。
- 推理性能: FRISM 始终优于现有的合并基线(Task Arithmetic、Ties-Merging、DARE、IP-Merging),并且通常显著超越基础 VLM。例如,在 7B 规模下,FRISM 的平均推理得分达到49.4,比基础 VLM 高出 2.0 分,并接近高成本后训练模型(如 ThinkLite-VL-7B)的性能。
- 视觉保持: 与其他在视觉感知任务中遭受性能下降的方法不同,FRISM 在很大程度上保留甚至略微提升了视觉能力。在 VL 感知基准测试中,FRISM 表现出所有方法中最小的性能下降。
- 效率: FRISM 效率极高,仅需0.53M 可训练参数和单 GPU 上0.49 小时的训练时间。这显著优于后训练方法(如 DRIFT,后者需要约 7000M 参数和约 2 小时),同时实现了相当或更优的推理性能。
- 消融研究: 实验证实,SVD 分解过程和推理最大化损失项都至关重要。移除 SVD(退回到逐层方式)或移除注入损失会导致性能接近基础 VLM,验证了细粒度子空间控制和主动推理注入的必要性。
意义与主张
本文声称,FRISM 通过解决注入推理与保持视觉感知之间的固有冲突,有效地弥合了强大的 LRM 与 VLM 之间的差距。通过将推理注入视为子空间级别的滤波问题,而非层级别的平衡行为,FRISM 提供了一种通用、即插即用的解决方案,兼容各种 VLM 架构。
作者强调,他们的方法为资源密集型的后训练提供了一种高效的替代方案,在无需昂贵标记推理数据集的情况下,既保持了视觉鲁棒性,又实现了最先进的推理性能。这项工作表明,模型的能力并非均匀分布,而是独特地编码在特定的秩子空间中,这一发现使得更精确和有效的模型合并成为可能。
注:论文承认了局限性,包括由于输出序列更长(过度思考)导致的推理时间增加,以及目前无法泛化到不同规模或结构的模型。此外,由于数据稀缺,推理目标依赖于代理(子空间幅度)而非直接监督。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。