Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution
本文提出了解耦视觉处理(Decoupled Visual Processing, DVP),这是一种参数高效的训练框架,它通过将多模态大语言模型的上层解码器层替换为一个专门用于视觉标记的轻量级 Transformer 块,在仅更新极小部分总参数的情况下,实现了在基准测试中具有竞争力的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机可以同时“看”和“读”的世界,就像一个超级聪明的朋友,看着一张猫的照片就能给你讲一个有趣的故事。这就是多模态大语言模型(MLLMs)的领域。为了让这些模型发挥作用,科学家通常会将两个强大的工具组合在一起:“视觉编码器”(一个经过训练、能够理解图像的大脑)和一个“大语言模型”(一个经过训练、能够理解文字的大脑)。难点在于如何让它们进行交流。通常,当你向计算机展示一张图片并提问时,计算机会将图像部分和文字部分一起塞进同一个巨大的工厂流水线进行处理。流水线中的每一个步骤都会被调整和优化,以确保答案完美无缺。但问题在于,这条工厂流水线规模庞大,调整其中的每一台机器都需要耗费大量的时间、金钱和电力。这就像是为了让一辆送货卡车跑得更快,而去试图修理整个城市的交通系统一样。
科学家们一直在思考一个大问题:图像部分和文字部分真的需要经过完全相同且深层复杂的工厂流水线吗?也许图像部分只需要一个快速、专门的捷径,而文字部分则需要完整的、深层的处理。如果我们能找到一种方法,在不破坏整个系统的前提下给图像提供一条捷径,我们就能让这些智能计算机的训练变得更便宜、更快速。这正是来自清华大学的一个研究小组决定解决的难题。
这篇论文:为图片提供 VIP 捷径
研究人员 Mingkuan Feng、Zhengqi Wen 和 Jianhua Tao 提出了一种名为**解耦视觉处理(Decoupled Visual Processing, DVP)**的新训练方法。把标准模型想象成游乐场里一个又长又弯的滑梯。每个人——无论是拿着图片还是文字——都必须一起沿着这 32 级的滑梯滑到底。研究人员问道:“如果我们在滑梯的中途让拿图片的人跳下来,通过一个微型且超快速的隧道,然后在底部与拿文字的人汇合,会怎么样呢?”
以下是他们的“解耦视觉处理”如何一步步运作的:
- 共享起点: 首先,图像碎片(视觉 Token)和文字碎片(文本 Token)一起滑下滑梯的前半段(第 0 到 16 层)。这很重要,因为它让图像和文字能够互相了解并理解上下文。
- 分离: 在中点处,人群分开了。文字碎片继续沿着原本漫长且“冻结”的滑梯向下移动(第 17 到 31 层)。这条滑梯是“冻结”的,意味着它在处理句子方面已经很完美了,所以不需要再去触动它。
- VIP 隧道: 然而,图像碎片并没有继续走那条漫长的滑梯。相反,它们被引导通过一个全新的、微型的、仅有一步的隧道(一个单层 Transformer 模块)。这个隧道是整个系统中唯一需要被训练和调整的部分。
- 重聚: 在最底部,经过处理后的图像碎片(由微型隧道处理)与经过处理后的文字碎片(由长滑梯处理)重新缝合在一起,从而生成最终答案。
他们的发现
团队使用了一个名为 LLaVA-1.5 的流行模型(其骨干网络为 Vicuna-7B)测试了这个想法。他们将他们的“VIP 隧道”方法与另外两种方法进行了对比:一种是标准方法(训练整个模型),另一种是“常规训练”方法(虽然使用了这种分离架构,但仍然训练所有部分)。
结果非常有效:
- 巨大的节省: 通过使用 DVP,他们只需要训练大约 3.1% 的总参数。这就像是通过只调整一个街角的红绿灯,就解决了整个城市的交通问题。
- 看得清晰: 在一项名为 MME(检查模型是否能实际“看到”物体,如计数或阅读标牌)的测试中,他们的方法得分 1440。这非常接近全量训练模型的得分(1496),并且实际上比“常规训练”的分离法(得分仅为 1225)要好得多。这表明,冻结主模型实际上有助于计算机更好地“看”,因为它防止了模型产生混乱。
- 减少幻觉: 在一项名为 POPE(检查模型是否会凭空捏造不存在的事物,比如在猫的照片里看到狗)的测试中,DVP 得分为 0.8619。这是所有方法中的最高分,超过了全量训练模型的 0.8577。这表明,为图像提供一条专门的路径可能可以阻止模型变得“爱做梦”并胡编乱造。
- 权衡之处: 该方法并非在所有方面都完美。在 ChartQA(一项关于阅读图表和曲线的测试)中,DVP 得分为 0.2356。虽然这比全量训练模型的 0.1776 要高,但低于“常规训练”分离法的 0.432。作者认为这是因为阅读图表需要图像细节与文本标签之间非常精细、往复的检查,而当两条路径过早分离时,这种任务会变得更加困难。
为什么这很重要
论文指出,这些 AI 模型顶层的深层复杂层实际上在为文字承担了大量的重任,但对于图像来说,这些层可能有些大材小用。研究人员发现,如果图像和文字已经在中途有了接触,那么一个微小的 Transformer 模块就足以处理图像处理。
这种方法挑战了“每条数据都必须经过整个深层网络”的旧观念。它表明,通过认识到图像和文字的不同特性以及它们可能需要不同类型的帮助,我们可以构建出更聪明、更高效的 AI。虽然该方法在处理需要极度精细推理的任务(如阅读复杂图表)时可能还需要改进,但总体而言,他们认为这种“解耦”路径是一种强大的、节能的方式,可以教会计算机如何观察,而无需每次都重建整个“大脑”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。