← 最新论文
🤖 AI

Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders

该论文通过系统性的编码器掩码实验和提出的评估指标,揭示了多模态大语言模型中普遍存在的视觉编码器冗余现象,表明移除特定编码器不仅能降低计算成本,甚至在某些任务上能提升模型性能,从而挑战了“编码器越多越好”的现有假设。

原作者: Yizhou Wang, Song Mao, Yang Chen, Yufan Shen, Yinqiao Yan, Pinlong Cai, Ding Wang, Guohang Yan, Zhi Yu, Xuming Hu, Botian Shi

发布于 2026-02-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Yizhou Wang, Song Mao, Yang Chen, Yufan Shen, Yinqiao Yan, Pinlong Cai, Ding Wang, Guohang Yan, Zhi Yu, Xuming Hu, Botian Shi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的“超级多模态大模型”(能看图、能聊天、能推理的 AI)做了一次彻底的“体检”和“瘦身手术”

简单来说,作者发现了一个反直觉的真相:现在的 AI 模型里,塞进太多的“眼睛”(视觉编码器),不仅没让它们变得更聪明,反而让它们变得“臃肿”且“效率低下”。

为了让你更容易理解,我们可以用几个生动的比喻来拆解这篇论文的核心内容:

1. 核心问题:为什么我们要给 AI 装好几双“眼睛”?

现在的趋势是,为了让 AI 看懂图片,开发者会给它装上好几双不同品牌的“眼睛”(视觉编码器)。

  • 比喻:想象你在招聘一个侦探团队
    • 有的眼睛擅长看大轮廓(比如:这是一只狗)。
    • 有的眼睛擅长看细节(比如:这只狗有几条腿,毛色是什么)。
    • 有的眼睛擅长读字(比如:图片里的路牌写了什么)。
    • 大家原本以为:眼睛越多,看得越全,侦探团队就越厉害。

2. 作者的发现:其实很多眼睛是“凑数”的

作者通过实验发现,“人多力量大”这个逻辑在这里行不通

  • 比喻:当你把那个侦探团队里的 5 个人减少到 2 个,甚至只留 1 个最厉害的,破案率(AI 的答题准确率)居然没有下降,甚至有时候还提高了!
  • 原因
    • 重复劳动:那 5 双眼睛里,有 3 双其实是在看同一件事,而且看得差不多。它们互相“撞车”,反而让 AI 的大脑(大语言模型)不知道该听谁的,造成了信息冗余
    • 甚至有害:有些眼睛不仅没用,还会提供错误的线索(比如把路牌看错了),反而干扰了判断。

3. 他们发明的“体检工具”

为了证明这一点,作者发明了两个很酷的工具:

  • 工具一:条件利用率 (CUR) —— “谁才是真大佬?”

    • 比喻:这就像给团队里的每个人打分。如果你把某人“屏蔽”掉(让他闭嘴),团队的成绩是变差了、没变、还是变好了?
    • 结果
      • 看图表、读文字(OCR)这种任务上,往往只有一双眼睛(比如专门读字的)在起作用,它的贡献率超过 90%。其他眼睛基本在“摸鱼”。
      • 普通问答上,几双眼睛的作用差不多,谁都可以替代谁,说明它们互相冗余
      • 最有趣的是,有些眼睛的分数是负数!意味着把它关掉,团队反而更聪明了。
  • 工具二:信息差距 (IG) —— “团队内部是否平衡?”

    • 比喻:看团队里“最强的人”和“最弱的人”差距有多大。
    • 结果:现在的模型里,差距巨大。有的眼睛是“超级英雄”,有的完全是“累赘”。这种不平衡说明资源浪费严重。

4. 惊人的结论:做减法,反而更强

作者做了一个大胆的实验:把那些“凑数”的眼睛摘掉,只留 1-2 双最核心的。

  • 效果
    • 性能不减:在大多数任务上,只留 2 双眼睛的模型,能发挥出原来 5 双眼睛模型 90% 以上 的能力。
    • 甚至更好:在某些特定任务(比如读复杂的图表)上,精简后的模型甚至比原来的全功能模型更准(因为没有了干扰)。
    • 省钱省力
      • 训练时间:少了 3 双眼睛,训练时间缩短了 34%
      • 运行速度:推理(回答问题)的速度快了 19.5%
      • 比喻:这就像你开一辆装了 5 个引擎的卡车,结果发现只开 2 个引擎就能跑得一样快,而且省油(省算力)、省保养费(省训练成本),还不容易坏。

5. 这对我们意味着什么?

这篇论文给现在的 AI 开发提了一个醒:

  • 不要盲目堆料:并不是给 AI 塞进越多不同的视觉模型就越聪明。
  • 精准配置:未来的 AI 设计应该像搭积木一样,根据任务需求,只保留最核心的那一两块(比如:读图任务留读图的眼睛,普通聊天留看整体的眼睛)。
  • 更环保、更便宜:通过这种“瘦身”,我们可以用更少的显卡、更少的电力,训练出同样聪明甚至更聪明的 AI。

总结一下:
这就好比以前大家觉得“厨师越多,菜越好吃”,结果发现其实只要一位主厨加上一位专门切菜的助手就足够了,再多请几个厨师只会让厨房乱成一团,还浪费食材。这篇论文就是告诉我们要学会做减法,让 AI 变得更高效、更聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →