← 最新论文
💬 NLP

On the Limits of Token Reduction for Efficient Unified Vision Language Training

原作者: Siyi Chen, Weiming Zhuang, Jingtao Li, Lingjuan Lv

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Siyi Chen, Weiming Zhuang, Jingtao Li, Lingjuan Lv

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:一个大脑,两项任务

想象一个超级聪明的机器人大脑(被称为统一视觉-语言模型),它被训练同时完成两项截然不同的工作:

  1. 侦探: 观察一张图片并回答关于它的问题(视觉理解)。
  2. 画家: 看着一段描述,从无到有地画出一幅画(视觉生成)。

通常情况下,训练一个机器人同时胜任这两项工作是非常昂贵且缓慢的,就像试图在练习杂耍的同时跑马拉松。研究人员想看看是否可以通过“剪枝”(移除)大脑处理过程中不必要的部件——特别是图像标记(image tokens)(即图片的数字构建模块)——来让这项训练变得更快。

发现:两种不同的节奏

研究人员仔细观察了这个机器人大脑在每一层(就像摩天大楼中的每一层楼)是如何运作的,并发现这两个工作之间存在一个令人惊讶的区别:

  • 侦探(理解): 当机器人分析图片时,它在开始阶段(底层)会重度观察图像。但随着它向摩天大楼的高层移动进行复杂的推理时,它基本上会停止观察图片,转而完全专注于文本。图像在这些高层中变成了“冗余”(多余的负担)。

    • 类比: 这就像看地图。你在开始时会专注地看地图以确定位置,但一旦你知道了位置,你就可以在听着 GPS 语音的同时继续开车。你不需要全程盯着地图看。
  • 画家(生成): 当机器人画画时,它需要持续不断地观察图像标记,从底层一直到顶层。每一个新的笔触都依赖于之前的笔触。如果你停止观察图像,绘画就会崩溃。

    • 类比: 这就像搭纸牌屋。你不能停止观察已经放下的那些牌;如果你忽略它们,下一张牌可能会把整个结构撞倒。

实验:尝试提速

基于这一发现,研究人员尝试通过移除不需要的图像数据来提高速度:

  1. 对于侦探: 他们移除了高层中的图像数据。
    • 结果: 成功! 机器人的训练速度提高了 76%,且其回答问题的能力几乎没有下降。这证明了图像数据在这些高层中确实是多余的负担。
  2. 对于画家: 他们尝试在中间层跳过图像处理。
    • 结果: 成功(基本实现)。 通过小心地仅跳过特定的层,他们节省了计算时间,而且机器人的绘画效果反而变得更好了,因为这迫使大脑更高效地组织其图像处理工具。

转折点:“协同损失”

这是论文中最关键的发现。当研究人员尝试将这两个加速技巧合并到同一个机器人中,让它同时完成这两项工作时,一切都崩溃了。

  • 问题所在: 侦探需要在高层忽略图像,但画家在高层必须观察图像。
  • 类比: 想象一个学生试图同时复习数学考试和历史考试。
    • 为了数学,他需要忽略历史书。
    • 为了历史,他需要忽略数学书。
    • 如果你强迫他使用一种“加速”方法,要求他在学数学时忽略书本,同时在学历史时也忽略书本,那么他最终会把两本书都给忽略了。他无法很好地学习任何一门学科。

在论文中,当他们将两种加速方法结合在一起时,机器人在两项任务上的表现都大幅下滑。原本在同时训练两项任务时通常会获得的“协同效应”(即神奇的加成)消失了。这个机器人在两项任务上的表现,甚至比它分别学习这两项任务时还要差。

结论:不要切断共享路径

论文得出结论:你不能简单地将适用于单一任务的“加速”技巧,直接套用到一个多任务机器人身上。

  • 教训: 要让一个统一的机器人保持高效,你必须保留“共享路径”的畅通。即便侦探在高层不需要图像,画家也需要。如果你为了省钱而切断这条路径,你就会伤害到画家,由于这两项工作通常会相互促进,你最终也会伤害到侦探。

简而言之: 如果机器人只做一件事,你可以让它变快。但如果它要做两件需要从同一个大脑中获取不同东西的事情,你就必须非常小心,不要切断那些让它们协同工作的连接。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →