Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction
本文介绍了 GAS,这是一个通过使用带有“下一嵌入预测”(Next Embedding Prediction)作为辅助监督的解耦生成分支来增强多模态大语言模型中零推理开销视觉理解能力的训练框架,旨在不损害最终推理架构的前提下优化共享的视觉表示。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一位才华横溢的学生如何理解一幅复杂的画作。传统上,你会展示给他们看,然后让他们写一段描述。他们学会了如何谈论这幅画,但却从未真正需要去“画”它。这就是当今大多数“多模态大语言模型”(MLLMs)的工作方式:它们非常擅长描述图像、回答关于图像的问题,甚至解决基于视觉的谜题。然而,由于它们仅被训练去“谈论”图像,它们有时会错过那些微小而精确的细节——比如某个特定物体究竟在哪里,或者人群中隐藏了多少件物品。它们掌握了“大意”,但在“细节”上可能会失手。
现在,想象一种不同的方法:如果为了帮助他们更好地理解,你也要求他们去“重构”这幅画呢?听起来这像是额外的工作量,你可能会担心尝试绘画会分散他们学习描述的注意力。但如果,你可以将绘画纯粹作为一种秘密的训练练习呢?你可以强迫他们的脑力去关注每一个像素和空间关系,以确保画作准确,但一旦训练完成,你就把绘画工具全部扔掉。学生将获得一种超强的理解能力,因为他们从绘画练习中获益,但之后再也不需要进行绘画。这就是被称为 GAS(生成作为辅助监督)的一种新方法的内核思想。
问题所在:谈论 vs. 看见
目前的 AI 模型就像是从未拿过画笔的艺术评论家。它们的训练目标是预测句子中关于图像的下一个词。虽然这让它们成为了优秀的对话者,但也留下了视觉上的鸿沟。它们没有对于精确形状、边界或空间关系的直接“肌肉记忆”。论文指出,通过仅仅训练它们去“谈论”,我们正在错失一个巨大的视觉学习宝库。以往试图通过让模型既能谈论又能绘画(统一模型)来修复这一问题的尝试往往以失败告终,因为“绘画”部分太重,拖慢了模型的速度,或者因为它们绘画的方式(使用不同类型的数字“像素”)与它们的思考方式不匹配,导致了困惑而非提升。
解决方案: “幽灵”绘画课
GAS 背后的研究人员想出了一个聪明的技巧。他们构建了一个特殊的训练框架,让 AI 在执行其正常理解任务的同时,学习如何“绘画”(更准确地说,是预测图像数字表示的下一部分)。
以下是他们是如何实现的,使用了两层楼房的比喻:
- 共享的地基(主干/Trunk): 无论是“理解型”AI 还是“绘画型”AI,都共享相同的底层楼层。这是处理原始视觉信息的地方。
- 分叉(MoT 架构): 当信息向上移动时,房子发生了分叉。一条路径通向“理解”房间(AI 在这里回答问题),另一条平行的路径通向“绘画”房间。
- 秘密武器(NEP): 在绘画房间里,AI 并不是在尝试创作一幅用于画廊的美丽画作。相反,它使用了一种称为**下一嵌入预测(Next Embedding Prediction, NEP)**的技术。你可以把它想象成 AI 正试图根据收到的指令,去猜测构成图像的下一个“数字乐高积木”。它不是在尝试成为艺术家,而是在尝试成为视觉数据的精确建筑师。
- 神奇的迁移: 尝试预测这些精确视觉块的行为,迫使共享的地基(底层楼层)变得极其细腻且锐利。它学会了比以前更好地保留视觉信息。
- 零开销的转折: 这是最棒的部分。一旦训练结束,整个“绘画”房间就会被拆除。AI 保留了它学到的超锐利地基,但它不再拥有绘画的额外空间或工具。当你稍后向它提问时,它的回答速度与之前一样快,但拥有了更敏锐的视觉。论文证实这增加了零推理开销——这意味着它不会让 AI 变得更慢或更臃肿。
他们的发现
团队在 20 亿和 40 亿参数的模型上进行了测试。他们不仅仅是猜测;他们进行了广泛的实验,以观察这种“绘画练习”是否真的有助于“理解”技能。
- 更擅长细节: 使用 GAS 训练的模型在需要精确视觉的任务上表现得显著更好,例如计数物体、判断空间关系(例如:“灯比电视更近吗?”)以及理解复杂的图表。例如,在计数测试中,2B 模型从 87.7 跃升至 90.1,4B 模型达到了 90.8。
- 适用于任何阶段: 他们在全新的 AI 模型、已经过预训练的模型以及已经经过微调的模型上都进行了测试。在每种情况下,“绘画练习”都有所帮助。它对全新的模型最为有效,但即使是已经很强大的成熟模型也得到了提升。
- 并非所有的绘画都平等: 他们发现绘画任务的类型至关重要。仅仅要求 AI “画一只猫”并没有带来太多帮助。但要求它根据复杂的指令进行绘画——比如“分割图像中的这个特定部分”或“根据逻辑原因编辑这个物体”——会迫使 AI 进行深度思考。正是这些“认知型”绘画任务,真正强化了理解能力。
- “幽灵”分支是关键: 他们证明了,如果不用他们特殊的“混合专家转换器”(Mixture-of-Transformers)设计将绘画路径与理解路径分开,AI 的理解能力实际上会变差。绘画任务会干扰 AI。这种分离对于让视觉学习“渗透”进基础而不干扰思考过程至关重要。
为什么这很重要
论文表明,我们不需要构建庞大、缓慢且既能谈论又能绘画的 AI 系统来获得更好的视觉能力。相反,我们可以将“生成”的过程作为一种秘密的训练工具。通过在训练期间迫使 AI 以一种特定的、结构化的方式预测视觉细节,我们可以在不让 AI 变慢的前提下,获得一个视觉更敏锐的模型。
研究人员发现,这种方法在不同的模型规模和训练阶段都有效,这表明它是提升视觉智能的一种可靠方式。他们还展示了 AI 并未丧失其文本推理能力;事实上,其文本推理能力也略有提升。论文总结道,生成引导式训练是实现更强多模态理解的一条实用且高效的路径,解决了如何让 AI “看得更清”而不使其“变慢”的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。