← 最新论文
💬 NLP

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

本文提出了对多模态大语言模型(MLLMs)中统一视觉-语言感知的首次系统性综述,将感知形式化为一种内在能力,提出了其范式演进的五阶段分类法,并概述了迈向通用人工智能的未来研究方向。

原作者: Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一位聪明但有点笨拙的学生如何理解世界。这位学生是一个多模态大语言模型(MLLM)。它很擅长读书(文本)和看图(视觉),但长期以来,它一直难以将两者联系起来。它能模糊地描述一张图片,却无法准确指出猫咪究竟坐在哪里,或者解释为什么猫咪看起来很害怕。

这篇题为**《从结构到协同》(From Structure to Synergy)**的论文,就像一本历史书,也是一份路线图,记录了我们是如何教会这位学生真正实现“视”与“理解”同步的过程。作者认为,我们不应该将视觉和语言视为两个独立的学科;相反,它们需要融合为一个名为“感知”(Perception)的超级技能。

这是我们如何抵达那里的故事,分为五个章节,并使用了简单的类比:

问题所在:“盲目”的学生

在这篇综述之前,大多数研究都是将“视觉”和“语言”分开讨论的。这就像是有专门教数学的老师和专门教艺术的老师,但从未要求他们协作。作者认为这是一个错误。要真正理解一张图像,你需要同时观察它并谈论它。他们想要创建一个单一的地图,展示这些模型是如何进化到能够做到这一点的。

五个进化阶段

作者将这些模型的历史分为五个阶段,从“修复硬件”转向“教大脑思考”。

第一阶段:修复眼睛(以编码器为中心)

类比: 想象模型的“眼睛”(观察图像的部分)是模糊的。
发生了什么: 研究人员首先开始升级眼睛本身。他们在模型尝试阅读图像之前,加入了特殊的透镜(模块),使其能够像放大镜一样缩放到图像的特定部分。他们还尝试给模型配备多双眼睛(不同的专家),从不同的角度观察图像。
结果: 模型不再只是把整个画面看作一片模糊,而是开始注意到特定的区域,比如“那边那个红色的球”。

第二阶段:修复双手(以解码器为中心)

类比: 现在眼睛能看到区域了,但模型的“双手”(绘制或指向的部分)却很笨拙。它能说“球在那里”,但无法画出一个完美的圆圈。
发生了什么: 研究人员在模型的输出端增加了特殊的工具。他们构建了“像素级精准”的双手,能够围绕物体绘制精确的轮廓、掩码或方框。
结果: 模型从只能说“那里有一只猫”,进化到了能够逐像素地描绘出猫咪毛发的完美轮廓。

第三阶段:学会看两次(动态感知)

类比: 想象你正在看一幅复杂的画作。你不会只瞥一眼;你会放大、退后、观察细节,甚至可能要求使用放大镜。
发生了什么: 旧的模型看一眼图像就给出答案。而新的模型学会了动态思考。它们学会了:

  • 调用外部工具(例如用于读取图像中文字的 OCR 扫描仪)。
  • 如果感到困惑,会放大观察特定位置。
  • 编写小程序来帮助它们解开谜题。
    结果: 模型变成了一个主动的调查员。它不再是一个静态的快照,而是可以“在图像中走动”,循序渐进地收集线索。

第四阶段 A:无需手术的训练(无架构策略)

类比: 我们不再是给学生换眼镜或换手,而是改变了“如何教他们”。
发生了什么: 研究人员停止了修改模型的物理结构。相反,他们使用了指令微调(提供更好的练习测试)和强化学习(就像玩电子游戏,模型答对得加分,答错则扣分)。
结果: 模型仅仅通过更刻苦的练习和从错误中学习,就变得更擅长寻找物体和解决难题,而不需要进行硬件升级。

第四阶段 B:宏大的协同(迈向统一感知)

类比: 这是“超级英雄”阶段。学生现在结合了所有技能:他们有敏锐的眼睛、灵巧的双手,知道如何放大,会写代码,并且知道如何从奖励中学习。
发生了什么: 论文探讨了融合了所有这些技能的最先进模型(如 OpenAI 的 o3)。它们不仅仅遵循死板的清单;它们会规划、选择自己的工具、在需要时放大,并像人类一样进行推理。
结果: 我们正朝着一个不仅仅是“处理”图像,而是真正以统一、灵活的方式“感知”图像的模型迈进。

前方的障碍

尽管我们取得了巨大进步,但作者指出了三个主要障碍:

  1. 数据饮食: 这些模型需要大量高质量、经过精心标注的数据来学习。这既昂贵又难以获取。
  2. 评分问题: 给数学考试评分很容易(对或错),但给“感知”评分很难。你如何为一个模型“观察”复杂场景的表现给出精确的分数?我们需要更好的奖励机制。
  3. 思考的成本: 那些会“放大”和“思考两次”的最聪明模型需要大量的计算能力。这就像为了看一张照片就要运行一台超级计算机,对于日常使用来说目前太昂贵了。

核心结论

这篇论文是一本指南。它告诉我们,要构建真正的智能机器,我们不能仅仅分别修补眼睛或双手。我们需要教整个系统实现协同——将视觉、思考和行动融合成一个统一的、适应性强的整体大脑。这段旅程已经从修复硬件转向了教大脑思考,而下一步是让这种思考变得高效且具有真正的通用性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →