Modern Computer Vision from CNNs to Foundation Models: A Unified Framework for Representation Learning
本综述提出了一个统一的表示学习框架,追踪了现代计算机视觉中判别式、多模态与生成式范式的演进脉络——从卷积神经网络(CNNs)和视觉 Transformer 到基础模型与扩散模型——并主张通过一种凝聚性的视角来推进通用视觉智能的发展。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人如何观察世界。长期以来,教它最好的方法是给它一套非常具体、僵化的规则,就像厨师严格遵循食谱一步步操作一样。但世界是混乱的、色彩斑斓的,且充满了惊喜。最近,科学家们一直试图构建“基础模型”——这些是庞大的、超级聪明的“大脑”,它们不再仅仅是遵循食谱,而是通过研究数百万张图片来学习事物的样子,就像孩子通过观察周围环境来学习一样。这些模型现在已经如此强大,以至于它们不仅能识别照片中的猫,还能描述它、从头开始画出一只猫,甚至理解它的声音。研究人员提出的重大问题是:所有这些不同类型的智能机器人,实际上是否都是同一种东西的不同版本?它们是否都在尝试构建同一种内在的“世界地图”,只是使用了不同的工具来实现这一目标?
这篇由研究团队撰写的论文,就像是这个快速变化的计算机视觉领域的宏伟导游。作者并没有将不同类型的 AI 视为不同的部落,而是提出了一个“统一框架”。他们认为,无论一个模型是使用传统的卷积层(关注图像的小局部区域)、现代的“Transformer”(同时观察整个画面),还是生成式模型(创造新图像),它们本质上都在做同一件事:构建并操纵一个隐藏的“潜在表示”(latent representation)。把这种表示想象成一种 AI 用来理解现实的、秘密的、压缩后的语言。论文指出,识别事物的模型、描述事物的模型以及绘画的模型之间的界限正在变得模糊。它们都在向一种单一的、更通用的智能汇聚,这种智能可以同时处理感知、推理和创造。
机器人眼睛的进化
为了理解我们所处的阶段,我们必须回顾机器人的“眼睛”是如何变化的。十多年来,占据主导地位的工具是卷积神经网络 (CNN)。你可以把 CNN 想象成一个微小的、局部的侦探。它有一个小放大镜(滤波器),在图像上滑动,寻找像边缘或角落之类的简单模式。它非常擅长这种局部工作,并且由于拥有关于世界运作方式的内置规则(归纳偏置,例如“物体通常由靠近在一起的部分组成”),它很擅长从少量数据中学习。然而,这个侦探有一个盲点:它难以连接图像中距离较远的事物。它可能会看到一只狗的耳朵和一只狗的尾巴,但如果它们位于照片的两端,它可能无法意识到它们属于同一只狗。
随后出现了视觉 Transformer (ViT)。如果说 CNN 是一个局部的侦探,那么 ViT 就是一个全局的“八卦者”。它不再使用放大镜滑动,而是将图像分解成许多小拼图块(patches),并让每个碎片同时与所有其他碎片进行交流。这是通过一种被称为“自注意力机制”的方法实现的。突然之间,机器人可以同时看到整个画面。它可以瞬间连接起耳朵和尾巴,无论它们离得有多远。这让 AI 变得极其强大,但也带来了代价:这些“八卦型”模型非常“饥渴”。它们需要海量的数据来学习,因为它们不像 CNN 那样拥有内置规则;它们必须从零开始摸索世界的规则。
大融合:工具的混合
论文强调了一个引人注目的趋势:这两种方法正在开始融合。研究人员意识到,局部侦探和全局八卦者各有所长,也各有所短。因此,他们开始构建混合架构。想象一个团队,其中局部侦探负责初步扫描以寻找边缘,然后由全局八卦者接手来理解整个场景。像 CoAtNet 和 MaxViT 这样的模型正是这样做的。它们利用卷积层高效地获取局部细节,然后切换到注意力机制来理解大局。论文指出,这不仅仅是随机的混合,而是为了获得两全其美的结果——即 CNN 的数据效率和 Transformer 的强大推理能力——而进行的必然进化。
“基础”大脑的崛起
论文描述的下一个重大飞跃是向基础模型 (Foundation Models) 的转变。这些是 AI 世界中的“超级大脑”。科学家们不再仅仅训练机器人识别猫,而是开始在数十亿张没有任何标签的图片上训练它们(自监督学习)。DINO 和 DINOv2 就是其中的例子。它们通过观察图片来学习理解世界的“结构”。如果你给它们看一张正面拍摄的猫的照片,然后再看一张侧面拍摄的照片,它们就会学习到这些是同一个物体,即使没有人告诉它们“那是只猫”。
论文解释说,这些模型对视觉表示的理解已经如此精深,以至于它们几乎可以用于任何用途。例如,DINOv3 创建的图像地图如此详细,以至于你可以使用它们来寻找物体的特定部分,或者在不同的照片中匹配相似的物体,而无需针对这些任务进行专门训练。这就像机器人已经学会了视觉的“语法”,因此它可以应对你要求的任何“方言”(任务)。
说话与绘画:多模态与生成式模型
当这些视觉大脑开始说话和绘画时,故事变得更加令人兴奋了。CLIP 和 ImageBind 等多模态模型将视觉世界与文字及声音的世界联系起来。CLIP 学习将图像与文本描述相匹配。这就像是教会机器人,一张“日落”的照片和“日落”这两个词代表的是同一件事。ImageBind 则更进一步,将图像与音频、深度信息甚至运动传感器绑定在一起,创造了一个所有感官共存的单一共享空间。
接着是生成式模型,特别是扩散模型 (Diffusion Models)。它们是艺术家。它们不仅识别图像,还会创造图像。它们从充满随机噪声(static/noise)的画布开始,通过一步步移除噪声,最终显现出一幅清晰的图像。论文指出,这些模型现在正在使用原本用于识别任务的“Transformer”大脑。扩散 Transformer (DiT) 用新的全局八卦大脑取代了旧有的卷积艺术家,使得艺术生成更加快速且连贯。甚至更新的方法,如正则流 (Rectified Flow),正试图让这个过程变得更加直接,将缓慢、多噪的旅程转变为一条笔直、平滑的直线。
大局观:统一的语言
这篇论文的核心发现是,所有这些不同的方法——CNN、Transformer、自监督学习、多模态系统以及生成艺术——并不是孤立的岛屿。它们都在向一种统一的视觉思维方式汇聚。作者认为,我们不应再将它们视为不同的工具,而应将其视为构建和使用潜在表示 (latent representation) 的不同方式。
把这种潜在表示想象成一种 AI 用来描述世界的秘密、压缩后的语言:
- CNNs 利用局部规则构建这种语言。
- Transformers 通过让一切事物相互交流来构建这种语言。
- 基础模型 (Foundation Models) 通过阅读整个互联网的图书馆来学习这种语言。
- 生成式模型 (Generative Models) 使用这种语言来编写新的故事(创造图像)。
论文表明,计算机视觉的未来不在于挑选一个赢家。相反,它在于构建通用视觉智能 (General-Purpose Visual Intelligence)。未来的系统将能够在一个统一的框架内实现观察、理解、交谈和创造。它们将能够观察一张照片,解释正在发生什么,回答相关问题,甚至画出一个新的版本,这一切都是因为它们拥有同一个理解世界的底层“大脑”。
前方的道路:挑战与梦想
虽然论文对这种融合持乐观态度,但也指出我们尚未到达终点。目前仍存在一些巨大的障碍:
- 效率: 这些庞大的模型对计算能力有着极高的需求。让它们在小型设备(如手机或机器人)上运行仍然是一个挑战。
- 信任与安全: 由于这些模型如此复杂,很难知道它们为什么做出某些决策。如果医疗 AI 说患者患有某种疾病,我们需要知道它是真的判断正确,还是仅仅在瞎猜。论文强调了对“可信部署”的需求,即模型应该是可靠的且能够解释自身。
- 数据: 这些模型需要大量高质量的数据。如何在不抄袭互联网上所有内容的情况下找到足够好的数据,是一个日益严重的问题。
总之,这篇论文描绘了一个领域正在走向成熟的过程。我们正在从构建执行单一任务(如仅仅是计数车辆)的专用机器人,转向构建能够学习、推理和创造的通用视觉助手。工具在变化,但目标变得更加清晰:创造出不仅能看到像素,而且能理解并与之交互的、丰富且互联的现实世界的机器。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。