← 最新论文
🤖 AI

Video Generation Models are General-Purpose Vision Learners

本文提出了 GenCeption,一种基于预训练文本生成视频扩散骨干网络的前馈感知模型,证明了大规模视频生成是实现跨多种计算机视觉任务的、达到最先进水平且数据高效且通用的视觉智能的卓越预训练范式。

原作者: Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你花费多年时间打造了一位超级聪明的机器人厨师。这位厨师非常擅长遵循食谱做出完美的牛排、蓬松的煎蛋或香辣的咖喱。但问题在于:如果你问这位厨师“告诉我厨房的温度”或者“数一数冰箱里有多少个鸡蛋”,它只会一脸茫然地盯着你看。它是一个制作事物的专家,却并不理解它所制作事物的世界。

长期以来,计算机视觉(教计算机如何“看”的领域)一直就像这位厨师一样。我们为每一个特定的任务构建了独立的、专门的机器人:一个机器人负责测量深度,另一个负责追踪面部,第三个负责寻找边缘。它们在各自的特定工作中表现出色,但它们无法相互交流,也无法在不被彻底重构的情况下学习新技能。

后来,来自 Google DeepMind 和其他大学的研究人员提出了一个大胆的问题:如果我们把那位通过尝试“生成”完美视频来学习的机器人厨师,变成一个通用的侦探,会发生什么?

他们的论文题目为《视频生成模型是通用视觉学习器》(Video Generation Models are General-Purpose Vision Learners),其研究结论给出了肯定的回答:“是的”。他们介绍了一个名为 GenCeption 的新模型。

魔法技巧:从“制作”到“认知”

把训练旧式视觉模型的方式比作通过展示闪卡来教学生。你展示一张树的照片并说“树”,再展示一张汽车的照片并说“汽车”。这行得通,但效率低下且僵化。

这种被称为 GenCeption 的新方法,就像是让那个学生通过编写一百万个关于世界的不同故事来学习。为了写出一个关于大猩猩对着镜头挥手的故事,这个学生必须理解大猩猩长什么样、手是如何移动的、光线是如何照射在皮毛上的,以及摄像机角度随时间如何变化。为了让故事逻辑自洽,他们必须将世界的物理规律内化于心。

论文指出,这种**文本生成视频(text-to-video generation)**的过程实际上是视觉能力的终极训练场。通过训练模型根据文本提示(如“一只大猩猩靠近并挥手”)来创建高质量视频,模型会“无意中”学到海量的“世界知识”——包括 3D 空间如何运作、物体如何移动以及光线如何表现。

重大的转变:一统天下的模型

研究人员将一个大规模视频生成模型(基于一种被称为“扩散模型”的技术,这种技术就像一个去噪器,能将静电噪声慢慢转化为清晰图像)进行了改造。

他们没有让它像以前那样缓慢地逐帧“梦幻”出视频(这太慢了),而是将其调整为一个**前馈(feed-forward)**模型。你可以这样理解:与其让模型通过 50 个步骤来慢慢猜测答案,不如训练它观察输入并以单步、极速的方式吐出答案。

然后,他们教会了这个单一模型仅通过改变文本提示就能完成所有任务:

  • 提示词:“深度(Depth)” \rightarrow 模型输出深度图(物体距离远近)。
  • 提示词:“表面法线(Surface Normal)” \rightarrow 模型输出表面朝向的方向。
  • 提示词:“分割(Segmentation)” \rightarrow 模型勾勒出物体轮廓。
  • 提示词:“3D 关键点(3D Keypoints)” \rightarrow 模型找到人体关节。

这就像是一个瑞士军刀,你需要的工具会根据你的要求自动出现,而不是让你在兜里揣着单独的刀、螺丝刀和剪刀。

结果:击败专家

团队在大量任务上测试了 GenCeption,从测量场景深度到追踪滑雪者的姿态。结果令人惊讶。

  • 它击败了专家: 在许多情况下,这个单一的“通用型”模型的表现,足以媲美甚至超越那些专为这些任务设计的专业模型。例如,它达到了与 DepthAnything3(深度专家)相当或更好的水平,也击败了 SAM3(分割专家)。
  • 它是数据魔术师: 最令人惊叹的部分之一是它所需的数据量之少。作者发现,GenCeption 仅使用 7 到 500 倍更少的数据,就能达到与顶级模型(如 D4RTVGGT-Ω\Omega)相媲美的性能。这仿佛模型已经从视频生成训练中深刻领悟了游戏规则,因此不需要死记硬背每一个招式。
  • 它是一个通用者: 该模型几乎完全是在合成数据(计算机生成的各种人类视频)上训练的。然而,当他们向它展示从未见过的真实世界视频(如动物、机器人或人在做动作)时,它依然有效。它甚至能追踪一只猫的胡须,或者在从未见过的视频中分割出毛发。这表明模型学习的是“皮毛”或“毛发”的概念,而不仅仅是死记硬背特定的图像。

这篇论文明确表示它“不是”什么

了解这篇论文没有声称什么也很重要。作者谨慎地指出,这并不是一个能解决世界上所有问题的魔杖。

  • 他们明确反对认为我们需要为每一个视觉任务构建一个全新的、定制的架构。他们证明了这种“专业化模型”的老路比这种统一的方法效率更低。
  • 他们也指出,虽然该模型非常出色,但并非完美。当他们尝试将所有任务合并到一个训练过程中时,模型在 3D 人体关键点估计(追踪人体关节)方面变得有些混乱。其性能较仅针对该任务进行训练时有所下降。这表明,虽然“通用型”方法非常强大,但在混合非常不同的任务时,仍有一些细节需要完善。
  • 他们还澄清,模型在接受“虚假”数据训练后处理“真实”视频的能力是一种涌现行为(emergent behavior)——这是训练方法带来的一个惊喜,而非他们显式编程实现的功能。

核心结论

这篇论文表明,计算机视觉的未来可能不在于建造更多专门的机器人,而在于教导一个超级机器人如此生动地“想象”世界,以至于它能完美地理解这个世界。

通过利用视频生成作为预训练工具,GenCeption 展示了模型可以通过尝试创造世界,来学习如何观察、测量和理解物理世界。这是一种从“为每个问题设计解决方案”到“创建一个可以解决所有问题的智能基础”的转变。

作者认为,这条路径——将生成式模型作为感知的基础——可能是构建真正通用视觉智能的关键,正如大语言模型(LLM)彻底改变了文本处理一样。这是一个充满希望的步骤,但正如论文所述,我们仍处于探索如何让这种通用大脑在每一项任务上都趋于完美的早期阶段。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →