← 最新论文
💻 computer science

InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision

本文提出了 InternVideo-Next,一种无需视频 - 文本监督的通用视频基础模型,通过解耦编码器 - 预测器 - 解码器架构并采用两阶段预训练策略(利用条件扩散解码器注入语义先验及在潜在空间预测冻结目标),有效解决了像素重建与语义抽象的冲突及捷径学习问题,从而在公开无标签视频数据上实现了最先进的通用视频表征性能。

原作者: Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 InternVideo-Next 的新 AI 模型。简单来说,它试图教 AI 像人类一样“看懂”视频,而不仅仅是识别视频里有什么物体。

为了让你更容易理解,我们可以把训练 AI 的过程想象成培养一个“世界观察员”

1. 以前的难题:两个极端的“学生”

在 InternVideo-Next 出现之前,教 AI 看视频主要有两种方法,但它们都有明显的缺点:

  • 方法 A:靠“文字描述”学习(像背课文)
    • 比喻:就像老师给学生看视频,然后旁边配一段文字解说(比如“一个人在跑步”)。
    • 缺点:这些解说往往很粗糙,甚至全是机器生成的假话(噪音)。AI 只记住了“跑步”这个词,却看不懂跑步时腿是怎么摆动的、身体是怎么倾斜的、或者地面是不是湿的。它懂概念,但不懂物理细节
  • 方法 B:靠“猜谜游戏”学习(像玩找茬)
    • 比喻:老师把视频的一部分涂黑,让 AI 猜涂黑部分是什么。
    • 缺点:以前的猜谜游戏太简单了。AI 发现只要猜个大概的“颜色”或“形状”就能得分,它学会了走捷径(Shortcut),却懒得去理解背后的物理规律(比如重力、物体运动轨迹)。它懂细节,但不懂深层逻辑

结果:以前的 AI 要么是个“书呆子”(懂词不懂事),要么是个“投机者”(懂皮毛不懂原理)。

2. 我们的新方案:InternVideo-Next(两阶段特训)

作者设计了一个两阶段特训营,把 AI 培养成一个既懂细节又懂逻辑的“世界观察员”。

第一阶段:建立“高保真记忆库”(Stage 1)

  • 目标:让 AI 既能看清像素级的细节(比如衣服的纹理),又能理解高层的语义(比如“这是一只猫”)。
  • 创新点
    • 以前的做法:用一根简单的“直线”把 AI 的脑电波(潜空间)转换成图像。这就像强行把复杂的油画压成一张简笔画,丢失了太多信息。
    • 我们的做法:引入了一个**“扩散解码器”**(Diffusion Decoder)。
    • 比喻:想象 AI 的脑子里有一个**“模糊的草图”。以前的方法试图直接把这个草图打印出来,结果糊成一团。现在的方法,是把这个草图交给一个“超级画师”(扩散模型),这个画师手里还有一本“参考书”**(来自高质量图片的语义知识)。画师根据草图和参考书,把细节一点点“画”出来,既保留了画面的清晰度,又保证了内容的合理性。
    • 效果:AI 建立了一个**“既清晰又有深意”**的内部世界模型。

第二阶段:学习“世界运行规律”(Stage 2)

  • 目标:在这个已经建立好的高质量“记忆库”里,让 AI 去预测未来,学习物理规律。
  • 创新点
    • 以前的做法:让两个 AI 互相猜,结果它们发现只要互相“打哑谜”(走捷径)就能得分,根本不需要理解真实世界。
    • 我们的做法
      • 冻结老师:把第一阶段那个已经学得很棒的 AI 当作“老师”,并且冻结它的参数(不让它变)。
      • 学生挑战:让“学生”AI 去预测“老师”脑子里的完整画面。
    • 比喻:这就像**“师徒传承”**。老师已经掌握了所有细节和逻辑(因为第一阶段练好了),学生必须真正理解视频里的因果关系(比如:球被踢出去后,为什么会滚远?),才能猜对老师脑子里的画面。如果学生想走捷径,根本猜不对,因为老师的“脑电波”太复杂、太真实了。
    • 结果:AI 被迫去理解物体运动、3D 空间、因果关系等真正的“世界知识”。

3. 这个模型厉害在哪里?

经过这种特训,InternVideo-Next 展现出了惊人的能力:

  1. 不用看字幕也能学:它完全不需要视频配文字,只用公开的视频数据就练成了,而且效果比那些看了海量字幕的模型还要好。
  2. 懂物理:它能估算视频的深度(判断物体离镜头多远),能追踪物体的运动轨迹。这就像它脑子里有了"3D 地图”和“物理引擎”。
  3. 通用性强
    • 动作识别:能分清“跑步”和“走路”的细微差别。
    • 视频问答:能回答“为什么那个人会摔倒?”这种需要推理的问题。
    • 视频聊天:它可以作为未来“视频聊天机器人”的大脑,理解你发的视频内容。

总结

InternVideo-Next 的核心思想是:不要只教 AI 背单词,也不要只让它玩简单的猜谜。

它通过**“先画好精细的草图(第一阶段),再在草图基础上推演世界规律(第二阶段)”,成功让 AI 从“死记硬背”进化到了“理解世界”。这为未来构建真正拥有常识物理直觉**的通用人工智能(AGI)铺平了道路。

一句话总结:它让 AI 不再只是“看热闹”,而是真正开始“看门道”了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →