← 最新论文
💻 computer science

VideoWorld 2: Learning Transferable Knowledge from Real-world Videos

本文介绍了 VideoWorld 2,它通过引入动态增强的潜动力学模型(dLDM)实现了从原始真实视频中解耦视觉外观与动作动态,从而学习可迁移的任务知识,并在手工制作任务和机器人操作(CALVIN)中显著提升了性能。

原作者: Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, Xiaojie Jin

发布于 2026-02-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, Xiaojie Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇关于人工智能如何“通过看视频来学习技能”的前沿论文。为了让你轻松理解,我们可以把这个复杂的 AI 模型想象成一个**“正在学做手工的小学生”**。

1. 核心问题:AI 为什么以前学不会“复杂动作”?

想象一下,如果你想教一个孩子折纸飞机,你给他看一段视频。

  • 以前的 AI(像是一个“死记硬背”的学生): 它看视频时,会把背景里的桌子颜色、灯光的亮度、甚至手指的纹路全都死死记在脑子里。当换了一个桌子、换了一种颜色的纸时,这个 AI 就“懵”了——因为它以为“折纸”这件事必须在“那个蓝色的桌子上”才能做。它分不清什么是**“动作”(折叠),什么是“环境”**(桌子颜色)。
  • 结果: 动作做一半就走形了,或者干脆罢工。

2. VideoWorld 2 的绝招:给大脑装一个“滤镜”

这篇论文提出的 VideoWorld 2,本质上是给 AI 装上了一个极其聪明的“大脑分工系统”。它把学习过程拆成了两部分:

第一部分:提取“动作骨架”(dLDM 模型)

这就像是给 AI 装了一个**“透视滤镜”。当它看视频时,这个滤镜会自动把背景、颜色、光影全部“抹掉”,只留下最核心的“动作轨迹”**。

  • 比喻: 就像看一场舞蹈表演,AI 不再去管舞者的衣服是什么颜色、舞台是什么材质,它眼里看到的只有**“身体在空间中移动的线条”**。这些线条就是“知识”,它们是通用的——无论在什么舞台上,跳同样的舞,线条都是一样的。

第二部分:还原“高清皮肤”(预训练视频扩散模型 VDM)

有了“动作骨架”后,AI 需要把动作变成看得见的视频。这时候,它请出了一位**“顶级画师”**(预训练好的视频生成模型)。

  • 比喻: 这个画师非常有经验,他见过世界上所有的桌子、所有的纸、所有的手。AI 只需要告诉画师:“请按照这个‘折纸的动作骨架’,用你脑子里最真实的素材,给我画一段视频。”
  • 结果: 这样生成的视频,既有准确的动作,又有极其逼真的画面,而且换了环境也能完美适配。

3. 它到底有多厉害?(实验成果)

论文通过两个“考场”测试了这个学生:

  1. 手工考场 (Video-CraftBench): 让 AI 学折纸飞机、折纸船、搭积木。
    • 成绩: 以前的 AI 折到一半就乱套了,而 VideoWorld 2 能够非常丝滑地完成一整套复杂的长流程动作,甚至换了不同颜色的纸和背景,它依然能准确地完成任务。
  2. 机器人考场 (CALVIN 机器人环境): 让 AI 通过看人类操作视频,学会控制机器人手臂。
    • 成绩: 它展现了惊人的**“举一反三”**能力。它在互联网海量视频里学到的“抓取”、“移动”等知识,可以直接拿来指挥现实中的机器人,成功率大幅提升。

总结一下

VideoWorld 2 的核心逻辑就是:
“剥离表象,直击本质。”

它不再试图去背诵整个视频,而是学会了**“提取动作的灵魂”,再利用“强大的绘画能力”**把灵魂装回肉体。这让 AI 第一次真正具备了从杂乱无章的现实视频中,提取出“可以跨场景使用的知识”的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →