← 最新论文
💻 computer science

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

VideoCoCo 引入了一种代理式双引擎框架,该框架利用可执行的 Blender 代码作为过程级思维链,通过首先创建一个确定性的时空草图,然后将其细化为写实输出,从而生成物理一致的视频,在物理一致性基准测试上显著优于现有基线。

原作者: Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou
发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou, Zhengrong Yue, Yaxin Luo, Xiaotong Li, Yuzhu Wang, Junyan Ye, Jinjing Zhao, Zehui Chen, Lin Chen, Renye Yan, Feng Zhao, Pheng-Ann Heng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅仅通过耳语一句“把它做得美味些”来教一个机器人如何烤蛋糕。机器人可能会理解“美味”这个词,但如果没有食谱,它根本不知道是该先混合鸡蛋还是先加面粉,也不知道要烤多久,或者为什么蛋糕不应该变成一块砖头。这就是当前人工智能视频生成领域所面临的困境。科学家们正在构建能够将文本描述转化为动态画面的模型,但这些 AI “梦想家”往往难以理解物理定律。它们可能会让球向上漂浮而不是落下,或者让玻璃在撞击地面之前就破碎,因为 AI 只是在猜测事件发生的序列,而不是真正理解世界运作的方式。

为了解决这个问题,研究人员正在寻找一种让 AI 在行动前先进行“思考”的方法,这种概念被称为思维链(Chain-of-Thought)。与其直接跳到最终画面,不如鼓励 AI 创建一个中间计划。这就像建筑师在盖房子前先画蓝图,或者厨师在烹饪前先写食谱。大问题在于:什么样的蓝图才是最好的?是一份文字列表?几张草图?还是更精确的东西?这就是 VideoCoCo 这篇论文试图解决的谜题,旨在让 AI 生成的视频不仅看起来漂亮,而且真正遵循现实世界的规则。


“代码即思维链”的魔力:双引擎梦幻组合

认识一下 VideoCoło,这是一个全新的系统,它像一位超级聪明的导演和一位天才艺术家协同工作,共同制作出不会破坏物理定律的视频。研究人员意识到,当 AI 仅凭文本提示词来猜测场景演变时,它经常会把“故事”讲错。因此,他们给了 AI 一个新工具:可执行代码

可以将这个过程想象如下:

  1. 导演(编码智能体): 当你给 AI 一个类似“黄油在热锅中融化”的提示词时,导演并不仅仅是在脑海中想象场景。相反,它会编写一段 Blender 程序(一组计算机指令)。这段代码就像一个严格、不可逾越的食谱。它明确告诉计算机:“将一块黄油放在这里。打开热量。让黄油在恰好 5 秒钟内变软、塌陷并铺开。”因为这是代码,它必须完全按照编写的内容运行。这不是一种猜测;而是一个模拟过程。
  2. 沙盒(模拟引擎): 计算机在一个名为“沙盒”的安全、隔离的游乐场中运行这段代码。其结果还不是一部漂亮的电影;而是一个确定性的草稿。想象一下一段低质量的白粘土动画。它看起来像是一个用橡皮泥做的粗略草图,但在运动轨迹上却是完美准确的。黄油会按照物理学应有的方式精确融化,因为代码强制要求它必须如此。
  3. 艺术家(生成式视频引擎): 现在,第二个引擎介入了。这位艺术家负责接过那个粗糙的白粘土草图,并在其上进行绘画,使其看起来像一部高画质的真实电影。因为艺术家已经拥有了一个完美的“橡皮泥”版本作为模板,他们不需要去猜测黄油应该如何移动。他们只需要专注于让它看起来闪闪发光、金黄诱人即可。

为什么这种方法具有变革意义

论文指出,以往的方法试图一次性完成太多事情。一些 AI 模型试图编写文本计划(如“黄油融化”),但文本是模糊的。另一些模型则试图猜测视频的下一帧,但这就像是通过观察上一张模糊的照片来尝试创作杰作。

VideoCoCo 说:“停止猜测物理现象。直接模拟它。”

通过使用代码作为“思维链”,该系统将运动的逻辑与图像的美感分离开来。代码处理“发生了什么以及何时发生”,而视频引擎处理“它看起来是什么样”。这是一个巨大的转变,因为它将一场猜谜游戏变成了一个两步走的流程,且第一步是 100% 可靠的。

事实胜于雄辩(以及物理定律)

研究人员在两个主要挑战上测试了他们的系统:PhyGenBenchVBench-2.0。这些是专门测试 AI 是否遵循重力、热量以及材料行为等现实世界规则的“AI 考试”。

  • 结果: 在使用 VideoCoCo 之前,基准 AI(称为 OmniWeaving)在物理测试中的平均得分是 0.475。在加入“代码即思维链”系统后,得分跃升至 0.558。在另一个测试(VBench-2.0)中,得分从 52.18% 飙升至 77.88%
  • “顿悟时刻”: 最显著的提升发生在 AI 通常最容易失败的领域:热力学(如热量和融化)以及材料动力学(物体如何破碎或流动)。这证明了代码草稿确实教会了 AI 物理学是如何运作的,而不仅仅是让视频看起来更漂亮。

论文排除了哪些可能性

值得注意的是 VideoCoCo 不是什么。论文明确反对了这样一种观点,即我们只需通过数百万个视频训练一个更大的 AI 来“学习”物理学。他们发现,如果没有一个明确的、可执行的计划(代码),AI 仍然难以掌握事件发生的正确顺序。他们还表明,仅仅拥有一个粗略的文本计划或几个关键帧是不够的;计划需要是可执行的代码,以便计算机可以实际运行并创建草稿。

局限与未来

虽然结果令人印象深刻,但论文也坦诚地说明了局限性。由于系统必须编写代码、运行模拟并随后绘制视频,目前的运行速度稍慢。这就像拥有一位卓越的建筑师和一位画家,但比起直接按下快门拍照,它需要更长的时间。此外,该系统受限于 Blender 模拟器的复杂程度;目前,像旋转、混沌的水流这类极其复杂的现象可能仍然难以完美模拟。

然而,作者认为这种“代码即思维链”的方法是一种强大的全新思考方式。与其寄希望于 AI 能够神奇地理解世界,不如先给它一个工具去构建一个世界模型,然后再基于这个坚实的基础去创造艺术。这提醒了我们,有时,创造美丽事物的最佳方式是先构建一个行之有效的逻辑基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →