← 最新论文
💻 computer science

DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation

本文提出了名为 DCDM 的框架,通过大语言模型解析提示词、噪声空间中的时序相机表征以及全局场景生成范式,分别解决视频生成中的片段内语义一致性、片段间相机运动一致性及跨镜头元素一致性问题,并在 AAAI'26 CVM 竞赛测试中验证了其有效性。

原作者: Haoyu Zhao, Yuang Zhang, Junqi Cheng, Jiaxi Gu, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

发布于 2026-02-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoyu Zhao, Yuang Zhang, Junqi Cheng, Jiaxi Gu, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 DCDM(分而治之扩散模型)的新系统,它的目标是解决当前 AI 生成视频时最大的痛点:“视频虽然画面好看,但经常逻辑不通、镜头乱晃、或者前后角色长得不一样。”

想象一下,现在的 AI 视频生成就像是一个才华横溢但有点“偏科”的超级画家。他画单张图很厉害,画几秒钟的动画也很流畅,但一旦让他画一部完整的电影,他就容易犯迷糊:

  1. 逻辑混乱:让一个人“吃苹果”,结果苹果突然变成了香蕉,或者人把苹果吞进了眼睛里(缺乏常识)。
  2. 镜头失控:想让镜头“慢慢推进”,结果画面突然像坐过山车一样乱飞(镜头运动不连贯)。
  3. 角色失忆:第一幕主角穿红衣服,第二幕突然变蓝了,或者主角的脸变了(跨镜头的一致性差)。

为了解决这些麻烦,作者没有试图造一个“全能大脑”去同时处理所有问题,而是采用了**“分而治之”(Divide-and-Conquer)**的策略。他们把造电影的任务拆成了三个专门的“部门”,每个部门只负责解决一个核心问题,但大家共用同一个“画室”(基础模型)。

以下是这三个“部门”是如何工作的:

1. 第一部门:逻辑翻译官(解决“单段视频内的常识”问题)

  • 痛点:用户给的指令通常很简单,比如“一只猫在追老鼠”。AI 可能不知道猫怎么跑、老鼠怎么躲,或者猫和老鼠的比例对不对。
  • DCDM 的做法:在 AI 开始画画之前,先请一位**“大语言模型(LLM)”当翻译官**。
  • 比喻:这就好比你给导演一句简单的台词:“拍个猫追老鼠”。导演(LLM)不会直接拍,而是先写一份详细的剧本:“一只橘猫在客厅地毯上全速奔跑,胡须抖动,老鼠惊慌失措地钻入沙发底,光影要体现紧张感……"
  • 效果:把模糊的指令变成了详细的“世界知识”,AI 照着这个详细剧本画,视频里的动作和物体关系就合理了,不会出现“猫长着翅膀”这种荒谬场景。

2. 第二部门:摄影机导航员(解决“镜头运动”问题)

  • 痛点:告诉 AI“镜头向左移”,AI 往往理解得很生硬,或者移着移着就歪了。
  • DCDM 的做法:他们不给 AI 看文字指令,而是直接给 AI 一张**“隐形地图”**。
  • 比喻:想象你在玩赛车游戏。以前你是用文字告诉 AI“向左转”,它经常转错。现在,DCDM 直接在游戏的底层代码(噪声空间)里画好了路线。它把“向左转”这个动作,变成了一种数学上的“扭曲”,直接注入到视频生成的起点。
  • 效果:就像给赛车装上了自动驾驶导航,无论画面怎么变,镜头的运动轨迹(比如平滑的推进、旋转)都严格遵循你设定的路线,既稳定又精准。

3. 第三部门:记忆管家(解决“长视频角色一致性”问题)

  • 痛点:拍长视频时,AI 容易“失忆”。拍完第一幕,第二幕主角的脸就变了,或者背景风格不统一。
  • DCDM 的做法:他们设计了一种**“只记重点”的注意力机制**。
  • 比喻:想象你要拍一部 10 分钟的微电影。如果让 AI 记住每一帧的每一个像素,它会累死(计算量太大)且记不住重点。DCDM 的做法是:
    • 每一场戏内部(比如主角在房间说话),AI 会全神贯注地记住所有细节,保证动作流畅。
    • 不同场戏之间(比如从房间切到街道),AI 不会死记硬背每一帧,而是只提取**“关键摘要”(比如主角的脸、衣服颜色、整体色调),把这些摘要存进一个“记忆小本本”**里。
    • 当拍下一场戏时,AI 会翻看“小本本”,确保主角还是那个人,风格还是那个风格。
  • 效果:既保证了长视频里角色和风格从头到尾不跑偏,又不会因为记忆太多而让电脑卡死。

总结

DCDM 的核心思想就是:不要试图用一个大脑解决所有问题,而是组建一个专业团队。

  • 翻译官负责把指令变详细(保证逻辑通顺);
  • 导航员负责给镜头画好路线(保证运镜稳定);
  • 记忆管家负责在长视频中锁定角色(保证人设不崩)。

这三个部门共用同一个强大的“画师”(基础扩散模型),最终合作产出了既符合物理常识、镜头运动精准、且长视频角色一致的优质视频。这篇论文在 AAAI'26 的 CVM 比赛中获得了顶尖团队奖,证明了这种“分而治之”的思路是解决视频生成一致性难题的良方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →