← 最新论文
💻 computer science

CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition

CogOmniControl 是一个以推理为驱动的框架,它通过整合专用的 CogVLM 以精准理解创意意图、统一的 CogOmniDiT 生成器以及闭环的 Best-of-N 选择机制,来增强可控视频生成能力,并在专业基准测试中展现出优于现有模型的性能。

原作者: Hongji Yang, Songlian Li, Yucheng Zhou, Xiaotong Zhao, Alan Zhao, Chengzhong Xu, Jianbing Shen

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongji Yang, Songlian Li, Yucheng Zhou, Xiaotong Zhao, Alan Zhao, Chengzhong Xu, Jianbing Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位电影导演,正试图向动画师团队解释一个复杂的场景。你手头有一张粗略的草图(故事板)、一个角色黏土模型,以及几条模糊的备注,比如“让它营造出雨天的悲伤氛围”。

在过去,AI 视频生成器就像只能遵循严格、像素级精确指令的动画师。如果你给它们一张粗略的草图,它们会感到困惑,产出浑浊的混乱画面,或者完全忽略你的情感备注。它们缺乏“创造性大脑”来理解你为何希望场景呈现某种特定样貌。

CogOmniControl 是一个旨在解决此问题的新系统。它扮演着一位超级聪明的创意总监的角色,坐在你(用户)与动画团队(AI 生成器)之间。其工作原理分解为简单步骤如下:

1. 问题:“翻译鸿沟”

当前的 AI 视频工具在让画面显得逼真方面表现出色,但当面对抽象或杂乱的指令(如手绘草图或黏土模型)时,它们却显得力不从心。

  • 旧方式:你提供一张草图;AI 试图精确复制线条,却遗漏了感觉故事
  • 结果:视频看起来不对劲,角色面部发生变化(身份漂移),或者动作显得生硬。

2. 解决方案:双人团队

作者构建了一个由两个主要角色协同工作的系统:

角色 A:“创意总监”(CogVLM)

将其想象为一位受过高度训练的电影导演,观看了数千部专业动画制作视频。

  • 它做什么:它不仅仅查看你的草图,而是理解你的意图。如果你展示一张雨中角色的草图,这位“总监”看到的不仅仅是线条。它会推理:“好吧,角色很悲伤,地面应该是湿的,雨水应该泛起涟漪,光线应该显得阴沉。”
  • 神奇之处:它将你模糊、抽象的想法转化为密集、详细的计划。它充当翻译,将你的“创意意图”转化为计算机实际可执行的清晰指令集。
  • 训练:他们使用来自专业动画工作室的真实数据(故事板和黏土渲染图)来训练这位总监,而不仅仅是随机互联网视频。这使其成为“事物应呈现何种样貌”的专家,而不仅仅是“事物看起来像什么”。

角色 B:“动画师”(CogOmniDiT)

这是实际的视频生成器,负责绘制像素。

  • 它做什么:它接收来自创意总监的详细计划以及原始草图,并构建视频。
  • 神奇之处:因为它听从了总监的详细计划,它确切知道如何移动角色、衣物如何飘动以及光线如何变化。它不只是猜测,而是遵循一条逻辑路线图。

3. “驾驭”系统:质量控制循环

这是最巧妙的部分。通常,你生成一个视频并 hoping 它足够好。CogOmniControl 增加了一个质量控制驾驭系统

  • 理念:在最终视频展示之前,创意总监(CogVLM)扮演制片人的角色。它说:“好的,我们需要检查三件事:角色面部是否一致?雨水是否自然流动?光线是否正确?”
  • 过程
    1. 系统生成多个版本的视频(就像尝试 4 个不同的镜头)。
    2. 总监根据场景需求挑选特定的“检查员”(评估者)。如果场景包含特定角色,它会挑选一个“身份检查员”。如果是暴风雨场景,它会挑选一个“物理检查员”。
    3. 这些检查员对视频进行评分。
    4. 系统挑选最好的一个(Best-of-N)并展示给你。

4. 新的“试驾”(基准测试)

为了证明其系统有效,作者没有仅使用标准测试。他们构建了两条新的“驾驶赛道”,称为 CogReasonBenchCogControlBench

  • 这些赛道充满了现实世界的专业挑战(例如将粗略的故事板转化为最终电影场景)。
  • 他们发现,他们的系统 CogOmniControl 的表现优于所有其他开源模型,并且非常接近最昂贵的私有系统。

总结类比

想象你想烘焙一个非常特定且复杂的蛋糕。

  • 旧 AI:你递给它一张画着蛋糕涂鸦的餐巾纸。它试图精确复制涂鸦,结果做出一个烧焦、形状怪异的混乱之物。
  • CogOmniControl:你将餐巾纸交给一位主厨(CogVLM)。主厨阅读你的涂鸦,理解你想要一个“带有覆盆子夹心的湿润巧克力蛋糕”,并写出一份精确的食谱。接着,烘焙师(CogOmniDiT) 完美地遵循该食谱。最后,主厨品尝几批成品,使用特定清单挑选出最好的一批,为你端上完美的蛋糕。

该论文声称,这种方法弥合了“模糊的人类想法”与“精确的计算机执行”之间的鸿沟,使得从简单的草图和抽象想法生成高质量、专业外观的视频成为可能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →