← 最新论文
🤖 AI

ViMax: Agentic Video Generation

Max是一个智能体视频生成框架,它采用协同多智能体协作、层级化叙事引擎以及依赖感知视觉一致性机制,旨在克服现有方法在生成具有持续角色与环境连贯性的长篇叙事结构视频方面的局限性。

原作者: Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, Chao Huang

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, Chao Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想要用视频讲述一个漫长且复杂的故事,就像拍一部短片一样。目前,大多数 AI 视频工具就像是那些才华横溢但注意力极其短暂的演员。它们可以制作出一段人物行走的精美 5 秒片段,但如果你要求它制作一部 10 分钟的电影,让同一个人穿梭于不同的房间、与朋友交谈,且始终保持容貌和着装不变,AI 就会感到困惑。角色的眼睛可能会从棕色突然变成蓝色,或者厨房会在场景切换间变成森林。

ViMax 是一个旨在解决这一问题的全新系统。不要把它仅仅看作一个单一的演员,而要把它看作一家由专门的 AI 智能体组成的、组织严密的电影制作公司

以下是 ViMax 的工作原理,我们使用简单的类比来解释:

1. “导演室”(层级化叙事规划)

如果你要求单个 AI 一次性写出整个电影剧本,它会感到应接不暇,并在写到结尾时忘记了开头。

  • ViMax 的解决方案: ViMax 像俄罗斯套娃一样将故事进行拆解。
    • 首先,它勾勒出大的“事件”(如电影的开头、中间和结尾)。
    • 然后,它将这些事件拆分为“场景”(Scenes)。
    • 最后,它将场景进一步拆分为单个的“镜头”(Shots,即摄像机角度)。
  • 核心秘诀: 为了确保 AI 在专注于微观细节时不会忘记宏观全局,它使用了一个数字图书馆(检索增强生成,RAG)。每当 AI 规划一个新场景时,它都会在自己的图书馆中“查阅”原始故事,以提醒自己角色是谁以及情节的发展方向。这保证了故事从始至终的一致性。

2. “连续性部门”(视觉一致性)

在真实的电影拍摄中,如果一个角色在第一场戏中戴着红帽子,那么他们在第十场戏中也必须戴着红帽子。如果他们坐在蓝色沙发上,沙发就必须一直是蓝色的。目前的 AI 工具经常会忘记这些细节。

  • ViMax 的解决方案: ViMax 使用了一个依赖图(基于图的视觉依赖关系)
    • 想象一个连接所有镜头的流程图。如果镜头 5 需要看起来像镜头 2,系统就会将它们链接起来。
    • 在生成镜头 5 时,AI 不仅仅是在靠猜测,它还会使用镜头 2 的实际图像作为参考。这就像一位艺术家在之前的草图上进行描摹,以确保角色的面部特征完全一致。
  • “相机移动”技巧: 为了确保房间从不同角度看去依然保持一致(例如先从左侧观察角色,再从右侧观察),ViMax 会先生成一段过渡视频。它先创建一个平滑的相机移动视频,展示从一个角度移动到另一个角度的过程,然后从这段平滑的运动中剪辑出所需的特定镜头。这保证了 3D 空间(家具、墙壁)的一致性。

3. “质量控制团队”(基于 VLM 的筛选)

有时,AI 可能会生成一段看起来还可以但带有奇怪瑕疵的视频,比如出现六根手指的手。

  • ViMax 的解决方案: 对于每一个镜头,ViMax 不仅仅生成一个视频,而是会生成多个候选版本(就像针对同一个姿势拍摄 5 张不同的照片)。
  • 然后,一个“评审员” AI(视觉语言模型,VLM)会观察所有候选视频,并选出最优秀的一个,使其既符合剧本要求,又看起来最真实。这确保了只有最高质量的片段能进入最终的电影。

他们证明了什么?

研究人员在名为 ViMax-Bench 的新基准测试上测试了 ViMax,该测试挑战 AI 在保持角色和场景一致性的同时,制作包含多镜头(连续多达 13 个镜头)的视频。

  • 结果: ViMax 在保持角色形象一致性和剧情逻辑连贯性方面,表现优于现有的方法(如 Sora、Veo 等)。
  • 权衡(Trade-off): 由于需要进行所有的规划和检查,它需要消耗更多的计算能力和时间,但其结果是获得了一个更加连贯、更长的视频。

总结

ViMax 就像是从即兴表演(AI 随性发挥,经常忘记情节)升级到了专业的电影剧组(由导演、编剧和连续性经理协作,确保故事逻辑通顺且演员在每个场景中都保持一致)。

论文中提到的局限性:

  • 它依赖于其他强大的 AI 模型来进行实际的绘画和视频制作。
  • 它在处理非常拥挤的场景或复杂的交互动作(如两人击掌)时仍可能遇到困难。
  • 它目前还无法处理音频或对话同步。
  • 使用如此一致的视频生成技术来创建虚假事件或冒充他人存在伦理担忧,因此作者建议需要进行安全检查。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →