← 最新论文
💻 computer science

CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation

原作者: Sharath Girish, Tsai-Shien Chen, Zhikang Dong, Mukesh Singhal, Hao Chen, Sergey Tulyakov, Aliaksandr Siarohin

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Sharath Girish, Tsai-Shien Chen, Zhikang Dong, Mukesh Singhal, Hao Chen, Sergey Tulyakov, Aliaksandr Siarohin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正试图用一根魔杖来导演一场电影场景。在过去,如果你想让视频生成器制作一段电影剪辑,你只能给它一个简单的句子,比如“一位魔术师正在表演戏法”。然后 AI 会自行猜测其余的部分:魔术师是谁、戏法看起来是什么样、持续多久、镜头如何移动,以及场景是否会切换到新的角度。这就像是要求一位厨师做一顿完整的饭菜,却只给了他们一种主要食材的名字。

CineOrchestra 是一个改变游戏规则的新工具。它不再使用单一的句子,而是允许你像真正的电影导演一样,通过提供一个能同时控制四件事的统一剧本来进行创作:

  1. 演员(The Actors): 场景中有谁(例如:一位魔术师、一名助手、一个箱子)。
  2. 动作(The Action): 他们做什么,以及在什么时候做(例如:“在 2 秒时,魔术师举起双手”)。
  3. 镜头(The Camera): 镜头如何移动(例如:“在 5 秒时,向箱子进行缩放/变焦”)。
  4. 转场(The Transitions): 场景如何变化(例如:“在 7 秒时,场景通过紫色烟雾进行淡入淡出”)。

核心理念:“万物皆为实体”(Everything is an Entity)

研究人员意识到,在电影中,一个人、一个相机移动和一个场景转场实际上是非常相似的。它们都是**“在特定时间内发生的事情”**。

可以把它想象成一份列车时刻表。

  • 魔术师是一列在 0:00 出发并在 2:00 到达的火车。
  • 镜头缩放是另一列在 2:00 出发并在 5:00 到达的火车。
  • 转场是一列在 7:00 仅运行极短时间的火车。

CineOrchestra 将所有这些都视为时间轴上的“实体”。它不需要独立的系统来分别处理演员、相机或剪辑。它使用一个单一的“管弦乐指挥”(AI 模型)来告诉每一位“乐手”(演员、相机和剪辑)何时开始演奏,以及何时停止。

它如何解决“时序”问题

这个任务最难的部分在于,电影事件的长度差异极大。一个“硬切”(突然切换到新场景)可能只持续 0.1 秒,而一个“慢速平移”整个房间的过程可能持续 10 秒。

旧的 AI 模型就像一个每秒只滴答一次的节拍器。如果一个事件发生在 0.1 秒内,节拍器会完全错过它;如果一个事件持续了 10 秒,节拍器会感到困惑,不知道起点和终点在哪里。

CineOrchestra 引入了两个聪明的技巧(称为旋转嵌入/Rotary Embeddings)来解决这个问题:

  1. 灵活的尺子: 它不再以固定的速度滴答,而是拉伸或收缩它的测量带以适应事件。无论是瞬间的眨眼还是长达 10 秒的行走,AI 都能公平地测量它,从而确保时序完美。
  2. 名牌系统: 想象一个所有人都在大声下达指令的拥挤房间。为了避免混乱,AI 给每个指令分配了一个特定的“名牌”(例如:“魔术师的动作”)和一个“时间槽”。这确保了 AI 知道“举起双手”这条指令属于 2:00 的魔术师,而不是 5:00 的助手。它防止了演员和相机运动发生混淆。

研究发现

研究人员将这个新系统与六个其他的 AI 工具进行了测试,每个工具都是某个领域的专家(例如,有的只擅长控制演员,或者只擅长控制相机剪辑)。

  • 结果: CineOrchestra 赢了。它是唯一一个能同时处理所有四个元素(演员、时序、相机和剪辑),且不会出现演员换脸、时序出错或相机出现怪异行为的工具。
  • 证明: 当人类观看这些视频时,他们更倾向于 CineOrchestra,因为它完美地遵循了剧本,保持了角色的一致性和场景转场的平滑,就像真正的电影导演所期望的那样。

它目前还做不到的事(局限性)

论文诚实地说明了该工具目前无法实现的功能:

  • 缺乏 3D 精确度: 它使用文字来描述相机移动(如“向左平移”),而不是精确的数学坐标。如果你之后需要重建 3D 场景,这个工具还不够精确。
  • 短片限制: 它一次只能生成一个场景(大约一分钟长)。它目前还不能一次性编写并导演一部两小时的完整电影。
  • 默片: 它只生成视频。它没有声音、对话或音乐生成功能。

简而言之,CineOrchestra 是一种强大的新方式,让你告诉 AI:“这是剧本,这是演员,这是相机计划。请完全按照我的描述制作这部电影”,并且让它真正做到听从每一个细节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →