ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships
ReBind 是一个系统性框架,通过引入一种专门的 MLLM(ReBind-Instruct)来生成带有显式引用标记的语义指令,从而解决了视频编辑中协调多个视觉源的挑战,实现了视觉属性与其来源的精确绑定,并在多参考图像条件的视频编辑中达到了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位正在拍摄电影场景的导演,但你手里没有一份单一的剧本,而是一堆混乱的照片和一个视频片段,你需要告诉你的演员具体该做什么。这就是 AI 视频编辑的世界——在这个领域,计算机正在学习如何根据我们的指令来改变视频。长期以来,这些计算机就像是热情但容易困惑的实习生:如果你要求它们“让天空看起来像这张照片,让角色看起来像那张”,它们经常会搞混,把天空和角色互换,或者将两张图像混合成一团乱七八糟的东西。核心问题不在于计算机看不见图像,而在于它们无法清晰地理解指令,从而不知道视频的哪一部分应该根据哪张特定的照片进行改变。
这篇名为 ReBind 的论文解决了这种困惑。作者意识到,秘诀不仅仅在于拥有一个更聪明的视频生成器,而在于拥有一个更聪明的“翻译官”。作者指出,传统的指令方式——比如使用模糊的句子如“把那个男的换成图 2 中的人”——对于处理涉及多张照片的情况来说太模糊了,计算机难以处理。相反,他们提出了一种新的与 AI 对话的方式,这种方式就像一个严格的舞台监督,明确地指向每一张照片并说道:“视频的这一部分来自这张特定的图片,而那一部分来自那张图片。”通过先修复指令,视频编辑的魔力才能真正实现。
问题所在: “照片太多”导致的困惑
想象一下,你正在尝试像遵循食谱一样编辑视频,但你必须同时从三本不同的食谱中混合食材。如果食谱只是说,“从书 A 中加入一些香料,从书 B 中加入一些蔬菜”,人类厨师可能会进行猜测,但计算机往往会陷入恐慌。它可能会抓错香料,或者把蔬菜与错误的菜肴混合在一起。
作者发现,现有的 AI 模型在处理 多参考视频编辑(Multi-Reference Video Editing) 时表现挣扎。这是指当你想要修改一段视频(例如一个在街上行走的人),并利用来自多个参考图像的细节来进行修改(例如,你希望街道看起来像图 1 中的赛博朋克城市,但人要看起来像图 2 中的机器人)。
旧的方法之所以失败,是因为它们使用的指令太模糊了。它们依赖 AI 去“弄明白”哪张照片对应哪一部分。论文指出,通用型 AI 模型(那些能与我们聊天并回答问题的模型)并不擅长这项特定工作。它们会对哪个视觉细节属于哪张源图像感到困惑,导致结果中机器人带上了赛博朋克街道的光影,或者在不该改变的时候改变了背景。作者称之为“关键缺陷”:指令缺乏 显式参考关系(explicit reference relationships)。
解决方案:ReBind 与 “魔法标签”
为了解决这个问题,团队构建了一个名为 ReBind 的新系统。想象你在写一个故事,但你不仅仅是说“那辆红色的车”,而是必须在“红色”这个词上附带一个字面上的、牢不可破的标签,上面写着:“这辆红色的车来自照片 1”。
ReBind 引入了一种新型指令,称为 带有显式参考标记的密集指令(Dense Instructions with Explicit Reference Tokens)。
- 旧的方法: “把那个年轻人换成第二张照片里的中年人。”(AI 必须猜测哪张照片是哪张,以及变化发生在何处)。
- ReBind 的方法: “在视频中,来自
<Video_1>的年轻人被一个脸部匹配<Image_2>且穿着来自<Image_1>毛衣的中年人所取代。”
通过将这些特殊的“标签”(如 <Image_1>)直接嵌入到句子中的相关描述旁边,AI 就能准确知道该看哪里。这就像是给计算机一张标有 X 标记的地图,而不是仅仅给它一段关于某个社区的口头描述。
他们是如何教 AI 的:两阶段训练
论文解释说,你不能仅仅把这些特殊指令交给标准的 AI 并期望它奏效;它需要经过专门训练才能编写这些指令。作者为他们的新 AI —— ReBind-Instruct 创建了一个两步训练过程:
第一阶段:学习格式(监督微调)。
首先,他们教 AI 编写这些结构化句子。他们向它展示了数千个视频及其“修改前”和“修改后”的版本,以及正确的“带标签”指令。AI 学会了观察变化并说道:“啊,这部分是因为 Image 1 而改变的,而那部分与原始视频保持一致。”它学会了在正确的位置放置<Image_1>标签。第二阶段:学习精准度(强化学习)。
仅仅知道格式是不够的;AI 需要做到 精确。如果它说“帽子来自 Image 1”但帽子实际上来自 Image 2,那么它就失败了。为了解决这个问题,团队使用了一种名为 群体相对策略优化(GRPO) 的技术。
- 这可以看作是一个游戏,AI 会写出几个不同版本的指令。
- 一个“评委”(另一个 AI)会根据一份清单检查它们。它是否提到了所有发生变化的地方?它是否正确地将帽子链接到了正确的照片?它是否避免了编造不存在的内容(幻觉)?
- 如果 AI 正确地建立了链接,它会获得“奖励”,如果搞混了,则会受到“惩罚”。随着时间的推移,它学会了始终将正确的照片标签附加到正确的细节上。
结果:一个更聪明的编辑器
一旦 AI(ReBind-Instruct)成为了编写这些完美、带标签指令的专家,他们就用它来训练一个名为 ReBind-Edit 的视频编辑器。这个编辑器接收这些带标签的指令,并使用它们来引导一个基于 LTX-2.3 系统的视频生成模型。
结果令人印象深刻。在 UniVBench 和 IntelligentVBench 等基准测试中进行测试时:
- 指令质量: ReBind-Instruct 在编写清晰、准确的指令方面比标准的通用 AI 模型表现得更好。它在正确地将视觉细节与其源图像相链接方面,甚至超越了一些强大的“闭源”模型(即那些你看不到代码的模型)。
- 视频质量: ReBind-Edit 产生的视频显著优于其他开源方法。在测试 AI 需要使用一张照片更换角色面部并使用另一张照片改变背景的任务中,ReBind-Edit 能够保持细节不出错,而其他模型经常会将两者混淆,或者无法保留原始视频的运动。
作者发现,指令的质量直接决定了视频的质量。当他们使用这种带有标签的新型“密集”指令来训练视频编辑器时,结果比使用旧的、模糊的指令要好得多。这表明,视频编辑的瓶颈可能不在于视频生成器本身,而在于我们给出的指令质量。
为什么这很重要
论文总结道,为了让 AI 真正掌握复杂的视频编辑——例如你可能想将来自五张不同照片的元素组合到一个场景中——我们需要停止将指令视为简单的句子,而开始将其视为结构化的地图。通过强制 AI 明确说明“这个像素来自那张照片”,我们消除了困惑。
作者并不声称他们解决了视频生成中的所有问题,但他们证明了 显式参考接地(explicit reference grounding) 是缺失的关键环节。他们的 ReBind 方法证明了,通过拥有正确的编写指令的“翻译官”,即使是开源模型也能与最优秀的闭源系统竞争,创造出不仅视觉效果酷炫,而且真正符合导演特定、多照片构想的视频。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。