← 最新论文
💻 computer science

MiVE: Multiscale Vision-language features for reference-guided video Editing

MiVE 引入了一种参考引导的视频编辑框架,该框架在统一的自注意力扩散 Transformer 中利用 Qwen3-VL 的分层多尺度特征,以克服模态差距和空间细节丢失,从而在保持运动和执行精确编辑方面实现了最先进的性能。

原作者: Tong Wang, Meng Zou, Chengjing Wu, Xiaochao Qu, Luoqi Liu, Xiaolin Hu, Ting Liu

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Tong Wang, Meng Zou, Chengjing Wu, Xiaochao Qu, Luoqi Liu, Xiaolin Hu, Ting Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一段朋友走在街上的家庭录像。你想把他们的发色改成亮粉色,但同时希望保留他们的步态、背景以及其他一切细节完全不变。这就是参考引导的视频编辑所面临的挑战。

这篇论文介绍了一种名为MiVE(用于参考引导视频编辑的多尺度视觉 - 语言特征)的新工具,它比包括昂贵商业系统在内的现有方法更好地解决了这一问题。

以下是 MiVE 的工作原理,通过简单的类比进行解释:

问题:“翻译员”与“建筑师”的对立

现有的视频编辑工具通常试图分别完成两件事:

  1. 翻译员:一个系统,负责解读你的文字指令(例如“把头发变成粉色”)。
  2. 建筑师:一个系统,负责查看视频和参考照片,以理解需要修改的内容。

论文指出,这两个系统常常各说各话。“翻译员”理解“粉色头发”这个概念,但不知道头发具体在哪里;“建筑师”能看到头发,却可能无法完全领会具体的指令。当它们试图在流程后期将各自的工作结合起来时,结果往往模糊不清、不一致,或者改变了你本不想修改的部分。

解决方案:MiVE 的“全员会议”

MiVE 通过让一个强大的大脑(名为 Qwen3-VL 的视觉 - 语言模型)一次性完成所有任务,从而改变了游戏规则。但其中的秘诀在于:MiVE 会倾听该大脑内部不同的“声音”

作者发现,深度学习模型具有层级结构,就像摩天大楼的楼层:

  • 底层(早期层):这些就像拿着放大镜的建筑师。它们能观察到微小而具体的细节:发丝的确切形状、衬衫的纹理,或阴影的边缘。
  • 顶层(最终层):这就像首席执行官(CEO)。它们理解全局和含义:“这是一个人”、“这是粉色头发”、“这是一个晴天”。

旧方法只听取首席执行官(最终层)的意见。它们知道要做什么,却忽略了细节,导致编辑结果模糊。
MiVE则召开一场会议,让拿着放大镜的建筑师首席执行官同时发言。

工作原理:“统一舞台”

与其让文字、参考照片和视频通过一场复杂的接力赛相互沟通(这会导致延迟和错误),MiVE 将它们全部置于一个单一舞台上。

  1. 输入:你向 MiVE 提供原始视频、文字指令以及参考照片(即你希望结果呈现的样子)。
  2. 融合:MiVE 从参考照片和指令中提取“放大镜”级别的细节和“全局”层面的含义。
  3. 协同:它将所有这些信息在一个大池子中混合。视频帧不仅仅是“听取”指令,而是与指令共舞。这确保了当视频改变发色时,它确切知道要修改哪些像素、保留哪些像素,从而完美保留原始运动。

结果:为何 MiVE 胜出

论文将 MiVE 与其他顶尖学术模型以及一款著名的商业系统(Kling O1)进行了测试。

  • 在简单场景中:MiVE 能够改变物体颜色或移除人物,而不会使背景模糊。
  • 在复杂场景中:当视频包含快速运动、阴影或人物从物体后方走过时,只有 MiVE 能保持人物面部可识别且光照真实。

作者表示,MiVE 之所以最佳,是因为它不只是猜测;它利用精细细节(来自早期层)来确保精确性,并利用宏观概念(来自最终层)来确保正确遵循指令。

总结

将 MiVE 想象为一位大师级编辑,它不仅仅分别阅读剧本(文字)和查看照片(参考)。相反,MiVE 拥有一种超能力:它能同时看到整部电影整个剧本,同时关注宏大故事细微细节。这使得它能够做出看起来自然、保持一致且完美遵循你指令的修改。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →