Many-for-Many: Unify the Training of Multiple Video and Image Generation and Manipulation Tasks
本文介绍了“Many-for-Many”,这是一个统一的框架,它采用轻量级适配器和图像-视频联合学习策略来训练单个基础模型,使该模型能够执行十余种多样化的视觉生成与操控任务,在利用来自多个数据源的数据以克服特定任务训练高成本的同时,实现了具有竞争力的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个庞大的艺术创作指令库。有些指令说:“画一只猫”,有些说:“把这张猫的照片变成视频”,还有些说:“修复这段视频中模糊的部分”或者“为黑白电影上色”。
通常情况下,要完成所有这些工作,你需要为每一项任务配备不同的专家。你需要一位“文本生成视频”的大厨,一位“图像生成视频”的大厨,以及一位“视频编辑”大厨。从头开始训练每一位这样的厨师是非常昂贵的,并且需要海量高质量的食材(数据)。
“多对多”(Many-for-Many, MfM)应运而生。
该论文的作者构建了一个“超级大厨”,它可以同时胜任所有这些工作。他们没有雇佣十个不同的专家,而是训练了一个单一的模型,使其能够处理超过 10 种不同类型的视觉任务,从从零开始创建视频到编辑现有视频。
以下是他们是如何实现的,我们使用简单的类比来解释:
1. 通用适配器(“瑞士军刀”的手柄)
不同的任务需要不同的“输入”。
- 文本生成视频: 你给它一句话。
- 图像生成视频: 你给它一张图片。
- 视频编辑: 你给它一段带有“掩码”(Mask,即显示哪些部分需要修改的模板)的视频。
通常,这些输入就像形状各异的拼图碎片,无法放入同一个孔洞中。MfM 团队设计了一个轻量级适配器。你可以把它想象成一个通用手柄或瑞士军刀的附件。它能将文本、图像、视频、掩码,甚至是深度图(Depth Map,即场景的 3D 空间蓝图,类似于地形图)全部重新塑形为相同的格式。这使得模型能够理解任何形式的指令,无论其输入形式如何。
2. “联合学习”策略(“学徒”方法)
从头开始训练一个视频 AI 通常就像是在教一个人学会走路之前先去跑马拉松。这需要数百万个昂贵的视频样本。
MfM 使用了一种聪明的训练技巧,称为图像-视频联合学习。
- 第一阶段: 他们首先通过简单的“图像”任务(如根据文本画图)来教导模型。这既便宜又容易。
- 第二阶段: 他们逐渐引入“视频”任务。
- 神奇之处: 因为模型已经通过图像学习了“视觉”的基础知识,所以它不需要那么多昂贵的视频样本就能学会如何让物体运动。这就像一名学徒,先学会了切菜(图像),当他转向烹饪炖菜(视频)时,他已经掌握了处理食材的方法。
这意味着,他们仅使用其他顶尖模型所需视频数据的 10%,就训练出了一个强大的 80 亿参数模型。
3. “3D RoPE”(时空 GPS)
为了让视频看起来自然,模型不仅需要理解事物在哪里(左、右、上、下),还需要理解它们在何时发生(第一帧、最后一帧)。
团队升级了模型的内部“GPS”(称为 3D RoPE)。模型不再仅仅知道像素在平面屏幕上的位置,现在它还能理解在 3D 空间和时间中的位置。这有助于模型创造出平滑、真实的动作,而不是僵硬、不自然的动作。
4. 结果:一个模型,多种超能力
论文测试了这个“超级大厨”的两个版本:一个较小的 20 亿参数版本和一个较大的 80 亿参数版本。
- 多功能性: 该模型可以执行超过 10 种不同的任务,包括:
- 创作: 将文本转化为视频,或将图像转化为视频。
- 扩展: 将短片段延长。
- 编辑: 移除物体(修复/补全)、添加新场景(扩图/外扩),或改变颜色。
- 增强: 使模糊视频变得清晰(超分辨率)。
- 性能: 在与知名模型(如 Wan2.1、Hunyuan,甚至像 Sora 这样的商业巨头)的正面交锋中,MfM 模型表现得非常有竞争力。尽管使用的训练数据更少,它在整体一致性和运动质量方面经常排名第一或第二。
核心结论
论文声称,通过统一训练过程并使用智能“适配器”来混合不同类型的数据,他们创建了一个单一且高效的模型,其表现与仅针对特定任务进行训练的专业化模型一样出色(有时甚至更好)。他们证明了,如果你能构建一个通过广泛经验学习的通用工具,你就无需为每项工作准备单独的工具。
该论文并未声称的内容:
论文严格关注模型的训练技术和在标准基准测试中的表现。它并未声称解决了特定的临床问题,也未详细说明除开源代码和模型权重发布之外的具体未来商业产品。这是一项基础性的研究步骤,而非最终的消费级应用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。