Vorch-Omni: Multi-Task Orchestration of Sight and Sound
Vorch-Omni 是一个统一且可扩展的多任务框架,它利用单一的流匹配扩散 Transformer(flow-matching diffusion transformer),通过灵活的标记级条件控制(token-level conditioning)和双视觉通路,在无需对特定任务进行架构变更的情况下,无缝编排超过 10 种多样化的视听生成、编辑与扩展任务。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人成为一名电影大师。在过去,你必须为每一项工作都雇佣一个不同的机器人:一个只知道根据文字画图的机器人,另一个只知道让视频片段变长的机器人,第三个可以更换角色脸部的机器人,以及第四个可以添加音效的机器人。这就像拥有一个工具箱,里面的每件工具都是一台独立的、沉重的机器,你必须逐一搬运并单独插上电源。这就是当今“生成式人工智能”的世界——在这个领域,计算机学习如何创造新的图像、视频和声音,而不是仅仅复制旧的内容。
科学家们一直面临的一个巨大挑战是,这些不同的“机器人”之间沟通得并不好。如果你想要一段角色在背景变换时唱歌的视频,你通常必须将三个不同模型的处理结果缝合在一起,这往往会导致瑕疵、时机不对,或者视觉与听觉之间的错位。大家都在思考的问题是:我们能否构建一个单一的、超级聪明的“指挥家”,它能同时理解所有这些不同的工作?它能否决定何时该创造新事物,何时该精确复制某物,以及何时只需改变一个微小的细节,同时还能保持声画完全同步?
Vorch-Omni 应运而生,这个新项目暗示答案可能是“可以”。请不要把 Vorch-Omni 仅仅看作是一组独立的机器人,而要把它看作是一位极其全能的管弦乐团指挥。它不再是分别雇佣一位小提琴手负责音乐、一位鼓手负责节奏,而是由这位指挥来统筹整个交响乐。研究人员构建了一个系统,将视频和音频视为一种统一的语言。无论你是想根据文本描述生成一个全新的场景,还是想延长一段刚刚结束的视频,亦或是想在保持舞蹈动作完全不变的同时更换角色的脸部,Vorch-Omni 都使用同一个核心大脑来完成这一切。
其“秘诀”在于系统如何“思考”输入信息。想象一下你在给一位厨师下达指令。有时你会说:“给我从头做一个汉堡”(这是在生成新事物);有时你会说:“这是个汉堡,加点芝士就行”(这是在编辑);有时你会说:“这是一张汉堡的照片,把它变成画作风格”(这是在参考)。在过去,计算机会对这些不同的请求感到困惑。Vorch-Omni 通过给每一条信息贴上特定的“名牌”和分配“座位号”解决了这个问题。它非常清楚输入的哪一部分是“目标”(需要被创造的部分),哪一部分是“源头”(需要被保留的部分),以及哪一部分仅仅是“参考”(风格指南)。这使得该模型能够处理超过 10 种不同类型的任务——比如将文本转化为视频、克隆声音或编辑电影的特定部分——而无需为每项工作更改其内部结构。
论文指出,这种方法的效果非常出色,尤其是在保持声画完美同步方面。当研究人员将他们的模型与其他顶尖系统进行对比测试时,他们发现,虽然整体质量往往旗鼓相当,但 Vorch-Omni 在确保音频与视频匹配(例如唇语与说话节奏同步)以及遵循参考图像或音频剪辑的具体细节方面,表现要显著优于其他系统。它不仅仅是在“猜测”两者之间的联系,而是真正理解了视觉与听觉之间的关系。
然而,作者也谨慎地指出,这还不是一把能解决电影制作中所有问题的“魔杖”。虽然该模型擅长处理短片和特定编辑,但在处理需要长时间保持一致性的极长且复杂的叙事故事时,仍然会遇到困难。此外,它在生成每种语言的语音或处理极其精细的编辑方面也并非完美。但论文表明,这种“统一指挥家”的方法是一个重大的进步。通过证明一个模型可以在不产生混乱的情况下胜任如此多样的角色,Vorch-Omni 为这样一个未来开启了大门:即创作高质量、同步的视听内容,将变得如同给出一条清晰指令一样简单。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。