← 最新论文
💻 computer science

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

Vorch-Omni 是一个统一且可扩展的多任务框架,它利用单一的流匹配扩散 Transformer(flow-matching diffusion transformer),通过灵活的标记级条件控制(token-level conditioning)和双视觉通路,在无需对特定任务进行架构变更的情况下,无缝编排超过 10 种多样化的视听生成、编辑与扩展任务。

原作者: Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wa
发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人成为一名电影大师。在过去,你必须为每一项工作都雇佣一个不同的机器人:一个只知道根据文字画图的机器人,另一个只知道让视频片段变长的机器人,第三个可以更换角色脸部的机器人,以及第四个可以添加音效的机器人。这就像拥有一个工具箱,里面的每件工具都是一台独立的、沉重的机器,你必须逐一搬运并单独插上电源。这就是当今“生成式人工智能”的世界——在这个领域,计算机学习如何创造新的图像、视频和声音,而不是仅仅复制旧的内容。

科学家们一直面临的一个巨大挑战是,这些不同的“机器人”之间沟通得并不好。如果你想要一段角色在背景变换时唱歌的视频,你通常必须将三个不同模型的处理结果缝合在一起,这往往会导致瑕疵、时机不对,或者视觉与听觉之间的错位。大家都在思考的问题是:我们能否构建一个单一的、超级聪明的“指挥家”,它能同时理解所有这些不同的工作?它能否决定何时该创造新事物,何时该精确复制某物,以及何时只需改变一个微小的细节,同时还能保持声画完全同步?

Vorch-Omni 应运而生,这个新项目暗示答案可能是“可以”。请不要把 Vorch-Omni 仅仅看作是一组独立的机器人,而要把它看作是一位极其全能的管弦乐团指挥。它不再是分别雇佣一位小提琴手负责音乐、一位鼓手负责节奏,而是由这位指挥来统筹整个交响乐。研究人员构建了一个系统,将视频和音频视为一种统一的语言。无论你是想根据文本描述生成一个全新的场景,还是想延长一段刚刚结束的视频,亦或是想在保持舞蹈动作完全不变的同时更换角色的脸部,Vorch-Omni 都使用同一个核心大脑来完成这一切。

其“秘诀”在于系统如何“思考”输入信息。想象一下你在给一位厨师下达指令。有时你会说:“给我从头做一个汉堡”(这是在生成新事物);有时你会说:“这是个汉堡,加点芝士就行”(这是在编辑);有时你会说:“这是一张汉堡的照片,把它变成画作风格”(这是在参考)。在过去,计算机会对这些不同的请求感到困惑。Vorch-Omni 通过给每一条信息贴上特定的“名牌”和分配“座位号”解决了这个问题。它非常清楚输入的哪一部分是“目标”(需要被创造的部分),哪一部分是“源头”(需要被保留的部分),以及哪一部分仅仅是“参考”(风格指南)。这使得该模型能够处理超过 10 种不同类型的任务——比如将文本转化为视频、克隆声音或编辑电影的特定部分——而无需为每项工作更改其内部结构。

论文指出,这种方法的效果非常出色,尤其是在保持声画完美同步方面。当研究人员将他们的模型与其他顶尖系统进行对比测试时,他们发现,虽然整体质量往往旗鼓相当,但 Vorch-Omni 在确保音频与视频匹配(例如唇语与说话节奏同步)以及遵循参考图像或音频剪辑的具体细节方面,表现要显著优于其他系统。它不仅仅是在“猜测”两者之间的联系,而是真正理解了视觉与听觉之间的关系。

然而,作者也谨慎地指出,这还不是一把能解决电影制作中所有问题的“魔杖”。虽然该模型擅长处理短片和特定编辑,但在处理需要长时间保持一致性的极长且复杂的叙事故事时,仍然会遇到困难。此外,它在生成每种语言的语音或处理极其精细的编辑方面也并非完美。但论文表明,这种“统一指挥家”的方法是一个重大的进步。通过证明一个模型可以在不产生混乱的情况下胜任如此多样的角色,Vorch-Omni 为这样一个未来开启了大门:即创作高质量、同步的视听内容,将变得如同给出一条清晰指令一样简单。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →