UniVideo: Unified Understanding, Generation, and Editing for Videos
UniVideo 是一个通用的双流框架,它在统一的多模态指令范式下实现了视频理解、生成与编辑的融合,达到了最先进的性能,并实现了诸如任务组合以及从图像编辑数据中进行零样本迁移等新颖能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的助手,它能同时完成三件事:观看视频并告诉你发生了什么,从零开始创作一段全新的视频,以及仅凭你的指令编辑现有的视频。
直到现在,大多数 AI 助手都像是专门的工人。一个擅长看视频但不会制作;另一个是出色的视频导演但无法理解复杂的指令;第三个是大师级的编辑,但每项工作都需要特定的工具。
UniVideo 就像是聘请了一位“瑞士军刀”式的助手,它将所有这些工作整合在一个包中。以下是它的工作原理,我们使用简单的类比来解释:
1. 双脑系统
论文解释说,UniVideo 使用了“双流”设计,这就像有两个专门的大脑在协同工作:
- “理解大脑” (MLLM): 把这想象成一位博学多才的图书管理员。它阅读你的指令,查看你的参考照片,并观看你的视频。它理解故事、语境和逻辑。它知道什么是“阳光沙滩”,也知道“侦探帽”意味着什么。
- “创作大脑” (MMDiT): 把这想象成一位大师级的画家或特效师。它不太擅长阅读文字,但它非常擅长将原材料转化为流动的画面。
神奇的连接: “理解大脑”阅读你的请求,并向“创作大脑”低声传达一份详细的计划。“创作大脑”随后进行绘画,确保细节(如衬衫的纹理或汽车的运动)看起来真实且连贯。
2. 它能做什么?
因为这两个大脑是共同训练的,UniVideo 可以处理各种各样的任务,而不需要为每种任务准备不同的应用:
- 导演: 你可以说,“制作一段男人穿着夏威夷衬衫坐在沙滩上的视频”,它就会完成创作。
- 编辑: 你可以上传一段视频并说,“把男人的衬衫换成绿色”,或者“把视频中的人换成这张照片里的人”,它就能做到。
- 讲述者: 你可以给它看一段视频并问,“这里正在发生什么?”它会详细描述整个场景。
- “思考”模式: 这是一个特殊功能。有时你的指令很混乱,或者带有涂鸦。例如,你可能在照片上画了一个粗略的草图并说,“让这个发生”。“理解大脑”会搞清楚你凌乱的画作,并将其转化为一份清晰的计划,供“创作大脑”遵循。
3. “零样本”超能力
论文声称最酷的一点是,UniVideo 可以做一些它从未被明确教授过的事情。
想象一下,你教了一个孩子如何编辑照片(将背景从公园改为沙漠)。然后,你给他们看一段公园的视频,并要求他们将背景改为沙漠。即使你从未专门教过他们如何编辑视频,他们也可能会通过摸索学会,因为他们理解了“改变背景”这个概念。
UniVideo 也是如此。它在图像编辑方面接受了大量的训练,当被要求编辑视频(例如改变天气或物体的材质)时,它会迁移这种知识。它不需要针对每一种类型的编辑都去上一堂专门的“视频编辑”课;它只是将从图像中学到的知识应用到了视频世界中。
4. 为什么这与众不同?
之前的模型就像是一个工具箱,你必须为每项工作挑选合适的工具。如果你想编辑视频,你需要一个特定的“视频编辑器”工具;如果你想生成视频,你需要一个“生成器”工具。
UniVideo 就像是一个万能遥控器。你按下按钮(给出一个指令),设备就会判断它是需要观看、创作还是编辑,然后完美地完成任务。论文表明,这种“通用型”方法实际上比使用专门工具更好,尤其是当你想要组合执行任务时(比如在编辑视频的同时改变角色的风格)。
简而言之: UniVideo 是一个单一的 AI 模型,它通过使用一个聪明的“阅读者”来理解你的愿望,以及一个天才的“艺术家”来将愿望变为现实,从而实现观看、创作和编辑视频。它甚至能够自己摸索出新的技巧。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。