Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation
Vorch-IR 是一个基于 LTX2 构建的统一多模态框架,它通过对驱动视频、参考图像和文本指令进行联合调节,实现了长视频中灵活的单人及双人身份替换以及可选的背景编辑,同时通过自动合成流水线克服了数据稀缺问题,并通过时间重叠推理策略将生成能力扩展至分钟级。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你手里拿着一个现实世界的遥控器,但你不是为了切换频道,而是想在保持剧本、镜头角度和舞蹈动作完全不变的情况下,更换电影中的演员。这就是“视频身份替换”(video identity replacement)的梦想,也是人工智能领域的一个热门话题。长期以来,AI 可以从零开始生成新的视频,但想要编辑现有的视频,就像是在尝试改变真人电影中角色的脸部,却又不破坏光影或动作一样困难。早期的尝试要求 AI 必须拿到一份详细的地图,标明人的站位,或者一张姿态骨架图,亦或是用来遮盖脸部的掩模。这就像是要求一位厨师做菜,却必须先给他们一份预先切好的食材清单和厨房平面图。这些方法既僵化又难以使用。研究人员现在提出的重大问题是:我们能否教会 AI 理解一句简单的句子,比如“把左边的舞者换成这张照片里的那个人”,然后它就能直接“领悟”,而不需要复杂的地图或骨架?
Vorch-IR 应运而生,它是一个全新的 AI 系统,扮演着超级聪明、充满魔力的电影剪辑师角色。把它想象成一位不需要场记或特技协调员的导演。你只需给 Vorch-IR 三样东西:原始视频(“驱动”视频)、几张你想插入的新人物的照片(“参考”照片),以及一段告诉 AI 谁该去哪里的简单文字说明。神奇之处在于,这些照片并不需要与视频中的姿势或位置相匹配。如果视频中的人在举手跳舞,而你的照片显示那个人正坐着,Vorch-IR 也能搞定如何让这个坐着的人跳起舞来。它能处理单人、双人共舞,甚至还能更换背景场景,这一切都通过同一个模型实现。
Vorch-IR 的研发团队是在一个强大的视频生成器 LTX2 之上构建了这个系统。他们教会了 AI 同时观察视频、照片和文字指令。AI 并没有使用僵化的地图,而是利用一种“视觉-语言”大脑(一种能同时理解图像和文字的 AI 类型)来寻找其中的联系。这就像 AI 阅读了你的便条,看了看照片,然后心领神会地说道:“啊,你是想让这个人取代左边的那位,”然后它利用其内部的“自注意力机制”(self-attention),将新的面孔完美地融合到移动的身体上。
这个领域最大的障碍之一是数据。要教会 AI 换脸,你需要成千上万个“变换前”和“变换后”的视频示例。由于现实世界中并不存在这些素材,团队构建了一个机器人流水线来制作它们。他们提取真实视频,利用其他 AI 工具在第一帧进行换脸,然后使用一个运动引导机器人让剩余的视频遵循新的面孔。随后,他们过滤掉了那些失败的尝试(例如 AI 不小心给了舞者三只手臂的情况),从而创建了一个完美的训练集。这使得他们能够训练出一个全能模型:无论是更换一个人、两个人,还是更换背景,都不需要为每种任务准备单独的工具。
那么,制作一部完整的电影呢?大多数 AI 视频生成器在几秒钟后就会变得混乱或模糊。Vorch-IR 使用了一个聪明的技巧,叫做“时间重叠推理”(temporal overlapping inference)。想象一下你在画一幅长卷壁画。与其画一个小方块,晾干,再画下一个(这可能会导致颜色不一致),不如同时绘制重叠的部分并将它们无缝融合。这使得它能够生成长达一分钟的视频,而不会出现角色面部漂移或动作变得怪异的情况,且无需逐个片段地生成视频。
团队将 Vorch-IR 与其他顶尖 AI 模型进行了测试。在面对面对比中,Vorch-IR 表明它在保持新人物面部特征(身份保持)以及保持背景一致性方面表现更好,同时动作依然流畅。在人类测试中,人们更倾向于 Vorch-IR 的结果,尤其是在让新角色看起来真实且符合物理逻辑方面。论文指出,虽然一些旧模型在某些特定场景下的完美姿态匹配方面可能略胜一筹,但 Vorch-IR 提供了一种更加灵活且统一的视频编辑方式,证明了你并不需要复杂的地图也能获得出色的效果。这是迈向“通过输入一句话就能轻松编辑视频”之未来的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。