← 最新论文
💻 computer science

OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films

OmniVR 是一个开创性的 22B 参数音视频联合生成模型,它通过将任务构建为统一多模态扩散 Transformer(DiT)中的条件生成,在同时解决视觉和音频退化问题的同时,确保跨模态一致性与自然的色彩还原,从而修复退化的历史电影。

原作者: Xin Lu, Zihao Fan, Mingchen Zhong, Jie Huang, Xueyang Fu, Zheng-Jun Zha

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Xin Lu, Zihao Fan, Mingchen Zhong, Jie Huang, Xueyang Fu, Zheng-Jun Zha

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名拥有神奇相机的时空旅行者,这台相机只能看到过去。你发现了一卷来自一个世纪前的陈旧、布满灰尘的胶片。当你播放它时,画面模糊、闪烁,呈现黑白影像;声音则是嘈杂、嘶嘶作响的杂音,听起来像是从一个铁罐子里传出来的。几十年来,科学家们一直试图修复这些电影,但他们通常将画面和声音视为两个独立的问题。一支艺术团队负责清理视频,另一支音频工程师团队负责修复噪音,两者各自为政。问题在于,在现实世界中,视频和音频是最好的朋友;它们会相互影响。如果音频很沉闷,很难分辨角色是在低语还是离得太远。如果视频很模糊,很难判断音效是否与动作匹配。

这篇论文介绍了一种新型的“数字修复师”,叫做 OmniVR。把它想象成不仅仅是两个独立的维修队,而是一个超级聪明的侦探,它同时观察混乱的画面和嘈osa的声音,从而弄清楚原始场景原本看起来和听起来究竟是什么样的。研究人员利用一个拥有 220 亿参数的海量“大脑”(一种类型的 AI 模型)构建了这个侦探,这个大脑最初是被用来从零开始创造新电影的。他们并没有让它凭空捏造,而是教会了这个大脑如何通过“去扩散”(un-diffuse)混乱的过程,利用旧电影中的糟糕部分作为线索来重建清晰的部分。他们不仅修复了模糊或嘶嘶声,还让视频和音频产生了对话,确保当角色移动嘴唇时,声音能完美匹配,并且当音乐响起时,场景感也恰到好处。

核心问题:为什么只修复单方面是不够的

历史电影就像时间胶囊,但它们往往是破损的。论文指出,这些旧电影遭受着“双重打击”:视频变得模糊、多颗粒且闪烁,而音频则变得充满嘶嘶声、破裂并出现中断。作者注意到了一些以往方法忽略的关键点:损坏是同时发生的。 你不能仅仅修复画面并期望声音奇迹般地变好,或者反之亦然。事实上,如果你修复了视频却留下了破碎的音频(或反之),两者就会失去同步。这就像是在尝试与一个舞步不一致的舞伴跳舞;结果会显得尴尬且不自然。

研究人员发现,在他们研究的大多数旧片段中,视觉和听觉都在同时受损。他们还发现,一个旨在共同生成视频和音频的 AI 模型,其内部具有“交叉连接”。模型的音频部分会关注视频,而视频部分会关注音频。如果你静音音频,视频生成的内容就会发生变化。这意味着,要真正修复一部电影,你必须让音频和视频互相协作,而不是把它们当作陌生人。

解决方案:一个由三部分组成的团队

为了构建 OmniVR,作者创建了一个三步走的策略,将一个“电影制造者”AI 转化为一个“电影修复者”AI。

1. “伪造旧电影”工厂
首先,团队需要教会 AI 什么是破损的旧电影。由于他们找不到足够的、带有完美“修复前后对比”的真实破损电影来进行训练,于是他们建造了一个数字工厂。他们提取高质量的现代视频和音频,并故意将其破坏。他们在视频中加入了数字划痕、灰尘、闪烁和模糊,并在音频中加入了嘶嘶声、爆裂声和沉闷感。他们确保这些“伪造”的损坏看起来和听起来都与历史书籍中的真实情况完全一致。这使得 AI 能够练习修复它从未见过的故障,学习如何辨别真实的脸部与模糊的混沌之间的区别。

2. “沉默伙伴”技巧
他们使用的初始 AI 是一个旨在根据文本描述(如“一只奔跑的猫”)生成电影的巨型模型。他们不想从头开始重新训练整个模型,因为那会耗时过久,并可能让模型忘记如何进行创作。相反,他们使用了一个聪明的技巧。他们告诉 AI:“保留你制作电影的能力,但现在,不要听从文本描述,而是听从我们给你的破损电影。”
他们通过将坏掉的视频和坏掉的音频输入到 AI 的“耳朵”(输入通道)中来实现这一点,同时保持“大脑”基本不变。他们还使用了一种特殊的**提示词退火(prompt annealing)**技术。想象一下 AI 正在学习一门新语言。起初,他们让它阅读原始的场景文本描述以保持热度。然后,他们慢慢地用一条固定的指令替换这些描述:“使其清晰、锐利且同步。”这帮助 AI 平滑地从“创造新事物”过渡到“修复旧事物”,而不会失去其创造力。

3. 长电影的“锚点”
旧电影可能非常长,但 AI 一次只能处理短小的片段(约 5 秒或 121 帧)。如果你只是简单地将这些片段拼接在一起,一段的结尾可能会与下一段的开头略有不同,导致视频跳跃或色彩偏移。为了解决这个问题,作者使用了“首帧锚点”。当 AI 完成一个片段的修复后,它会取所创建的最后一帧作为下一个片段的“起点”。这就像一场接力赛,跑步者将接力棒交给下一个人;下一个跑步者会从前一个人的终点处精准开始。这保证了即使是长篇电影也能保持流畅和连续。

研究发现:建立新标准

团队在他们创建的一个名为 OmniVRBench 的新基准测试上测试了 OmniVR,该测试包含 200 个真实的的历史片段。他们将自己的方法与现有的最佳工具进行了比较,这些工具通常是将视频和音频分开修复,或者仅仅是为黑白电影添加色彩。

结果显而易见:OmniVR 是第一个成功同时修复视频、音频和色彩的方法。

  • 视觉质量: 在衡量图像看起来多么“自然”和锐利的量表上,OmniVR 的得分显著高于其他任何方法。它不仅去除了模糊,还找回了那些已经丢失的细节,如皮肤纹理和织物图案。
  • 音频质量: 修复后的声音更加清晰,嘶嘶声更少,音量更佳。它听起来更像人类在说话,而不是像铁罐子里的机器人。
  • 同步性: 由于视频和音频是共同修复的,唇语动作与言语完美契合。其他方法往往会让音频听起来不错,但嘴唇看起来不同步,或者反之亦然。
  • 色彩: 它不仅仅是添加随机颜色;它添加了与场景光影和氛围相符的、具有“合理性”的色彩,使黑白电影看起来像是用彩色拍摄的一样。

研究人员还展示了仅仅结合一个视频修复器和一个音频修复器(即“级联”方法)效果并不理想。这两个独立的工具无法进行交流,因此经常会出现错误,而联合模型则避免了这些错误。例如,一个独立的音频修复器可能会稍微改变声音的时机,从而导致与视频不同步,但 OmniVR 始终让它们紧密锁定在一起。

总结

OmniVR 证明了修复历史不仅仅是清理一张图片或一个音频文件,更是理解两者之间的关系。通过将视频和音频视为一个单一且相互关联的故事,该模型可以恢复那些曾被认为已经失落的细节。虽然论文指出,对于极其严重的损坏(如帧完全缺失的情况)仍然具有挑战性,且 AI 偶尔可能会为了填补空白而产生一点点“幻觉”细节,但其结果是一次巨大的飞跃。它提供了一种让过去重现生机的方式,不仅是作为一个静态图像,而是作为一个鲜活、呼吸着的、同步的体验。该代码和模型正向公众开放,这意味着任何人现在都可以使用这个“时空旅行侦探”来修复属于他们自己的旧记忆。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →