← 最新论文
💻 computer science

Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation

Unison 是一个统一框架,通过语义引导的音频解耦与双向跨模态强制策略,显式地协调动作、语音和音效,从而确保精确的时间对齐与声学清晰度,以实现最先进的以人为中心的音视频生成。

原作者: Shihao Cheng, Jiaxu Zhang, Quanyue Song, Shansong Liu, Zhizhi Guo, Xiaolei Zhang, Chi Zhang, Xuelong Li, Zhigang Tu

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Shihao Cheng, Jiaxu Zhang, Quanyue Song, Shansong Liu, Zhizhi Guo, Xiaolei Zhang, Chi Zhang, Xuelong Li, Zhigang Tu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在执导一场电影场景:一名演员在雨中一边弹吉他一边唱歌。在一个完美的世界里,歌声、吉他扫弦声和雨声会在恰好的时刻同时发生,融合成一种优美而自然的体验。

然而,当前试图制作这类视频的 AI 工具往往力不从心。它们可能会把演员的声音调得过大,以至于盖过了吉他和雨声;或者让演员的嘴唇随着吉他音符开合,而不是随着歌词动作。这就像一支乐队,歌手在乐器声之上嘶吼,而鼓手则节奏混乱。

这篇论文介绍了一种名为Unison(意为“协同一致”)的新 AI 框架,旨在解决这些问题。你可以将 Unison 想象为一位技艺高超的音视频指挥,确保视频中的每个元素都能完美和谐地协作。

以下是它如何通过简单的类比解决两个主要问题:

1. “音量旋钮”问题(语音与音效)

问题所在: 在以往的 AI 模型中,“语音”(演员说话或唱歌)就像派对上的一个霸凌者。它会占据所有空间,将“音效”(如雨声、风声或吉他扫弦)挤到背景中,直到几乎听不见。其结果是音频平淡乏味,环境显得虚假。

Unison 的解决方案: Unison 扮演一位拥有两个独立调音台的智能音频工程师的角色。

  • 分离: Unison 不再试图将人声和吉他混在一个杂乱的堆里,而是在两条独立的音轨上分别构建它们。
  • “智能门控”(SCG): 想象一个交通信号灯系统。如果场景主要是演员在说话,系统会自动将背景噪音的音量降低到刚好让人声清晰的程度。但如果场景是音乐会或暴风雨,系统则会调高背景声音,防止它们被人声淹没。
  • “握手”(Bi-ACA): 人声音轨和声音音轨不断相互“交流”。它们互相检查,确保人声不会意外吞掉吉他声,反之亦然。这确保了最终的音频是一个平衡、丰富的混音,你能清晰地听到歌手和雨声。

2. “唇形同步”问题(动作与声音)

问题所在: 视频和音频经常不同步。演员可能会在声音发出后的一刹那才张开嘴,或者在听到音符之前就开始扫弦。这感觉就像视频和音频是两个从未一起排练过的不同的人。

Unison 的解决方案: Unison 使用一种称为“跨模态强制”的训练演练

  • 类比: 想象两位舞者正在学习一套舞蹈。通常,他们会尝试以完全相同的速度学习整支舞。如果其中一人绊倒,另一人也会绊倒,两人都会感到困惑。
  • Unison 的转折: Unison 让其中一位舞者(比如音频)以稍快且更清晰的速度学习舞步,而另一位(视频)则稍慢。这位“更清晰”的舞者随后充当向导,向那位“更杂乱”的舞者精确展示下一步该踩在哪里。
  • 结果: 通过让更清晰的信号引导较杂乱的那个,AI 学会了将视频动作和声音完美地锁定在一起。久而久之,演员的嘴唇会在说出话语的同一时刻移动,吉他的扫弦也会在手指触弦的同一瞬间响起。

最终结果

当你将这两个解决方案结合起来时,Unison 创造出的视频感觉真实

  • 不再互相淹没: 你既能听到歌手,也能听到背景音乐。
  • 不再延迟: 动作和声音在同一时刻发生。

论文表明,Unison 不仅让视频看起来好看,还让它们听起来悦耳、感觉同步,从而创造出比以往 AI 模型更具沉浸感的体验。它无需庞大的计算机即可实现这一目标,证明了智能的组织方式(如分离音轨和引导学习)与原始算力同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →