← 最新论文
💻 computer science

Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation

Omni-Customizer 是一个端到端框架,通过引入 Omni-Context Fusion、Masked TTS Cross-Attention 和 Semantic-Anchored Multimodal RoPE 等新颖模块,实现精确的音视频联合生成,确保在多个主体间保持视觉身份与语音音色的连贯性,从而解决语音泄露等挑战并达成最先进的多模态定制水平。

原作者: Yuheng Chen, Qingdong He, Teng Hu, Yuji Wang, Yabiao Wang, Lizhuang Ma, Jiangning Zhang

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuheng Chen, Qingdong He, Teng Hu, Yuji Wang, Yabiao Wang, Lizhuang Ma, Jiangning Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位导演,正试图拍摄一个有多位演员出演的电影场景。你有一份剧本,但同时也必须确保演员 A始终看起来像你所聘请的特定人物,声音也完全符合其独特的嗓音;而演员 B也要做到同样的事情。如果摄像机感到困惑,你可能会得到演员 A 的脸在动,却说着演员 B 的声音;更糟糕的是,演员们可能会因为你在场景笔记中描述了某些内容,而开始说出剧本中根本没有的台词。

这正是Omni-Customizer所要解决的确切问题。它是一个全新的 AI 系统,旨在创建多人对话和互动的视频,同时完美地保持每个人独特的外貌和声音。

以下是其工作原理,通过简单的类比进行分解:

1. 问题:困惑的导演

之前的 AI 工具要么擅长制作视频,要么擅长制作音频,但当它们试图同时为多个人完成这两项任务时,就会感到困惑。

  • 混淆: AI 可能会搞错谁在说话。它可能会让穿红衬衫的男人说出女人的台词。
  • “幽灵”声音: 有时,AI 会意外地将场景的描述转化为语音。如果你写道“这个男人很高”,AI 可能会让角色真的说出“我很高”,即使这并不在对话中。
  • 漂移: 随着视频的推进,角色可能会逐渐改变他们的面部或声音,从而失去其身份特征。

2. 解决方案:"Omni-Customizer"工具包

研究人员构建了一个包含三个主要“工具”的系统来解决这些问题:

A. “超级连接器”(Omni-Context Fusion)

想象一下,AI 的大脑有不同的部门:一个负责文本,一个负责图片,一个负责声音。通常,这些部门之间交流非常缓慢且间接。

  • 修复方案: Omni-Customizer 构建了一个“超级连接器”,迫使所有这些部门坐在同一张桌子旁进行即时交流。它在视频生成开始之前,将人物的描述、照片和声音样本融合成一个紧密的整体。这确保了 AI 知道:“这张脸、这个声音和这个名字都属于同一个人。”

B. “姓名标签”系统(Semantic-Anchored RoPE)

想象你有一堆拼图碎片:有些是脸,有些是声音,有些是文字。如果你只是把它们扔进一个盒子里,它们就会混在一起。

  • 修复方案: 该系统使用一种特殊的“姓名标签”(称为 SA-MRoPE)。它将“脸 A"和“声音 A"的拼图碎片直接物理附着在剧本中的文本单词“主体 1"上。这就像在拼图碎片上贴上磁性标签,使它们无法飘走并附着到错误的人身上。这阻止了 AI 在拥挤的场景(例如有三四个人的场景)中搞混谁是谁。

C. “静音按钮”(Masked TTS Cross-Attention)

还记得 AI 意外说出场景描述的那个问题吗?

  • 修复方案: 研究人员安装了一个“静音按钮”(MTP-CA)。他们告诉 AI:“只说 <S>(开始)和 <E>(结束)标签内的文字。”其他所有内容——比如天气或角色服装的描述——都被严格静音。AI 在生成语音时被迫忽略描述性文本,因此它永远不会意外地大声读出舞台指示。

3. 训练:“健身房常规”

为了训练这个系统,研究人员并没有一次性将所有数据都扔给它。他们使用了一个智能的训练计划:

  • “仅音频”训练: 有时,AI 只练习音频(聆听声音和学习语言),而不必担心视频。这有助于它学习多种语言而不感到困惑。
  • “视频 - 音频”训练: 其他时候,它练习让视频和音频完美匹配(对口型)。
  • “由易到难”的阶梯: 他们首先教 AI 处理只有一个人说话的情况。一旦它掌握了这一点,就转向两个人,最后转向多个人互相交谈的复杂场景。这种循序渐进的方法防止了 AI 感到不知所措。

4. 结果

经过测试,Omni-Customizer 证明它能够:

  • 即使在长时间的对话中,也能保持面部和声音的一致性。
  • 防止“幽灵声音”问题(即描述被说出来)。
  • 比任何之前的开源模型更好地处理多人的复杂场景。

简而言之: Omni-Customizer 就像一个组织严密的电影剧组,永远不会搞错哪位演员是谁,确保他们只说实际的台词,并从第一秒到最后一秒保持他们的声音和面部特征的一致性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →