← 最新论文
💻 computer science

Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction

本文通过提出用于解耦文本条件的层级视觉锚定字幕(HVGC)框架,以及通过双重交叉注意力机制实现鲁棒语义与时间同步的 BridgeDiT 模型,解决了文本生成声画同步视频的挑战,从而在多个基准测试中实现了最先进的性能。

原作者: Kaisi Guan, Xihua Wang, Zhengfeng Lai, Xin Cheng, Peng Zhang, XiaoJiang Liu, Ruihua Song, Meng Cao

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaisi Guan, Xihua Wang, Zhengfeng Lai, Xin Cheng, Peng Zhang, XiaoJiang Liu, Ruihua Song, Meng Cao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你只想通过输入一句话就能创造出一个电影场景,比如“铁匠敲击一块红热的铁”。你希望视频能展示出锤子击打的过程,并且音频要是金属碰撞时发出的响亮“锵锵”声,且声音要与锤子击打的时刻完美同步。

这篇论文介绍了一个名为 BridgeDiT 的新系统,它正是为此而生。它能将文本转化为带有完美同步音效的视频。作者认为,以往的尝试就像是试图先分别盖好屋顶和地基,然后祈祷它们能对得上。结果往往是屋顶迟到了,或者声音不对。

以下是他们如何解决这一问题的简单解释:

1. 问题所在:两种不同的语言

研究人员发现了阻碍其他系统发挥作用的两个主要痛点:

  • “一份剧本给两个演员”的问题: 想象一位导演给一位负责视觉角色的演员和一位负责音频角色的演员发了完全相同的剧本。视觉演员需要了解颜色和形状,而音频演员需要了解音量和节奏。如果你给他们同样的文本,他们会感到困惑。音频演员可能会试图去“听”一种颜色,而视觉演员可能会试图去“看”一种声音。这会导致干扰
  • “短笔记与长故事”的问题: 当你向 AI 发出指令时,你通常给的是像“人敲打铁”这样简短的笔记。但 AI 是在像“一个脸上带着煤烟的强壮铁匠,正用发光的橙色铁锤敲击滚烫的铁砧,火星四溅”这样长而详细的故事上进行训练的。如果你把短笔记喂给 AI,它会迷失方向,因为它习惯了长篇大论。

2. 解决方案: “翻译官与编辑”团队 (CRR)

为了解决剧本问题,他们构建了一个名为交叉参考重写器 (Cross-Referential Rewriter, CRR) 的智能流水线。你可以把它想象成一个由两名编辑组成的协作团队:

  • 事实核查员(语义检查器): 首先,他们获取用户的短笔记,并构思这个场景看起来和听起来是什么样的。但这里的诀窍在于:他们并不只是靠猜测。他们会对视觉和音频的想法进行交叉核对。如果音频编辑建议加入“鸟鸣声”,但视觉编辑看到的却是“铁匠”,那么事实核查员就会说:“不对,铁匠铺里不该有鸟。”它会过滤掉幻觉(虚假的声音),只保留那些相互匹配的事物。
  • 专业作家(跨模态重写器): 事实经过核查后,这个团队会将故事拆分为两个独立且完美的剧本。
    • 剧本 A(视频): 只描述你看到的(锤子、火星、肌肉)。它严格避免使用“响亮”或“锵锵”之类的词汇。
    • 剧本 B(音频): 只描述你听到的(金属的鸣响、节奏)。它严格避免使用“红色”或“锤子”之类的词汇。
    • 神奇之处: 他们还会将你的短笔记(“人敲打铁”)扩展成 AI 所热爱的长而详细的故事,确保短笔记的处理方式与长篇训练故事保持一致。

3. 解决方案: “桥梁” (BridgeDiT)

一旦两个演员拿到了各自完美且独立的剧本,他们就需要协同表演。在过去,系统要么试图强迫他们共用一个大脑(这很混乱),要么在他们之间筑起一道墙(这意味着他们无法同步)。

作者构建了一座名为双向交叉注意力 (Dual Cross-Attention, DCA)桥梁

  • 想象一下,视频 AI 和音频 AI 是住在两个不同房间里的人。
  • 他们并没有试图把两个房间合并成一个,而是通过这两个房间之间建立了一个特殊的双向对讲机系统。
  • 每隔几秒钟,视频那边会向音频那边低声说:“我现在正在敲锤子!”
  • 音频那边会回话:“好的,我现在正在发出‘锵锵’的声音!”
  • 这种沟通持续不断且是双向的。这确保了当视频显示锤子移动时,音频准确知道何时开始发声,同时又不会把视觉细节与声音细节混淆。

4. 结果

论文在三个不同的数据集上测试了这个系统。结果显示:

  • 视频和音频的同步性比以往任何方法都更好。
  • 声音与文本描述的匹配度更高。
  • 人类测试者更喜欢这些视频,因为其节奏感非常自然,就像真实的电影一样,而不是那种配乐略微错位的视频。

总而言之: 这篇论文不仅仅是构建了一个更好的视频生成器;它还构建了一个更好的指挥家。它利用一个聪明的编辑来编写两个独立的、完美的剧本(一个给眼睛看,一个给耳朵听),并通过一座特殊的桥梁确保两位音乐家能够完美合拍,从而从简单的文本提示中创造出无缝衔接的体验。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →