← 最新论文
💻 computer science

Reference-Driven Multi-Speaker Audio Scene Generation from In-the-Wild Priors

该论文介绍了 ScenA,一种参考驱动的多发言人音频生成方法,它利用在野外数据上预训练的文本到音频流匹配模型,通过以参考声音和自由形式提示词为条件,来创建具有环境噪声且真实的重叠对话场景,同时通过高噪声偏置训练策略克服了“参考捷径”挑战。

原作者: Michael Finkelson, Daniel Segal, Eitan Richardson, Shahar Armon, Nani Goldring, Poriya Panet, Nir Zabari, Benjamin Brazowski, Or Patashnik, Yoav HaCohen

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael Finkelson, Daniel Segal, Eitan Richardson, Shahar Armon, Nani Goldring, Poriya Panet, Nir Zabari, Benjamin Brazowski, Or Patashnik, Yoav HaCohen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想创作一段生动活泼的广播剧,其中有两个不同的演员、背景音乐以及嘈杂咖啡馆的环境音。

旧方法(“流水线”模式)
以前,如果你想制作这样一个场景,你必须像一个拿着剪贴板、严格执行命令的电影导演一样。你必须:

  1. 写一份精确规定谁在何时说话的剧本(例如:“第1句:说话者A”,“第2句:说话者B”)。
  2. 单独生成说话者A的声音。
  3. 单独生成说话者B的声音。
  4. 手动将这些音频片段拼接在一起。
  5. 在上面叠加背景噪音。

结果往往听起来很“干净”但很假,就像两个人在真空里说话一样,因为系统并不知道他们应该如何重叠、如何一起大笑,或者如何应对房间的声学环境。

新方法 (SCENA:“即兴导演”)
这篇论文介绍了一个名为 SCENA 的新系统。你不再需要拿着剪贴板,只需给 AI 一个用自然语言描述的自由流动的故事即可。

  • 提示词(Prompt): 你输入:“钢琴声轻柔响起。第一个说话者快速说‘嗨!’。第二个说话者同时大喊‘欢迎!’,两人的声音完美地融合在一起。”
  • 参考资料(References): 你上传两个短小的音频片段作为你想要使用的声音(声音1 和 声音2)。
  • 神奇之处: AI 阅读你的故事,并瞬间生成整个场景。它能搞定谁在何时说话、让声音自然重叠、加入钢琴声,甚至让房间听起来真实无比——这一切都是一次性完成的。

他们解决的核心问题:“作弊捷径”

当研究人员最初尝试用这种方式教导 AI 时,它试图“作弊”。

想象一个学生正在参加一项测试,要求他根据描述匹配照片。

  • 目标: 学生应该阅读描述(“戴红帽子的男人”)并找到匹配的照片。
  • 作弊: 学生看着试图解决的照片,看到了红帽子,然后直接选择了看起来最像那张照片的人,完全忽略了描述。

在 AI 的案例中,在训练期间,“测试”是一个带有噪声、被扰乱的版本音频。AI 意识到它只需听着这些被扰乱的噪声,找到听起来最接近的声音,然后直接复制它即可。它不需要阅读你的文本提示来知道谁在说话。这在训练期间效果极佳(误差得分很低),但在实际使用时却表现得一塌糊涂,因为真正的生成过程是从“纯粹的静默”开始的(没有可以用来作弊的噪声)。AI 已经学会了忽略你的指令。

解决方案:“高噪声饮食”

为了修复这个问题,研究人员改变了 AI 的“训练饮食”。

通常,AI 训练发生在“中等噪声”水平,此时答案仍然隐约可见。研究人员意识到,这正是作弊发生的地方。他们转向了一种 高噪声偏向型方案(High-Noise-Biased schedule)

把这想象成教一个人在暴风雪中识别面孔:

  1. 旧方法: 给他们看一张略微模糊的照片。他们仍然能看到特征,并在不阅读线索的情况下猜出名字。
  2. 新方法 (SCENA): 给他们看一张 90% 都是白雪的照片。唯一的办法就是阅读线索(“那是戴红帽子的家伙”)。

通过强迫 AI 主要在音频几乎全是静态噪声的情况下进行学习,他们迫使 AI 停止作弊,转而真正学会通过倾听你的文本指令来决定哪个声音在何时说话。

结果

当他们测试这个新系统时:

  • 更好的绑定能力(Binding): 它比之前的系统能更准确地将正确的声音分配给故事的正确部分。
  • 真实感: 它创造了重叠的语音、笑声、叹息和背景噪音,听起来像是真实的、混乱的对话,而不是那种死板的录音室录制。
  • 适应性(Wild Cards): 即使声音片段是在嘈杂的现实环境(如街道或公园)中录制的,它依然表现良好,而非仅限于安静的录音室。

简而言之,SCENA 是一个让你只需通过一个故事和一些声音片段,就能导演一场多角色音频场景的系统,无需编写复杂的剧本或手动编辑音频,因为它学会了倾听你的话语,而不是寻找捷径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →