← 最新论文
💻 computer science

DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech

DuplexGen 是一个新颖的对话合成框架,它通过使用大语言模型进行剧本生成,随后由两个全双工对话模型进行实时交互,从而将内容、时序和声学特征解耦,进而能够在保留剧本内容和高保真语音质量的同时,实现如中断和重叠等自然生成的对话动态。

原作者: Pengcheng Wang, Sheng Li, Jiyi Li, Takahiro Shinozaki

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Pengcheng Wang, Sheng Li, Jiyi Li, Takahiro Shinozaki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类的对话是一场关于时机的、微妙且高速的舞蹈,说话者在说话的同时不断倾听,彼此打断,在短暂的爆发中重叠,并提供如“嗯哼”之类的快速回应,而不破坏流向。几十年来,计算机一直难以模仿这种自然的节奏。虽然人工智能在生成人类所说的话语方面已经变得非常出色,但在捕捉真实交谈中那种混乱、自发的时机方面,历史上却一直表现不佳。大多数现有系统都是先生成一段剧本,然后试图通过僵化的预设规则将中断或停顿强加到音频中。其结果往往听起来生硬且不自然,缺乏定义了真实人类交流的那种流畅的互动感。这种局限性对于构建语音识别系统的研究人员来说至关重要;如果训练数据听起来过于完美或过于机械,那么当软件遇到医生诊室或繁忙咖啡馆中的混乱现实时,它将会失效。

一个研究团队推出了一种名为 DuplexGen 的新方法,改变了合成对话的构建方式。他们没有将对话视为一个单一的、整体的过程,而是将任务分解为三个不同的阶段:决定说什么、决定何时说以及决定听起来如何。首先,一个大语言模型编写剧本,确定准确的词汇和说话顺序。这确保了内容保持固定且可控。接着,两个人工智能模型同时演绎这个剧本。与遵循严格时间表的传统系统不同,这两个模型会实时倾听彼此,就像人类一样。它们独立决定是说出剧本中的下一个词,还是保持沉默,从而让对话的时机从它们的互动中自然产生。最后,一个高保真语音合成器重新录制整个交互过程,在确保音频清晰且真实的同时,保留了两个模型创造的精确时机和重叠。

研究人员通过创建患者与临床医生之间的模拟对话语料库来测试这种方法,在这样的场景中,精确的时机和自然的打断至关重要。他们将这种新兴的、由互动驱动的方法与旧方法进行了对比,旧方法只是将预录制的语音片段与固定的或随机的间隙拼接在一起。结果显示出明显的差异。新方法产生的对话具有重叠的语音和长停顿,这与在真实人类录音中发现的统计模式非常吻合。相比之下,旧的拼接方法无法复制这些自然动态,而是坍缩成一种单一且不自然的语音模式,几乎没有任何重叠。研究发现,该新框架将合成对话与真实对话在时机上的统计距离缩小了近一半,成功捕捉到了人类互动的复杂节奏,而没有改变剧本内容。

除了听起来更自然之外,这种方法还为测试语音识别技术提供了一个强大的工具。由于研究人员分别控制了时机和内容,他们可以为软件创造特定的难度等级。他们生成了三个层级的对话:干扰较少的礼貌互动、具有典型重叠的自然互动,以及具有密集频繁打断的对抗性互动。当他们在这些录音上测试流行的语音识别系统时,随着对话变得更加重叠和困难,错误率也稳步上升。至关重要的是,研究表明,难度来自于重叠的时机本身,而不仅仅是音频的质量。这一区别使得工程师能够以受控的方式对系统进行压力测试,确保它们能够处理两人互相说话时的混乱现实。

研究人员承认,他们的系统并不是人类对话的完美复制品。由于单词在互动开始前就已经固定,说话者无法在句子中间改变主意或自我纠正,这限制了互动的深度。此外,目前的系统主要处理句子边界处的重叠,而不是句子深处的重叠。然而,这项工作证明了,通过将内容与时机解耦,生成感觉鲜活且具有响应性的合成语音是可能的。这一突破提供了一种新的、可靠的方法,用于创建大量的现实主义训练数据,以教导计算机如何理解人类语言中复杂的、重叠的本质。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →