← 最新论文
⚡ electrical engineering

DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling

本文介绍了 DuplexChat,这是一个大规模开源的英语和日语说话人分离的全双工对话语音语料库,通过 DuplexChat-Pipe 流水线从公开播客中构建而成,旨在解决用于对话语言模型的合适训练数据匮乏的问题。

原作者: Wataru Nakata, Yuki Saito, Hiroshi Saruwatari

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Wataru Nakata, Yuki Saito, Hiroshi Saruwatari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想要教一个机器人如何进行自然、像人类一样的对话。问题在于,我们用来教机器人的“教科书”大多像是听一个人在打电话,当两个人同时说话时,你无法分辨谁在说话。那是一个混乱、混合在一起的音频轨道。

为了教机器人掌握真实对话的艺术——即人们互相插话、在对方说话时说“嗯哼”、以及快速地来回切换话题——你需要一种特殊的训练数据:两条独立的音频流,且每条音频都必须是完美同步的。

这篇论文介绍了 DuplexChat,这是一个庞大的新型对话库,以及构建它的神奇机器 DuplexChat-Pipe

问题所在:“果昔” vs. “水果盘”

把现有的公开语音数据(如播客)想象成一杯巨大的果昔。你有苹果(说话者 A)、橙子(说话者 B),可能还有冰淇淋(音乐或广告),它们全部被搅拌成了一杯单一的液体。你可以尝出水果的味道,但你无法将苹果从橙子中分离出来进行单独研究。

为了让机器人学习自然的对话,它需要一个水果盘,其中每一块水果都在各自独立的碗里。直到现在,大规模获取这种“水果盘”几乎是不可能的,因为这通常需要雇人录制电话通话,既慢又贵。

解决方案:“DulexChat-Pipe”工厂

作者构建了一个名为 DuplexChat-Pipe 的开源工厂,它能将“果昔”(来自互联网的公开播客馈送)神奇地重新分类回“水果盘”。这个工厂的工作步骤如下:

  1. 寻找原料(馈送收集): 工厂扫描互联网上的播客 RSS 馈送(就像一份节目的购物清单),并过滤掉那些不是英语或日语的内容。
  2. 清洗水果(音频检索与清理): 它下载音频集。如果某个节目纯粹是音乐,或者单集时长超过三小时(通常是长时间的音乐流),则会被丢弃。剩余的音频会被清理并标准化。
  3. 切割合适的碎片(对话切分): 工厂使用一种智能“说话者检测器”(声纹识别/说话人日志)来寻找播客中恰好有两个人在交谈的部分。它会切掉音乐、广告以及只有一个人在独白的片段。它只保留“双人聊天”的片段。
  4. 神奇的分离(语音分离与修复): 这是最关键的一步。工厂使用一种特殊的 AI 模型(DialogueSidon)将混合音频(果昔)拆解回两条独立的轨道:一条属于左侧的人,另一条属于右侧的人。它还会清理噪声,使声音变得清脆清晰。

结果:一个庞大的对话库

通过运行这个流水线,作者创建了 Duichat,它是目前世界上同类资源中规模最大的。

  • 英语: 超过 282,000 小时的双人对话。
  • 日语: 超过 132,000 小时的双人对话。

为了让你有个直观的概念,之前的庞大数据集就像一个小图书馆;而 DuplexChat 则像是整个国会图书馆。

它有效吗?(品尝测试)

作者通过将他们的“水果盘”与金标准数据集 Fisher(由真实的电话通话组成)进行对比,来检查 DuplexChat 的质量是否达标。

  • 音质: DuplexChat 中的声音实际上比电话录音更干净,噪点更少。
  • 分离度: AI 在保持两个声音清晰区分方面做得很好,尽管在英语上的表现略优于日语(这可能是因为分离工具在训练时更多使用了英语数据)。
  • 真实感: 他们分析了这些录音中的说话方式。他们发现这些对话具有人类语言自然的“舞步”:人们会互相插话、使用反馈词(如“是的”或“对”),并且快速切换话轮。例如,日语数据展示了更频繁的插话和重叠语音,这符合该文化中真实的语言行为。

核心结论

该论文声称,DuplexChat-Pipe 是第一个可以大规模将互联网上混乱、混合的音频转化为干净、分离的双人对话数据集的开源、可复用的工具。由此产生的 DuplexChat 数据集提供了所需的“水果盘”,用于训练下一代 AI,使其能够与人类进行自然、往复的对话,捕捉到真实对话中那种杂乱、重叠且生动的动态特性。

注:作者谨慎地指出,由于这些数据是从公开互联网抓取的,他们仅发布了音频的“链接”和重建它的代码,而非音频文件本身,以尊重版权法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →