← 最新论文
💬 NLP

DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects

本文介绍了 DialectS2S,一种针对低资源中文方言的端到端语音对话模型,该模型利用可扩展的数据合成流水线和两阶段自对齐后训练策略来克服数据稀缺和语义不一致问题,显著提升了方言一致性、响应质量和语音清晰度。

原作者: Yi Shu, Tianyu Peng, Yingzhuo Deng, Wen Yang, Jun Lin, Changming Xie, Xinyu Yu, Jiajun Zhang

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Yi Shu, Tianyu Peng, Yingzhuo Deng, Wen Yang, Jun Lin, Changming Xie, Xinyu Yu, Jiajun Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你的手机不仅能理解学校里教的那些“官方”语言,还能听懂你朋友和长辈们真正使用的那些色彩斑斓、充满俚语的表达方式。长期以来,最聪明的计算机大脑——被称为“语音对话模型”——就像是只会在教科书上说完美普通话或英语的精英学生。它们可以用这些语言流利地聊天,但如果你用四川话或粤语等地方方言问它们问题,它们往往会感到困惑,说话声音机械单调,或者干脆切换回官方语言。这是一个大问题,因为方言是地方文化和家庭纽带的心跳。问题在于,并没有足够的方言录音来教会计算机如何自然地说话。这就像是试图教一位厨师做一道特定的地方菜肴,但你手里只有一本食谱和一些零散的食材。

这项研究背后的研究人员开发了 DialectS2S,旨在解决这个问题,他们构建了一种全新的“语音到语音”(speech-to-speech)模型,使其能够用低资源中文方言进行自然对话。他们并没有仅仅尝试强迫计算机去死记硬背一些稀有的录音,而是发明了一种巧妙的方法,利用其他 AI 工具来创造数千个新的练习对话。他们还注意到一个棘手的问题:当你教计算机一种新方言时,它的内部“大脑”会改变其思考方式,但我们教它说话的方式却保持不变,从而导致了不匹配。为了解决这个问题,他们开发了一种两阶段训练方法,让计算机根据自己新的理解来进行自我教学,而不是遵循旧的、僵化的剧本。结果如何?该模型可以在四川话、粤语和天津话等方言中进行自然、清晰且连贯的对话,同时不会丧失说普通话或英语的能力。

问题所在:无法说家乡话的“机器人”

想象你有一个超级聪明的机器人朋友,它能用完美的英语和普通话讲笑话。但当你尝试用家乡方言与它交谈时,它开始结巴,听起来像一台坏掉的收音机,或者更糟的是,它直接忽略你的口音,用完美的普通话回答你。这正是目前的语音模型所面临的情况。它们在海量的主流语言数据上进行训练,但对于方言,数据却非常匮乏。

研究人员发现,仅仅尝试向这些模型灌输更多的方言数据往往会适得其反。这就像是在教一位钢琴家弹奏一首新曲子时,不是通过练习,而是通过让他们把旧曲子弹得更快、更大声;他们越努力,手指就越容易缠在一起。当模型学习一种新方言时,它的内部“思考”(如何理解意义)会发生变化和演进。然而,“说话”部分(如何将这种想法转化为声音)仍然在使用旧的、未改变的规则进行教学。这造成了不匹配:大脑在用方言思考,但嘴巴试图用一种不匹配的方式说话,导致说话听起来不自然或难以理解。

解决方案:构建一个方言游乐场

为了解决这个问题,团队构建了 DialectS2S,一个专门为低资源方言设计的系统。他们没有坐等人们录制更多的方言对话,而是制造了一台能够创造对话的机器。

1. 合成流水线(“方言工厂”)
由于真实的方言数据难以获取,他们创建了一个生成数据的流水线。

  • 第一步:改写剧本。 他们提取现有的高质量普通话对话,并使用大型语言模型将其“翻译”成四川话、粤语和天津话等方言。这就像是将一部标准的剧本重新编写对话,让角色听起来像是来自某个特定的村庄,保持故事不变,但改变其韵味。
  • 第二步:合成语音。 然后,他们使用语音生成模型将这些新的方言剧本转化为音频。对于对话中的“用户”部分,他们使用了多种声音以模拟不同的人;对于“系统”(AI)部分,他们保持了声音的一致性,使 AI 听起来像是一个可靠的角色。
  • 第三步:质量过滤。 并非所有的 AI 生成语音都听起来都很棒。他们使用了一个名为 UTMOS 的工具,自动过滤掉那些听起来机械化或发音不佳的片段,只保留高质量的“金牌”样本。

2. 两阶段训练(“自我修正循环”)
这是核心秘诀。研究人员意识到,传统的训练方法(仅仅展示例子并说“模仿这个”)之所以不起作用,是因为模型的内部理解正在发生偏移。

  • 第一阶段:混合数据微调。 首先,他们使用普通话、英语和新的方言数据混合进行训练。这有助于模型理解这些方言。
  • 第二阶段:自我对齐语音监督。 这是聪明之处。他们不再强迫模型去模仿旧的语音目标,而是让模型的“思考者”(理解意义的部分)生成自己的文本回复。然后,他们使用语音合成器将这些文本转化为新的语音。他们将这种新生成的语音作为“说话者”(发声的部分)的目标。
    • 类比: 想象一个正在学习说话的学生。在旧方法中,老师给他们一个剧本并说:“照着读。”而在新方法中,学生思考自己想说什么,写下内容,然后练习说出自己的话。这确保了他们说话的方式与其思考的内容完全一致,消除了“我想表达什么”与“我说了什么”之间的混乱。

结果:说出地道的家乡话

团队将他们的新模型与几种顶尖的语音模型进行了对比测试。结果令人印象深刻。

  • 语言匹配度: 当被要求使用特定方言时,DialectS2S 在四川话上的正确率达到了 96%,粤语为 95%,天津话为 91%。相比之下,其他模型往往得分极低,甚至为 0%(例如某竞争对手在四川话上的得分仅为 2.22%)。这体现了游客只会说几个短语与当地人可以畅谈一整天的区别。
  • 响应质量: 当人类对回答的自然度和准确度进行评分时,DialectS2S 在所有方言中的平均得分达到了 4.42 分(满分 5 分)。其他模型表现挣扎,在天津话上的得分甚至低至 2.06
  • 语音清晰度: 这衡量了语音是否易于理解。研究人员使用了字符错误率(CER)这一指标,数值越低越好。DialectS2S 在方言上的 CER 达到了 8.69%,这实际上优于现有方言基准测试的平均表现(为 11.67%)。这意味着其语音不仅带有“方言味”,而且清晰易懂。

这意味着什么

论文指出,通过将语音目标与模型自身不断演进的理解进行对齐,我们可以更有效地教会计算机使用低资源方言。团队证明,仅仅增加训练时间(如他们测试的 “sft-3ep” 方法)并不如他们的新自我对齐方法有效。事实上,仅仅延长训练时间有时反而会让语音变得不够清晰。

研究人员已经将他们的整个框架,包括代码和他们创建的数据,进行了开源处理。这意味着任何人都可以使用 DialectS2S 来构建自己的方言聊天机器人。虽然目前的模型涵盖了五种语言和方言(普通话、英语、四川话、粤语和天津话),但大门已经敞开,人们可以借此教计算机说出更多地方语言,在数字时代保护不同文化的独特声音。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →