← 最新论文
💬 NLP

Elderly-Contextual Data Augmentation via Speech Synthesis for Elderly ASR

本文提出了一种数据增强流程,该流程将基于大语言模型的转录文本改写与使用老年参考说话人的文本转语音合成相结合,以生成合成老年语境数据,从而显著提升了 Whisper 自动语音识别模型在低资源老年语音数据集上的性能。

原作者: Minsik Lee, Seoi Hong, Chongmin Lee, Sieun Choi, Jian Kim, Jua Han, Jihie Kim

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Minsik Lee, Seoi Hong, Chongmin Lee, Sieun Choi, Jian Kim, Jua Han, Jihie Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个聪明的机器人理解世界。你给它一座庞大的图书馆(数据)去学习。但问题在于:这座图书馆里充满了由年轻、精力充沛的人快速而清晰地讲述的故事。其中关于老年人的故事却寥寥无几,他们的声音可能有些颤抖、语速较慢,或用词不同。

由于机器人没有针对这些特定声音进行足够的练习,当老年人对它说话时,它会感到困惑并犯错。这正是本文要解决的核心问题:如何在缺乏足够真实老年人录音供其学习的情况下,教会语音识别机器人理解老年人。

以下是作者如何通过“两步魔法”解决这一问题的:

1. 问题:缺失的图书馆

作者指出,大多数语音数据集就像一座缺失了“老年专区”的图书馆。70 岁以上人群的真实录音很难找到,因为获得录音许可很困难,而且许多现有录音只是人们朗读脚本(像新闻主播那样),而非自然交谈。由于缺乏足够的练习数据,机器人(具体指名为Whisper的模型)在处理老年人语音时会频频出错。

2. 解决方案:“代笔作家”与“配音演员”

与其等待更多真实录音,研究团队构建了一个流程,利用两种工具创造新的练习数据:

  • 步骤 A:“代笔作家”(大型语言模型)
    首先,他们选取一个现有句子,请一位超级聪明的 AI 作家(大型语言模型)对其进行改写。但他们并非仅仅要求替换同义词,而是给 AI 一个具体指令:“请将这句话改写为仿佛由一位老年人说出的样子。”

    • 类比: 想象你有一个句子,比如“会议在下午 3 点开始”。AI 将其改写为听起来像祖父母可能会说的话,或许会添加一些背景信息,或调整措辞以符合老一辈人的说话方式。这样就生成了一份对老年说话者而言显得真实的“脚本”。
  • 步骤 B:“配音演员”(文本转语音)
    一旦 AI 写好了这些“老年风格”的脚本,它们就被输入到一个**文本转语音(TTS)**系统中。然而,他们并未使用通用的机器人声音,而是使用了一个包含真实老年人录音的特殊“声音库”。

    • 类比: 这就像聘请一位听起来完全像 75 岁老人的配音演员来朗读新脚本。结果是一份全新的音频文件,听起来就像一位真实的老年人在说话,尽管其中的文字是由计算机生成的。

3. 结果:更出色的机器人

团队将这些新创建的“虚假”但逼真的音频片段与他们拥有的少量“真实”片段混合在一起。随后,他们利用这个庞大的混合数据集重新训练了机器人(Whisper)。

发生了什么?
机器人在理解老年人语音方面显著 improved。

  • 成绩: 在他们的测试中,与未使用此特殊技巧训练时相比,机器人的错误率降低了58.2%
  • 秘诀: 他们发现,添加的“虚假”老年人数据越多(最多将训练集规模翻倍),机器人的表现就越好。他们还发现,在“配音演员”中混合使用男性和老年人的声音,比仅使用单一性别效果更好。

4. 为何重要(根据论文所述)

该论文表明,你无需等待世界神奇地产生更多老年人的录音。你可以利用 AI 来模拟缺失的数据。通过结合一位聪明的作家(用于改变文字)和一位聪明的配音演员(用于改变声音),他们填补了机器人图书馆中的空白。

简而言之: 他们通过创建一个充满合成老年声音的“练习健身房”,教会了机器人理解老年人,使机器人能够在不需要成千上万条新的真实世界录音的情况下,学习衰老语音独特的节奏和风格。

注:该论文严格专注于提高针对 70 岁以上人群的语音转文字软件的准确性。它并未声称该技术目前正被用于医院、医疗诊断或特定的临床治疗中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →