← 最新论文
⚡ electrical engineering

WildElder: A Chinese Elderly Speech Dataset from the Wild with Fine-Grained Manual Annotations

本文介绍了 WildElder,这是一个从网络视频中采集的带有细粒度人工标注的普通话老年人语音数据集,旨在解决现有受控环境数据集的局限性,并为自动语音识别和说话人特征分析研究提供一个稳健的基准。

原作者: Hui Wang, Jiaming Zhou, Jiabei He, Haoqin Sun, Yong Qin

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Hui Wang, Jiaming Zhou, Jiabei He, Haoqin Sun, Yong Qin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人理解人类的语言。通常情况下,我们会在安静、完美的录音棚里训练这些机器人,那里的人说话清晰、缓慢,且没有任何背景噪音。这就像是在寂静的图书馆里,让一名学生通过教科书来学习阅读。但现实生活并不是图书馆,而是一个喧闹的市场。人们互相插话,含糊其辞,带着浓重的地域口音,有时说话的声音听起来还显得疲惫或颤抖。这就是“野外”(in-the-wild)语音的世界。虽然我们已经制造出了能完美阅读那本教科书的奇妙机器人,但当它们试图在真实世界中倾听真实的人类时,往往会完全陷入混乱。对于老年人来说情况尤其如此,他们的声音可能会颤抖、语速变慢,或者带有家乡独特的韵律色彩。如果我们希望机器人能帮助老年人的日常生活(例如作为语音助手或监测他们的健康),我们就需要教会它们如何去聆听这些真实的、杂乱的、且充满生命力的声音,而不仅仅是那些完美的“教科书式”声音。

这正是来自中国南开大学的一个研究团队决定解决的问题。他们意识到,虽然目前有一些老年人语音的集合,但它们大多是在受控实验室中录制的,因此过于干净和可预测,无法在真实的机器人应用中发挥真正的作用。为了解决这个问题,他们进行了一场数字“寻宝游戏”,以构建一个名为 WildElder 的新数据集。他们没有要求人们坐在录音室里,而是搜寻网络视频,寻找老年人自然、即兴的对话。他们找到了619个视频,总计超过71小时的原始素材。但原始素材就像一大堆杂乱无章的拼图碎片;它是混乱的。因此,团队花费了大量时间手动将这些视频切割成小巧、易于处理的片段,写下每一段话的具体内容,并为每个片段贴上标签,标注出说话者的年龄、性别以及口音强度。他们甚至制定了一套特殊的“规则手册”来对口音进行评分,范围从“轻微”(接近标准语)到“浓重”(需要高度专注才能理解说话者)。

其成果是一个包含23,701个语音片段的数据集,总时长达33.7小时,涵盖了从家庭故事到科学与历史的各种内容。研究人员不仅收集了数据,还对其进行了测试。他们尝试用这个新数据集来训练几种不同类型的语音识别机器人。结果却是一个现实的警示:即使是使用最先进的机器人,在“野外”环境下理解老年人的语音仍然非常困难。机器人犯了很多错误,尤其是在面对男性说话者以及85岁以上的老年说话者时。然而,这项研究也展示了一条清晰的前行之路。研究人员发现,当他们把已经在海量通用语音上接受过训练的机器人拿出来,再针对 WildElder 数据集进行专门的补充训练后,机器人的表现有了显著提升。这就像是一个已经学会阅读的学生,接受了一个关于“老年人方言”的强化课程——突然之间,他们就能更好地理解对话了。

团队发现,机器人在面对“浓重”口音和高龄老人(90岁以上)的声音时最为吃力,此时错误率会大幅上升。他们还注意到,机器人对女性说话者的理解通常比对男性说话者更好。虽然机器人目前还不完美,但 WildElder 数据集证明,通过使用这种正确类型的、杂乱的、真实的现实世界数据,我们可以开始构建真正适用于老龄化人口的技术。这并不是一个能在一夜之间解决所有问题的魔法方案,但它提供了一个坚实且具有挑战性的基准,明确地告诉我们机器人在哪些地方失败了,以及我们该如何帮助它们学会像真实世界那样去倾听。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →