Evaluating Goodness of Pronunciation and Phonological Posteriors as Objective Markers of Speech Severity in Motor Speech Disorders
本研究表明,源自自监督语音表示(尤其是 WavLM)的发音质量评分,在评估运动性言语障碍的言语严重程度方面,是比传统声学特征和音素后验概率更优越的客观指标,同时与感知到的失真度和清晰度评分表现出高度一致性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
想象一下,你正试图教会一个机器人理解人类的语言,但说话的人患有一种会让他们的词句听起来“含混不清”、“僵硬”或“混乱”的疾病。这就是运动性言语障碍的世界——大脑关于移动嘴部的计划出了点差错。几十年来,医生一直依靠自己的耳朵和经验来判断言语听起来有多糟糕,有点像音乐老师通过听觉来给学生的歌唱打分。但人类的耳朵会疲劳,不同的老师也可能给出不同的分数。科学家们一直试图构建一把“言语尺”——一个能够观察声波并对其失真或模糊程度给出客观评分的计算机程序。为了实现这一点,他们使用了两种主要的工具:一种检查声音是否符合“正确”的词典定义(就像是声音的拼写检查器);另一种则将声音分解成其物理构建模块(比如检查嘴唇是否圆润或舌头是否平坦)。现在的大问题是,哪种计算机工具更擅长发现问题,以及它们是否需要协同工作?
这项由梅奥医学中心(Mayo Clinic)研究人员开展的研究,决定通过使用一个非常特定的单词——“catastrophe”(灾难)来对这些工具进行测试。他们记录了489人说这个单词的过程——其中一些人言语健康,另一些人患有运动性言语障碍。团队想要看看能否使用现代的“自监督”人工智能模型(把这些模型想象成通过聆听互联网上数百万小时未标记音频而学会说话的超级聪明机器人)来创建一个更好的“发音质量”(Goodness of Pronunciation, GoP)评分。他们将这种新型的高科技 GoP 与传统的声学特征进行了对比,同时也将其与“音素后验概率”(即那个检查物理构建模块的工具)进行了对比。
以下是他们的发现:这种新型的高科技人工智能方法是一个明显的赢家。当研究人员使用一种名为 WavLM 的特定现代人工智能模型来分析言语时,与旧式方法相比,它在匹配医生对言语失真或模糊程度的评分方面表现得出色得多。事实上,表现最好的设置是使用了一种称为“k-最近邻”(类似于在图书馆中寻找最相似的例子来进行判断)的方法,并结合了 WavLM 人工智能。这种组合实现了与医生对言语评分的最强关联。
研究还观察了另一种工具,即那个检查言语物理构建模块的工具。事实证明,这个工具是有帮助的,但在预测言语问题的整体严重程度方面,它不如 GoP 评分那么出色。研究人员发现,虽然这两个工具观察言语的角度不同——一个检查声音是否是“正确的”单词,另一个检查嘴部是如何移动的——但它们实际上捕捉到的东西略有不同。然而,当他们尝试将两者结合起来打造一个“超级评分器”时,由于 GoP 评分已经承担了大部分重任,第二个工具并没有增加多少额外的价值。
有趣的是,研究还检查了年龄或性别是否会干扰结果。他们发现,这些因素几乎对计算机评分的效果没有影响。无论说话者是年轻还是年老,男性还是女性,计算机识别言语问题的能力都保持稳定。这是一个重大意义,因为它表明这些计算机工具可以很好地适用于广泛的人群,而不需要为每个人进行重新调优。
最后,论文指出,使用这些先进的自监督人工智能模型来创建发音评分,是客观衡量言语障碍的一种强大方式。虽然“构建模块”检查器在理解嘴部是如何移动方面有其地位,但“拼写检查器”风格的 GoP 评分是告诉我们言语问题究竟有多严重的更好工具。研究人员谨慎地指出,这仅是在一个单词被多次重复的情况下进行的测试,因此虽然结果令人鼓舞,但仍需更多工作来观察它是否同样适用于长篇、自然的对话。但就目前而言,言语评估的未来看起来可能是一个正在非常仔细聆听的超级聪明机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。