Self-Supervised Speech Representations Track Spoken Language Convergence to Adult Models in Infants and Children Who Are Deaf/Hard-of-Hearing
本研究表明,自监督语音嵌入能够利用日常声学录音,有效追踪聋哑或听障儿童与其照顾者之间口语模式的收敛情况,从而为传统的评估方法提供一种可扩展且与语言无关的替代方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
语言是一种生命体,在不断生长与变化,其形态受孩子每天所听到的声音所塑造。几十年来,科学家们已知孩子们会逐渐学会像周围的成年人那样说话,这一过程被称为“趋同”(convergence)。传统上,追踪这种向成年人语音迈进的缓慢进程是一项劳动密集型的任务。研究人员必须坐在长达数小时的音频录音前,手动转录孩子发出的每一个单词和声音,这个过程需要专业的知识,且只能应用于世界上极小比例的语言。这种瓶颈意味着,理解儿童如何发育(尤其是那些有听力障碍的儿童)的过程一直进展缓慢且难以规模化。然而,一种新方法应运而生,它绕过了对人工转录的需求,转而通过观察原始的声学模式,来观察一个孩子的声音在多大程度上镜像了其照顾者的声音。
在最近的一项研究中,斯坦福大学的研究人员将这种新方法应用于一组失聪或听障儿童。这些孩子年龄从婴儿期到学龄前不等,他们使用助听器或人工耳蜗来获取声音,但他们的语言路径可能是不均衡且充满挑战的。研究团队想要了解,是否可以通过仅仅分析日常生活中声波的结构,而不必知道具体的单词内容,来衡量这些孩子在追赶成年人语音模式方面的表现。为此,他们为34名儿童配备了一种佩戴在衣服上的专用录音设备,该设备在孩子们进行日常活动时,一次可捕捉长达16小时的音频。总计,研究团队收集了超过925小时的录音,建立了一个由孩子们和照顾他们的成年女性组成的日常声音的大型库。
研究人员使用了一个经过训练、能够理解人类语音结构的计算机模型,这是一个将声音转化为数学表示(称为“嵌入”,embedding)的工具。可以将这个过程想象成将一个人发出的每种声音放入一张巨大的、无形的地图中,相似的声音在地图上靠在一起,而不同的声音则相距较远。团队绘制了孩子们发出的声音地图,并将其与录音中成年女性发出的声音的核心地图进行对比。他们测量了孩子的声音与成年人声音在地图上的距离。其核心理念非常简单:随着儿童学习说话,他们的声音应该听起来更像成年人,这意味着他们在地图上的声音距离应该变得更小。
结果证实,随着听觉经验的增加,这种距离确实在缩小。研究测量了“听觉年龄”(hearing age),即孩子通过设备获得放大声音的时间长短,而非仅仅根据其出生日期。分析显示出一个清晰的模式:孩子使用助听器或植入物的时间越长,他们的语音就越接近周围成年人的声音。即使在研究人员考虑了其他因素(如孩子的音高或发声时长)之后,这种趋同现象依然存在。研究结果表明,计算机模型成功捕捉到了儿童语音结构随时间成熟的细微方式——即从早期、组织性较弱的声音向复杂的成年语音模式转变的过程。
除了追踪时间的流逝,研究人员还测试了这种声音相似性的度量标准是否可以预测一个孩子在标准语言测试中的实际表现。他们将声音地图上的距离与衡量词汇量和辅音发音准确性的测试得分进行了对比。研究发现,在地图上其语音与成年人模型更接近的孩子,往往拥有更大的词汇量和更好的发音技巧。这对于孩子们理解的词汇以及他们能说出的词汇都同样适用。该度量标准在预测孩子形成辅音的能力方面表现得尤为出色,而辅音是语音发育的关键里程碑。至关重要的是,研究人员通过模拟计算机在嘈会儿环境中区分儿童声音与成年人声音时可能出现的错误,测试了该方法的可靠性。即使在引入了这些模拟误差后,主要发现依然保持稳定,这表明该方法足以应对现实世界中杂乱的录音。
这项研究并不声称这种新指标可以取代言语治疗师的细致工作,也无法独立诊断特定的语言障碍。研究人员谨慎地指出,他们的方法测量的是语音的声学结构,这与语言的完整复杂性相关,但并不等同。它目前还无法告诉我们一个孩子是否理解了特定的语法规则,或者是否能产生特定类型的单词。然而,这项工作提供了一个强大的新工具,可以用一种可规模化且与语言无关的方式来观察语言的发展。通过消除对昂贵的转录和专家级语言学家的需求,这种方法为监测更多儿童(特别是那些有听力损失的儿童)的进展打开了大门,利用他们日常生活的自然声音进行观察。这表明,理解儿童如何学习说话的路径,不仅在于他们所说的词汇,也在于他们发出的声音本身的形状。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。