BanglaVowelDataset: True AC and Synthetic BC Bangla Vowel Datasets in Speech Information System
本文介绍了 BanglaVowelDataset,该数据集包含来自十位说话者的 120 个录制的空气传导 (AC) 和 120 个合成的骨传导 (BC) 孟加拉语元音,旨在解决此类资源的匮乏问题,并促进噪声鲁棒性语音处理、识别和说话人识别领域的研究。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在语音技术领域,计算机正在不断学习如何倾听。它们通过对海量录音库的学习来识别单词、辨别说话人或理解指令。然而,这些库中的大多数都是由捕捉空气中的声音构建而成的。当我们说话时,声波通过空气传播,撞击麦克风,并被转化为数字数据。这种被称为“气导”(air-conduction)的方法是几乎所有语音助手和转录服务的标准。但还有另一种方式让声音到达我们的耳朵和录音设备:通过我们的颅骨。当我们说话时,我们的声带会引起颅骨震动,这些震动直接传导至内耳,并能被放置在皮肤上的传感器捕捉到。这就是“骨传导”(bone-conduction)。由于气导声音容易被交通噪音或人群嘈杂声所淹没,而骨传导声音则能保持异常清晰,因为它绕过了嘈杂的空气。几十年来,研究人员一直致力于构建能够理解这种基于骨骼语音的计算机,但主要原因是许多语言都缺乏必要的此类数据。
来自孟加拉国和日本大学的一个研究小组现在填补了该领域的重大空白,他们创建了首个专门收集孟加拉语元音的声音集,这些声音通过空气和骨骼两种方式进行采集。孟加拉语字母包含十二个截然不同的元音,这种复杂性使得该语言虽然丰富,但对于机器解析而言却具有难度,尤其是在背景噪声干扰的情况下。在此项工作之前,还没有任何数据集能同时提供这些声音的传统空气录制版本及其对应的骨传导版本以供对比。研究人员在安静的隔音室内,从十位母语使用者(五男五女)那里记录了这些声音。他们使用高质量的麦克风来捕捉气导元音,确保每段录音都有足够的长度进行分析,时长在600到780毫秒之间。为了确保数据的纯净,他们仔细修剪了每段录音开头和结尾的静音部分,仅保留了纯净的发声部分。
接下来的挑战在于如何在不需要每位参与者都佩戴专门且罕见的骨传导麦克风(这类设备在标准研究环境中难以寻找和使用)的情况下,获取骨传导数据。该团队并没有直接记录骨骼震动,而是使用了一个复杂的计算机模型来模拟它们。他们提取了纯净的气导元音,并将其通过一个数字滤波器,该滤波器可以模拟人类颅骨如何改变声音。这个过程有效地滤掉了空气携带的高频细节,而这些细节会被骨骼过滤掉,从而创造出一个合成版本,模拟声音通过颅骨记录时的样子。结果是一个配对的数据集:120个真实的空气传导元音和120个合成的骨传导元音,它们与相同的说话人和相同的十二种元音完美匹配。
研究人员随后将这一庞大收藏整理成一个结构化的库,将数据分为不同的处理阶段,以帮助其他科学家测试他们的理论。他们提供了原始录音、修剪后的版本以及计算机模拟的骨传导声音,并标注了关于说话人性别和特定元音的精确细节。为了证明其模拟的准确性,他们将真实空气声音的数学特性与合成骨传导声音进行了对比。他们发现,合成的骨传导声音表现得完全符合预期:它们显示出更宽的频率范围,以及一种能将它们与空气声音区分开来的特定数学特征。这证实了他们的计算机模型成功地重现了骨传导语音独特的声学轮廓。
该数据集现在已向全球研究界开放使用。它提供了一个测试语音识别系统处理噪声能力的独特机会。由于气导语音容易受到背景噪声的破坏,而骨传导语音则不会,研究人员可以利用这些配对数据来构建能够在这两者之间切换或结合两者来理解语音的系统,从而应对像繁忙街道或拥挤房间等混乱环境。该团队还公开了用于生成这些声音的计算机代码,允许他人验证其方法或将同样的技术应用于其他语言。通过提供对孟加拉语元音通过空气和骨骼传导的首次全面观察,这项工作为开发更具鲁棒性、更具抗噪性的语音技术打开了大门,使这些技术不仅能在安静的工作室中运行,也能在任何地方可靠地发挥作用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。