Bridging communication between hearing and visually impaired individuals via speech recognition and synthesis
本文介绍了一种在 MATLAB 中开发的具有成本效益的纯软件语音识别与合成工具(SRST),该工具通过将语音转换为高对比度文本以及将文本转换为合成语音,实现了听障人士与视障人士之间的双向交流,且在无需专门硬件的情况下达到了约 90% 的运行效率。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,沟通的世界就像一场巨大而繁忙的派对,每个人都试图互相交谈。对于大多数人来说,这很容易:你说话,你的朋友听见,他们回应,你也看到他们的嘴唇在动。但对于某些宾客来说,这场派对有点“坏掉了”。如果你听不到音乐(听障),对话就像是在看一部无声电影,你会错过所有的笑点;如果你看不见屏幕(视障),你可能听到了音乐,却不知道电影在讲什么,因为你看不到字幕。
这篇论文生活在被称为“辅助技术”(Assistive Technology)的科学领域,这基本上是一个致力于制造工具来帮助残障人士加入这场派对的领域。要理解这些研究人员做了什么,你需要了解计算机用来与人类交流的两个主要“绝招”。第一个是语音识别(Speech Recognition),它就像一个超快速的翻译员,倾听你的声音并将其转化为屏幕上的文字。第二个是语音合成(Speech Synthesis),它是相反的过程:它将文字转化为计算机声音并朗读出来。通常,这些工具是为那些能听见但看不见的人,或者能看见但听不见的人设计的。但如果一个听不见的人试图与一个看不见的人交谈,会发生什么呢?他们会陷入一个死循环:一个人听不到回答,而另一个人读不到问题。这篇论文试图修复这个特定的“损坏循环”。
研究人员是来自埃塞俄比亚阿克苏姆大学(Aksem University)的一个团队,他们建造了一座数字桥梁,称之为语音识别与合成工具(SRST)。把它想象成一个双向对讲机,它不仅传输声音,还能瞬间将声音转化为文本,并将文本转回声音。他们的目标是创建一个系统,让听障人士对着麦克风说话,其话语能瞬间以清晰的大号文字呈现在屏幕上,供盲人通过计算机声音“听见”;同时,让那位盲人说话,其声音能转化为文本,供听障人士阅读。
这个项目的酷炫之处在于,他们并没有制造任何华丽的新型机器人或昂贵的硬件。相反,他们编写了一个聪明的软件程序,可以在使用普通麦克风和扬声器的标准计算机上运行。这就像是将一台普通的笔记本电脑变成了一个神奇的通信设备。该系统有两个主要方向。在其中一侧,它倾听盲人的声音。它将声音切成微小的碎片,分析语音的独特模式(就像声音的指纹),并将这些模式与它所学习的词汇表进行匹配。一旦确定了说了什么,它就会在屏幕上打印出高对比度的文本,以便听障人士阅读。在另一侧,听障人士输入一条消息。然后,计算机将这些字母和一些预录制的微小人类语音片段(称为“双音素/diphones”)缝合在一起,创造出一个新的声音,向盲人朗读这条消息。
团队通过让人们在嘈杂的大学实验室里对着系统说话,测试了他们的发明。他们发现该系统运行得相当不错,准确率约为 90%。它在识别孤立单词时(约 91.2%)的表现略优于在安静房间内理解句子(89.5%),而在有背景噪音的情况下,表现则略有下降(84.1%)。作者指出,少数错误发生是因为有些单词在计算机听来非常相似,就像人群中的双胞胎一样。
他们还发现该系统具有灵活性。由于他们没有硬编码复杂的语法规则,该系统可以处理混合语言,在同一次对话中成功识别英语、提格利尼亚语(Tigrigna)和阿姆哈拉语(Amharic)的单词。然而,他们也承认系统目前尚不完美。它有时会被突然的噪音(如椅子刮地声)干扰,且如果计算机需要同时检查太多单词,速度可能会变慢。
研究人员总结道,虽然这是一个工作原型而非成熟的商业产品,但它证明了低成本、仅靠软件的解决方案可以成功弥合这两个群体之间的鸿沟。他们建议,在未来,加入一个翻译层可以让人们说不同的语言并依然理解彼此,而使用更好的麦克风可以帮助系统忽略背景噪音。不过,就目前而言,他们已经建立了一个坚实的基石——一个“数字握手”,展示了技术如何帮助两个体验世界方式不同的人最终能够进行一场对话。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。