WorldSpeech: A Multilingual Speech Corpus from Around the World
本文介绍了 WorldSpeech,这是一个包含 76 种语言共 65,000 小时对齐音频 - 转写数据的大规模多语言语料库,它通过将词错误率平均降低 63.5%,显著提升了低资源语言的自动语音识别性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教一个机器人说地球上每一种语言。对于英语或西班牙语等流行语言,你拥有海量的书籍和有声读物库,机器人可以在其中一边聆听语音,一边阅读同时 spoken 的确切文字。这就像拥有一位完美的老师。
但对于数百种其他语言,机器人却处于“饥荒”状态。它几乎没有“老师”材料。它可能只有零星散落的几页,但不足以让它正常学习。这正是本文作者 WorldSpeech 试图解决的问题。
大型合集:全球图书馆
研究人员构建了 WorldSpeech,这本质上是一个为机器人教师打造的全新巨型图书馆。
- 规模:他们收集了 65,000 小时 的音频。为了让你有个概念,如果你不间断地收听这个图书馆,需要超过 7 年 才能听完。
- 多样性:它涵盖了 76 种不同语言,从主要世界语言到较小的区域性语言,如塞舌尔克里奥尔语(Kreol Seselwa)和缅甸语。
- 来源:他们并没有只是让人录制自己的声音(这可能会很杂乱),而是深入挖掘公共记录:
- 议会:政府会议的录音,其中包含政治家的发言以及现有的官方文字记录。
- 广播:用多种语言广播新闻的国际电台。
- 有声读物:已被朗读的公有领域故事。
这就像收集所有公有领域中可用的公开演讲、新闻广播和故事书,并将它们整理好,以便计算机能够从中学习。
“匹配者”难题
仅仅拥有音频和文本是不够的;它们必须完美同步。计算机需要知道单词"hello"的声音与文本"hello"在确切的那一秒完全匹配。
这很难,因为:
- 格式杂乱:有些音频是 MP3 格式,有些是视频文件。有些文本是双栏的 PDF,有些是旧的 Word 文档。团队必须建立一个“清洁小组”来修复所有这些不同的格式。
- “糟糕翻译”问题:为了将音频与文本匹配,他们首先使用标准 AI(一个“翻译器”)来猜测正在说什么。如果 AI 对某种特定语言(如缅甸语或老挝语)不擅长,它就会猜错,计算机也就找不到匹配的文本。这就像试图匹配一块拼图,但拼图上的图案是模糊的;你看不清它该拼在哪里。
“迭代”技巧:变得更聪明以发现更多数据
这是本文最巧妙的举措。他们意识到,对于那些初始 AI 表现不佳的语言,他们因为“匹配”失败而丢弃了大量优质数据。
因此,他们发明了一个 反馈循环:
- 第一轮:他们使用基础 AI 来匹配它 能够 匹配的内容。
- 训练:他们利用该 AI 确实找到 的匹配项来训练它。
- 第二轮:他们使用这个新变“聪明”的 AI 再次审视 相同 的音频。因为该 AI 现在对这种特定语言更擅长,它最终能够识别出之前遗漏的单词。
- 结果:他们恢复了大量额外数据——有时甚至将困难语言的可用时长 增加一倍或两倍,而无需录制任何新的音频秒数。
结果:教导机器人
他们通过使用 WorldSpeech 训练一个标准语音识别模型(机器人)来测试这个新图书馆。
- 改进:对于 11 种不同的语言,机器人的错误率大幅下降。平均而言,错误率降低了 63.5%。
- “神奇”案例:对于某些机器人此前完全迷失(错误多于正确单词)的语言,新的训练将其转变为称职的说话者。例如,对于萨摩亚语,机器人从几乎无用变成了极少犯错。
局限性(注意事项)
作者诚实地指出了该图书馆的缺陷:
- “正式”偏见:大部分音频来自政治家和新闻主播。这些人说话非常正式、清晰且缓慢。如果机器人试图与一个进行随意、快节奏或充满俚语对话的普通人交谈,它可能会感到吃力。
- “质量”上限:最终匹配的质量取决于用于匹配的 AI。如果 AI 对某种语言极其糟糕,即使这种聪明的过程也无法找到完美的匹配。
总结
简而言之,WorldSpeech 论文是关于为 76 种语言构建一个巨大的公有领域口语词汇及其书面转录库。他们采用了一种巧妙的“熟能生巧”策略,修复了图书馆中难以整理的部分。其结果是一个庞大的数据集,帮助计算机理解和说比以往多得多的语言,特别是通过从政府会议和广播等公共记录中学习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。