✨ 要点🔬 技术摘要
想象一下,你拥有一个神奇的翻译机,无论任何人说什么语言,它都能瞬间理解并记录下来。长期以来,这种魔法只适用于英语、西班牙语或普通话等主流语言。如果你说的是一种规模较小、较不常见的语言,翻译机要么会面面相觑,要么会胡乱猜测。这就是**自动语音识别(ASR)**的世界:这项技术将说话声转化为文字。把它想象成一个超级快速的速记员,倾听对话并将内容打出来。长久以来的挑战在于,世界上有超过 7,000 种语言,但大多数速记员只掌握其中极小的一部分。学习一门新语言通常需要大量的录音资料库和一支专家团队来教导计算机,这既昂贵又缓慢。但是,如果我们能建造一个能够学习所有语言运作“模式”的速记员,使其只需通过听取几句话就能几乎瞬间学会一门新语言,那会怎样呢?这就是这篇论文试图解决的大问题:我们如何让语音技术变得公平且易于获取,而不仅仅是为那些使用“大语种”的人服务?
于是有了 Omnilingual ASR ,这是来自 Meta 的一个全新的开源项目,它就像是一个功能强大的、通晓多国语言的速记员,旨在处理超过 1,600 种语言。团队不仅是尝试教计算机更多的单词;他们还构建了一个巨大的、多样化的“大脑”,从海量的语音数据中学习,其中包括来自此前从未被人工智能听闻过的社区的录音。他们创建了一个包含不同规模的系统:一个用于强大计算机的巨大、超高精度版本(70 亿参数),以及一个可以在普通手机上运行的微型、轻量化版本(3 亿参数)。最令人兴奋的部分是他们如何处理计算机从未见过的语言。这个系统不需要通过整座资料库来学习一门新语言,它只需通过10 个简短的示例 (即某人说话并书写的内容)即可进行学习。这就像向一位大师级厨师展示一张新水果的照片和一道用这种水果制作的菜谱;突然间,他们无需品尝一千次这种水果,就能做出那道菜。
研究人员发现,这个新系统是一个游戏规则的改变者,对于那些数据量极少的语言尤其如此。在测试中,该模型的“字符错误率”(一个衡量错误字母数量的分数)在 1,200 多种语言中保持在 10% 以下。事实上,对于 500 多种语言来说,这是任何语音系统有史以来第一次能够对它们进行转录。论文表明,他们的新模型击败了之前的冠军,如 Whisper 和 USM,尤其是在那些稀有的、处于“长尾”部分的语言上。虽然旧系统会在这些语言上感到困惑并失败,但 Omnilingual ASR 却能保持冷静。他们还发现,如果你想让系统针对某种特定的、微小的语言表现得更好,你可以利用极少的计算能力和仅有的几小时数据对较小的版本进行微调,从而获得足以媲美大型模型的结果。
然而,论文也谨慎地指出,这并不是一根能完美解决一切问题的魔杖。该系统仍在学习中,虽然它可以通过仅有的几个例子处理未见过的语言(一种“零样本”能力),但其表现并不像专门针对该语言并使用大量数据进行训练的系统那样出色。作者建议,对于医疗或法律转录等最关键的用途,人类仍应对工作进行复核。他们还强调,这项技术旨在成为社区保护其语言并建立自身档案的工具,而不是为了取代人类说话者或强加一种“一刀切”的解决方案。通过免费发布所有的代码和数据,他们希望邀请世界各地的研究人员和社区加入这场盛会,让每一个语言都能在数字世界中拥有自己的声音。
技术摘要:全语言自动语音识别 (Omnilingual ASR)
问题陈述
尽管自动语音识别 (ASR) 在高资源语言领域取得了显著进展,但仍有超过 4,000 种拥有成熟书写系统的语言未得到支持。目前的方案面临两个主要障碍:
可扩展性与成本: 由于对于相对较小的训练数据集而言,工程和数据收集工作量巨大,将覆盖范围扩展到数千种语言被视为成本过高。
架构局限性: 现有系统通常依赖于固定的语言集,这使得在不进行专家驱动的微调的情况下很难添加新语言,而这一过程对于许多社区来说是难以触及的。
伦理担忧: 如果在没有经过仔细校准或缺乏当地自主权的情况下,将技术部署在资源匮|乏的社区,存在使这些社区失去能力的风险。
方法论
数据构建
作者组建了迄今为止最具语言多样性的 ASR 语料库,包含两个主要部分:
无标注预训练数据: 涵盖 1,239 种语言的 380 万小时语音(另有 46 万小时无语言识别数据),用于自监督预训练。
有标注微调数据: 涵盖 1,690 种语言的 177,700 小时语音及其对应的转录文本。
有标注数据整合了:
公共数据集: 约 1.5 万小时,来源包括 LibriSpeech、Common Voice、VoxPopuli、FLEURS 和 MLS。
内部及授权数据: 约 15 万小时,来自内部收藏和商业授权(例如 IARPA Babel)。
社区采集与委托数据: 这是一个关键组成部分,涉及与当地组织(如 African Next Voices、Lanfrica/Naijavoices)的合作以及“语言技术合作伙伴计划 (LTPP)”。这包括 Omnilingual ASR 语料库 (OASRC) ,这是一个包含 348 种语言、共 3,350 小时的定制集合。与许多现有数据集不同,OASRC 优先考虑具有自然语流停顿的自发性语音,而非脚本化的朗读,这是通过调查式提示引导完成的,以确保文化相关性和参与度。
模型架构
Omnilingual ASR 利用旨在实现零样本泛化的编码器-解码器架构:
编码器: 一个规模达 70 亿参数 的大型 Transformer 网络,用于通过自监督预训练提取鲁棒的跨语言语音表示。
解码器: 提出了两种变体:
CTC 模型: 使用线性层将编码帧映射到字符概率,并使用连接时序分类 (CTC) 损失。
LLM-ASR 模型: 采用受大语言模型 (LLM) 启发的解码器,并使用交叉熵损失。该变体可以在推理时基于语言代码进行条件化,以解决低资源环境下常见的脚本歧义问题。
零样本能力
为了应对没有标注数据的语言,LLM-ASR 模型通过 零样本推理 (zero-shot inference) 进行扩展。通过在推理过程中提供来自新语言的少量上下文示例(语音-转录对),模型可以在无需额外训练的情况下对先前未见的语言进行 ASR。
模型家族
为了适应多样化的部署约束,模型以家族形式发布,范围涵盖:
紧凑型变体: 3 亿参数,适用于低功耗设备。
大型变体: 70 亿参数,针对最大精度进行优化。
关键结果
支持语言的表现
规模: 该系统支持 1,660 多种语言 ,其中包括 500 多种此前从未被任何 ASR 系统服务过的语言。
准确度:
在高和中等资源类别(>10 小时数据)中,90% 的语言实现的字符错误率 (CER) 低于 5。
在低资源类别(<10 小时数据)中,34–36% 的语言达到了 CER < 10 的阈值。
7B LLM-ASR 模型在 1,570 种评估语言中的平均 CER 为 7.1 ,其中 78% 的语言实现了 CER ≤ 10。
对比: Omnilingual ASR 在多个基准测试(FLEURS-102, MLS, MMS-Lab)中优于强力的基线模型,包括 Whisper (large-v3)、Universal Speech Model (USM) 和 Massively Multilingual Speech (MMS)。值得注意的是,300M CTC 变体在平均 CER 上优于 Whisper-large-v3。
零样本表现
对于未见语言,LLM-ASR 零样本模型(带有 10 个上下文示例)将平均 CER 从 26.3% (基线 CTC)降低到了 14.4% 。
零样本模型显著减少了脚本混淆错误,在脚本误识别普遍存在的 FLEURS-102 和 CV22 等数据集上优于非零样本基线模型。
微调效率
在低资源语言(5–10 小时数据)上对 300M 和 1B 模型进行特定语言微调,其 CER 与 7B OmniASR 模型相当,通常能达到 CER < 5。
使用 OmniASR CTC 检查点作为微调种子,比使用标准的 w2v2 检查点更高效,所需的训练步数更少(5k 对比 30k)即可收敛。
重要性与主张
论文将 Omnilingual ASR 定位为语音技术的一种范式转变,即从固定的、专家驱动的系统转向 社区驱动的可扩展性 。
民主化访问: 通过使社区能够仅使用 10 个配对的音频-文本样本来添加语言,且无需将数据交给第三方或需要大规模计算资源,该系统降低了欠发达社区的门槛。
科学贡献: 这项工作证明,在海量且多样化的数据集(1,600 多种语言)上进行训练,可以使模型学习到足以实现广泛泛化的鲁棒表示,挑战了低资源语言需要完全独立且资源密集型开发流程的观点。
开源与协作: 将模型、训练流水线和语料库作为开源产物发布,不仅是为了透明度,更是一种重新分配创新权力的干预措施,从而实现本地化的适配与控制。
实际部署: 7B 和 300M 变体的可用性允许在高性能云环境和低功耗、离线设备中进行部署,将 ASR 的应用范围从研究领域扩展到社区主导的档案管理和无障碍工具。
作者总结道,虽然性能差异依然存在,且在高度敏感的场景中人工审查仍是必要的,但 Omnilingual ASR 为语言记录、保护以及开发面向世界语言多样性的语音驱动界面提供了可扩展的基础。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。