← 最新论文
💻 computer science

Omnilingual ASR: Open-Source Multilingual Speech Recognition for 1600+ Languages

本文介绍了 Omnilingual ASR,这是一个可扩展的开源语音识别模型系列,它利用 7B 参数的自监督架构和大规模、多样化的训练语料库来支持超过 1,660 种语言(其中包括 500 多种此前未被服务的语言),同时使社区能够以极少的数据轻松地将该系统适配到新语言中。

原作者: Marta Costa-jussa, Omnilingual Team, Gil Keren, Artyom kozhevnikov, Yen Meng, Christophe Ropers, Matthew Setzler, Skyler Wang, Ife Adebara, Michael Auli, Can Balioglu, Kevin Chan, Chierh Cheng, Joe Ch
发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Marta Costa-jussa, Omnilingual Team, Gil Keren, Artyom kozhevnikov, Yen Meng, Christophe Ropers, Matthew Setzler, Skyler Wang, Ife Adebara, Michael Auli, Can Balioglu, Kevin Chan, Chierh Cheng, Joe Chuang, Caley Droof, Mark Duppenthaler, Paul-Ambroise Duquenne, Alexander Erben, Cynthia Gao, Gabriel Mejia Gonzalez, Kehan Lyu, Sagar Miglan, Vineel Pratap, Kaushik Ram Sadagopan, Safiyyah Saleem, Arina Turkatenko, Albert Ventayol-Boada, Zheng Xin Yong, Yu-An Chung, Jean Maillard, Rashel Moritz, Alexandre Mourachko, Mary Williamson, Shireen Yates

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个神奇的翻译机,无论任何人说什么语言,它都能瞬间理解并记录下来。长期以来,这种魔法只适用于英语、西班牙语或普通话等主流语言。如果你说的是一种规模较小、较不常见的语言,翻译机要么会面面相觑,要么会胡乱猜测。这就是**自动语音识别(ASR)**的世界:这项技术将说话声转化为文字。把它想象成一个超级快速的速记员,倾听对话并将内容打出来。长久以来的挑战在于,世界上有超过 7,000 种语言,但大多数速记员只掌握其中极小的一部分。学习一门新语言通常需要大量的录音资料库和一支专家团队来教导计算机,这既昂贵又缓慢。但是,如果我们能建造一个能够学习所有语言运作“模式”的速记员,使其只需通过听取几句话就能几乎瞬间学会一门新语言,那会怎样呢?这就是这篇论文试图解决的大问题:我们如何让语音技术变得公平且易于获取,而不仅仅是为那些使用“大语种”的人服务?

于是有了 Omnilingual ASR,这是来自 Meta 的一个全新的开源项目,它就像是一个功能强大的、通晓多国语言的速记员,旨在处理超过 1,600 种语言。团队不仅是尝试教计算机更多的单词;他们还构建了一个巨大的、多样化的“大脑”,从海量的语音数据中学习,其中包括来自此前从未被人工智能听闻过的社区的录音。他们创建了一个包含不同规模的系统:一个用于强大计算机的巨大、超高精度版本(70 亿参数),以及一个可以在普通手机上运行的微型、轻量化版本(3 亿参数)。最令人兴奋的部分是他们如何处理计算机从未见过的语言。这个系统不需要通过整座资料库来学习一门新语言,它只需通过10 个简短的示例(即某人说话并书写的内容)即可进行学习。这就像向一位大师级厨师展示一张新水果的照片和一道用这种水果制作的菜谱;突然间,他们无需品尝一千次这种水果,就能做出那道菜。

研究人员发现,这个新系统是一个游戏规则的改变者,对于那些数据量极少的语言尤其如此。在测试中,该模型的“字符错误率”(一个衡量错误字母数量的分数)在 1,200 多种语言中保持在 10% 以下。事实上,对于 500 多种语言来说,这是任何语音系统有史以来第一次能够对它们进行转录。论文表明,他们的新模型击败了之前的冠军,如 Whisper 和 USM,尤其是在那些稀有的、处于“长尾”部分的语言上。虽然旧系统会在这些语言上感到困惑并失败,但 Omnilingual ASR 却能保持冷静。他们还发现,如果你想让系统针对某种特定的、微小的语言表现得更好,你可以利用极少的计算能力和仅有的几小时数据对较小的版本进行微调,从而获得足以媲美大型模型的结果。

然而,论文也谨慎地指出,这并不是一根能完美解决一切问题的魔杖。该系统仍在学习中,虽然它可以通过仅有的几个例子处理未见过的语言(一种“零样本”能力),但其表现并不像专门针对该语言并使用大量数据进行训练的系统那样出色。作者建议,对于医疗或法律转录等最关键的用途,人类仍应对工作进行复核。他们还强调,这项技术旨在成为社区保护其语言并建立自身档案的工具,而不是为了取代人类说话者或强加一种“一刀切”的解决方案。通过免费发布所有的代码和数据,他们希望邀请世界各地的研究人员和社区加入这场盛会,让每一个语言都能在数字世界中拥有自己的声音。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →