MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond
本文介绍了 MEUSLI,这是首个开放科学的多语言投影器家族,它将 Whisper 语音编码器与开源大语言模型(LLM)相连接,以实现跨 28 种欧洲语言的可扩展、端到端自动语音识别及其他语音理解任务。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明的机器人大脑,它可以阅读和书写世界上任何文本,但它是完全失聪的。它听不到任何一个字。另一方面,你有一个超级耳朵,可以完美地听到声音,但并不理解这些声音的含义。长期以来,为了让它们互相交流,工程师们不得不构建一个笨拙的中间人:声音要传给翻译员,然后传给文本转换器,最后才传给大脑。这很慢,而且如果翻译员犯了错,大脑就会感到困惑。
最近,科学家们发现了一种方法,可以在“超级耳朵”和“超级大脑”之间建立一座直接的桥梁。这座桥梁被称为投影器(projector)。把它想象成一个万能适配器插头。它能将声音的原始电信号瞬间转化为大脑理解的语言,让两者能够直接交谈。这就是**语音语言模型(SLMs)*的世界。研究人员提出的重大问题是:我们能否构建一个不仅适用于英语使用者,而是适用于所有人*的适配器?如果我们能做到这一点,我们就能最终为成千上鸣数种在数字对话中被遗忘的语言——尤其是那些说话者极少或记录数据不足的语言——提供发声的机会。
于是有了 MEUSLI,这是一个新的项目,它扮演着 28 种欧洲语言“万能钥匙”的角色。研究人员构建了一系列这样的“适配器插头”,将一个强大的“声音耳朵”(称为 Whisper)连接到开源的多语言机器人大脑。他们的主要发现是,这个系统表现得极其出色,不仅适用于西班牙语或德语等常见语言,也适用于布列塔尼语或马耳他语等稀有语言。他们发现,如果你从他们预制的、多语言的适配器开始,你只需要极少量的数据——有时甚至只需 46 分钟的音频——就能教会它一种全新的语言。
然而,这里有一个陷阱。如果你在学习新语言时没有经过精心设计,这个适配器往往会“忘记”它原本对那 28 种语言所掌握的一切,就像一个学生为了准备一场新考试而立刻忘记了旧作业一样。论文指出,为了解决这个问题,你需要使用一种叫做“数据重放(data replay)”的技术,即在学习新语言的同时,偶尔练习旧语言,以保持记忆的活跃。
除了记录人们说了什么(转录)之外,团队还展示了该适配器可以通过微调来胜任其他工作,比如将口语翻译成英语,或者猜测对话的主题(例如体育或政治)。他们发现,通过针对每个新任务进行仅几小时的特定训练,系统也能学会做这些事情。
论文明确反驳了认为构建此类系统需要海量数据或私有(秘密)信息的观点。他们反对“低资源语言无法得到支持”的看法,而是证明了一个良好的起点(即他们的多语言投影器)使得通过极少量数据来“引导(bootstrap)”新语言成为可能。虽然他们并不声称解决了世界上所有的难题,但他们提供了强有力的证据,证明这种方法是可扩展、开放且有效的。他们使用真实世界数据上的标准测试测量了这些结果,表明其方法始终优于从零开始,尤其是在处理最困难、最稀有的语言时。
简而言之,MEUSLI 是一个工具包,它证明了我们可以构建包容性的、开源的语音技术,这种技术不仅仅为少数人服务,而是为大众服务,通过一个巧妙且轻量级的适配器,将一个失聪的机器人大脑变成一个博学多才的语言通。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。