Breaking the Curse ofMultilinguality inMany-to-Many Speech-to-Text Translation via a Resource-AwareMixture of Speech Encoders
本文介绍了 MSRT,这是一个利用资源感知型语音编码器混合机制(resource-aware Mixture of Speech Encoders)和五阶段课程学习策略的新型框架,旨在克服语音翻译中的多语言诅咒,在仅需极少数据量的情况下,实现了 45 种语言的最佳性能,并同时在不损害高资源语言性能的前提下提升了低资源语言的能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正站在一个繁忙、嘈杂的国际火车站里。这就是**语音转文本翻译(Speech-to-Text Translation)**的世界,这是一个致力于教机器倾听某人所说的某种语言,并立即将其转化为另一种语言文字的计算机科学领域。长期以来,这些机器就像是笨拙的导游,虽然说着完美的英语,却在处理其他一切事务时磕磕绊绊。它们的工作原理是先将语音转录为文本(就像速记员一样),然后再将该文本进行翻译(就像字典一样),但这种两步走的过程经常导致错误不断堆积,就像一场出错不断的“传声筒”游戏。最近,科学家们尝试构建“多模态大语言模型”(MLLMs)——拥有能够听和说的超聪明 AI 大脑。梦想是拥有一个能够处理任何语言的单一、神奇的大脑。但问题在于:当你试图教一个大脑同时说 45 种不同的语言时,它会感到困惑。这就像试图把 45 种不同的方言塞进一个背包里;那些沉重且练习充分的语言(如英语或西班牙语)占据了所有空间,导致那些较轻、练习较少的语言(如稀有方言)没有呼吸的空间。这个问题被称为“多语言之咒”(curse of multilinguality),这意味着 AI 在某些语言上表现极佳,但在另一些语言上却表现糟糕。
于是,由 Yexing Du 及其团队提出的新框架 MSRT 登场了,旨在解决这个“背包问题”。他们并没有强迫一个大脑承担所有的重任,而是构建了一个拥有两个专业化“耳朵”(称为语音编码器)和一个交通控制器(路由器)的智能系统。你可以把它想象成一个高端餐厅的厨房。通常情况下,一位主厨试图烹饪菜单上的每一道菜,从简单的吐司到复杂的舒芙蕾。如果厨房变得过于忙碌,舒芙蕾可能会因为主厨过于专注于吐司而烧焦。MSRT 改变了游戏规则:它拥有一位“大师级主厨”,这位主厨的时间仿佛被冻结了,精通烹饪那些受欢迎的高资源菜肴(如英语);还有一位“学徒主厨”,他渴望学习,并专门负责处理那些棘手的低资源菜肴。一位聪明的服务员(路由器)会查看订单票(正在说话的语言),并立即将请求发送给正确的厨师。如果订单是常见语言,大师级主厨会在不改变任何东西的情况下处理它。如果是稀有语言,学徒主厨就会挺身而出,针对这道菜专门调整其技能。
研究人员在 45 种不同的语言上测试了这个想法,涵盖了从中国和西班牙等常见巨头到高棉语和老挝语等较小语言的所有内容。他们不仅测试了几种,还检查了每一种可能的组合,这意味着他们尝试将这 45 种语言中的每一种都翻译成其他每一种语言(总计 1,980 个方向)。结果令人印象深刻:他们的 40 亿参数模型(与 270 亿或 300 亿参数的巨型模型相比,规模相对较小)实现了最高的平均得分,击败了更大的模型甚至顶级的商业 API。至关重要的是,这个系统不仅帮助了稀有语言,它实际上还让常见语言的表现变得更好,证明了你不需要通过牺牲一个领域的质量来修复另一个领域。他们还发现,他们只需要大约 10 小时的语音-文本配对数据即可有效地训练该系统,这与其他模型通常需要的量相比是非常微小的。
论文明确反对“单一共享语音编码器是处理多种语言的最佳方式”这一观点。他们表明,当你强迫一个编码器处理一切时,会产生一种“零和博弈”,即提升低资源语言往往会损害高资源语言。通过使用他们的“混合语音编码器”(Mixture of Speech Encoders, MoSE),他们打破了这个诅咒。该系统使用了一种五阶段训练策略,有点像难度逐级增加的电子游戏,从简单的语音识别开始,逐渐增加翻译任务。这种循序渐进的方法帮助模型在不会感到不堪重负的情况下进行学习。
在实验中,MSRT 模型展现出了全面的收益。对于低资源语言,改进最为显著,在其他模型挣扎的地方大幅提升了得分。但与以往可能以牺牲常见语言为代价来提升稀有语言的尝试不同,MSRT 也强化了高资源语言。作者认为,这是因为“冻结的专家”保留了流行语言的强大知识,而“可训练的专家”则专注于那些需要更多帮助的语言。他们还注意到,虽然该模型非常出色,但其翻译质量最终受限于底层的“大脑”(大语言模型),这意味着如果基础模型不太了解某种语言,语音系统无法凭空创造出这种知识。然而,对于它所涵盖的语言,结果表明,这是一种构建多语言 AI 的更高效、更具尊重感的新方式,而不是让那些喧闹的语言淹没那些安静的语言。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。