← 最新论文
⚡ electrical engineering

Enhancing Multilingual LLM-based ASR with Mixture of Experts and Dynamic Downsampling

本文提出了一种基于投影器的 LLM-ASR 框架,该框架利用混合专家架构实现跨语言适应性,并利用连续集成与释放机制进行动态下采样,在多语言语音识别方面较强基准模型实现了显著的性能提升。

原作者: Guodong Lin, Ziqi Chen, Yuxiang Fu, Ke Li, Wei-Qiang Zhang

发布于 2026-06-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Guodong Lin, Ziqi Chen, Yuxiang Fu, Ke Li, Wei-Qiang Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位才华横溢、精通多种语言的翻译官(一个大语言模型,或称 LLM),他能听懂并说出世界上几乎所有的语言。然而,这位翻译官对声音是“耳聋”的;他只能理解文本。你的目标是构建一个系统,让这位翻译官能够听懂语音并将它们准确地记录下来。这就是**自动语音识别(ASR)**的挑战。

你分享的论文描述了一种将“耳朵”(音频处理器)与“大脑”(LLM)连接起来的新方法,使它们能够完美协作,特别是在处理多种不同语言和说话速度时。

以下是使用简单类比对他们解决方案的拆解:

问题所在:僵化的连接

在之前的尝试中,音频处理器与翻译官之间的连接就像是一个僵硬、固定大小的传送带

  • 问题在于: 语音是杂乱无章的。有时人们说话很快,有时很慢。有时句子很短,有时很长。
  • 旧的方法: 旧系统试图在将音频交给翻译官之前,将其切分成等长的、固定大小的块(就像把一条面包切成大小完全相同的薄片)。如果说话者语速很快,这些薄片就会太小,从而丢失信息;如果说话者语速很慢,这些薄片又会太大,从而浪费空间。这使得系统在处理不同语言和速度时表现挣扎。

解决方案:两项升级

1. “专家团队”(混合专家模型 / MoE)

他们没有使用单一、通用的翻译官来处理所有音频,而是建立了一个专家团队

  • 运作方式: 想象一个繁忙的机场。与其让一个疲惫不堪的代理人尝试为 11 个不同国家的乘客办理登机手续,不如配备一个专家团队。一位是法语专家,另一位是日语专家,还有一位是西班牙语专家。
  • 神奇之处: 一个聪明的“守门人”(门控机制)会观察传入的声音,并立即将其路由到正确的专家那里。如果音频听起来像韩语,它就会被送到韩国专家那里。如果听起来像德语,它就会被送到德国专家那里。
  • 结果: 因为每个“专家”只专注于其特定语言的模式,所以该系统在理解不同口音和语言方面,比单一的“全才型”模型要出色得多。

2. “智能计时器”(连续集成与触发 / CIF)

这解决了前面提到的“僵硬传送带”问题。

  • 运作方式: 系统不再将音频切分成固定的大小,而是使用一个智能计时器来倾听语音的流动。
  • 机制: 这就像是用桶接水。系统将音频的“滴滴”信息投入到一个桶里。一旦水位达到特定的线(阈值),系统就会说:“好了,这足够作为一个词了!”然后将这个词传递给翻译官。接着,它又开始为下一个词重新填满桶。
  • 益处: 如果有人说话很快,桶填满的速度就快,单词传递的速度也快。如果说话慢,桶就填满得慢。无论说话者语速如何,这都能在声音和文本之间创造出完美的、灵活的匹配。
  • 转折点: 作者发现,原始的“智能计时器”有时过于“急躁”,填满桶的速度太快,导致丢失细节。因此,他们调整了规则(一个“宽松版”),以确保桶填充的速度恰到好处,在完美匹配文本长度的同时,保留所有重要的细节。

结果

作者在一个涵盖 11 种不同语言(包括英语、法语、日语、韩语等)的大规模数据集上测试了这个新系统。

  • 基准测试: 标准系统表现挣扎,犯了很多错误。
  • 新系统: 通过结合“专家团队”(MoE)和“智能计时器”(CIF),该系统的错误率显著降低。
  • 规模化提升: 当他们向系统输入更多数据(8,000 小时的语音而非 1,500 小时)时,它在理解那些接触较少的语言方面变得更加出色,证明了它在处理新情况时具有极强的泛化能力。

总结

论文声称,通过赋予 AI 一个语言专家团队和一个灵活的智能计时器来匹配声音与文本,他们创建了一个比以往方法更准确、更鲁棒、且能更好地处理多种不同语言的语音识别系统。他们并未声称这是用于医疗用途或特定的未来应用,而仅仅是指出这是构建更好、更可靠的语音转文本系统的一大进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →