← 最新论文
🤖 AI

Data-Efficient On-Policy Distillation for Automatic Speech Recognition

本文表明,教师引导的在线策略蒸馏使得一个仅在 10 万小时语音数据上训练的、参数量为 06 亿的紧凑自动语音识别模型,能够显著超越监督微调并几乎媲美更大的基线模型,从而降低了实现具有竞争力的自动语音识别所需的数据量。

原作者: Yu Lin, Yiming Wang, Runyuan Cai, Xiaodong Zeng

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Yu Lin, Yiming Wang, Runyuan Cai, Xiaodong Zeng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教导一位充满热情的小学徒(学生)如何成为口语翻译大师。通常,要成为大师,你需要聆听数百万小时的录音对话。但如果只有 10 万小时呢?这依然很多,但只是那些巨头(如教师)所用数据的一小部分。

本文介绍了一种名为Ark-ASR的巧妙训练方法,它通过“智能教练”的方式,帮助这位小学徒即使在有限的练习时间内也能变得出奇地出色。

以下是该过程的分解步骤:

1. 设置:小学徒与教练

  • 学生(Ark-ASR): 一个小型、高效的计算机模型(06 亿参数),已在 10 万小时语音数据上接受了基础教育(监督微调)。它掌握了基础知识,但尚未完美。
  • 教师(Qwen-ASR): 一个更大、经验更丰富的模型,见识过海量数据(数百万小时)。它比任何人都更清楚“正确”的答案。

2. 旧方法与新方法

  • 旧方法(离线策略): 想象老师给学生一叠完美的、预先写好的脚本,并说:“背诵这些。”学生在这些静态脚本上练习,但在现实世界中,学生可能会早期犯一个错误,导致后续句子完全不同。旧的脚本无法帮助解决这些特定的错误。
  • 新方法(在线策略蒸馏): 这是本文的主要创新。老师不再只是给学生脚本,而是实时观察学生。
    1. 学生尝试自己翻译一个句子。
    2. 老师查看学生到目前为止确切写下的内容。
    3. 老师说:“好的,鉴于你写了这个特定的词,这是最佳的前进路径。”
    4. 学生从自己特定的错误和选择中学习,获得即时的、个性化的反馈。

3. 秘密武器:“并集”策略

这里有一个棘手的问题:学生和教师可能会使用略有不同的“词汇表”(例如,一个使用特定的俚语,而另一个使用正式术语)。

  • 为了解决这个问题,本文使用了Union Top-K方法。想象老师和学生都写下他们对下一个词的前 5 个猜测。系统将这两个列表合并为一个“安全区”的可能性集合。
  • 然后,学生被训练在这个共享的安全区内匹配教师的置信度。这就像一场舞蹈,两位舞伴同意练习一组特定的舞步,确保他们不会因不同的词汇表而感到困惑。

4. “热身”(教师数据阶段)

在实时辅导开始之前,作者增加了一个“热身”阶段。

  • 他们首先让学生练习 2,000 小时由教师生成的转录文本。
  • 为什么? 这有助于学生和教师进入同一频道。就像学徒在开始真正训练前,先跟随大师实习几天一样。
  • 结果: 这个“热身”使师生更加兼容。当他们最终开始实时辅导时,已经在使用同一种语言,从而使训练更加高效。

5. 结果:小而强大

本文在英语和普通话语音识别上测试了这种方法。

  • 目标: 一个在极小预算(10 万小时)下训练的小模型,能否击败在巨大预算下训练的类似规模模型?
  • 结果: 是的!使用这种“智能教练”方法(Ark-Base + TD + OPD)训练的小模型,在五项测试中的四项上击败了标准小模型(Qwen3-ASR-0.6B)。
  • 局限: 它仍然没有击败巨大模型(Qwen3-ASR-1.7B),这很合理,因为该模型物理上更大,拥有更多的“脑力”。但就其规模而言,它已经达到了可能的最佳水平。

核心启示

本文证明,构建优秀的语音识别器并不总是需要数百万小时的数据。如果你有一个强大的“教练”(一个大教师模型),并采用一种让学生从其实时特定错误中学习的方法(在线策略蒸馏),你就可以用一小部分数据获得出色的结果。

这就像在说:“你不需要读完图书馆里的每一本书就能成为伟大的作家;你只需要一位伟大的编辑,在你写作时阅读你的草稿,并确切地告诉你如何修改那些你感到棘手的句子。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →