← 最新论文
🤖 machine learning

Test-Time Compute Scaling for ASR with Depth-Conditioned Looped Transformers

本文介绍了 LARM,一种深度调节的循环 Transformer 框架,它通过利用诸如 FiLM 条件化和稀疏 CTC 检查点等专门组件动态调整循环编码器深度,实现了自动语音识别的测试时计算扩展,从而在不需要更大的固定深度模型的情况下提高了识别准确率。

原作者: Yacouba Kaloga, Shashi Kumar, Shakeel A. Sheikh, Driss Khalil, Petr Motlicek, Ina Kodrasi

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Yacouba Kaloga, Shashi Kumar, Shakeel A. Sheikh, Driss Khalil, Petr Motlicek, Ina Kodrasi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明但略显疲惫的翻译员,正试图将一段语音转换为文字。在传统的系统中,这位翻译员有一个固定的“步骤”或“层数”可以进行理解。一旦完成这些步骤,他们就会给出他们认为最好的猜测,即使他们对某个棘手的词仍然感到困惑。如果你想让他们变得更好,通常需要构建一个全新的、规模大得多的翻译系统,拥有更多的步骤,而这会耗费更多的资金并需要更长的训练时间。

这篇论文介绍了一个名为 LARM(循环音频循环模型,Loop Audio Recurrent Model)的新系统,它改变了规则。LARM 不再是构建一个更大的翻译器,而是让同一个翻译器根据你在实际对话中拥有的时间,采取尽可能多的额外步骤。

以下是它的工作原理,使用了日常生活的类比:

1. “循环”概念:同一支团队,更多时间

把标准的语音识别系统想象成一条拥有 10 个工位的工厂流水线。一个产品(声音)经过所有 10 个工位一次,最后变成成品文本。如果你想要更好的质量,你通常会建造一个拥有 20 个工位的工厂。

LARM 则不同。它只有 4 个工位,但它有一个神奇的“重入门”。在声音经过 4 个工位后,它可以被送回这些工位再次通过,一遍又一遍。

  • 问题: 如果你只是在没有任何变化的情况下让声音反复通过这 4 个工位,翻译员会感到厌倦并变得重复。他们会不断重复同样的错误。
  • 解决方案: LARM 给翻译员一本特殊的指令手册,这本手册每次循环时都会发生变化。它告诉他们:“在第一次通过时,只需听出大致的氛围。在第二次通过时,关注语法。在第三次通过时,检查拼写。”这使得同一个小团队可以在不同的阶段进行专业化的工作。

2. “监督时钟”:教练的哨声

为了防止翻译员在循环中迷失方向,系统使用了一个监督时钟
想象一位教练每隔几分钟吹一次哨子。

  • 哨声(检查点): 每 4 个循环,教练会叫停翻译员并说:“好了,写下你现在认为这句话是什么。”系统会将这个猜测与正确答案进行对比,并给予反馈。
  • 静默时间(精炼): 在两次哨声之间,翻译员在沉默中工作。他们此时还未被评分;他们只是利用上一次哨声带来的反馈来精炼对声音的理解。这创造了一种“检查、精炼、检查、精炼”的节奏。

3. “延迟反馈”:左手边的便签

语音识别中最难的部分之一是知道“之前”发生了什么,从而理解“接下来”会发生什么。

  • 类比: 想象你在读一本书,但你只能看到当前的单词。你可能会猜“猫坐在……”然后停下来。
  • LARM 的技巧: LARM 提取前一个循环中的“软猜测”(即某个词出现的概率),将其向后移动一步,然后将其交给当前循环中的翻译员。这就像翻译员从过去的自己那里得到了一张便利贴,上面写着:“嘿,我觉得上一个词是‘the’,所以请记住这一点。”这有助于系统在循环过程中,从左到右构建一个连贯的故事。

4. “FiLM 调节器”:情绪环

为了确保翻译员知道自己处于哪一次循环(这样他们就不会在第一步时就尝试进行最后的拼写检查),LARM 使用了一个“情绪环”或 FiLM 调节

  • 这是一个信号,告诉系统:“你目前处于第 3 次循环(共 12 次)。”基于这个数字,系统会微妙地改变翻译员处理声音的方式。这就像告诉学生:“你现在处于头脑风暴阶段,所以可以天马行空,”对比“你现在处于编辑阶段,所以要严谨。”这确保了同一个大脑在不同时间执行不同的任务。

他们发现了什么?

研究人员在著名的语音数据集 LibriSpeech 上测试了该系统。

  • 时间越多,效果越好: 他们发现,如果让他们运行更多的循环(采取更多步骤),准确率就会提高。他们不需要训练一个新的、更大的模型;他们只需要在同一个模型上投入更多的“思考时间”。
  • 击败巨头: 一个只有 4 层的小型 LARM 模型,在运行 12 个循环后的表现,几乎与或有时甚至优于一个拥有 16 层的庞大标准模型。这意味着你可以获得高质量的结果,而无需需要超级计算机级别的模型。
  • 提前退出: 因为模型是逐步改进的,所以如果你需要快速响应(比如用于实时字幕应用),你可以提前停止它以获得一个不错的答案;或者让它运行更久,以获得完美的转录。

核心结论

LARM 证明了对于语音识别,你并不总是需要一个更大的大脑;有时,你只需要让现有的脑子思考得更久一点、更有策略一点。它将模型的“深度”变成了一个你可以根据可用时间进行调节的旋钮,让语音识别变得更加灵活且高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →