← 最新论文
🤖 machine learning

LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training

该论文提出了 LEAF,一种回顾性树状强化学习方法,通过在 Rollout 批次中为共享前缀分配跨度级优势(span-level advantages),改进了语音感知大语言模型的后训练过程,从而在性能上超越了现有的 GRPO 式方法,甚至超越了使用更小模型的全参数基准模型。

原作者: Argyrios Gerogiannis, Yekaterina Yegorova, Mark Hasegawa-Johnson, Venugopal V. Veeravalli

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Argyrios Gerogiannis, Yekaterina Yegorova, Mark Hasegawa-Johnson, Venugopal V. Veeravalli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名学生如何根据口头提示编写故事。在旧的方法中(使用一种被称为 GRPO 的方法),老师会听完学生写的整个故事,然后给出一个最终成绩,并告诉学生:“整个故事写得很好!”或者“整个故事写得很差!”

这种方法的问题在于它过于粗放。如果学生写了一个精彩的开头,但结尾很糟糕,那么“差评”会将精彩的开头也一并惩罚;反之,如果学生起步很艰难,但结尾非常精彩,那么“好评”也会奖励那个艰难的起步。老师无法知道学生是在哪里做对了或做错了。

LEAF(低秩探索与自适应分叉)登场了。

伊利诺伊大学的研究人员提出了一个更聪明的方法来教这些语音 AI 模型。LEAF 不仅仅是为整个故事给出一个分数,它更像是一个侦探,回溯观察学生的作业,寻找故事发生转折的具体时刻。

以下是 LEAF 的工作原理,通过简单的类比来解释:

1. “团体旅行”类比

想象你派 8 名学生进行同一场徒步旅行(即“展开过程/rollout”)。他们最初都走在同一条路上,共同走完第一个一英里。然后,在路口处,一些学生向左转,另一些向右转。最终,他们都到达了终点,你根据风景的好坏给他们评分。

  • 旧方法 (GRPO): 你根据最终的风景告诉所有 8 名学生:“做得好!”或“做得差!”你并不关心其中 4 个人在第一英里时走错了路。
  • LEAF 方法: LEAF 观察这群人并说:“等等。大家在前一英里是一起走的。然后,在第一英里处,人群分开了。让我们看看那些选择了左侧路径的人。他们的风景变好了吗?是的。那么,“左侧路径”这个决定就是好的。让我们看看那些选择了右侧路径的人。他们的风景变差了吗?是的。那么,“右侧路径”这个决定就是坏的。”

2. 寻找“分叉点”(分支)

在语音 AI 中,模型逐个生成单词。有时,它会感到困惑或做出冒险的猜测。LEAF 会寻找这些困惑的时刻(被称为“高惊异度/high-surprisal”点)。

这就像一本**“选择你的冒险”**类书籍。

  • 模型写下前几个句子。
  • LEAF 会问:“这组 AI 模型是否对这些前几个句子达成了一致?”
  • 如果他们达成了一致,LEAF 会将其视为一个稳固的“大本营”。
  • 然后,LEAF 会寻找模型开始产生分歧或采取不同路径的时刻。它将该处标记为一个**“分叉点 (Fork)”**。

3. “倒带与奖励”

一旦 LEAF 找到了这些分叉点,它就会倒带。它根据在分叉点之前所采取的特定路径(前缀)对响应进行分组。

  • 如果一组响应共享一个特定的前缀(句子的开头),并且随后获得了高分,LEAF 会专门向那个起始部分给予额外奖励
  • 如果一组响应共享一个前缀,但随后得了低分,LEAF 会专门针对那部分给予负面评价,告诉模型:“不要这样开始你的句子。”

这就像教练在说:“你跑第一圈跑得完美,但在 50 米处绊倒了。让我们把训练重点放在修复那特定的 50 米路段上,而不是针对整场比赛。”

为什么这很重要?

论文声称,通过使用这种“回顾性树状结构”方法,即使使用更少的资源,LEAF 教导 AI 的效果也比旧方法好得多。

  • 更智能的学习: 它防止了 AI 因为结局运气好而学到坏习惯,或者因为结局运气差而丢掉好习惯。
  • 高效性: 它不需要生成新的故事来进行学习。它只是重新分析已经生成的故事,从中发现隐藏的结构。
  • 更好的结果: 论文表明,使用 LEAF 训练的模型在回答有关音频的问题和翻译语音方面,比使用旧方法训练的模型表现更好。事实上,一个用 LEAF 训练的小型模型,其表现优于一个用旧方法训练的规模大得多的模型。

核心总结

LEAF 是一种用于语音 AI 的新训练技术,它不再将整个对话视为一个单一的“好”或“坏”事件。相反,它将对话分解成小的片段,识别出 AI 做出正确或错误决定的确切时刻,并仅针对这些特定时刻给予奖励(或责备)。这就像是从一个对整篇作文进行统一评分的老师,升级到了一个能精准指出哪些句子需要改进的老师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →