← 最新论文
💬 NLP

On the Optimal Reasoning Length for RL-Trained Language Models

本文表明,对于经过强化学习训练的语言模型,推理准确度与输出长度呈现出非单调关系,由于在日益趋向正确的中心趋势周围存在不断增加的离散性,该准确度在中间值处达到峰值,即便其众数准确度会随着思维链的增长而持续提高。

原作者: Daisuke Nohara, Taishi Nakamura, Rio Yokota

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Daisuke Nohara, Taishi Nakamura, Rio Yokota

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一位非常聪明但爱唠叨的学生如何解决数学难题或编写计算机代码。你发现,如果你让这个学生把思考过程说出来(这个过程被称为“思维链”),他们在解决难题时表现会出色得多。然而,这里有一个陷阱:学生变得越聪明,他们往往就越爱说话。他们开始写成篇的文章而不是给出答案,这会浪费大量的时间和金钱。

为了解决这个问题,研究人员尝试通过给他们一个“惩罚”来教导学生保持简洁。他们原本预期,如果只是让学生少说一点点,他们依然会很聪明,只是速度更快。

大惊喜
Nohara及其同事的论文发现,“学生说话的多少”与“聪明程度”之间的关系并不是一条直线。它更像是一座山丘

  • 太短: 如果你强迫学生过于简短,他们就没有足够的时间思考,从而导致答案错误。
  • 恰到好处: 随着你让他们多说一点,他们的准确率会上升。存在一个“甜点区”(sweet spot),在那里他们最准确。
  • 太长: 如果你让他们说话太多,即使他们仍在努力思考,准确率实际上也会开始下降。

这种情况发生在不同类型的学生(不同的AI模型)以及不同学科(数学和编程)中。

“中心” vs “游荡的人群”
为什么当学生说话太多时,准确率会下降?作者使用了一个巧妙的比喻来解释。想象一下学生的答案就像一群站在田野里的观众。

  1. “中心”(众数准确率): 随着学生说话时间变长,人群的中心会越来越接近正确答案。事实上,如果你让这个学生生成100个答案,并挑选出出现次数最多的那个,那么这个“最常见的”答案会随着学生说话时间的增加而变得更加正确。核心思想是思路变得越来越清晰。
  2. “离散度”(众数泄漏): 然而,随着学生说话时间变长,人群中的个体却开始从中心向更远的地方游荡。他们分心了、闲扯了,或者绕了奇怪的弯路。

结果:
在“过长”的区域,人群的中心正站在靶心上,但由于个体游荡得太远,如果你随机挑选一个人,你很可能会错过目标。

  • 短答案: 人群甚至还没找到目标。
  • 中等长度答案: 人群紧密地聚集在目标周围。
  • 长答案: 人群的中心完美地位于靶心,但人们却在整个田野里乱转。

启示
论文得出结论:仅仅让AI模型少说话并不总是答案,但让他们无止尽地说话也是适得其反的。存在一个最优的长度,让模型既能保持专注以找到正确答案,又不会因为过度唠叨而分心导致准确率下降。研究人员建议,未来的工具应该自动为我们找到这个“甜点区”,而不是让我们去猜测正确的设置。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →