← 最新论文
💬 NLP

Your Models Have Thought Enough: Training Large Reasoning Models to Stop Overthinking

该论文提出"Just-Enough Thinking (JET)"方法,通过轨迹截断和质量控制的长度奖励训练大推理模型在信息积累充足时主动停止过度思考,从而在保持甚至提升准确率的同时显著降低推理成本。

原作者: Jinyi Han, Ying Huang, Ying Liao, Zishang Jiang, Xikun Lu, Haiquan Zhao, Xinyi Wang, Guanghao Zhou, Sihang Jiang, Jiaqing Liang, Weikang Zhou, Zeye Sun, Fei Yu, Yanghua Xiao

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinyi Han, Ying Huang, Ying Liao, Zishang Jiang, Xikun Lu, Haiquan Zhao, Xinyi Wang, Guanghao Zhou, Sihang Jiang, Jiaqing Liang, Weikang Zhou, Zeye Sun, Fei Yu, Yanghua Xiao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为 JET (Just-Enough Thinking,即“刚刚好思考”) 的新方法,旨在解决大型推理模型(LRMs)目前面临的一个大麻烦:“想太多” (Overthinking)

想象一下,你让一个超级聪明的学生做一道数学题。

  • 以前的模型(LRMs): 就像那个过度焦虑的学生。哪怕题目很简单,他也要把解题思路在草稿纸上写满三页纸,反复验算,甚至怀疑自己是不是漏掉了什么宇宙真理,最后才给出答案。虽然答案通常是对的,但他浪费了太多时间(计算资源)和纸张(Token)。
  • JET 方法: 就像给这个学生装上了一个**“智能刹车”**。教会他:“嘿,当你已经收集到足够的线索时,就立刻停笔,直接写答案。别再为了凑字数而强行思考了。”

下面我用几个生动的比喻来拆解这篇论文的核心内容:

1. 核心发现:其实你早就知道答案了

论文的作者们做了一个有趣的实验(就像做“截断测试”):
他们把模型生成的长思考过程强行切断,只保留前 25% 或 50% 的内容,然后问模型:“停!现在基于你刚才想的内容,直接告诉我答案。”

  • 结果令人惊讶: 即使只看了前一半的思考过程,模型依然能给出正确答案!
  • 比喻: 这就像你在听侦探破案。侦探刚说了“凶手是左撇子,且案发时不在家”,你就已经猜出是谁了。侦探却非要继续啰嗦半小时,分析凶手的心理活动、天气对案发的影响……其实后面的话都是废话。模型在思考初期就已经积累了足够的信息,后面的步骤往往是多余的“过场动画”。

2. 为什么以前的方法不管用?

以前的训练方法(强化学习)试图通过奖励“短答案”来让模型变聪明。但这有个大问题:

  • 比喻: 这就像教练告诉运动员:“跑得快一点!”但运动员天生喜欢慢悠悠地散步。教练如果强行把运动员的腿绑起来让他跑短距离,运动员会摔得很惨,而且根本学不会怎么自己控制速度。
  • 问题所在: 模型自己生成的“短答案”非常少,大部分时候它都在“废话连篇”。如果强行用人工缩短的答案去训练它,模型会感到困惑(分布不一致),导致学习效果很差。

3. JET 是怎么解决的?(两大法宝)

JET 方法通过两个巧妙的步骤,教会模型“见好就收”:

法宝一:两阶段“截断”训练 (Two-Stage Rollout)

  • 第一阶段(完整思考): 让模型像往常一样,把整道题从头到尾想一遍,生成完整的长答案。这是它的“自然状态”。
  • 第二阶段(强制刹车): 在模型思考的过程中,随机在某个时间点(比如想了一半、想了一大半时)给它插个牌子,上面写着:“停!信息够了,直接给答案!”
  • 比喻: 就像在练车。教练先让你开完整条路(完整思考),然后突然在路口喊“停车!”,让你基于刚才的驾驶情况直接报出目的地。通过反复练习这种“随机截断”,模型学会了:“哦,原来在思考的中间某个点,我就已经掌握所有关键信息了,不需要再想下去。”

法宝二:有质量的“长度奖励” (Quality-Controlled Length Reward)

  • 规则: 只有答对了,才奖励“短”;如果答错了,再短也没用,甚至要惩罚。
  • 比喻: 这就像考试评分。
    • 如果你做对了,而且只用了一行字,老师给你满分 + 小红花(奖励短)。
    • 如果你做对了,但写了三页纸,老师给你满分,但没有小红花(奖励少一点)。
    • 如果你做错了,哪怕只写了一个字,老师也给你零分(因为短没意义)。
    • 这样模型就明白了:“我要在确保做对的前提下,尽可能写得短。” 而不是为了短而短,或者为了保险而啰嗦。

4. 效果如何?

实验结果显示,JET 方法非常成功:

  • 省资源: 模型的输出长度平均减少了 46%(相当于省了一半的纸张和墨水)。
  • 更聪明: 令人意外的是,因为去掉了那些干扰性的废话,模型的准确率反而提高了 4.6%
  • 比喻: 就像把一杯浑浊的泥水沉淀过滤,去掉了泥沙(冗余思考),剩下的清水(核心逻辑)反而更纯净、更准确。

总结

这篇论文的核心思想就是:大模型不需要“想太多”,只需要“刚刚好”。

JET 方法通过模拟人类“信息积累到阈值就停止”的决策机制,教会 AI 在思考过程中主动刹车。这不仅让 AI 算得更快、更省钱,还让它变得更精准、更像个聪明的“老手”,而不是一个只会死记硬背、啰里啰嗦的“书呆子”。

一句话概括: 给 AI 装个“刹车片”,让它知道什么时候该停,既省油(算力)又快(效率),还更安全(准确)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →