← 最新论文
🤖 AI

Reasoning Can Be Restored by Correcting a Few Decision Tokens

本文表明,通过识别并干预基础模型与更强推理模型不一致的稀疏早期高不确定性规划令牌,并采用一种能显著提升性能的轻量级推理时委托策略,大语言模型的推理能力可被高效恢复。

原作者: Changshuo Shen, Leheng Sheng, Yuxin Chen, An Zhang, Xiang Wang

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Changshuo Shen, Leheng Sheng, Yuxin Chen, An Zhang, Xiang Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《通过修正少量决策令牌可恢复推理能力》的通俗解读,辅以生动的类比。

核心理念:“GPS 与司机”的困境

想象有两位司机试图前往同一个目的地(解决一道高难度数学题)。

  1. 司机 A(基础模型): 这位司机速度快、效率高,且熟悉本地街道。然而,面对复杂陌生的路线时,他们往往会在早期犯下几个关键错误——比如在第一个路口本该右转却转了左。一旦拐错弯,他们便会自信地沿着错误路线继续行驶,越走越偏。
  2. 司机 B(推理模型): 这位司机是一位缓慢而严谨的专家。他们会反复确认每一个转弯,仔细规划整条路线,几乎从不迷路。但他们的速度慢,且雇佣他们完成每一次行程的成本高昂。

问题所在: 我们希望司机 A 能达到司机 B 的水平,但又不想为整个行程支付使用司机 B 的高昂成本。

研究发现: 研究人员发现,司机 A 并非全程表现糟糕。他们在 90% 的行程中行驶得完美无缺。他们仅在极少数特定时刻——通常是在路线变得棘手的开头部分——才会出错。这些时刻就是“决策令牌”。

核心发现:关键在于最初的几次转弯

论文分析了数百万个两位司机意见相左的步骤,得出了三个令人惊讶的结论:

  1. 错误很罕见: 快速司机生成的词汇(令牌)中,只有约 8% 是真正出现分歧的地方。其余 92% 都是正确的。
  2. 错误发生得很早: 关键错误几乎总是出现在答案的最开始。这就好比司机在第一个路口拐错了弯,而剩下的旅程只是他们自信地朝着错误方向行驶罢了。
  3. 错误发生在“规划”时刻: 错误发生在司机决定“下一步该做什么”(规划)时,而不是在单纯进行数学计算(执行)时。这是“我该左转还是右转?”的抉择时刻,而非"1 + 1 = 2"的计算时刻。

解决方案:“抽查”干预机制

研究人员没有聘请慢速专家全程驾驶,而是提出了一种巧妙的技巧,称为“分歧引导的令牌干预”。

其运作方式如下:

  • 快速司机(基础模型)开始驾驶。
  • 一个智能的“抽查”系统监控路况。它将快速司机的下一步动作与慢速专家(推理模型)本会采取的动作进行对比。
  • 触发机制: 如果两位司机对下一步骤存在强烈分歧(出现分歧“峰值”),系统会瞬间踩下刹车。
  • 接管: 慢速专家介入,说出唯一一个能修正方向的正确单词或短语,随即立刻将方向盘交还给快速司机。
  • 结果: 快速司机沿着正确的路线继续完成剩余旅程,自行处理所有常规工作。

类比:编辑与作家

基础模型想象成一位快速、精力充沛的作家,能在几秒钟内写完整个故事。但有时,他们在第一段就会把情节搞错。
推理模型想象成一位缓慢、一丝不苟的编辑,他们知道完美的故事该如何讲述。

研究人员发现,与其让编辑重写整个故事(这需要耗费无穷的时间),不如只让编辑修正情节变得混乱的前几句话。修正之后,作家就能独自完美地完成故事的其余部分。

通过仅修正 8% 的词汇(即关键的决策点),这位快速作家的表现甚至超过了那些被训练成“推理专家”的版本。

为何这很重要

这篇论文证明,“推理”并不是一种需要为每一步都配备庞大大脑的魔法能力。相反,推理主要关乎在最初阶段做出正确的少数选择。一旦路径被正确设定,模型就能轻松处理其余部分。

通过仅在模型感到困惑的高不确定性时刻进行干预,我们可以用极少量的帮助恢复模型的推理能力,使其比全程使用巨型推理模型更快、更经济。

简而言之: 你不需要修好整辆车才能让它跑起来;你只需要在驾驶刚开始时修好方向盘即可。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →