← 最新论文
🤖 machine learning

Quantized Reasoning Models Think They Need to Think Longer, but They Do Not

本文揭示了激进的训练后量化会导致推理模型通过生成不必要的中间步骤并无法输出此前已发现的正确答案来产生“过度思考”现象,而这一问题可以通过对特定的过度思考标记应用无需训练的逻辑惩罚来有效缓解,从而在减少推理长度的同时保持准确性。

原作者: Sanae Lotfi, Polina Kirichenko, Steven Li, Zechun Liu

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Sanae Lotfi, Polina Kirichenko, Steven Li, Zechun Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和创意类比对该论文进行的解释。

核心问题:过度思考的 AI

想象你有一个非常聪明的学生(AI),他非常擅长解决数学题。通常情况下,他解出一道题,写下答案,然后就结束了。

现在,想象你把这个学生放在一个嘈杂、拥挤的房间里,他听不清自己的思考声(这代表了量化/Quantization,一种用于使 AI 模型更小、更快的技术)。

研究发现了一个令人惊讶的现象:当 AI 置身于这个“嘈uku 嘈杂的房间”时,它不仅仅是得到了错误的答案。相反,它变得困惑了。它在思考过程的中途其实已经找到了正确答案,但随后它开始怀疑自己。它心想:“等等,也许我错了?如果我尝试另一种方法呢?”它开启了新的思维之门,质疑自己的逻辑,并陷入了一个冗长、重复的思考循环中。

最终,它在能够说出之前找到的答案之前,就耗尽了时间或内存。它因为“过度思考”而导致失败。

发现:不是缺乏智力,而是缺乏停止能力

研究人员观察了这些“嘈杂”AI 模型的数千次失败尝试。他们发现,在高达 52% 的失败案例中,AI 实际上在推理过程中间已经得出了正确答案。

  • 旧有的假设: “AI 太笨了,无法解决问题,因为它被缩小了。”
  • 新的现实: “AI 足以解决这个问题,但‘噪声’让它过度自我怀疑,以至于它永远无法停止说话并给出答案。”

这就像一位厨师做了一顿完美的饭菜,尝了一下,意识到味道很棒,但随后开始担心:“是不是太咸了?也许我应该再加点盐?或者我应该重新做一遍?”食物被毁掉并不是因为厨师不会做饭,而是因为他们停不下来。

诊断:“等一下”与“但是”的触发器

为了理解为什么会发生这种情况,研究人员将“嘈杂”的 AI 与“清晰”的 AI(原始的全尺寸版本)进行了对比。他们观察了 AI 生成的具体词汇。

他们发现,“噪声”特别干扰了犹豫性词汇

  • 稳定的词汇: 数字、数学符号和格式化字符(例如“255”、“sqrt”、“answer”)保持清晰且稳定。
  • 不稳定的词汇: 表示怀疑或分支路径的词汇(例如“Wait/等一下”、“But/但是”、“Alternatively/或者”、“Maybe/也许”)在 AI 感到困惑时变得更加频繁地出现。

当 AI 处于一个已经不确定(高不确定性)的状态时,“噪声”使得它更有可能选择像“Wait”这样的词。这会触发一个新的思维链,导致 AI 放弃了原本已经在进行的正确路径。

解决方案:“静音按钮”

研究人员提出了一个聪明的、免费的修复方法,不需要重新训练 AI。

他们创建了一个包含 50 个“过度思考标记”(如“Wait/等一下”、“But/但是”、“However/然而”、“Reconsider/重新考虑”)的列表。在 AI 思考的过程中,他们会对这些特定的词应用微小的惩罚(penalty)

这就像一位严厉的老师,每当学生开始说“等一下,也许我应该……”时,就会轻轻拍一下学生的肩膀。老师并不是阻止他们思考,只是温和地劝阻那些带有“怀疑色彩”的表达方式。

结果:

  • 更短的思考时间: AI 不再陷入循环。它的推理速度提升了 12% 到 23%
  • 更高的准确率: 因为它不再自我怀疑,它能更频繁地得到正确答案。在某些情况下,准确率显著提高(例如,在某项数学测试中从 47% 跳升至 61%)。
  • 零额外成本: 这种修复方法不需要额外的计算能力或训练时间。它只是在 AI 说话时应用的一个简单规则。

大局观

这篇论文表明,当我们缩小 AI 模型以使其更快时,我们会在无意中让它们变得优柔寡断。它们并没有失去计算能力,而是失去了信任自己计算结果的能力。

通过简单地告诉 AI “不要犹豫”(惩罚像“Wait”和“But”这样的词),我们可以让这些更小、更快的模型表现得几乎与那些庞大、昂贵的模型一样出色,而不会让它们浪费时间在原地打转。

简而言之: 量化模型失败并不是因为它们不会思考,而是因为它们无法停止思考。一点点纪律(对犹豫词汇的惩罚)就能解决问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →