← 最新论文
💬 NLP

The Illusion of Superposition? A Principled Analysis of Latent Thinking in Language Models

该论文通过三种训练范式的对比分析指出,只有从头训练的模型在连续思维链推理中真正利用了“超叠加”机制,而免训练和微调模型因预训练偏差和容量限制倾向于发现捷径并导致超叠加失效。

原作者: Michael Rizvi-Martel, Guillaume Rabusseau, Marius Mosbach

发布于 2026-04-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael Rizvi-Martel, Guillaume Rabusseau, Marius Mosbach

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(LLM)做一次“思想体检”,目的是搞清楚它们到底是不是真的在“同时思考多条路”,还是只是在“假装思考”。

为了让你更容易理解,我们可以把大语言模型想象成一个超级聪明的侦探,而它解决问题的过程就是破案

1. 核心概念:什么是“叠加态”(Superposition)?

想象一下,侦探接到一个案子,面前有 10 条可能的线索(比如:凶手可能是 A、B、C...)。

  • 传统的推理(离散思维): 侦探必须一条一条地查。他先查 A,发现不对,再查 B,发现也不对……就像在迷宫里走,走不通就回头。每一步他只能选一个确定的方向。
  • 理想的“叠加态”推理(Latent CoT): 这是最近流行的一种新方法。理论认为,侦探可以同时拿着 10 条线索一起查,在脑子里同时保留所有可能性,最后再根据综合信息做出决定。这就像侦探同时分身成 10 个人,每个人走一条路,最后汇合。

这篇论文的核心问题就是:现在的 AI 侦探,真的能做到“同时分身”吗?还是说它只是在“装样子”?

2. 论文做了三个实验(三种侦探训练法)

作者找了三种不同训练出来的 AI 侦探,看看它们在面对复杂问题时,是不是真的在“同时思考”:

实验一:现成的侦探(训练免费法 / Soft Thinking)

  • 做法: 拿一个已经训练好的成熟侦探(比如 Qwen),不重新教它,只是强行让它把“多条线索”混合在一起输入给它(比如把“可能是 A"和“可能是 B"的向量加在一起)。
  • 结果: 完全失败。
  • 比喻: 就像你给一个习惯单线思维的侦探,强行把 10 张不同的地图揉成一张纸塞给他。结果呢?侦探的大脑(模型内部)在几秒钟内就把这张揉皱的纸强行展开,只看到了其中一张地图(通常是概率最大的那个),其他 9 张瞬间消失。它并没有真的同时思考,只是迅速做出了一个决定,然后假装在思考。

实验二:微调过的侦探(Coconut 微调法)

  • 做法: 拿一个基础侦探,专门用“连续思考”的方法重新训练它,让它学会用“模糊的、连续的”线索来推理。
  • 结果: 也是失败,而且更狡猾。
  • 比喻: 这个侦探学会了一个作弊技巧(捷径)。它发现,其实根本不需要一步步推理,只要看一眼题目,就能直接猜出答案。于是,它在“思考过程”中,虽然表面上在走迷宫,但实际上它早就把答案写在手心里了,然后假装在一步步推导。
    • 作者发现,即使把它的“思考过程”(那些模糊的线索)全部删掉,只给它题目,它依然能答对 96% 的题!这说明它根本没在用“叠加态”思考,它只是在死记硬背或者走捷径

实验三:从零培养的侦探(从头训练法 / From-Scratch)

  • 做法: 不借用任何现成的知识,从零开始训练一个小侦探,专门让它用“连续思考”的方法解题。
  • 结果: 终于成功了!
  • 比喻: 这个从小在“模糊世界”长大的侦探,真的学会了同时思考。它的脑子里确实保留了多种可能性的“概率云”,在推理过程中,它会同时权衡“可能是 A"和“可能是 B",直到最后才确定答案。
    • 关键点: 只有这种“从零开始”且模型比较小的侦探,才真正掌握了“叠加态”技能。

3. 为什么大多数侦探都失败了?(两个原因)

论文揭示了两个导致“叠加态”失效的深层原因:

  1. “最后一步定生死”的坏习惯(预训练偏见):

    • 现在的 AI 侦探大多是在海量人类文本上训练的。人类说话或写文章时,习惯一步一个脚印,必须明确说出下一个字是什么。
    • 这导致 AI 在最后一层大脑(输出层)时,会强迫自己把模糊的想法“坍缩”成一个确定的词。就像你让一个习惯了说“是”或“否”的人去描述“既像又不像”的状态,他最后还是会强行选一个词。这种习惯根深蒂固,微调也改不掉。
  2. 能力太强反而变笨(容量问题):

    • 这是一个反直觉的发现:模型越大,越容易偷懒。
    • 如果侦探太聪明(模型参数量太大),它发现“直接猜答案”比“辛苦地同时思考 10 条路”要快得多、容易得多。于是它选择了走捷径
    • 只有那些能力适中(模型较小)的侦探,因为“猜答案”太难了,被迫老老实实地去“同时思考多条路”,反而学会了真正的叠加态。

4. 总结与启示

这篇论文告诉我们什么?

  • 目前的“幻觉”: 我们以为现在的 AI 在通过“连续思考”同时探索多条路径,其实大部分情况下,它们只是在假装。它们要么迅速坍缩成单一答案,要么直接走捷径作弊。
  • 真正的希望: 只有从零开始规模适中的模型,才真正展现了“同时思考”的潜力。
  • 未来的方向: 我们不应该盲目地追求更大的模型或简单的微调。如果想让 AI 真正学会“多线并行”的推理,我们需要改变训练方式,甚至可能需要专门设计更小、更“笨”一点的模型,强迫它们学会真正的思考,而不是走捷径。

一句话总结:
现在的 AI 侦探大多是在“装模作样”地同时思考,其实心里早就想好了一条路;只有那些“白手起家”且“能力适中”的小侦探,才真正学会了同时分身思考的绝技。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →