← 最新论文
🤖 machine learning

When Chain-of-Thought Fails, the Solution Hides in the Hidden States

本文通过对 GSM8K 数据集的激活补丁(activation patching)实验发现,思维链(CoT)的中间隐藏状态中蕴含着足以恢复正确答案的任务相关信息,即使在原始推理链错误的情况下,通过提取这些 token 级别的隐藏状态也能显著提升模型的答题准确率。

原作者: Houman Mehrafarin, Amit Parekh, Ioannis Konstas

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Houman Mehrafarin, Amit Parekh, Ioannis Konstas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章的研究非常有意思,我们可以把它想象成一个关于**“考试作弊”与“大脑潜意识”**的故事。

核心主题:当“嘴巴”说错时,“大脑”其实知道答案

想象一下,你正在参加一场数学考试。你一边在草稿纸上写解题步骤(这就是所谓的 Chain-of-Thought,思维链),一边在心里默默计算。

有时候,你写出来的步骤是错的,最后得出的答案也是错的。按理说,既然步骤错了,答案肯定没救了。但这篇文章的研究人员发现了一个惊人的现象:虽然你写在纸上的“解题过程”是错的,但你大脑里的“思维状态”(隐藏层状态)其实早就已经掌握了正确答案的线索!


1. 形象的比喻:草稿纸 vs. 大脑里的“小剧场”

为了让你理解,我们把大模型(AI)比作一个正在考试的学生:

  • 思维链 (CoT) = 你的草稿纸:这是你写出来的文字,比如“第一步,16减3等于13...”。
  • 隐藏状态 (Hidden States) = 你大脑里的“小剧场”:这是你还没说出口、还没写下来的、深层的逻辑直觉。
  • 直接回答 (Direct Answer) = 闭着眼直接填答案:不写过程,直接猜一个数。

研究人员做了一个“脑机接口”实验:
他们发现,如果这个学生在草稿纸上写错了(CoT失败),研究人员可以强行把学生大脑里那个“正确的直觉”提取出来,直接“植入”到他正在填写的答题卡上。结果发现,这个学生竟然奇迹般地写出了正确答案!

这说明:AI 的“嘴巴”(生成的文字)可能会撒谎或犯错,但它的“内心”(隐藏层)往往比它的“嘴巴”更聪明。


2. 谁才是真正的“智囊团”?(研究发现)

研究人员还仔细观察了,大脑里的哪些“念头”最管用:

  • 动词和名词是“指挥官”
    如果你把“拿”、“吃”、“剩下”这些动词,或者“苹果”、“钱”这些名词的思维状态植入进去,AI 就像突然开窍了一样,能重新理清逻辑,算出正确答案。它们携带的是“如何解决问题”的逻辑。

  • 数字只是“传声筒”
    奇怪的是,那些单纯的数字(比如“16”、“3”)虽然看起来很重要,但它们携带的信息很浅。如果你只把数字的思维植入进去,AI 往往只是机械地蹦出一个数字,并没有真正理解逻辑,所以出错率反而高。

  • “早熟”的思维
    研究发现,正确的逻辑往往出现在解题过程的早期阶段。就像一个聪明人,虽然最后说话结巴了,但他在思考刚开始的那几秒钟里,逻辑其实已经通了。


3. 这项研究有什么用?(未来的意义)

既然我们知道了“正确答案”其实藏在 AI 的“潜意识”里,我们就能做很多酷炫的事情:

  1. “大脑修复术”:如果 AI 说话逻辑乱了,我们不需要让它重写一遍长篇大论,只需要从它之前的思维里“抓取”一点正确的逻辑补丁,就能让它瞬间变聪明。
  2. “极简主义解题”:现在的 AI 为了算对题,往往要写一大堆废话(长长的思维链)。但这项研究告诉我们,其实不需要那么多废话,只要抓住了关键的“思维瞬间”,哪怕只说一两句话,也能把题做对。这会让 AI 运行得更快、更省电。

总结一下:

这篇文章告诉我们:AI 的“思考过程”并不总是它“思考能力”的真实体现。 即使它在纸面上表现得笨手笨脚,它的“内心世界”里可能早就藏着通往真理的钥匙。我们现在的任务,就是学会如何从这些“隐藏的思维”中,把正确答案给“捞”出来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →