← 最新论文
💬 NLP

Reasoning Fine-Tuning Induces Persistent Latent Policy States

本文证明了推理微调将语言模型的内部动力学全局性地重构为由切换动力系统建模的、具有显著功能特化特征的潜在策略状态,从而通过因果干预和对易错推理路径更有效的剪枝来提升性能。

原作者: Abir Harrasse, Michael Lan, Hunar Batra, Fateme Hashemi Chaleshtori, Chaithanya Bandi

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Abir Harrasse, Michael Lan, Hunar Batra, Fateme Hashemi Chaleshtori, Chaithanya Bandi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观察一位才华横溢的学生解决一道复杂的数学题。有时,他们会直接脱口而出答案,或者在猜想的迷雾中徘徊,尝试一个接一个的想法,直到某个想法奏效。而有时,他们有着清晰、循序渐进的计划:他们停下来理解问题,将其分解成较小的部分,检查自己的工作,然后充满信心地写下最终解法。多年来,科学家们一直想知道计算机程序(称为“大语言模型”,LLMs)是如何学会第二种思考方式的。这些模型是在海量文本上进行训练的,但为了让它们擅长推理,研究人员会对那些需要“思维链”(Chain of Thought)——即在给出最终答案前进行逐步解释——的问题进行额外的训练。

一个巨大的谜团是:这种额外的训练仅仅是让模型在预测下一个词时变得稍微好一点吗?还是从根本上随着时间的推移重构了模型的“大脑”运作方式?这就像是区分一个混乱的、人群随机喊叫的场景与一支排练精良、演奏交响乐的管弦乐队之间的区别。这篇论文探讨的是:训练是将模型变成了一个知道何时引入小提琴、何时让鼓声占据主导地位的指挥家,还是仅仅让原本嘈杂的人群变得声音更大、更自信了。理解这一点至关重要,因为如果我们知道这些模型是如何思考的,我们或许就能在它们陷入困境时修复它们,或者帮助它们解决目前无法处理的问题。


AI 大脑内部的隐藏开关台

在这篇论文中,研究人员将 AI 的思考过程视为一个切换动力系统(switching dynamical system)。这是一个高级说法,意指他们认为模型的“大脑”不仅仅是一个平滑流动的思想之河,而更像是一列在不同“轨道”或**潜在策略状态(latent policy states)**之间跳转的火车。

想象 AI 是一位在漫长旅途中旅行的游客。一个“基础”模型(即未经过专门推理训练的模型)就像是一个漫无目的的游客。他们可能会停在咖啡馆,然后去公园,接着去博物馆,但他们经常回到原处打转,感到困惑,或者在没有明确目的地的情况下随机切换位置。他们的路径是混乱且不可预测的。

相比之下,经过推理微调的模型则像是一位经验丰富的向导。这位向导拥有一张包含不同“模式”或“状态”的隐藏地图。当向导进入“规划模式”时,他们会停留一段时间,仔细规划路线。然后,他们会切换到“计算模式”,开始进行数值运算。最后,他们会移动到“验证模式”,在抵达“答案站”之前进行双重检查。这篇论文的核心发现是:训练不仅让向导变得更聪明,还赋予了他们在这些模式之间切换时更加组织化、结构化的能力。

研究人员的发现

研究团队观察了在解决数学和逻辑谜题时,参数量从 15 亿到 320 亿不等的 AI 模型的内部“激活值”(即电信号)。他们使用了一种名为 CEBRA 的特殊工具,将这些海量数据压缩成一个简单的低维地图,然后应用了一个称为**切换动力系统(SDS)**的数学框架,以寻找隐藏的“机制”或“状态”。

以下是他们的发现:

  1. 更具组织性的切换: 推理训练后的模型不仅拥有更多的状态,而且在状态切换方面具有更好的结构。基础模型往往会在相邻的状态之间随机闪烁(就像一个卡住的灯开关),而推理模型则拥有截然不同、界限清晰的“聚类”活动。它们会在一个状态中停留更长时间(高持久性),然后进行一次有目的的跳跃,进入下一个必要的阶段。
  2. 功能专业化: 研究人员发现,这些隐藏状态实际上与真实的推理步骤相匹配。有些状态显然是在“思考问题”,有些是在“做数学题”,还有些是在“检查答案”。推理模型能更好地保持在正确的状态中并维持合适的时间。
  3. 不仅仅是关于正确率: 研究的一个关键部分是排除“这些模式仅仅是因为推理模型答对了更多问题”这一假设。研究人员通过仅观察基础模型和推理模型都答对的问题来测试这一点。即使在这些“完美”的情况下,推理模型仍然表现出这种有组织的、多状态的结构,而基础模型依然保持着混乱。这表明这种结构是思考方式的一种根本性变化,而非仅仅是得分提高带来的副作用。
  4. 因果证明(“移植”实验): 为了证明这些状态确实发挥了作用,研究人员进行了一场“手术”。他们提取了推理模型的“切换规则”(策略),并尝试将其移植到基础模型中。通过轻轻引导基础模型遵循推理模型的路径,他们成功帮助基础模型解决了此前失败的问题。这证明了这种有组织的切换模式本身才是产生差异的关键。

一个实用的超能力:“前缀卫士”(Prefix Guard)

最令人兴奋的实际应用来自于利用这一发现来纠正错误。研究人员注意到,当模型开始走上“错误的路径”(即导致失败的推理前缀)时,它往往会陷入一个特定的、无助于解决问题的状态。

他们开发了一个名为 PREFIXGUARD 的工具。想象一位教练在观察一名跑步者。如果跑步者开始朝错误的方向冲刺,教练会在其浪费过多体力之前大喊“停!”。PREFIXGUARD 对 AI 也起到了同样的作用。它监视模型在思考过程中的隐藏状态。如果它看到模型进入了一个“易导致失败”的状态,它就会切断该思路,并强制模型以更好的方法重新开始。

结果令人印象深刻:在 12 种不同的测试设置中(结合了不同的模型和不同的数学数据集),这种方法将模型的准确率提升了高达 12.5 个百分点。它不仅仅是更好地进行猜测,而是完全避免了走错路。

这意味着什么

这篇论文表明,当我们教 AI 进行推理时,我们不仅仅是在教它新的事实。我们是在从根本上重组它的内部“操作系统”。我们赋予了它一组截然不同的、具有持续性的心理模式,并教会它如何在连贯的、具备时间意识的序列中进行切换。

作者谨慎地指出,这并不意味着模型拥有类人的意识,也不意味着它在哲学意义上“知道”自己在做什么。相反,这意味着它思考的数学结构已经变得更像一场编排精良的舞蹈,而不是一场混乱的乱舞。这一发现为分析 AI 如何运作开辟了新途径,更重要的是,它为我们提供了一种新工具,可以引导这些模型远离错误,走向更好的解决方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →