← 最新论文
🤖 AI

Policy of Thoughts: Scaling Test-Time Training for LLM Reasoning via Online Policy Evolution

该论文引入了思维策略(Policy of Thoughts, PoT)框架,该框架通过将测试时执行视为一个在线优化过程,利用组相对策略优化(Group Relative Policy Optimization)动态更新瞬态 LoRA 适配器,从而通过内化反馈并演进模型的推理策略,来增强大语言模型的推理能力,使一个 4B 参数的模型在复杂的编程基准测试中显著超越了规模更大的最先进模型。

原作者: Zhengbo Jiao, Hongyu Xian, Qinglong Wang, Yunpu Ma, Zhebo Wang, Zifan Zhang, Dezhang Kong, Meng Han

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengbo Jiao, Hongyu Xian, Qinglong Wang, Yunpu Ma, Zhebo Wang, Zifan Zhang, Dezhang Kong, Meng Han

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图解决一个极其棘手的谜题,比如一个复杂的编程挑战或是一个需要长链条思考的数学问题。你有一个超级聪明的助手(一个大语言模型),它知道很多事实,但有时会陷入循环,一遍又一遍地重复同样的错误。在人工智能的世界里,这个助手通常使用一个“冻结”的大脑:一旦它开始思考,它就无法在中途改变其基本策略。如果它走错了路,它就会沿着那条错误的路径一直走下去,希望通过纯粹的运气或者尝试许多不同的路径来撞见正确答案。这就像是在迷宫中寻找出路,不是通过学习已经撞到的墙壁来寻找方向,而是盲目地跑遍每一条走廊,直到撞到墙为止。

长期以来,解决这些难题的最佳方法只是给计算机更多的时间和计算能力,让它尝试数百万次不同的猜测。但这篇文章提出了一种更聪明的方法:与其仅仅是“更努力地尝试”,不如让计算机在“尝试的过程中进行学习”。这就像一个电子游戏角色,它不仅仅是在失败后重新生成并再次尝试,而是能从刚刚杀死它的那个特定陷阱中学习,并立即调整下一轮尝试的策略。这项研究背后的研究人员在问:如果我们的 AI 能够“见机行事”,根据其之前的猜测是成功还是失败,实时更新自己的推理规则,会怎样?这就是一个只会遵循剧本的机器人与一个能针对每一个新挑战即时调整自身大脑进行演化的机器人之间的区别。


“思维策略”(PoT):教会 AI 在游戏中学习

认识一下 PoT(Policy of Thoughts,思维策略),这是一个全新的框架,它不将解决问题视为一次性的猜测,而将其视为 AI 与问题之间一场实时、演进的对话。作者们(来自浙江大学和慕尼黑大学有限责任公司等机构的研究团队)认为,旧有的方式——即 AI 的策略在搜索答案时保持冻结——限制了我们。他们提出了一个系统,让 AI 在测试过程中获得“第二次机会”,从自身的失败中学习,从而实现实时的自我训练。

波普尔谜题:猜测、测试与演化

其核心理念受到了著名哲学家卡尔·波普尔(Karl Popper)的启发,他认为科学是通过“猜想与反驳”来进步的。用通俗的话说,这意味着你做一个猜测,将其应用于现实进行测试,如果失败了,你就弄清楚它为什么失败,以便下次做出更好的猜测。

PoT 将这一哲学引入了 AI 领域。其循环过程如下:

  1. 猜想(The Conjecture/猜测): AI 观察一个问题,并生成几个不同的可能解(就像在地图上勾勒出三条不同的路线)。
  2. 反驳(The Refutation/现实检验): 系统在真实环境(如代码编译器)中运行这些解。如果代码崩溃或给出了错误答案,这就是一次“反驳”。
  3. 演化(The Evolution/学习): 这是神奇之处。PoT 并没有简单地丢弃失败的猜测,而是利用这次失败来更新 AI 的内部“策略”(即它的思考方式)。它会对 AI 的思考方式进行微小的、即时的调整,专门针对这个问题。
  4. 重复: AI 使用它更新后的新大脑再次尝试,现在它已具备更好的能力来避免刚才犯下的特定错误。

“临时大脑”的小技巧

你可能会问:“如果 AI 从每个问题中学习,它会不会变得混乱或忘记以前知道的东西?”作者们提出了一个聪明的解决方案。他们使用了一种称为 LoRA(低秩自适应)的技术,这就像是给 AI 戴上了一顶特殊的、可拆卸的“思考帽”。

想象一下,AI 有一个庞大的永久知识库(它的基础模型)。当它面临难题时,它会戴上一顶特殊的、轻量级的“思考帽”(LoRA 适配器)。这顶帽子允许 AI 快速学习并针对这个特定的谜题调整其策略。一旦谜题解决(或时间耗尽),这顶帽子就会被摘下并丢弃。永久的知识库保持原样,不会受到干扰。这意味着 AI 可以成为每一个新问题的适应大师,而不会弄乱它的通用知识。

结果:小脑,大胜

研究人员在编程挑战上测试了这个想法,这类挑战因其需要精确的、循序渐进的逻辑而闻名。他们使用了一个相对较小的 AI 模型(仅有 40 亿参数),并赋予了它 PoT 框架。

结果令人惊讶。这个使用了 PoT 框架的微型模型,在名为 LiveCodeBench V6 的严苛基准测试中,成功解决了 49.71% 的问题。为了让你有个直观的概念:

  • 它击败了 GPT-4o,这是一个庞大的商业模型,在同一个特定基准测试中得分 29.71%
  • 它显著优于其他大型模型在该特定测试中的基准表现,证明了具有动态学习能力的模型可以超越许多更大规模系统的静态推理。
  • 虽然像 Gemini-2.5-Flash(综合得分 60.91%)和 Claude-Opus-4(综合得分 55.22%)这样的模型在更广泛的混合基准测试中取得了更高的分数,但经过 PoT 增强的 4B 模型在严苛的 LiveCodeBench V6 上取得的 49.71% 的成绩,代表了一个比它们小 50 多倍的模型实现了巨大的飞跃,证明了自适应推理可以缩小与巨头之间的差距。

最令人印象深刻的是,经过 PoT 增强的模型比它竞争的一些巨型模型要小 50 多倍。它获胜并非靠拥有更大的大脑,而是靠拥有更聪明地使用现有大脑的方式。

为什么这很重要

论文表明,AI 推理的未来不仅仅在于构建越来越大的模型,而在于赋予模型“见机行事”的能力。通过将测试过程转变为训练过程,AI 不再在失败的路径上浪费能量,而是开始利用这些能量即时改进其策略。

作者发现,当存在明确的反馈(例如代码运行成功或崩溃)时,这种方法效果最好。当反馈模糊时,收益虽然有所减小,但依然是正向的。他们还展示了这种方法适用于不同类型的模型,而不局限于他们最初使用的模型。

简而言之,PoT 表明,解决难题的最佳方式不仅仅是更努力地尝试,而是更快地学习。通过让 AI 为每一个挑战演化出自己的推理策略,我们可以从更小、更高效的计算机中获得超智能的结果。这是一种从“寻找正确答案”到“学习如何找到正确答案”的转变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →