← 最新论文
💬 NLP

Test-time Recursive Thinking: Self-Improvement without External Feedback

该论文提出了测试时递归思维(Test-time Recursive Thinking, TRT),这是一种迭代式自我改进框架,通过利用多样化的候选生成与自我验证,使大语言模型能够在无需外部反馈或额外训练的情况下,显著提升其在挑战性基准测试上的推理与编程能力。

原作者: Yufan Zhuang, Chandan Singh, Liyuan Liu, Yelong Shen, Dinghuai Zhang, Jingbo Shang, Jianfeng Gao, Weizhu Chen

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Yufan Zhuang, Chandan Singh, Liyuan Liu, Yelong Shen, Dinghuai Zhang, Jingbo Shang, Jianfeng Gao, Weizhu Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解决一个非常困难的谜题,比如一道复杂的数学题,或者编写一段棘手的计算机代码。通常情况下,你可能会向老师索要答案,或者向教练请教你在哪里犯了错。但如果此时你独自一人在一个房间里,没有任何人可以帮助你,你必须完全靠自己去解决它,那会是什么样子?

这篇论文介绍了一种被称为**测试时递归思维(Test-time Recursive Thinking, TRT)**的新方法。你可以把它理解为教给一个聪明的 AI 如何在不需要任何外部帮助的情况下,同时成为自己最好的教练、老师和学生。

以下是它的工作原理,通过一个简单的故事进行拆解:

问题所在:“猜与试”的陷阱

通常,当 AI 尝试解决一个难题时,它可能会只是尝试猜测一个答案。如果错了,它会再试一次。但如果没有老师,它往往会重复同样的错误,或者只是在随机猜测。这就像是在黑暗的房间里寻找一把特定的钥匙,通过盲目摸索来寻找;你最终可能会找到,但过程会极其漫长,而且你会不断地被同样的家具绊倒。

解决方案:“递归思维”循环

作者创建了一个系统,让 AI 不仅仅是猜测,而是在一个持续的循环中玩一场“尝试、评判与学习”的游戏。想象一下,AI 就像一名正在侦破案件的侦探。

第一步:侦探生成嫌疑人(生成 Generation)
AI 不仅仅是猜测一个答案,而是同时创建几个不同的“嫌疑人”(即解决方案)。但这里的诀窍在于:它不是随机猜测。它会查看一本记录了从之前尝试中学习到的知识的笔记本(例如:“不要使用那个特定的数学技巧”或“不要忘记检查边界情况”)。它利用这个笔记本来创造全新且不同的嫌疑人,从而避开过去的错误。

第二步:侦探充当法官(选择 Selection)
现在 AI 有了一份嫌疑人名单。由于没有老师来告诉它“哪一个是正确的”,AI 必须自己进行评判。

  • 对于数学: 它寻找脱颖而出的答案。如果 10 个猜测中的数字各不相同,但其中 9 个根据逻辑显然是错误的,那么剩下的那个数字很可能就是赢家。
  • 对于编程: AI 会根据它对题目要求的理解,编写自己的“测试用例”(就像一场小型考试)。它运行代码并针对这些测试进行验证。通过最多测试的代码会获得一颗金星。

第三步:侦探更新笔记本(反思 Reflection)
这是最关键的部分。AI 会将“获胜”的嫌疑人与“失败”的嫌疑人进行对比。它会自问:“为什么这个失败了?”

  • 是漏掉了边界条件吗?
  • 是逻辑有缺陷吗?
  • 是使用了效率低下的算法吗?

然后,AI 会在它的知识笔记本中写下一条简短、清晰的笔记(例如:“下次记得检查差一错误/off-by-one errors”)。它会丢弃失败尝试中的琐碎细节,只保留高层级的教训。

结果:实时变得更聪明

论文在两类挑战上测试了该方法:

  1. 难题(AIME 数学竞赛): 使用该方法的开源 AI 模型达到了 100% 的准确率。它们通过从自身的尝试中学习,解决了每一个问题。
  2. 难题(LiveCodeBench 编程竞赛): 顶尖的闭源 AI 模型(如 o3 和 o4-mini)仅通过使用这种方法,其得分就提升了 10% 到 15%。它们不需要新的训练或外部老师;它们只是通过递归思考变得更强了。

为什么这很重要

把它想象成一款电子游戏,游戏中没有“游戏结束”界面。相反,每当你失败时,游戏会立即在你的日志中写下一行字,例如:“别再从那个悬崖跳下去了”,然后让你带着这个新知识重新开始关卡。

这篇论文表明,大语言模型(LLM)不需要通过人类进行重新训练就能在特定任务上变得更好。只要你给它们一种方法来生成多样化的想法自我批判记住教训,它们就能在被要求解决问题时,在实际测试过程中自行解决极其困难的问题。

简而言之: 这篇论文证明了 AI 可以通过循环执行“尝试、评判和更新自己的‘避坑指南’”这一过程,在实际测试期间实现自我进化,从而变得更聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →