← 最新论文
🤖 machine learning

Do Not Waste Your Rollouts: Recycling Search Experience for Efficient Test-Time Scaling

本文介绍了无需训练的回收搜索经验(RSE)策略,该策略通过提炼并复用来自失败与成功推理轨迹的中间洞察,以消除计算冗余并提升复杂任务上的推理效率,从而增强测试时的扩展能力。

原作者: Xinglin Wang, Jiayi Shi, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinglin Wang, Jiayi Shi, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和生动的类比,对论文《不要浪费你的推演:回收搜索经验以实现高效的测试时扩展》的解读。

核心难题:人工智能的“健忘症”

想象一下,你正在尝试解决一个极其复杂的迷宫。你派出了 100 名不同的探险者(即人工智能的“推演”或尝试)去寻找出口。

  • 旧方法(当前的人工智能搜索): 每名探险者都从起点出发,撞上一堵墙,掉头,然后尝试另一条路。当他们遇到死胡同时,就放弃了。下一名探险者从头开始,撞上同一堵墙,陷入同一个死胡同。他们甚至可能发现第一条探险者找到的捷径,但必须从头重新发现它。
  • 浪费之处: 人工智能正在浪费巨大的能量(计算能力),去重新推导它已经知道的事实,重新走过它已知行不通的路径。这就像一名学生参加了一次考试,失败了,然后不看之前的错题或笔记,直接参加完全相同的考试。

解决方案:“回收搜索经验”(RSE)

作者提出了一种名为回收搜索经验(Recycling Search Experience, RSE)的新策略。你可以将其想象为给探险者们提供一张共享的、动态更新的地图,每经过一轮探索后,这张地图就会得到更新。

RSE 不再将每一次尝试视为一次性的试验,而是将其视为一种累积的团队协作。其工作原理分为三个简单的步骤:

1. “蒸馏”(做笔记)

当一批探险者完成探索后,人工智能不会直接丢弃他们原始且杂乱的日志。相反,它像一位聪明的编辑,在混乱中梳理并写出两份具体的清单:

  • “好消息”清单(正面经验): “嘿,我们发现在喷泉处左转是死胡同,但直行可以到达一座桥。”这些是已验证的事实和捷径。
  • “坏消息”清单(负面经验): “不要进入黑暗隧道;那里通向一个深坑。”这些是已知的死胡同和需要避免的逻辑陷阱。

2. “共享银行”(记忆库)

这些清单被存储在一个共享经验银行中。这并非一堆杂乱无章的纸张,而是一个经过筛选、组织有序的数据库。人工智能使用“去重”过滤器,确保不会重复记录相同的笔记(例如,它不会把“不要左转”列出十次;它只保留一条清晰的警告)。

3. “引导式搜索”(使用地图)

当下一批探险者出发时,他们不再从零开始。他们会拿到这份共享银行

  • 如果看到“好消息”笔记,他们就可以跳过通往桥梁的漫长路程,直接前往(从而缩短工作路径)。
  • 如果看到“坏消息”笔记,他们会立即远离黑暗隧道(从而剪除死胡同)。

为何这是颠覆性的变革

论文声称,这种方法比旧方法高效得多。

  • 类比: 想象一下试图在干草堆里找到一根特定的针。
    • 旧方法: 你派 100 个人盲目挖掘。他们都挖了同样的地方,错过了针,然后精疲力竭。
    • RSE 方法: 前 10 个人挖掘,发现了一些不是针的泥土,并标记了这些地点。接下来的 10 个人被告知:“不要在这里挖。”他们还发现了一个可能是针的地方并做了标记。下一组人跳过那些糟糕的地点,专注于有希望的区域。
  • 结果: 你能够更快地找到答案,并消耗更少的能量,因为你不再在已经犯过的错误上浪费时间。

论文的实际发现

研究人员在极难的数学问题(如国际数学奥林匹克 IMO 或 HMMT 等高水平竞赛中的题目)、编程挑战以及复杂的规划任务(如规划多日行程)上测试了这种方法。

  • 更好的结果: 使用 RSE 的人工智能比那些仅仅试图“更努力地思考”或“尝试更多次”却不共享笔记的其他方法获得了更高的分数。
  • 适用于难题: 它在解决其他方法陷入僵局或放弃的最难题时表现尤为出色。
  • 无需额外训练: 最棒的是,人工智能不需要重新训练。它只是改变了在测试期间如何搜索答案,利用其内部自我评估工作的能力。

核心结论

该论文认为,智能不仅仅在于更努力地尝试,更在于记住你所学到的东西。 通过将“一次性”的尝试转化为“累积”的记忆,人工智能停止在死胡同和重复发现上浪费能量,从而在不依赖更大硬件的情况下变得更聪明、更高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →