← 最新论文
💬 NLP

DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search

DeepSearch 通过将蒙特卡洛树搜索(MCTS)直接嵌入强化学习验证奖励(RLVR)的训练循环,利用全局前沿选择、熵引导策略及自适应回放缓冲区,有效解决了传统方法因探索不足导致的性能瓶颈,在数学推理基准测试中实现了新的最先进水平,且计算效率远超单纯延长训练的方法。

原作者: Fang Wu, Weihao Xuan, Heli Qi, Ximing Lu, Aaron Tu, Li Erran Li, Yejin Choi

发布于 2026-04-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Fang Wu, Weihao Xuan, Heli Qi, Ximing Lu, Aaron Tu, Li Erran Li, Yejin Choi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 DeepSearch 的新方法,旨在解决大语言模型(LLM)在“数学推理”和“逻辑思考”方面遇到的一个瓶颈。

为了让你轻松理解,我们可以把训练一个聪明的 AI 模型,想象成教一个学生参加数学竞赛

1. 现在的困境:死记硬背 vs. 盲目刷题

现状(传统 RLVR 方法):
目前的训练方法有点像让学生盲目刷题

  • 做法:老师(算法)给学生出一道题,学生尝试写答案。如果写对了,老师给个糖(奖励);写错了,老师给个苦头(惩罚)。
  • 问题:学生为了拿糖,往往只会走自己最熟悉的那条路(比如死记硬背某种解题套路)。如果这道题需要一种全新的、复杂的解题思路,学生因为没走过那条路,就根本探索不到
  • 结果:刷了成千上万道题,成绩却卡住了(训练平台期)。就像学生每天只会在同一条路上跑,跑得再快也发现不了新大陆。

2. DeepSearch 的解决方案:带着“寻宝图”去训练

DeepSearch 的核心创新
它不再让学生盲目刷题,而是给训练过程装上了一个**“蒙特卡洛树搜索”(MCTS)引擎。这就像给学生发了一张动态的“寻宝图”**。

我们可以用三个生动的比喻来理解它的三大核心功能:

比喻一:全局探路者(Global Frontier Selection)

  • 传统做法:学生做题时,只盯着眼前的几步看,容易走进死胡同(局部最优)。
  • DeepSearch 做法:想象有一个全知全能的向导,他站在山顶俯瞰整个迷宫。他不仅看哪条路看起来好走,还会计算哪条路虽然难走但潜力最大
  • 效果:系统会优先去探索那些“最有希望”的分支,而不是在死胡同里浪费时间。这就像向导直接告诉学生:“别在那条死路上了,去试试左边那个看起来有点难但藏着宝藏的路口。”

比喻二:从“最自信的错误”中学习(Entropy-based Guidance)

  • 传统做法:学生做错了题,老师随便挑一个错误答案让他改,或者只关注做对的题。
  • DeepSearch 做法:系统会专门寻找学生**“最自信但做错了”**的地方。
    • 想象学生非常笃定地说:“答案肯定是 5!”结果答案是 3。这种“自信的错误”往往暴露了学生思维中最顽固的误区
    • DeepSearch 会重点“攻击”这些点,因为纠正这些根深蒂固的错误,比纠正那些“瞎蒙猜错”的点,进步要快得多。

比喻三:智能错题本(Adaptive Replay Buffer)

  • 传统做法:学生做过的题,不管会不会,下次还随机抽出来练,效率很低。
  • DeepSearch 做法:它有一个智能错题本
    • 如果一道题学生已经彻底搞懂了(找到了正确答案),系统就把这道题**“缓存”**起来,下次不再浪费时间去重新搜索,直接复用答案。
    • 系统把宝贵的精力(算力)全部集中在那些**“还没做出来”**的难题上。
    • 这就好比一个聪明的教练,只让学生反复练习那些还不会的题,已经学会的题就放一边,极大地节省了时间。

3. 惊人的效果:少花钱,多办事

这篇论文最厉害的地方在于效率

  • 传统方法:想提高成绩,就得让学生没日没夜地刷题(增加训练步数),消耗巨大的电力和算力,但效果越来越差(边际效应递减)。
  • DeepSearch 方法:它通过**“聪明的搜索策略”,用5.7 倍更少的算力(GPU 时间),就达到了更高的成绩**。
    • 在数学竞赛测试中,它的平均准确率达到了 62.95%,刷新了同类小模型(15 亿参数)的纪录。
    • 它证明了:与其盲目地“堆时间”、“堆算力”,不如在训练过程中加入“系统性的思考策略”。

总结

DeepSearch 就像是给 AI 装上了一个**“思考的导航仪”**。

它不再让 AI 在黑暗中盲目摸索,而是教它:

  1. 往哪走(全局探索最有希望的路);
  2. 在哪改(重点纠正那些“自信的错误”);
  3. 怎么省(学会的题别重复练,专攻难题)。

这项研究告诉我们,未来的 AI 变强,不仅仅靠“吃得更多”(更多数据、更大模型),更靠**“想得更好”**(更聪明的训练算法)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →