← 最新论文
💬 NLP

Aligning Tree-Search Policies with Fixed Token Budgets in Test-Time Scaling of LLMs

该论文提出了预算引导的蒙特卡洛树搜索(BG-MCTS),这是一种树搜索解码算法,它能够动态地将探索与精炼策略与剩余的 Token 预算相对齐,从而在数学和物理推理任务中超越了与预算无关的基准方法。

原作者: Sora Miyamoto, Daisuke Oba, Naoaki Okazaki

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Sora Miyamoto, Daisuke Oba, Naoaki Okazaki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名试图解开一个非常棘手的谜题的侦探,但你有一个严格的规则:在时间耗尽之前,你只能询问一定数量的问题。这正是大语言模型(LLMs)在解决数学或物理等复杂问题时面临的挑战。它们有一个“Token预算”——即它们可以生成多少单词或步骤的限制。

这篇论文介绍了一种名为 BG-MCTS(预算引导的蒙特卡洛树搜索)的新方法,旨在帮助这些“AI侦探”在严格的时间限制内更好地解决问题。

以下是它的工作原理,使用了简单的类比:

问题所在:“一成不变”的侦探

目前,大多数 AI 搜索方法表现得像是一个无论剩余时间多少都执行固定计划的侦探。

  • 旧方法: 侦探在第一半天里通过询问 100 个不同的人来寻找线索(广泛探索)。然后在最后 10 分钟时,他们才意识到已经没时间了,无法去跟进最有希望的线索。他们可能会在时钟归零前才开始新的调查方向,导致案件悬而未决。或者,他们可能会过早停止,白白浪费了最后 10 分钟的轮班时间。
  • 问题所在: 现有的方法仅将时间限制(Token 预算)视为一个“停止信号”。它们不会根据“剩余时间”来改变自己的策略。

解决方案:“聪明”的侦探 (BG-MCTS)

作者提出了一种会不断查看手表并根据剩余时间改变策略的侦探。他们称之为 预算引导的 MCTS (BG-MCTS)

将搜索过程想象成一棵从根部生长的树:

  1. 早期阶段(还有充足时间): 当侦探拥有 100% 的时间时,他们的行为就像一个撒大网捕鱼的渔夫。他们撒开一张大网,探索许多浅层的路径,以观察鱼群可能出现的位置。此时他们还不会深入挖掘,只是想看清整个海洋。
  2. 后期阶段(时间不多了): 随着时钟滴答作响(例如,预算只剩 25% 时),侦探停止撒大网。相反,他们会挑选之前发现的两个或三个最有希望的地点,并进行深度挖掘。他们不再开启新的调查方向,而是完全专注于完成那些最有希望的线索。

AI 是如何实现的

论文描述了 AI 用来实现这一目标的两个具体技巧:

  • “时间检查”评分: 当 AI 决定下一步遵循哪条路径时,它会使用一个观察剩余预算情况的公式。
    • 如果预算充足,该公式会鼓励尝试新的、未探索过的路径。
    • 如果预算较低,该公式会惩罚开启新路径的行为,并奖励对已有良好表现的路径进行深度挖掘。
  • “新分支”开关: AI 有一个特殊的开关,用来决定是在树上生长一个“新分支”,还是仅仅沿着“现有分支”向下深入。
    • 当时间充裕时,开关设置为“生长新分支”。
    • 当时间即将耗尽时,开关切换为“向下深入”,以防止 AI 在最后几秒钟浪费时间去开启一个它无法完成的新分支。

实验结果

研究人员在困难的数学和物理问题上,将这个“聪明侦探”与其他方法进行了对比测试。他们发现:

  • 更高的准确率: 在相同的 Token 限制内,该 AI 能够更正确地解决问题。
  • 不浪费时间: 与其他可能会过早停止或在结束时开启过多新路径的方法不同,BG-MCTS 高效地利用了整个预算。它在开始时进行广泛探索,并在结束时强力收尾。
  • 性能的一致性: 这种方法在不同的 AI 模型和不同难度的题目中都表现出色。

核心结论

论文声称,通过让 AI 的搜索策略能够“感知”剩余预算,我们可以在不需要更多计算能力的情况下,获得更好的答案。这就像教导一名跑步者不仅要跑得快,还要准确知道何时冲刺、何时节省体力,从而以最佳成绩冲过终点线。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →