← 最新论文
💬 NLP

Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing

本文介绍了局部分支路由(Local Branch Routing, LBR),这是一种基于标记级的测试时扩展框架,通过扩展局部前瞻树并使用轻量级路由器选择最优分支,从而高效地增强语言模型的推理能力,进而实现端到端强化学习,并在数学推理任务上超越了现有的离散思维链和软标记基准。

原作者: Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对论文《局部分支路由》(Local Branch Routing)的解释,使用了简单的语言和日常类比。

核心问题:思考太慢或视野太窄

想象你正在尝试解决一个非常难的数学题,或者在规划一次复杂的旅行。你有一个聪明的助手(AI)在协助你。

目前的 AI 助手通常以两种方式之一工作:

  1. “单路径”漫步者: 他们循序渐后地思考,一旦脑中蹦出第一个念头就立刻认定。如果他们在早期走错了路,可能会陷入困境,因为他们从未观察过其他的选项。
  2. “全图”探索者: 他们试图同时写出所有可能的解题路径,检查所有路径,然后选出最好的一个。这非常准确,但就像为了找一句话而去读遍图书馆里所有的书一样——这会消耗过多的时间和计算能力。

这篇论文的作者想要寻找一个“金发姑娘原则”(意指恰到好处)的解决方案:一种既能通过观察几种不同的可能性来做出更好选择,又不会因检查所有内容而陷入泥潭的方法。

解决方案:局部分支路由 (LBR)

作者提出了一种名为局部分支路由 (Local Branch Routing) 的新方法。你可以把它理解为一种**“先看一眼,再做决定”**的策略。

以下是其工作原理,分步骤使用徒步旅行者选择小径的类比进行说明:

1. “向前看”(生长树结构)

AI 不会立即选择下一个词(或路径),而是会停顿一下。它会将接下来的几个词(或路径标记)想象成真实的。

  • 论文术语: 扩展一个小的局部前瞻树 (Expands a small local lookahead tree)。
  • 类比: 想象你站在一个分叉路口。你不是直接选一条路,而是快速在路径 A 上走 3 步,在路径 B 上走 3 步,然后在路径 C 上也走 3 步。你还没有决定走哪条路,你只是在脑海中“行走”,以观察地形如何。

2. “路由器”(决策者)

一旦 AI “走过”了这些短路径,它就会观察结果。它会问:“这些短路径中,哪一条看起来最有希望?”

  • 论文术语: 使用轻量级路由器选择深度为 1 的子树 (Uses a lightweight router to select the depth-1 subtree)。
  • 类比: 一位聪明的向导(路由器)观察了你探索的地形。也许路径 A 是一处悬崖,路径 B 是个沼泽,但路径 C 通往一片美丽的草地。向导指向路径 C 并说:“好,那我们就正式选择这一条吧。”

3. “剪枝与移动”(向前推进)

AI 正式写下路径 C 的第一步。它丢弃了路径 A 和路径 B 的想法(剪枝)。然后,它将起点移动到该第一步的终点,并重复这个过程:再次向前看,挑选最好的下一步,然后继续前进。

  • 论文术语: 剪枝–移动–生长解码过程 (Prune–shift–grow decoding process)。
  • 类比: 你在草地路径上迈出了第一步。现在你到了一个新的位置。你再次向前看,挑选下一个最好的步骤,然后继续行走。

为什么这种方法比其他方法更好?

论文将此与另外两种常见的 AI 思考方式进行了对比:

  • 对比“离散思维链” (Discrete Chain-of-Thought) —— “单路径”漫步者:

    • 问题: “单路径”漫步者在看到路径长什么样之前,就必须决定走哪条路。这就像是在没开门之前就选择一扇门。
    • LBR 的优势: LBR 在决定之前先“打开门”(走过路径)。论文表明,在走过几步之后,这些“隐藏状态”(路径的心理图像)包含了有助于做出更好决定的宝贵线索。
  • 对比“软标记分支” (Soft-Token Branching) —— “模糊的混合体”:

    • 问题: 一些方法试图通过将所有路径融合在一起,变成一种“模糊”的平均值来同时观察所有路径。这就像看一张照片,其中三条路径重叠在一起。你无法清晰地看到任何单一路径的细节。
    • LBR 的优势: LBR 保持路径的离散性(独立且清晰)。它分别走路径 A、路径 B 和路径 C,并将它们进行明确的比较。论文发现,保持路径分离可以让 AI 看到特定的细节(如悬崖或草地),而这些细节在“模糊”的混合中会丢失。

结果:他们发现了什么?

作者在两类任务上进行了测试:

  1. 合成规划(一个虚构的游戏): 他们创建了一个 AI 需要在图中导航的谜题。他们发现 LBR 表现得好得多,因为它可以通过行走短路径找到“线索”,从而做出正确的转向。
  2. 数学推理(真实的数学问题): 他们在困难的数学基准测试(如竞赛中使用的测试)上测试了 LBR。
    • 结果: LBR 比标准的“单路径”方法和“模糊混合”方法解决了更多的正确问题。
    • 效率: 它实现这一点时,并不需要检查宇宙中所有的可能解。它只是检查了少数局部选项,做出了聪明选择,然后继续前进。

总结

局部分支路由 (Local Branching Routing) 就像是给了 AI 一个“手电筒”,让它在做决定之前可以窥探几步之后的景象。它并不试图预见整个未来(那太昂贵了),但它也不会盲目猜测。通过观察一些短期的可能性、清晰地进行比较并挑选出最好的路径,AI 在解决困难推理问题时变得更加聪明和准确。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →