← 最新论文
🤖 AI

HyPER: Bridging Exploration and Exploitation for Scalable LLM Reasoning with Hypothesis Path Expansion and Reduction

HyPER 是一种无需训练、适用于混合专家模型的在线控制策略,它通过在测试时推理过程中对假设池进行扩展、令牌级细化和置信度感知聚合来动态平衡探索与利用,从而在显著降低令牌使用量的同时大幅提升准确性。

原作者: Shengxuan Qiu, Haochen Huang, Shuzhang Zhong, Pengfei Zuo, Meng Li

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Shengxuan Qiu, Haochen Huang, Shuzhang Zhong, Pengfei Zuo, Meng Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一道非常困难的数学题或一个复杂的逻辑谜题。你有一位才华横溢但略显紧张的助手(即人工智能),它能够一步步地思考这个问题。

如果你只让助手尝试一次,它可能会在错误的方向上卡住,并给你一个错误的答案。为了解决这个问题,你可能会要求它同时尝试许多不同的方法。这被称为“扩展测试时计算”。

然而,这里有一个陷阱:你只有有限的时间和精力(即“计算预算”)。如果你要求助手尝试 100 条不同的路径,你可能在它们完成任何一条之前就用尽了精力。如果你只要求尝试 2 条路径,你又可能会完全错过正确的解决方案。

这篇论文介绍了一个名为HyPER(假设路径扩展与缩减)的新系统,以解决这种平衡难题。你可以将 HyPER 想象成助手思维过程的智能交通控制器

旧方法的问题

以往处理这种情况的方式就像僵化的交通规则:

  1. “树”方法:这就像强迫助手每走 5 步就停下来并分叉出新的路径,无论情况如何。有时它们并不需要分叉,而有时它们需要更早地分叉。这种方法过于僵化,浪费了精力。
  2. “并行”方法:这就像要求助手从头到尾写出 100 个完整的故事,然后挑选最好的一个。它浪费了大量精力去撰写 99 个几乎相同或明显错误的故事,并且在故事撰写过程中并没有帮助提高故事的质量

HyPER 如何工作:智能交通控制器

HyPER 通过将思考过程视为一个可以实时扩展或收缩的动态思想池来改变游戏规则。它使用了三个主要技巧:

1. “阶段依赖”开关(知道何时行动)

HyPER 像教练观察比赛一样观察助手的思考过程。

  • 早期阶段(探索):在开始时,助手刚刚起步。HyPER 会说:“让我们尝试几个不同的起点!”它会扩展路径数量,以确保不会错过正确的方向。
  • 后期阶段(利用):随着助手越来越接近答案,HyPER 注意到路径开始变得相似,或者某条路径看起来非常有信心。它说:“停止尝试新事物!将所有精力集中在完善这一条强有力的路径上。”
  • 神奇之处:它不使用固定的时间表。它根据当前想法的自信和多样性,即时决定是向外分叉(探索)还是向内聚焦(利用)。

2. “专家优化”技巧(利用 AI 内部的多样性)

现代 AI 模型通常具有“混合专家”(MoE)架构。想象一下,AI 实际上是一个由 100 名微小专家组成的团队,但在任何给定时刻只有少数专家处于活跃状态。

  • 旧方法:为了获得更好的答案,你必须从头开始重写整个句子。
  • HyPER 方法:当 AI 准备写下下一个词时,HyPER 会询问专家团队:“嘿,认为下一个词应该是什么?”它收集不同专家针对这一个词的意见,进行平均处理,并挑选出最好的一个。
  • 好处:这无需浪费时间重写整个故事,就能立即提高答案的质量。这就像在迈出下一步之前与团队快速商议,而不是重新开始整场比赛。

3. “长度与置信度”投票(选出获胜者)

最后,你有几个已完成的解决方案。你如何挑选出正确的那个?

  • 陷阱:有时,一个错误的答案非常自信且简短,而正确的答案则漫长且谨慎。简单的“多数投票”可能会选出那个简短的错误答案。
  • HyPER 的洞察:论文发现了一个有趣的现象:当你过滤掉低置信度的路径时,正确的路径往往比错误的路径更长。错误的路径通常因为 AI 失去信心而早早崩溃。
  • 解决方案:HyPER 不仅仅计算票数。它关注两点:**路径的置信度如何?以及解决它花了多长时间?**它对那些既自信又花时间做到详尽的答案给予奖励。这有助于它选出正确的答案,即使它不是最常见的那个。

结果

该论文在困难的数学和逻辑问题上测试了这个系统。

  • 准确性:与以往的方法相比,它获得正确答案的频率要高得多(大约提高了 8–10%)。
  • 效率:它使用了显著更少的能量(生成的“词元”或单词数量减少了约 25–40%)就达到了目标。

总结类比

想象你在黑暗中拿着一个电池有限的手电筒走迷宫。

  • 旧方法要么将光束射向 100 个随机方向直到电池耗尽,要么强迫你在特定地点转弯,而不管你看到了什么。
  • HyPER则是一位智能向导。当你迷路时,它告诉你散开并四处张望(探索)。当你看到一条有希望的路径时,它告诉你将光束集中在那里并小心前行(利用)。如果你绊倒了,它会帮助你立即调整步伐,而无需重新开始。当你找到出口时,它会检查你所走的路径是否漫长而稳健,确保你没有只是跌跌撞撞地走进一个看起来像出口的死胡同。

结果如何?你以更快的速度找到了出口,手电筒的光更亮,而且剩下的电池更多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →