← 最新论文
📊 statistics

More Bang for the Buck: Improving the Inference of Large Language Models at a Fixed Budget using Reset and Discard (ReD)

本文介绍了重置与丢弃(Reset-and-Discard, ReD),这是一种查询策略,它通过基于幂律的分配来缓解传统 pass@k 采样的收益递减问题,从而在固定预算内优化大语言模型所解决的独特问题的覆盖率。

原作者: Sagi Meir, Tommer D. Keidar, Noam Levi, Shlomi Reuveni, Barak Hirshberg

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Sagi Meir, Tommer D. Keidar, Noam Levi, Shlomi Reuveni, Barak Hirshberg

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:这个“猜谜游戏”的问题

想象一下,你有一大袋谜题(问题),并且只有有限的钱用来向一位聪明但有时很固执的朋友(大型语言模型或 LLM)购买答案(尝试次数)。你的目标不仅仅是解决一个特别难的谜题,而是要在用完所有的钱之前,尽可能多地解决不同种类的谜题。

这篇论文探讨了人们在玩这个游戏时常犯的一个错误。

旧的方法:“固执的赌徒”(完成式求解)

目前,大多数人都在使用作者称之为**“完成式求解”(Solve-to-Completion)**的策略。

  • 运作方式: 你挑选谜题 #1。你向你的朋友寻求答案。如果他们答错了,你就再问一次。再问一次。再问一次。你不断地针对谜题 #1 进行提问,直到他们终于答对为止。只有在那之后,你才会转向谜题 #2。
  • 问题所在: 有些谜题真的非常、非常难。你的朋友可能会在谜题 #1 上卡住 50 次尝试。等到他们终于解开谜题 #1 时,你已经花了 50 次尝试的机会。此时,你已经没有剩余的尝试机会去处理谜题 #2 到谜题 #100 了。你解决了一个难题,但却错失了 99 个简单的题目。
  • 结果: 随着你投入的资金增加,你解决的谜题数量增长得越来越慢。这就像是用一个漏水的软管来填满水桶;你越用力,实际进水就越少。

新的方法:“广度优先的探索者”(重置与丢弃 / ReD)

作者提出了一种名为**“重置与丢弃”(Reset-and-Discard / ReD)**的新策略。

  • 运作方式:
    1. 你挑选谜题 #1 并询问你的朋友一次。
    2. 如果他们答对了,你就庆祝一下,把这个谜题扔掉(丢弃/Discard),然后转向谜题 #2。
    3. 如果他们答错了,你不要继续追问。你立即停止,把这个谜题暂时搁置一旁,然后转向谜题 #2。
    4. 你遍历整个谜题列表,每个谜题只问一次(或几次)。
    5. 一旦你走完了整个列表,你回到顶部,重新尝试那些仍然未解决的谜题。
  • 类比: 想象你是一名消防员,试图扑灭许多小火灾。与其站在一处顽固的火堆前,不停地喷水直到它熄灭(从而忽略了附近正在蔓延的其他火灾),不如给每一处火灾都喷一点水。如果火熄灭了,你就离开;如果火还在燃烧,你稍后再回来。
  • 结果: 你能非常迅速地解决大量的谜题。即使你不能立即解决最难的那些,你也会先解决所有简单和中等难度的谜题。这让你获得了更好的“性价比”(更强的爆发力)。

魔法背后的科学原理

论文通过数学证明了为什么这种方法如此有效。

  1. 幂律(The Power Law): 作者注意到,对于这些 AI 模型,解决问题的概率遵循一种特定的数学模式(“幂律”)。基本上,问题越难,解决它的难度就会呈指数级上升。
  2. “收益递减”陷阱: 在旧有的“固执的赌徒”模式下,这种数学规律意味着,随着你投入的资金增加,你获得的已解决问题的数量会越来越少。
  3. 修复方案: “重置与丢弃”方法打破了这个陷阱。数学表明,通过在每次尝试(或几次尝试)后进行重置,你可以将这种缓慢的、递减的增长转变为稳定的、线性的增长。无论你进行多少次尝试,你都能获得持续不断的已解决问题流。

实验的关键发现

作者在真实的 AI 模型(如 Llama 和 GPT)上测试了三种类型的挑战:

  • 编程(Coding): 编写计算机程序。
  • 数学(Math): 解决数学应用题。
  • 推理(Reasoning): 回答复杂的选择题。

他们的发现是:

  • 更多的解决方案: 在同样的预算(资金)下,ReD 比旧方法解决了显著更多的独特问题。
  • 更便宜: 为了达到特定目标(例如解决 80% 的问题),ReD 需要更少的尝试次数、更少的计算机 Token 以及更少的实际现金支出。
  • 适用于不完美的检查器: 即使系统在检查答案时会出错(有时把对的判错,或把错的判对),ReD 依然能胜出。
  • 预测未来: 作者还展示了通过使用 ReD,你实际上可以推断出 AI 有多聪明(即其“幂律指数”),而无需运行成千上万次昂贵的测试。这就像是仅通过观察汽车行驶几秒钟就能猜出它的车速,而不是要跑完一整场比赛来计时。

总结

如果你有一个固定的预算来让 AI 解决一系列问题,不要一直死磕那些难题。 相反,尝试每一个问题一次,丢弃那些你已经解决的,然后循环回到你错过的题目。这种“重置与丢弃”策略能让你以同样的价格解决更多的难题,将一个缓慢、令人沮丧的过程变成一个高效、高速运转的机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →