← 最新论文
🤖 machine learning

Budget-Aware LLM Discovery via Cost-Calibrated Frontier Utility

本文介绍了 CostAda,一种成本校准的自适应控制器,它通过根据质量增益与 Token 成本的比率动态分配搜索资源来优化大语言模型(LLM)的发现过程,从而以比现有方法显著降低的预算实现更优或同等的成果。

原作者: Yansen Zhang, Yilu Liu, Tianyu Liu, Jiamin Chen, Xiaokun Zhang, Kai Xie, Xue Liu, Chen Ma, Yiyan Qi

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yansen Zhang, Yilu Liu, Tianyu Liu, Jiamin Chen, Xiaokun Zhang, Kai Xie, Xue Liu, Chen Ma, Yiyan Qi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一支由才华横溢的侦探组成的团队,正试图解决一系列极其复杂的谜题。他们拥有一种有限的“思考代币”——这是一种神奇的货币,为他们写的每一个字、搜寻的每一个线索以及测试的每一个假设支付费用。在人工智能的世界里,这些代币就是使用大语言模型(LLM)去发现新科学公式、设计更好的算法或编写完美计算机代码的真实成本。长期以来,“管理者”(这些侦探团队的经理)只关心一件事:分数是否上升了?如果侦探解开了一个微小的线索或一个巨大的谜团,且两者带来的分数提升相同,经理会对它们一视同仁。但问题在于:解开微小线索只花了一个代币,而解开巨大的谜团却要花六个。如果经理仅仅因为分数上涨就不断为昂贵的动作买单,那么在找到最佳方案之前,团队就会耗尽资金。科学家们面临的大问题是:当每一步动作的成本各不相同时,且你必须在一个严格的预算内进行管理,你该如何管理这样一个团队?

这篇论文介绍了一种更聪明的新型管理者,名为 CostAda。研究人员发现,旧有的管理方式——忽略动作实际花费了多少——简直是灾难的开端。他们从数学上证明,如果你不根据价格标签来调整你的信用评估,随着搜索变得更加复杂,你的进展可能会趋于零。CostAda 改变了游戏规则,它开始关注“性价比”。它会问:“这次分数提升是否值得我们刚刚消耗掉的这些代币?”如果一个动作很贵,CostAda 会要求在批准下一步之前获得更高的回报。它还会密切关注剩余的预算。在游戏早期,当资金充裕时,承担一些昂贵的风险以寻找新路径是可以接受的。但随着预算减少,经理会变得严格,只批准那些既便宜又被证明有效的动作,或者将最后的几个代币留给一个足以改变局面的重大指引。

团队在十二个不同的谜题集(基准测试)上,使用两种不同的 AI 大脑(GLM-5 和 GPT-5.4)对这个新经理进行了测试。结果令人印象深刻。在十六个测试案例中的十二个中,CostAda 找到的解决方案与之前的最佳方法一样出色,但它使用的预算最多只有一半。换句话说,它以 50% 的价格达到了同样高质量的结果。在所有八个主要挑战中,CostAda 始终保持着最高的平均最终质量。研究人员表明,通过将每一次行动的成本视为决策过程的一个关键部分——而不仅仅是事后查看的一张收据——人工智能可以更高效地探索,避免在死胡同里浪费金钱,并更快、更聪明地到达终点。这就像是意识到,有时走昂贵的高速公路是在浪费汽油,但知道何时该支付这笔费用以率先到达,才是赢得比赛的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →