想象一支由才华横溢的侦探组成的团队,正试图解决一系列极其复杂的谜题。他们拥有一种有限的“思考代币”——这是一种神奇的货币,为他们写的每一个字、搜寻的每一个线索以及测试的每一个假设支付费用。在人工智能的世界里,这些代币就是使用大语言模型(LLM)去发现新科学公式、设计更好的算法或编写完美计算机代码的真实成本。长期以来,“管理者”(这些侦探团队的经理)只关心一件事:分数是否上升了?如果侦探解开了一个微小的线索或一个巨大的谜团,且两者带来的分数提升相同,经理会对它们一视同仁。但问题在于:解开微小线索只花了一个代币,而解开巨大的谜团却要花六个。如果经理仅仅因为分数上涨就不断为昂贵的动作买单,那么在找到最佳方案之前,团队就会耗尽资金。科学家们面临的大问题是:当每一步动作的成本各不相同时,且你必须在一个严格的预算内进行管理,你该如何管理这样一个团队?
这篇论文介绍了一种更聪明的新型管理者,名为 CostAda。研究人员发现,旧有的管理方式——忽略动作实际花费了多少——简直是灾难的开端。他们从数学上证明,如果你不根据价格标签来调整你的信用评估,随着搜索变得更加复杂,你的进展可能会趋于零。CostAda 改变了游戏规则,它开始关注“性价比”。它会问:“这次分数提升是否值得我们刚刚消耗掉的这些代币?”如果一个动作很贵,CostAda 会要求在批准下一步之前获得更高的回报。它还会密切关注剩余的预算。在游戏早期,当资金充裕时,承担一些昂贵的风险以寻找新路径是可以接受的。但随着预算减少,经理会变得严格,只批准那些既便宜又被证明有效的动作,或者将最后的几个代币留给一个足以改变局面的重大指引。
团队在十二个不同的谜题集(基准测试)上,使用两种不同的 AI 大脑(GLM-5 和 GPT-5.4)对这个新经理进行了测试。结果令人印象深刻。在十六个测试案例中的十二个中,CostAda 找到的解决方案与之前的最佳方法一样出色,但它使用的预算最多只有一半。换句话说,它以 50% 的价格达到了同样高质量的结果。在所有八个主要挑战中,CostAda 始终保持着最高的平均最终质量。研究人员表明,通过将每一次行动的成本视为决策过程的一个关键部分——而不仅仅是事后查看的一张收据——人工智能可以更高效地探索,避免在死胡同里浪费金钱,并更快、更聪明地到达终点。这就像是意识到,有时走昂贵的高速公路是在浪费汽油,但知道何时该支付这笔费用以率先到达,才是赢得比赛的关键。
技术摘要:通过成本校准的前沿效用实现预算感知型 LLM 发现
问题形式化
大型语言模型(LLMs)正越来越多地通过推理时搜索(inference-time search)应用于科学和算法发现,即通过顺序生成、评估和改进候选解来进行探索。在数学优化、算法设计和可执行程序发现等领域,确定性评估器提供了可重复的质量信号。然而,现有的自适应发现控制器通常仅根据得分进展来分配行动信用,忽略了行动成本的异质性。
在基于 Token 的 API 定价模式下,不同的搜索行动会产生截然不同的成本。一次短促的改进可能仅消耗一次参考生成(reference generation)的成本,而一次长上下文的引导调用或对无效代码的重试可能消耗六次或更多。当控制器将高成本行动与低成本行动视为同等信用(因为它们产生了相同的得分提升)时,它未能考虑到剩余预算的机会成本。本文将其形式化为一个在离散可执行候选空间上的群体级分配问题,其中有效搜索视界是由累积的、已实现的 Token 预算而非固定的迭代次数定义的。
作者证明(命题 1),在具有异质行动成本的情况下,“成本盲目”(cost-blind)控制器——即其行动分布仅依赖于得分历史而非已实现成本的控制器——随着搜索前沿(search frontiers)数量和成本差异的增加,只能获得最优预算目标中极小部分的比例。
方法论:CostAda
为了填补这一空白,作者引入了 CostAda,这是一种旨在处理具有显式搜索侧 Token 预算的 LLM 发现任务的成本校准自适应控制器。CostAda 用**成本校准的前沿效用(cost-calibrated frontier utility)**取代了仅基于进展的信用分配,该效用整合了局部前沿进展、全局最佳至今(global best-so-far)的改进、已实现的行动成本以及剩余预算。
其核心机制通过三个耦合控制运行:
成本校准的前沿效用:
前沿 k 在迭代 t 时的效用 ut(k) 定义为:
ut(k)=dtλtgt+(1−λt)δt(k)
其中:
- gt 是全局增益(相对于全局最佳至今的改进)。
- δt(k) 是局部增益(相对于前沿局部存档的改进)。
- λt=1−ρt 是全局权重,以剩余预算比例 ρt 为条件。随着预算消耗,控制器会将重心从局部开发转向全局改进。
- dt=1+λtcϕt 是基于归一化已实现步进成本的成本除数。这确保了来自昂贵行动的等量增益会获得比廉价行动更少的信用。
预算感知控制决策:
- 局部探索强度: 前沿周围的采样广度根据其平滑后的效用进行调整。高效用导致低强度的精炼;低效用则触发更广泛的探索。至关重要的是,随着预算接近枯竭,剩余预算比例 ρt 会抑制昂贵的探索。
- 前沿分配: 控制器根据每单位已实现成本的全局增益(rt(k)=gt/dt)向各个前沿分配未来预算。仅对弱局部存档有改进的前沿不会获得分配信用。一种上置信界(UCB)规则平衡了对高性能前沿的利用与对欠采样前沿的探索,并受剩余预算的限制。
- 预算化策略干预: 只有在满足特定证据谓词时,才会购买更高层级的引导(如“guide”或“tactic”调用):(1) 剩余预算能够负担该引导及测试储备;(2) 存在持续的全局进展缺失(停滞)或累积的低收益支出;(3) 当前没有处于整合窗口期。这防止了在视界附近进行非必要的昂贵干预。
核心贡献
- 问题形式化与理论界限: 本文形式化了显式搜索侧 Token 预算下的 LLM 发现问题,并证明了在异质成本设置下,成本盲目的信用策略会损失预算目标。
- 成本校准的前沿效用: 作者提出了一种将进展以已实现行动成本和剩余预算为条件进行约束的信用原则,确保了每项行动的机会成本是显性的。
- CostAda 控制器: 这是该原则的一个实例化,通过预算门控的局部探索、成本感知的前沿分配以及预算化的策略干预进行协调。
- 实证验证: 大量实验表明,与最先进的基线相比,CostAda 实现了卓越的预算效率和最终解质量。
实验结果
作者在八个基准测试(涵盖几何填充、极值几何、加法组合数学和可执行程序优化)上评估了 CostAda 对抗 AdaEvolve(一个进展感知基线)和 EvoX(一个策略演化控制器)的表现,并使用了两个骨干模型:GLM-5 和 GPT-5.4。
- 效率: 在 16 个“基准–骨干”对中,有 12 个对中 CostAda 仅使用至多一半的预算就达到了最强基线的全额预算质量。
- 最终质量: 在两种骨干模型下,CostAda 在所有八个基准测试中均取得了最强的平均最终质量。
- 预算路径: 在预算消耗至四分之一时,CostAda 的平均归一化得分已超过了最强基线的全额预算平均水平。它在 16 个“基准–骨干”对中的 15 个上获得了最高的归一化曲线下面积(AUC)。
- 稳定性: 与基线相比,CostAda 展示了更低的计算结果方差,特别是在 GLM-5 模型下的 Circle Packing Rect 等基准测试中。
意义与主张
本文声称 CostAda 从根本上改变了 LLM 驱动的发现过程中资源管理的方式。通过将已实现的成本和剩余预算视为主动控制输入,而非事后会计变量或简单的停止规则,CostAda 使搜索策略与基于 Token 定价的经济现实保持一致。
作者断言,其方法在显著提高预算效率的同时,保留了最终解的质量。结果表明,成本校准对于扩展 LLM 发现至关重要,因为忽视成本异质性会导致次优的资源分配,而这种损失无法通过简单地平滑进展信号来弥补。这项工作证明,当行动的“成本”与它产生的“增益”一样多变时,控制器可以有效地在探索与利用之间进行权衡。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。