← 最新论文
🤖 AI

Test-Time Compute Games

本文指出大语言模型即服务市场中存在社会低效问题,即提供商有动机过度使用昂贵的测试时计算资源,并提出了一种逆向第二价格拍卖机制,使定价与边际价值相一致,该机制通过在数学和科学基准测试中针对多种模型族进行的实验得到验证。

原作者: Ander Artola Velasco, Dimitrios Rontogiannis, Stratis Tsirtsis, Manuel Gomez-Rodriguez

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Ander Artola Velasco, Dimitrios Rontogiannis, Stratis Tsirtsis, Manuel Gomez-Rodriguez

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和日常类比对论文《测试时计算博弈》的解释。

全局视角:“过度工程化”问题

想象你需要一辆出租车去机场。你有两家出租车公司:A 公司B 公司

  • A 公司通常只需 10 分钟就能把你送到。
  • B 公司通常需 12 分钟。

然而,两家公司都有一个可以按下的秘密按钮,叫做“超级加速”。

  • 如果 A 公司按下它,耗时变为 11 分钟,但向你收取双倍费用。
  • 如果 B 公司按下它,耗时变为 11 分钟,但向你收取三倍费用。

在正常世界里,你只会选择 A 公司,因为它的标准行程只需 10 分钟,既便宜又快。但这里的转折是:出租车公司的收入取决于它们消耗了多少汽油,而不仅仅是把你送到的速度有多快。

因此,A 公司会想:“如果我按下‘超级加速’,耗时 11 分钟,我可以向你收取双倍费用。虽然相比我之前的速度,你只节省了 1 分钟,但我赚的钱更多了。所以,我会一直按这个按钮。”

结果: 你最终为一次几乎没快多少的行程支付了双倍费用,而公司却为了没有实际收益的行程消耗了额外的汽油。这就是论文中所谓的**“测试时计算”(Test-Time Compute, TTC)**。在人工智能领域,“汽油”是计算能力,“超级加速”则是让 AI 思考更久,或在给出一个答案前尝试多种不同的解法。

问题:为何市场失灵

作者认为,我们目前购买 AI 服务的方式是社会低效的

  • 提供者的激励: AI 公司想要赚钱。它们知道,如果让 AI“更努力地思考”(使用更多计算资源),就可以向你收取更多费用。即使额外的思考仅让答案提升了 1%,它们可能仍会这样做,因为对它们而言额外成本很低,但它们能收取的额外价格却很高。
  • 用户的损失: 你最终为那些实际上没多大帮助的“思考”买单。这就像你为一道精致、慢火烹制的菜肴付费,而一个简单的三明治其实同样能填饱肚子,且便宜得多。

论文表明,在自由市场中,AI 公司自然会倾向于“过度思考”问题,以最大化自身利润,即使这会导致所有人的金钱和资源浪费。

解决方案:逆向拍卖

为了解决这个问题,作者提出了一种购买 AI 服务的新方式,类似于逆向拍卖(就像政府想购买 1000 张桌子,要求供应商报出最低价格)。

以下是他们的“智能拍卖”运作方式:

  1. 设置: 你(用户)有一个任务。你告诉一个中立平台:“我需要 AI 来解决这个数学问题。”
  2. 竞价: 几家 AI 公司提交竞价。它们会说:
    • “我可以以90% 的准确率解决这个问题。”
    • “我收费5 美元。”
    • (它们也会秘密决定为了达到 90% 的准确率需要进行多少“思考”。)
  3. 获胜者: 平台选择提供最佳交易(最高准确率、最低价格)的公司。
  4. 支付(神奇之处): 这是最重要的规则。获胜者不会按它们报价的金额获得支付。
    • 相反,它们根据第二好的报价获得支付。
    • 例如: 如果 A 公司报价 90% 准确率、5 美元,B 公司报价 85% 准确率、4 美元,A 公司获胜。但 A 公司只获得4 美元(加上因质量差异的一点点额外补偿),而不是 5 美元。

为何这会改变一切:
因为获胜者是根据竞争对手的价格而非自己的报价获得支付,它们就没有动机去过度收费或过度工程化。

  • 如果 A 公司试图“更努力地思考”以达到 95% 的准确率,它们可能会获胜,但它们仍然只能根据 B 公司较低的标准获得支付。
  • 如果 A 公司试图收费 10 美元,它们将在竞价中输给 B 公司。
  • 最佳策略: 公司获胜并获利的唯一途径是找到最高效的问题解决方法(即适量的“思考”),从而提供最佳价值。它们被迫停止“过度思考”,因为这会消耗它们的资金却无助于赢得竞价。

结果:实验显示了什么

作者使用真实的 AI 模型(如 Llama 和 Qwen)在数学和科学问题上测试了这一想法。

  1. 当前市场是浪费的: 在正常的“按 Token 付费”市场中,他们发现系统效率低下高达19%。这意味着我们浪费了近 20% 的资金和计算能力,因为公司为了多赚几美元而选择“思考”过多。
  2. 拍卖解决了问题: 当他们模拟其拍卖机制时,低效程度降至。AI 公司自动选择了适量的“思考”来高效地解决问题。
  3. 谁受益?
    • 用户: 获得更好的价值。他们支付更少,却得到同样好(甚至更好)的答案。
    • 提供者: 情况喜忧参半。一些公司可能因为无法再过度收费而收入减少,但另一些公司可能因为终于能够基于效率而非单纯抬高成本进行公平竞争而获得更多收入。

总结类比

  • 当前系统: 就像一家餐厅,厨师按他们切的每份食材收费。即使你只需要切好的洋葱,他们也会把洋葱切成粉末,以此向你收取更多费用。
  • 提议的系统: 就像一家餐厅,厨师根据隔壁餐厅对类似菜肴的收费获得固定价格。现在,厨师被迫高效地切洋葱。如果切得太细,他们浪费时间和金钱却得不到额外报酬;如果切得太粗,他们会失去顾客。他们必须找到完美的中间点。

论文结论指出,通过改变游戏规则(支付机制),我们可以阻止 AI 公司浪费资源,并确保它们进行的“思考”真正有助于用户。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →