Prompt-Induced Waste in Large Reasoning Models: A Preregistered Two-Harness Benchmark of Coding Agents
这项预注册基准研究表明,提示词措辞和评估框架设计会显著增加大型编程智能体的推理成本——通常增加 2.4 到 30 倍——且并不会提高任务成功率,其中诸如“开发多种方法”之类的特定指令以及某些评估框架架构是导致这种低效的主要驱动因素。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一个超级聪明的机器人助手来修理一台坏掉的面包机。你不仅希望机器人能修好它,还希望它在动手之前先进行“思考”。在人工智能的世界里,这些“思考”步骤被称为推理标记(reasoning tokens)。就像人类可能会在解谜之前在纸上涂鸦、划掉错误答案并尝试不同的想法一样,这些 AI 模型也会花费时间和金钱来进行“审议”,然后再给你答案。
但问题在于,机器人每产生一个念头,你都要付费——即使是那些它随后丢弃的想法。如果你要求机器人“深入思考”或“尝试五种不同的方法”,它可能真的会照做,从而在修好面包机之前就耗尽你的预算,而效果可能并不比你直接要求它“修理面包机”更好。这篇论文探索了计算机科学中一个奇特的领域:研究人员扮演着侦探的角色,试图弄清楚哪些指令词会让机器人在浪费金钱,而哪些词又能让它保持在预算范围内。他们不仅仅是在猜测,而是通过运行数千次受控实验,来精确观察不同短语带来的成本差异。
伟大的提示词实验:为什么你的话语会值钱
想象一下,你拥有一支由六位不同类型的超级智能机器人厨师组成的队伍。你想让他们编写代码(这就像是计算机的食谱)来解决 24 个特定的烹饪挑战。但有一个转折:你必须为厨师在烹饪时产生的每一个念头付费。研究人员想知道:你下达订单的方式是否会改变厨师的思考方式,以及这种思考是否真的能让菜肴的味道更好?
为了找出答案,他们建立了一个规模宏大、组织严密的实验室厨房。他们并没有凭空猜测;他们在开始烹饪之前就写好了规则(这被称为“预注册”,就像在去超市买菜前先写好菜单)。他们使用了两种不同类型的厨房经理(称为“框架/harnesses”)来与厨师沟通:一种是直接、不废话的经理,另一种则是非常啰嗦、细节丰富的经理,会在每次订单中发送大量的背景信息。
在进行了超过 4,600 次烹饪环节后,他们发现了以下结果:
1. “尝试一切”的陷阱
最大的浪费钱的行为是什么?就是告诉机器人**“开发几种方法并进行比较”**。
这听起来很聪明,对吧?就像一个好厨师在端菜前会品尝三种酱汁一样。但对于这些 AI 机器人来说,这个指令简直是一场灾难。它让它们的思考量增加了 2.4 到 7.4 倍。而最糟糕的是,最终的成品(代码)并没有变得更好。它们只是白白浪费了额外的现金去思考那些它们从未使用的选项。这就像是付钱请一位厨师写出三种不同的三明治食谱,让他全部尝一遍,最后却只为你端上一份他原本在被要求做“一个三明治”时就会做的东西。
2. 毫无作用的“魔法词汇”
人们常说“一步步思考”或“深入思考”来获得更好的结果。研究人员发现,对于这些编程机器人来说,这些“深度思考”的魔法词汇纯粹是浪费。它们让机器人的思考时间延长了 1.6 到 2.2 倍,却并未改善结果。这就像是告诉计算器在做 2 + 2 之前要“努力思考”一样;答案是一样的,但你却为额外的思考时间付了费。
3. “边界效率”的小妙招
另一方面,有一个可以省钱的秘诀。如果你给机器人一个严格的工作范围——明确告诉它目标是什么、规则是什么,以及何时停止——它实际上的思考量反而会减少。甚至有一个机器人将思考时间缩短了一半!这种“边界效率”模板是免费使用的,它能在不影响代码质量的前提下,让机器人运行得更快、更便宜。
4. 经理比厨师更重要
其中一个最令人惊讶的发现是,你雇佣谁来管理机器人,比机器人本身更重要。
他们用两个不同的经理测试了同一个机器人。一个经理(PI.DEV)非常高效。另一个经理(Claude Code)则像是一个微观管理者,在每条消息中都会发送一个庞大 12 到 15 倍的“开场白”。即使机器人完美地解决了问题,由于对话处理方式的不同,微观管理者版本产生的费用甚至高出了 5 到 30 倍。事实证明,“经理”(包裹 AI 的软件)往往才是账单中最重头的部分,而不是 AI 本身。
5. “隐藏折扣”的错觉
研究人员还观察了这些公司是如何为这些机器人计费的。他们发现,公司通过记住每次发送的“开场白”来自动节省成本。这节省了大约 61% 的账单。但研究人员警告说:不要称之为“效率”。 这仅仅是一种折扣。机器人并没有实际工作得更快或更聪明;只是公司没有为你重复的部分计费。
6. 新机器人,老套路
当一款全新的、超快速的机器人(Kimi-K3)发布时,研究人员立即对其进行了测试。尽管这个新机器人天生运行成本更低,但同样的糟糕指令(如“尝试多种方法”)仍会让它比平时多浪费 15 倍 的钱。教训是:无论机器人多么聪明或便宜,糟糕的指令永远会让它过度支出。
总结
这篇论文证明了,你提问的方式会改变成本,即便答案本身是一样的。
- 不要除非你真的需要它们执行特定任务,否则不要告诉机器人“尝试多种方法”或“深入思考”。
- 要给它清晰的边界和停止条件。
- 记住,管理机器人的软件可能会比机器人本身更让你破费。
研究人员公开了所有的实验数据、代码和测试食谱。他们希望让每个人都知道,在 AI Agent(智能体)的世界里,少一些“思考表演”,多一些清晰的指令,才是省钱并完成工作的最佳途径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。