← 最新论文
💻 computer science

Can your AI agent be cheaper? Investigating the effects of task specifications on token spend in agentic coding tasks

本文研究了任务规范如何影响智能体编程工作流中的 Token 消耗,证明了过于简短的提示词会显著增加成本,并提出了一种能够高精度估算不同配置下 Token 支出的预测方法。

原作者: Jakub Smékal

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Jakub Smékal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代软件开发领域,一种新型的劳动者已经出现:人工智能智能体(AI agent)。与只能回答单个问题的简单聊天机器人不同,这些智能体旨在处理复杂的、多步骤的任务,例如修复计算机程序中的漏洞或从零开始构建一个新功能。它们通过阅读任务描述、思考问题、使用数字工具编写并测试代码,并重复这一过程直到任务完成。然而,这种自主性是有代价的。每当 AI 进行思考、阅读或编写时,它都会消耗以“token”(模型处理文本的基本单位)衡量的数字资源。这些 token 直接转化为金钱。随着这些智能体在现实系统中变得越来越普遍,工程师们面临着一个迫切的问题:让 AI 解决一个问题的成本是多少,以及这种成本是否可以控制?

答案并不像选择一个更便宜的计算机模型那么简单。近期的研究表明,即使给予 AI 完全相同的指令,其消耗的金额也会在不同尝试之间产生巨大的差异。有时,同一任务的两次相同运行,其成本差异甚至可达 30 倍。这种不可预测性使得预算编制变得困难。此外,虽然研究人员已经观察了不同 AI 模型的表现,但他们很大程度上忽略了人类描述任务的方式本身是如何改变价格的。一名资深工程师可能会为软件修复编写一份详细、结构化的规范文档,而一名初级工程师可能会直接粘贴一段原始的错误信息。这些不同的描述是否会导致不同的成本,还是说无论请求如何措辞,AI 做的功都一样多?

为了查明真相,斯坦福大学的一位研究人员使用一种名为 Kimi K3 的特定 AI 模型进行了一项大规模实验。团队从开发者使用的标准测试套件中选择了五个不同的软件修复任务。针对每个任务,他们创建了各种各样的指令,范围从包含所有可能细节的完整、高度结构化的文档,到几乎没有任何信息的简陋描述。他们还测试了三个不同级别的“思考努力程度”,这本质上控制了 AI 在采取行动前进行推理的强度。总共,他们运行了该系统 2700 次,仔细追踪了每次尝试所花费的金钱以及智能体需要转向计算机执行任务的次数。

结果揭示了一个清晰且令人惊讶的模式。任务的描述方式对平均成本有着巨大的影响。当研究人员将一份完整的、详细的规范简化为一个关于用户需求的简单、平实的语言故事时,解决问题的成本增加了近 30%。这种情况在他们测试的每一个任务中都一致地发生了。这似乎表明,当 AI 没有得到足够的具体细节时,它必须花费更多的时间和金钱来自行摸索缺失的部分。然而,研究也发现,指令并不会改变成本的不可预测性。无论提示词多么详细或模糊,一次运行与下一次运行之间的差异都保持在大致相同的水平。单次尝试的成本本质上是不稳定的,而让总账单更具可预测性的唯一方法是降低单次尝试的成本。

另一个关键发现是,当 AI 被赋予有限的思考预算时,指令中的细节程度最为重要。当允许 AI 进行深度且广泛的思考时,详细提示词与模糊提示词之间的成本差异会缩小。这表明,如果你给 AI 足够的时间去推理,它就可以自行填补糟糕描述中的空白;但如果你限制它的思考时间,一个清晰且详细的提示词对于节省成本就变得至关重要。研究人员还发现,删除任务描述中的特定部分(如边缘情况列表或成功标准)本身影响很小,但删除整个用户故事或测试场景则会导致成本剧增。

对于使用这些工具的人来说,或许是最具实践意义的发现是一个预测新任务成本的方法。团队展示了你不需要对一个新问题进行数十次运行来了解其成本。通过在一个新问题上进行一次廉价的测试,他们就能相当准确地预测该问题在不同指令风格和思考设置下的成本。如果没有这单次测试,任何对新任务成本的猜测都可能偏差超过 100%。仅凭一次小规模测量,误差就能降至约 36%。这意味着工程师可以快速衡量其选择带来的财务影响,而无需浪费资源进行大量的试错。

研究结论指出,虽然 AI 的行为本质上是不可预测的,但其工作的成本深受人类构建请求方式的影响。一个结构良好、细节丰富的任务描述可以显著降低所花费的金钱,尤其是在 AI 没有无限思考时间的情况下。研究表明,管理这些成本最有效的方法不是试图消除 AI 的随机性,而是精心设计任务指令,并使用单次低成本测试来校准对新工作的预期。随着这些智能体越来越多地融入日常工作中,理解我们使用的词汇与我们所花金钱之间的关系,将与他们编写的代码本身一样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →