← 最新论文
💻 computer science

Compression, structure, and executor capability: a controlled real-cost decomposition of language-model agent skill optimisation

这项针对 1,200 次语言模型智能体运行过程的受控研究表明,尽管各种技能优化策略都未能提高成本效率或性能,但升级执行器模型仍然是显著提升任务成功率的唯一因素,尽管其货币成本也大幅上升。

原作者: Xiaonan Xu, Wenjing Wu

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaonan Xu, Wenjing Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一支数字助手(AI 智能体)团队来解决复杂的软件问题。你有一本“技能手册”——一套关于如何执行特定任务的指令。研究人员提出的核心问题是:我们应该如何编写和交付这些手册,才能以最低的价格获得最好的结果?

许多人假设,如果我们将手册缩短、将其整理成精美的图表,或者使用超级聪明的编辑器来重写它,助手就会工作得更快、更便宜。这项研究对这一假设进行了测试。

以下是他们的发现,解释如下:

1. 实验:“烹饪”类比

把 AI 智能体想象成一名厨师。

  • 技能: 厨师遵循的食谱。
  • 编译器(Compiler): 编辑食谱的人(也许是缩减食谱或将其转化为流程图)。
  • 执行器(Executor): 实际烹饪食物的厨师。
  • 成本: 食材和厨师的时间费用。

研究人员测试了向厨师提供食谱的 10 种不同方式。他们尝试了:

  • 给厨师原始的、未经编辑的食谱。
  • 将食谱精简到仅剩精华(缩减)。
  • 将食谱重写为结构化的列表或精美的表格(结构化渲染)。
  • 只向厨师展示与当前菜肴相关的部分(范围加载)。
  • 使用“初级厨师”(更便宜、更小的 AI 模型)对比“大师级厨师”(更昂贵、更强大的 AI 模型)来进行烹饪。

他们针对 40 个不同的软件任务进行了 1,200 次实验,测量了两个指标:菜品是否正确?(成功率)以及 实际花费了多少钱?(成本)。

2. 大惊喜:“厨师”比“食谱”更重要

最重要的发现是,谁来烹饪比食谱怎么写要重要得多。

  • 大师级厨师胜出: 当他们使用强大的“大师级厨师”(更强的 AI 模型)时,成功率提升了 27%。然而,这使得每个任务的成本增加了约 5 倍
  • 初级厨师表现挣扎: 当使用较便宜的“初级厨师”时,那些花哨的食谱技巧并没有起到帮助作用。事实上,它们往往会让情况变得更糟。
    • 缩减食谱: 对初级厨师并没有实质性的帮助,也没有节省成本。
    • 花式格式(图表/表格): 实际上让初级厨师感到困惑,导致其成功率低于使用简单的纯文本食谱。
    • 仅展示部分食谱: 同样降低了成功率,且没有节省成本。

隐喻: 想象你有一个学生(初级厨师)。如果你给他们一份简化过的、带要点的学习指南,如果他们连基础知识都不懂,他们可能仍然无法通过考试。但如果你雇佣了一位天才导师(大师级厨师),即使学习指南很乱或很长,他们也能轻松通过考试。劳动者的质量才是决定性因素,而不是指令的格式。

3. 成本陷阱:“Token 计数” vs. “真实金钱”

人们衡量 AI 成本的方式存在一个陷阱。

  • Token 错觉: 人们通常通过计算“Token”(文本块)来估算成本。他们认为:“哦,精美的结构化食谱使用了更少的 Token,所以更便宜!”
  • 现实情况: “大师级厨师”使用的 Token 更少,是因为他们更聪明,需要的指令更少,但他们每个 Token 的单价要高得多
    • 类比: 这就像雇佣一位大师级木匠,他 1 小时就能完成工作但每小时收费 500 美元,对比一位新手,虽然他需要 5 小时但每小时仅收 20 美元。尽管大师使用的“时间”(Token)更少,但总账单却高得多。
    • 研究发现,当观察实际美元成本时,没有任何一种“优化过”的食谱(缩减的、结构化的或范围限定的)比直接提供原始指令更省钱。

4. “盈亏平衡”的迷思

有些人认为:“如果我现在多付一点钱请一位超级聪明的编辑器来重写食谱,以后我就会省钱,因为厨师会工作得更快。”

  • 结论: 数学告诉我们:不成立
  • 类比: 想象你支付 10 美元请专业编辑重写你的指令,你希望这能让你每次使用时节省 1 美元。研究发现,对于大多数任务,你需要使用那个重写后的食谱数百次才能达到盈亏平衡。由于大多数人只使用这些技能几次,所以通过试图“优化”指令,你几乎总是处于亏损状态。

总结发现

  1. 不要过度设计指令: 让指令变得更短、更有结构或更具“范围性”,并不会让 AI 变得更聪明或更便宜。事实上,对于较便宜的 AI 模型,这样做往往会让它们表现得更差。
  2. 原材料本身就很好: 原始的、未经编辑的“技能”指令与那些精美版本一样好(甚至更好)。
  3. 升级劳动者,而非手册: 唯一能可靠提高结果的方法是切换到更强大的 AI 模型(“大师级厨师”),尽管这会增加成本。
  4. 真实成本至关重要: 不要被“Token 计数”所迷惑。始终关注真实的美元价格。在本研究中,试图通过重写指令来节省 Token 并没有真正节省金钱。

底线: 如果你想让你的 AI 智能体取得成功,请停止纠结于你的指令有多漂亮或多简短。相反,你应该专注于将任务交给一个能力更强的 AI 模型。“劳动者的质量”是唯一能真正改变局面的杠杆。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →