← 最新论文
💻 computer science

Compiling Agentic Workflows into LLM Weights: Near-Frontier Quality at Two Orders of Magnitude Less Cost

本文主张,将代理工作流直接编译到经过微调的小型模型(即“地下代理”)的权重中,提供了一种成本效益高、隐私性强且上下文高效的替代方案,以取代当前主流的外部编排框架,该方案在多种复杂任务中展现出接近前沿水平的质量,同时克服了关键的采用障碍。

原作者: Simon Dennis, Rivaan Patil, Kevin Shabahang, Hao Guo

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Simon Dennis, Rivaan Patil, Kevin Shabahang, Hao Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对该论文的解读。

核心理念:将“食谱”烘焙进“厨师”大脑

想象你正在尝试完成一项复杂的任务,比如预订一次复杂的旅行或修理一台故障机器。目前,大多数公司使用的是“经理与员工”系统(称为“智能体编排”)。

  • 现有方式(经理): 你拥有一个非常聪明但昂贵的“经理”(前沿 AI 模型)。每当“员工”(与你对话的 AI)需要做出决定时,经理就会停下来,阅读一本巨大的规则手册,告诉员工下一步该做什么,然后等待员工回复。这个过程会反复进行。这种方式既缓慢又昂贵,而且经理每次都必须通读整本规则手册。
  • 新方式(地下智能体): 作者提出了一种不同的方法:将流程编译进权重中。想象将那本巨大的规则手册直接烘焙进员工的脑子里。现在,员工本身就是专家。他们不需要经理告诉他们下一步该做什么;他们自然地知道流程。他们变成了一种“地下智能体”——一位从内而外工作的专家。

这篇论文提出了一个问题:将规则烘焙进一个更小、更便宜的 AI 中,是否真的能像使用巨大且昂贵的经理那样有效?

三大障碍(以及他们如何克服)

作者认为人们之所以没有这样做,是因为存在三大顾虑。他们在三个现实场景中测试了这些顾虑:旅行预订Zoom 技术支持保险理赔

1. 质量顾虑:“小脑能像大脑一样聪明吗?”

  • 顾虑: 人们认为,小型、廉价的 AI(30 亿或 80 亿参数)无法像大型科技巨头使用的那种庞大、昂贵的 AI 那样处理复杂的步骤。
  • 结果: 令人惊讶的是,小型 AI 的表现几乎与大型 AI 一样好。
    • 旅行场景中,小型 AI 比大型 AI 稍显不够“礼貌”或“优雅”,但它能正确完成任务。
    • Zoom 支持保险(这两者要难得多)场景中,他们将小型 AI 升级到了稍大一点的版本(80 亿参数)。这个版本在几乎所有指标上都与昂贵的大型 AI 不相上下。
    • 类比: 这就像雇佣一位当地经验丰富的机械师(小型 AI),而不是聘请一支世界著名的赛车队(大型 AI)。对于解决日常的汽车故障,当地机械师能达到 90%–98% 的效果,但成本却只是其零头。

2. 成本顾虑:“运行它真的更便宜吗?”

  • 顾虑: 人们认为,即使小型 AI 的训练成本很低,但由于需要支付计算能力费用,运行它可能仍然很昂贵。
  • 结果:极其便宜
    • “经理”系统必须为 AI 说的每一句话调用一个非常昂贵的 API。
    • “烘焙进”的系统则在标准计算机服务器(自托管)上运行。
    • 数据: 新方法每次对话的成本降低了128 到 462 倍
    • 类比: 旧方式就像每让你问一次“请转弯”,就要付给出租车司机 50 美元。新方式就像花 1000 美元买辆车然后自己开。你开得越多(任务越复杂),你省下的钱就越多。

3. 灵活性顾虑:“如果规则变了怎么办?我需要重新训练几个月吗?”

  • 顾虑: 人们认为,如果保险公司更改了表格,或者旅行社更改了政策,你就得等待数周来重新训练 AI。
  • 结果: 速度很快。
    • 更改规则并重新训练 AI 在标准硬件上仅需30 到 50 分钟
    • 类比: 这不像从头重建一栋房子;它更像是更新手机上的软件。你可以在煮一壶咖啡的时间内完成它。

工作原理(“地下”流程)

这个过程出奇地简单:

  1. 绘制地图: 你画出对话应有的流程图(例如:“询问日期” -> “检查预算” -> “展示选项”)。
  2. 模拟演练: 一个超级聪明的 AI(“老师”)根据这张地图进行数千次演练,生成模拟对话。
  3. 烘焙大脑: 你教一个小 AI 学习这些模拟对话。AI 学习的是对话的模式,而不仅仅是文字。
  4. 正式上线: 你部署这个小 AI。它不再需要流程图;流程图现在已成为其记忆的一部分。它直接与你对话。

结论

该论文得出结论:对于具有明确步骤的任务(如预订、支持或理赔),你不需要经理

  • 持久结构应属于权重: 游戏规则应被烘焙进 AI 的大脑中。
  • 瞬时状态应属于提示: 关于你的旅行或你的Zoom 通话故障的具体细节,应在对话中告知 AI。

通过将规则从“经理”转移到“员工的大脑”中,你可以以低两个数量级(100 倍)的成本获得近乎完美的质量,并具备在一小时内更新规则的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →