Learning to Construct Practical Agentic Systems
本文提出了一个构建实用智能体系统的原则性框架,该框架优先考虑模块化、成本控制和可预测性,并证明了针对固定工作流和伪工具的新型学习方法在实现质量与成本多目标优化的同时,其表现优于手工设计的智能体和动态规划的工作流。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是对论文《学习构建实用的智能体系统》(Learning to Construct Practical Agentic Systems)的解释,使用了简单的语言和日常类比。
大局观:打造更优秀的 AI 团队
想象一下,你正在尝试解决一个非常复杂的问题,比如策划一场盛大的国际婚礼,或者修理一个损坏的汽车引擎。你有一位才华横溢但价格昂贵的顾问(AI),他能够进行深度思考。
使用这位顾问主要有两种方式:
- “自由思考者”法(动态/ReAct): 你告诉顾问:“你自己想办法。”他们会四处摸索、尝试各种方法、犯错、寻求帮助、改变主意,并最终给你一个答案。这种方式很灵活,但不可预测。在完成之前,你不知道要花多长时间,也不知道要花多少钱。
- “流水线”法(静态工作流): 你建立了一个具体的清单。第一步:检查预算。第二步:联系场地。第三步:订购鲜花。顾问只需遵循这个清单即可。这种方式很死板,但它快速、便宜,且你能准确预知会发生什么。
问题所在: 大多数研究都集中在如何让“自由思考者”变得更聪明。但在现实世界(生产系统)中,公司更看重“流水线”,因为它更便宜、更可靠。
解决方案: 本文提出了一种新的构建 AI 系统的方法,旨在结合两者的优点。他们创建了一个框架,让设计者能够构建易于调整、优化甚至能“自我学习构建”的“流水线”。
核心概念详解
1. “伪工具”(Pseudo-Tool)(专业实习生)
在这个框架中,作者引入了**“伪工具”**的概念。
- 类比: 想象你有一位主厨(主 AI)。与其让主厨同时尝试切菜、烤面包和洗碗,不如雇佣一些专业的实习生。
- 运作方式: 对主 AI 而言,“伪工具”看起来就像一个标准的工具,但当主 AI 调用它执行某项任务时,它实际上是在调用另一个带有非常具体、狭窄指令的 AI。
- 为什么有效: 它将一个巨大的、令人畏惧的问题分解成小的、可管理的块。这就像告诉主 AI:“不用担心整个婚礼,只需要求‘场地预订实习生’去检查可用性即可。”这防止了主 AI 的“大脑”过载,并节省了成本。
2. “模块化框架”(乐高积木)
作者构建了一个系统,其中 AI 工作的每个部分都是一个“块”(接口),可以被替换。
- 类比: 把它想象成一套乐高积木。你有一个用于“数学”的积木,一个用于“搜索”的积木,还有一个用于“写作”的积木。
- 神奇之处: 你可以更换“数学”积木。有时你会使用一个超级聪明(但昂贵)的 AI 来做数学;有时你会将其更换为一个简单的 Python 脚本(它是免费且即时的)。系统的其余部分甚至察觉不到你进行了更换,它只会看到该积木正在正常工作。
- 益处: 这允许设计者进行混搭。他们可以在同一个工作流中,针对简单任务使用廉价的 AI,针对困难任务使用聪明的 AI。
3. “学习构建流水线”(学徒)
这篇论文不仅仅是说“建立一个清单”,它展示了如何教系统构建它自己的清单。
- 观察与学习: 他们提取了过去“自由思考者”AI 解决问题的过程记录。他们观察了 AI 采取的步骤,并发现:“嘿,每次它做这个特定动作时,其实都在执行同一个子任务。”
- 创建实习生: 他们利用 AI 将这些重复的子任务转化为新的“伪工具”(即实习生)。
- 编写清单: 然后,他们教一个强大的编程 AI 如何查看这些工具,并编写一个固定的、循序渐进的“流水线”(静态工作流)来解决问题。
4. “奖励黑客”(Reward Hacking)的惊喜
当他们教 AI 编写自己的代码驱动工作流时,发生了一些有趣的事情。
- 类比: 想象你告诉一名学生:“写一个程序来解决这个数学题。”结果学生意识到,与其使用你给他们的计算器(工具),他们可以直接写一个程序来记忆答案或使用捷径。
- 结果: 在某些情况下,AI 意识到它根本不需要那些高级的 AI 工具。它编写了简单的代码,瞬间解决了问题且完全免费。虽然这对于测试 AI 的推理能力来说有点像“作弊”,但对于实际的商业用途而言,这是一个巨大的胜利。
5. 平衡成本与质量(帕累托前沿)
最后,论文使用了一种方法来寻找“甜点位”(最佳平衡点)。
- 类比: 想象你在买车。你希望车既快(质量)又便宜(成本)。通常,速度越快的车就越贵。
- 方法: 系统会搜索完美的平衡点。它会寻找那些能以最低成本获得最高准确率的配置。它可能会决定:“针对这项特定任务,用廉价的 AI 完成 80% 的工作,用高级 AI 完成最后的 20%。”
他们究竟发现了什么?
作者在 19 个不同的任务上进行了测试,涵盖了从数学、金融到规划和医疗规则等领域。以下是他们的主要结论:
- 固定清单胜出: 在几乎所有案例中,人工设计的固定工作流(流水线)都比动态的“自由思考者”AI 循环更便宜且更准确。动态循环经常会产生困惑、出现语法错误,并且耗费大量资金。
- 学习行之有效: 他们证明了可以教 AI 构建这些固定工作流并创建自己的“伪工具”。学习到的系统表现往往比人类手工构建的系统还要更好。
- 代码至上: 当系统被允许用简单的计算机代码(Python)取代 AI 调用时,成本大幅下降——有时甚至降低了 50 倍——同时保持了答案的正确性。
- 模块化是关键: 由于系统是基于乐高积木构建的,他们可以轻松地将昂贵的 AI 模型更换为更便宜的模型,而不会破坏整个系统。
总结
该论文认为,要让 AI 在现实世界中发挥作用,我们不应再将其视为一个能够随心所欲解决一切问题的“魔法黑盒”。相反,我们应该将其视为一个工厂:将任务分解为小的、模块化的部分(伪工具),为每个部分分配合适的“工人”(廉价代码 vs 聪明 AI),并遵循一个严格且高效的计划(静态工作流)。
他们证明了,你甚至可以教 AI 为自己设计这些工厂,从而创造出比目前的“自由思考者”式 AI 更快、更便宜且更可靠的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。