A Control System, a Dataset, and a Recipe for Making Frozen LLM Agents Learn a Domain
本文提出了一种样本高效且可审计的控制系统,该系统通过在线强化学习和多目标奖励来优化一个固定的、人类可理解的 LLM 智能体控制框架(harness),并展示了其在不同任务领域和模型提供商下的有效性,同时发布了代码、数据集以及用于更广泛应用的部署方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
AI 大厨与魔法食谱
想象一下,你拥有一位才华横溢、超级聪明的厨师,他几乎能烹饪任何东西。这位厨师其实是一个人工智能,具体来说是一个大语言模型(LLM)。但问题在于:这位大厨并不会只是漫无目的地走进厨房开始做饭。他们需要一份食谱、一套工具和一个计划。在 AI 的世界里,这种设置被称为“护栏”(harness)。它是告诉 AI 如何 思考、使用什么 工具(比如计算器或搜索引擎)以及在端上最后一道菜之前如何 检查工作的说明书。
长期以来,科学家们认为让大厨变得更优秀的唯一方法是亲自训练大厨——从头开始教他们新的技能。但一个更新颖的想法指出,也许大厨本身已经很出色了,我们只需要微调一下食谱即可。研究人员提出的核心问题是:我们应该让 AI 在烹饪过程中自行改写食谱吗(这是一种冒险且昂贵的做法),还是应该将食谱视为一个固定的选项菜单,并使用一个聪明且简单的系统来为每项任务挑选最佳方案?本论文深入探讨了这个问题,测试了通过改变我们提供指令的方式,是否可以为一位“冻结”的 AI(即大脑不发生变化的 AI)注入超强动力。
实验:用“食谱交换机”驯服 AI
本文作者决定采取一种非常谨慎、受控的方法。他们没有让 AI 肆意妄为地去改写自己的代码(他们认为这就像是让一名学生在考试时改写考题),而是构建了一个“控制系统”。你可以把这个系统想象成一个巨大的、神奇的交换机,拥有正好 729 种不同的设置。每种设置都是一组特定的指令组合:
- 提示词风格(Prompt Style): AI 应该是直接的、结构化的,还是反思性的?
- 工具策略(Tool Policy): 应该只在需要时使用工具,还是始终使用?
- 记忆(Memory): 应该记住过去的成功经验,还是同时记住成功和失败的经验?
- 规划(Planning): 应该是直接动手、做一个简短计划,还是进行计划并不断修正?
- 验证(Verification): 应该在最后检查工作,还是进行逐步检查?
- 步骤预算(Step Budget): 在停止之前应该执行多少步?
研究人员想要观察是否可以使用一种智能的学习系统(称为强化学习),通过实时切换这些开关,来为每项任务找到完美的食谱。他们在三个不同的“厨房”中进行了测试:
- 工具使用(Tool-Use): 让 AI 管理一个虚构的客户数据库(类似于 CRM)。
- 编程(Coding): 要求 AI 编写能够通过特定测试的代码(使用 HumanEval 基准测试)。
- 检索(Retrieval): 要求 AI 通过搜索一堆文档来回答棘手的问题(使用 HotpotQA)。
他们在两个不同的“大厨”身上进行了这项实验:一个是本地开源模型(Ollama),另一个是强大的云端模型(AWS Bedrock)。他们将这个智能的学习交换机与另外两种方法进行了对比:一种是随机猜测者(随机挑选设置),另一种是“静态基准”(由名为 DSPy 的工具创建的、经过预先优化的单一食谱)。
大惊喜:“静态”食谱胜出
这里有一个作者们始料未及的转折:智能学习交换机并没有胜出。
在几乎所有的测试中,“静态基准”——即那个精心制作一次后便不再变动的单一预制食谱——表现得与不断尝试学习和适应的系统一样好,甚至更好。
- 在工具使用领域,静态食谱在 Bedrock 模型上的任务完成率达到了 96%,而学习系统仅完成了约 62%。
- 在编程领域,静态食谱与学习系统同样出色,但它消耗的“Token”(AI 食用的数字食材)更少,因此成本更低、速度更快。
- 即使在检索领域(对所有人来说都更困难的领域),静态食谱也依然能稳住阵脚。
作者意识到发生这种情况的原因:那个“学习”系统试图从 729 种可能性中寻找最佳设置,但它没有足够的时间或尝试次数来掌握这张地图。这就像是试图仅用 25 次尝试就在一个巨大的迷宫中找到最佳路径;你很可能会陷入死胡同。然而,静态食谱是利用一种最初就只关注合理且高质量选项的方法构建的,因此它不会在糟糕的路径上浪费时间。
这对未来意味着什么
论文得出结论:对于大多数实际的现实应用场景,你不应该从一个试图从零开始搞定一切的复杂自学习系统开始。相反,你应该:
- 从一个强大的静态食谱开始(例如由 DSPy 创建的食谱)。
- 只有在任务发生巨大变化,以至于旧食谱不再奏效时,才加入学习系统。
作者还分享了一份“食谱”(一份名为 RECIPE.md 的指南),供想要构建这些系统的团队参考。他们强调,如果你确实要使用学习系统,必须警惕“冷启动”问题(即系统在开始时意外选择了错误的设置),并且你需要留意那些会导致整个批次因一次错误尝试而崩溃的情况。
简而言之,论文表明,虽然“AI 能够不断重写自身指令”的想法听起来既酷炫又具有未来感,但在现实世界中,一本编写良好、固定的说明书往往比一个仍在努力摸索如何编写说明书的系统更有效、更快速、更便宜。其中的“学习”部分是有用的,但前提是你已经找到了一个良好的起点。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。