想象一下,你正在招聘一名新员工来管理你的数字生活。他极其聪明(一个强大的 AI),但从未见过你特定的应用程序、工具或规则。
问题:“冷启动”差距
通常,当你招聘某人时,你要么:
- 事先培训(离线):你给他们一本关于过去成功任务的厚手册。但如果你正在推出一款全新的应用程序,那本手册还不存在。
- 在职培训(在线):你让他们立即开始工作。但起初,他们在摸索过程中会犯错、失败并惹恼你。这就是“冷启动”问题。
这篇论文提出了一个问题:我们能否在他们从未见过真实客户之前,仅利用我们自己创建的练习会话来培训这名员工?
解决方案:PREPING(任务前可重用剧本制作)
作者创建了一个名为 PREPING 的系统。将其想象为一个模拟训练营,AI 在其中练习它自己发明的任务,但有一位非常严格的教练来确保练习确实有用。
以下是这个“训练营”的运作方式,涉及三个角色:
1. 提议者(创意教练)
这是 AI 中负责发明练习任务的部分。
- 没有教练:如果你只是告诉 AI“练习”,它可能会重复做同一件事 100 次(比如开门),或者尝试做不可能的事情(比如飞行)。这毫无用处。
- 使用 PREPING:提议者拥有一个记忆笔记本(提议者记忆)。它追踪已经练习过什么。如果它刚刚练习了“开门”,笔记本会告诉它:“好吧,现在试试锁门”或者“试试使用电梯”。它还会检查环境地图,以确保任务实际上是可行的(例如,“如果大楼没有屋顶,就不要让 AI 去飞”)。
- 目标:创建一套多样化的练习训练,涵盖新环境中的所有工具和规则,且不重复。
2. 求解者(受训者)
这是实际执行工作的 AI。它尝试完成由提议者发明的任务。它编写代码、点击按钮并调用 API,就像它为真实用户做的那样。
3. 验证者(严格检查员)
这是最重要的部分。并非每次练习会话都是好的。
- 有时受训者会尝试做不可能的事情(比如从一张不存在的卡上取钱)。
- 验证者查看结果并说:“停下。这是一个虚假任务。不要把它记下来。”
- 如果任务是真实的且受训者成功了,验证者会说:“太好了!这是学到的教训。把它记入剧本中。”
结果:第一天即可使用的“剧本”
当 AI 部署给真实用户时,它已经拥有一个充满剧本(程序记忆)的库,其中包括:
- 如何正确组合不同的工具。
- 当事情出错时该做什么。
- 哪些工具实际上是可用的。
为什么这比旧方法更好?
- 与无培训相比:AI 不会从零开始。它不会在你的第一个真实任务上犯尴尬的错误。
- 与在职学习相比:AI 不需要从你的失败中学习。它已经熟悉门道。
- 成本:在职学习成本高昂,因为 AI 必须在等待其工作时不断“思考”和“更新记忆”。PREPING 在你雇佣它之前就完成了所有这些繁重的工作,使得实际工作更便宜、更快。
类比简述
想象一名飞行员。
- 旧方法:你让他们第一次就驾驶载有乘客的真实飞机来学习操控。(危险且缓慢)。
- PREPING 方法:你让他们进入飞行模拟器。一位聪明的教练(提议者)给他们特定的场景(多云天气、引擎故障、新机场)。一名安全官员(验证者)在他们试图撞山时阻止他们。当他们进入真实驾驶舱时,他们已经拥有了处理各种情况的心理检查清单(记忆),并准备好立即起飞。
论文的发现
作者在三个不同的“数字世界”(管理应用程序、调用函数和使用服务器工具)上测试了这种方法。他们发现:
- PREPING 创造了一个比仅阅读手册或猜测更聪明的 AI。
- 即使它从未见过任何真实的人类任务,其表现也几乎与在数千个真实人类任务上训练过的 AI 一样好。
- 它节省了金钱和时间,因为 AI 不需要在为你的工作期间“学习”。
简而言之,PREPING 通过让 AI 聪明地练习并过滤掉不良练习,在它遇见客户之前就教会它成为专家。
技术摘要:PREPING——无需任务构建代理记忆
1. 问题陈述
部署在可执行环境(例如工具 API、模型上下文协议服务器)中的大语言模型(LLM)代理需要程序性记忆才能成功。这种记忆捕捉了特定于环境的 workflows、工具组合规则以及故障恢复策略。然而,现有的记忆构建方法面临冷启动差距:
- 离线方法依赖于人工策划的演示或已解决的轨迹,这些内容生成成本高昂,且在部署前对于新环境往往不可用。
- 在线方法在部署后从用户交互中积累记忆。这迫使代理从零记忆开始,使用户面临早期失败、记忆更新延迟以及额外的部署时成本。
本文解决了任务前记忆构建的问题:一个代理能否在观察任何目标环境任务之前,仅利用自我生成的合成练习来构建可复用的程序性记忆?挑战在于,在没有任务指令的情况下,合成练习很容易变得冗余、不可行或缺乏根基,从而导致记忆污染而非改进。
2. 方法论:PREPING
作者提出了PREPING(任务前可复用剧本制作,Pre-Task REusable Playbook MakING),这是一个将记忆构建视为对练习什么和存储什么进行控制问题的框架。PREPING 通过一个涉及三个 LLM 驱动模块和两种不同记忆状态的合成练习循环来运行:
2.1 双重记忆状态
- 提议者记忆(Mprop): 一种构建时的控制状态。它追踪合成任务的历史、工具使用统计、验证结果以及基于根基的环境事实(实体、状态、约束)。它指导未来任务的生成,以确保覆盖范围和可行性。
- 求解者记忆(Msol): 面向部署的程序性记忆。它仅包含从成功轨迹中提炼出的经过验证的、可复用的见解。
2.2 构建循环
在每次迭代 t:
- 提议者(Aprop): 基于环境文档(D)和当前的提议者记忆(Mprop)生成合成任务 xt。提议者的设计旨在避免冗余,针对未充分探索的工具,并将任务扎根于观察到的环境事实中。
- 求解者(Asol): 在目标环境(E)中执行任务 xt,产生轨迹 τt。
- 验证器(Aval): 评估任务 - 轨迹对 (xt,τt) 的可行性(任务是否扎根且可执行?)和完成度(目标是否达成?)。
- 非对称更新:
- 提议者更新: 所有经验(包括失败或不可行的任务)都会更新 Mprop。这使得系统能够学习不练习什么并调整覆盖范围。
- 求解者更新: 只有被判定为可行且成功完成的轨迹才被纳入 Msol。这些轨迹被提炼为紧凑的程序要点(剧本风格),而非原始日志。
3. 主要贡献
- 任务前记忆的形式化: 本文定义了一种设置,其中代理必须在无法访问目标任务分布的情况下构建记忆,以此区别于标准的在线学习或离线微调。
- 提议者引导的控制: 与天真的自我博弈或随机探索不同,PREPING 引入了一个结构化的控制状态(Mprop),主动塑造合成练习分布,以最大化工具覆盖率和可行性,同时最小化冗余。
- 验证门控准入: 该框架在不可行的合成轨迹污染求解者记忆之前显式地将其过滤掉,防止提炼出误导性的程序指导。
- 成本高效的初始化: PREPING 将记忆构建从反复发生的部署时开支转变为一笔一次性的部署前投资,显著降低了冷启动阶段每个任务的成本。
4. 实验结果
PREPING 在AppWorld(有状态应用工作流)、BFCL v3(结构化函数调用)和MCP-Universe(真实的 MCP 服务器工具使用)上进行了评估。
- 性能提升: PREPING 显著优于仅依赖文档或自由形式探索的基线。
- AppWorld: 比无记忆基线(Base)高出 17.1 分。
- BFCL v3: 比 Base 高出 19.3 分。
- MCP-Universe: 比 Base 高出 5.4 分。
- 尽管在构建过程中未使用任何此类数据,但其性能达到了与利用人工定义任务或部署时用户数据的强任务知情方法(如 ACE-Offline 和 ACE-Online)相竞争的水平。
- 消融研究: 性能提升是由验证门控准入和提议者侧控制的结合驱动的。移除验证器会导致记忆污染;移除提议者记忆会导致冗余或不可行的练习。
- 冷启动缓解: 当用于初始化在线学习(PREPING+ACE)时,该框架显著降低了早期失败率。在 AppWorld 上,它一部署就达到了 ACE-Online 在 58 个任务后达到的工具覆盖率,而 ACE-Online 需要 58 个任务才能达到相同的覆盖率。
- 成本降低: 与在线记忆构建(ACE-Online)相比,PREPING 将部署时成本降低了AppWorld 上 2.99 倍和BFCL v3 上 2.23 倍,因为它避免了在用户交互期间反复调用记忆更新。
- 泛化性: 该方法在不同骨干模型(GPT-5.1、GPT-OSS-120B、Qwen3-235B)上表现良好,表明其优势源于构建过程而非特定的模型架构。
5. 意义与主张
本文主张,代理记忆不必被动地从部署时的交互中积累。相反,它可以通过部署前受控的、基于环境的合成练习来主动准备。
- 实际影响: PREPING 为没有历史任务数据的新环境中的“冷启动”问题提供了可行的解决方案。它允许代理带着可复用程序的“剧本”进行部署,提高即时性能并降低在线适应的成本。
- 适度主张: 作者指出,该方法假设可以访问足够详细的 API 或工具文档,以便为合成任务提供根基。他们承认,在文档匮乏的环境中,生成有根基的合成任务的可行性可能受限。本文并不声称能解决完全无文档环境的记忆构建问题,而是针对那些拥有结构化接口(如 MCP 服务器)且文档可用但任务分布未知的情况。
总之,PREPING 证明,通过联合控制合成任务的生成和轨迹的存储选择,代理可以在没有先前人工任务数据的情况下构建有效的程序性记忆,从而弥合离线准备与在线适应之间的差距。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。