← 最新论文
🤖 AI

Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents

本文证明,通过将静态模型与一个将部署反馈蒸馏为可检索自然语言规则的外部记忆系统相结合,权重冻结的 AI 智能体可以实现显著的持续学习提升,从而使其能够在无需模型重训的情况下解决此前难以处理的任务。

原作者: Valentin Tablan, Scott Taylor, Kristoffer Bernhem

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Valentin Tablan, Scott Taylor, Kristoffer Bernhem

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:每当你试图解决一个谜题时,一旦计时器停止,你就会忘记规则。如果你今天解决了一个难题,明天即使面对完全相同的问题,你也会从零开始。这正是许多人工智能(AI)智能体目前的现实。它们构建在“冻结”的大脑之上——即在发布时就已经定型的强大模型。由于改变大脑的连接方式既昂贵、有风险又缓慢,它们无法在实时过程中从错误中学习。然而,在现实世界中,这些智能体不断获得反馈。客户可能会说:“那样奏效了!”或者人类可能会纠正一个错误并说:“正确的方法是这样的。”科学家们正在问的一个重大问题是:我们能否通过让这些冻结大脑的智能体阅读一份关于其自身过去经历的“小抄”,而不实际改变它们的大脑,从而教它们变得更聪明?

这篇题为《在工作中学习》(Learning on the Job)的论文探讨了一种巧妙的变通方法。研究人员并没有尝试重塑 AI 的大脑,而是给了智能体一个外部笔记本——一个记忆系统。当智能体完成一项任务后,它会观察结果(是赢了还是输了?),并将一条简短的自然语言规则写入这个笔记本中。例如,“如果客户要求退款,先检查日期。”稍后,当智能体面临类似情况时,它会在行动前查看自己的笔记本。这项研究在一个银行模拟实验中进行了测试,在该实验中,AI 必须通过处理复杂的规则来帮助客户。他们发现,仅仅通过阅读自己的笔记,智能体在工作中的表现就有了显著提升。一个仅通过“胜/负”信号进行学习的智能体,其成功率提高了 1.6 倍;而一个通过详细纠正进行学习的智能体,其成功率则提高了 2.6 倍。更酷的是,由一种类型的 AI 编写的笔记对另一种完全不同的 AI 也是有用的,这证明了这种“经验”可以像借阅图书馆书籍一样被共享。

问题所在:AI 健忘症

把当今最先进的 AI 智能体想象成极具天赋但极其健忘的实习生。你雇佣了他们,给他们提供了大量的政策手册(在本研究中约为 700 份文件)供其参考,并让他们尝试帮助客户。如果他们解决了一个难题,那太棒了!但一旦对话结束,他们的短期记忆就会被清空。如果同一个难缠的客户在明天再次来电,智能体会完全忘记昨天发生了什么。它必须从零开始。

这种健忘症源于架构设计。这些智能体运行在具有“冻结权重”的模型上。想象一下,模型的脑部是一个由粘土制成的巨大且复杂的雕塑。一旦雕塑被烧制并硬化(部署),你就不能在不熔化整个雕塑并重新开始的情况下,对其进行切割或添加新的粘土。熔化它是危险的(它可能会忘记之前知道的一切),也是昂贵的。因此,在现实世界中,这些智能体保持着冻结状态。它们在工作的最后一天与第一天一样具备相应的能力。

解决方案:外部笔记本

研究人员问道:如果智能体不需要改变大脑也能学习呢?如果它只需要一个笔记本呢?

他们将冻结的 AI 与一个名为 Spark 的系统配对。把 Spark 想象成一个共享的、神奇的图书馆,智能体可以在其中编写和阅读笔记。当一个智能体完成一项任务时,它不会仅仅丢弃这段经历。相反,它会反思发生了什么,并将一条“规则”写入图书馆。

  • “经验”模式: 智能体得到一个简单的赞成或反对(一个比特的判定)。它必须自己摸索出教训。“我尝试了 X 但失败了。下次我应该避免 X。”
  • “指令”模式: 智能体得到赞成/反对的同时,还会得到正确答案。“我尝试了 X 但失败了。正确的方法是 Y。”

智能体将这些教训写成简单的自然语言规则,例如:“当客户要求转账时,务必先检查每日限额。”这些规则被存储在 Spark 图书馆中。下次智能体面对客户时,它会在行动前搜索图书馆中的相关规则。

实验:赌在记忆上

为了测试这一点,团队使用了一个名为 τ-bench 的困难银行基准测试。想象你在玩一款电子游戏,扮演一名银行柜员。“客户”由其他 AI 模拟,他们拥有隐藏的目标和棘手的请求。智能体必须通过搜索大量的政策文件来弄清银行的规则。这很难;即使是最优秀的 AI 模型,在第一次尝试时也只能解决大约 25% 的任务。

研究人员使用两种不同的 AI 模型进行了实验:

  1. Mistral Large: 一个强大的开源模型,企业可以在自己的服务器上运行。
  2. Claude Sonnet 5: 一款顶尖的前沿模型。

他们为每种模型测试了三种场景:

  1. 基准线(Baseline): 智能体拥有政策库但没有记忆。它在每次尝试之间都会忘记一切。
  2. 经验(Experience): 智能体拥有政策库和记忆笔记本,但仅通过简单的“胜/负”信号进行学习。
  3. 指令(Instruction): 智能体拥有政策库、记忆笔记本,并且在失败后不仅能得到“胜/负”信号,还能得到正确方案。

结果:从零到英雄

结果令人震惊。使用记忆笔记本的智能体在工作中表现得好得多,而且它们是在没有改变其冻结大脑中的任何一个神经元的情况下实现的。

  • 纠正的力量: 对于 Mistral Large 模型,“指令”组(从纠正中学习)在首次尝试时解决的任务量是基准线的 2.6 倍。它们成功解决了 22 个出 84 个 基准线智能体无论尝试多少次都无法解决的任务。
  • 经验的力量: 即使只是通过简单的“胜/负”信号学习也有帮助。“经验”组比基准线提高了 1.6 倍
  • 学习曲线: 在开始阶段,所有的智能体表现都一样糟糕,因为笔记本是空的。但随着试验的进行,拥有笔记本的智能体变得越来越聪明。基准线智能体的表现保持平稳,而学习型智能体则随着每一次尝试不断攀升。
  • 跨模型魔力: 研究人员做了一件非常酷的事情。他们将 Mistral Large 模型构建的笔记本交给 Claude Sonnet 5 模型去阅读(反之亦然)。尽管它们是不同的模型,但笔记仍然非常有用!当阅读 Claude 的笔记时,Mistral 模型的成功率显著提高。这证明了存储在笔记本中的知识不仅仅是“Mistral 的风格”;它是通用的、有用的知识,任何智能体都可以使用。

为什么这很重要

这篇论文提出了一种无需承担高昂成本和风险进行重新训练即可让 AI 变得更聪明的新方法。与其尝试熔化并重塑 AI 的大脑,不如仅仅给它一个更好的记忆方式。

该研究还排除了一些可能性。例如,他们检查了智能体是否只是在“缓存”答案(即死记硬背特定谜题的精确解法)。他们发现事实并非如此。智能体学习的是 规则(如“检查日期”),这些规则能帮助它们解决 新的 变体问题。他们还表明,这种学习并不会让智能体在原本擅长的领域变差;它们在获得新技能的同时保留了旧有的技能。

简而言之,这项研究表明,对于冻结的 AI 智能体来说,它们每天获得的反馈——无论是简单的“做得好”还是详细的纠正——都足以让它们成为终身学习者,只要它们有一个记录所学知识的地方。它将单个智能体的经验转化为一种共享的组织资产,让整个系统通过一次次的笔记记录变得越来越聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →