想象一下你正在教一个机器人玩一款复杂的视频游戏。在旧的方法中,如果机器人失败了一个关卡,它只会是在笔记本上写下一条笔记:“不要在这里跳跃”,然后在下次尝试时试图记住这条笔记。机器人的大脑(其内部代码)从未真正改变;它只是依赖于翻阅笔记本来避免错误。
论文 LifeSkill 提出了一种新的训练 AI 智能体的方法,使其不仅仅是“记住”错误,而是通过改变其大脑的工作方式来真正地“学习”错误。
以下是该系统的运作方式,分为简单的步骤:
1. 问题所在:“笔记本”的局限性
目前的 AI 智能体就像是那些被禁止预习教材的学生;他们只能在考试期间查看一张“小抄”(记忆库)。
- 问题: 如果 AI 失败了一项任务,它可能会写下一段反思,比如“我应该更小心一点”。但这种反思只是作为文本留在笔记本里。AI 实际的“大脑”(其参数)并没有改变。它每次都必须不断地阅读这本笔记本,随着笔记本变得巨大,这会变得既混乱又缓慢。
2. 解决方案:“在行动中学习”
作者创建了一个名为 LifeSkill 的两步过程。把它想象成一位教练和一名学生在实时共同工作。
步骤 A:教练寻找正确的教训(验证器引导的技能学习)
当 AI(学生)失败一项任务时,它需要弄清楚为什么。
- 旧方法: AI 可能会仅仅猜测一个听起来很聪明的理由,比如“我需要更有礼貌”,即使这对于解决数学问题毫无帮助。
- LifeSkill 方法: AI 会生成几种可能的“教训”(技能)。然后,一个严格的验证器(Verifier,类似于裁判)会对每个教训进行测试。
- 类比: 想象 AI 尝试修理一辆坏掉的汽车。它提出了三种工具:锤子、扳手和螺丝刀。裁判尝试用每种工具去修理汽车。如果扳手真的修好了引擎,AI 就会因为提出了“使用扳手”而获得奖励。如果锤子只是制造了噪音,它就得不到任何奖励。
- 结果: AI 学习提取有用的技能(如“使用扳手”),而不是仅仅提取听起来像模像样的文本。
步骤 B:学生内化教训(在线技能内化)
一旦 AI 找到了有效的技能(例如,“使用扳手”),它不应该只是在下次使用时把这个技能写在笔记本里,它应该将其内化。
- 神奇之处: 系统会提取那个使用了“扳手”技能的成功尝试,移除“使用扳手”这一指令,然后训练 AI 的大脑在没有该指令的情况下解决问题。
- 类比: 想象一位厨师学习烤蛋糕。起初,他们需要一张写着“加入糖”的食谱卡。一旦他们掌握了,你就把卡片拿走。如果他们在没有卡片的情况下仍然能完美地烤出蛋糕,说明他们真正掌握了这项技能。
- 结果: AI 的大脑进行了更新。它不再需要查阅笔记本中的教训;知识已经成为了它 DNA 的一部分。
3. 结果:更聪明、更快速的学习者
研究人员在名为 LifelongAgentBench 的基准测试上测试了该系统,该测试涉及数据库管理、操作系统和知识图谱等任务。
- 得分: LifeSkill 以显著优势击败了所有其他方法(平均性能提升了 7 个点)。
- 获胜原因:
- 无需训练的方法(仅使用笔记本)因为无法改变其大脑而陷入困境。
- 其他训练方法虽然尝试学习,但没有一种好的方式来弄清楚从失败中究竟该学到什么。
- LifeSkill 取得了成功,因为它结合了寻找正确的教训(通过验证器)与内化该教训(通过内化)。
总结
简而言之,LifeSkill 将一个依赖于不断堆叠的小抄的 AI 智能体,转变为一个在工作中真正学习并适应的大师。它让 AI 不再仅仅是“检索”过去的经验,而是开始“内化”这些经验,使智能体随着时间的推移变得更聪明、更高效,而无需随身携带大量的文本库。
技术摘要:LifeSkill —— 用于在线终身学习智能体的技能增强型测试时协同进化
1. 问题陈述
在动态交互环境中运行的大语言模型(LLM)智能体需要终身学习能力,以适应不断变化的任务分布并从经验中积累知识。然而,现有方法存在三个关键局限性:
- 静态参数: 大多数智能体在部署期间保持模型参数固定,仅依赖外部记忆检索(如 Synapse、AWM)来提高性能。这阻碍了在交互阶段进行真正的学习。
- 技能监督不足: 虽然智能体可以总结轨迹或对失败进行反思,但从交互反馈中提取可重用的技能缺乏可靠的、基于执行的监督。当前方法通常依赖于主观的 LLM 评判者或启发式总结,而非任务成功率。
- 外部知识表示: 获取的知识通常存储为离散的外部文本。这阻碍了模型将这些技能作为其参数化知识的一部分进行内化、组合和泛化,导致上下文膨胀,并导致无法将经验转化为持久的能力。
核心挑战在于如何使智能体能够在行动时持续改进,将测试时反馈转化为持久的参数化增长,而不单纯依赖静态推理或外部记忆检索。
2. 方法论:LifeSkill 框架
作者提出了 LifeSkill,一个旨在用于在线终身学习智能体的两阶段强化学习框架。该框架在一个任务流(Dstream)上运行,并维护两个具有相同骨干网络但参数不同的模型:
- 策略模型 (πθ): 执行任务。
- 技能提取模型 (πϕ): 从失败的交互中提炼可重用的技能。
这两个模型通过由两个关键机制组成的测试时协同进化循环进行交互:
A. 验证器引导的技能学习 (VGSL)
这一阶段解决了技能提取缺乏直接监督的问题。
- 过程: 当策略模型失败(r=0)时,技能提取模型根据失败的轨迹生成候选技能(s)。
- 评估: 该方法不使用主观的 LLM 评判者,而是通过多个技能调节后的策略展开(每个技能 Kτ 条轨迹)的平均验证器成功率来评估每个候选技能。
- 优化: 技能提取模型使用 DAPO(直接偏好优化)目标进行训练。技能的效用由其经验成功率(Ri)定义。能够带来更高验证成功率的技能会获得奖励,从而训练提取器生成基于执行(而非仅仅是文本上合理)的技能。
B. 在线技能内化 (OSI)
这一阶段解决了技能引导的探索与参数化适配需求之间的不匹配问题。
- 过程: 对于通过技能引导实现成功的轨迹(r=1),显式的技能文本从输入上下文中移除。
- 优化: 策略模型使用与该轨迹相关的验证器奖励进行更新,该奖励仅基于原始任务输入(q),而不基于技能(s)。
- 目标: 这迫使模型将技能引导探索过程中发现的推理能力和行为直接内化到其参数中。它将成功的“脚手架式”行为转化为“无脚手架”的参数化知识,从而消除了未来交互中重新生成或检索技能文本的需求。
3. 核心贡献
- LifeSkill 框架: 一种新颖的两阶段强化学习框架,使在线终身学习 LLM 智能体能够在部署期间进行改进,超越了基于外部记忆的静态参数推理。
- 验证器引导的技能学习: 一种使用基于执行的反馈(验证器成功率)而非主观评分来训练技能提取器的方法,确保提取的技能在解决任务时具有实际用途。
- 在线技能内化: 一种将成功的技能引导轨迹转化为无脚手架策略改进的机制,允许智能体将推理能力吸收进其参数中,并减少对检索文本的依赖。
- 实证验证: 通过广泛的实验证明,将基于执行的技能提取与在线参数化适配相结合,其性能优于现有的基准方法。
4. 实验结果
该框架在 LifelongAgentBench 上进行了评估,这是一个针对数据库(DB)、操作系统(OS)和知识图谱(KG)三个环境下的长程交互任务的持续适配基准。
- 性能: LifeSkill 达到了 0.59 的平均准确率,分别比最强的无需训练基准(Group Self-Consistency)高出 10 个绝对百分点,比最强的基于训练的基准(RFT)高出 7 个绝对百分点。
- 环境特性:
- DB: LifeSkill 达到 0.82(相比之下,最佳基准为 0.63)。
- OS: LifeSkill 达到 0.64(相比之下,最佳基准为 0.56)。
- KG: LifeSkill 得分为 0.32,略低于最佳无需训练基准(0.36)。作者将其归因于长程 KG 任务中二元奖励信号的稀疏性,这削弱了技能提取和内化的学习信号。
- 消融研究:
- 使用 LLM-Judge 监督取代 VGSL 会降低性能,证实了基于执行的奖励的必要性。
- 移除技能提取模型会导致最大的性能下降,突显了双模型协同进化的价值。
- 禁用 OSI 会降低性能,证明仅靠技能提取而不进行参数内化是不够的。
- 超参数: 随着测试时计算量(更多展开次数)的增加,性能有所提升,直至达到饱和点(4 次展开);此外,最优窗口大小因环境而异(DB 倾向于较小的窗口以实现快速更新;OS 倾向于较大的窗口以保证稳定性)。
5. 重要性与主张
论文声称 LifeSkill 代表了迈向真正的持续适配 LLM 智能体的重要一步。通过将技能视为一种引导探索并在随后被内化的中间学习接口,该框架弥合了经验检索与参数化学习之间的鸿沟。
作者强调,其方法使智能体能够:
- 利用可靠的、特定于任务的验证器来学习提取哪些技能。
- 在部署期间进行在线参数更新,而非仅仅依赖外部记忆。
- 在原始任务输入下内化成功的行为,从而减少对检索文本的长期依赖并缓解上下文膨胀。
这项工作表明,虽然目前的智能体可以检索经验,但 LifeSkill 展示了一条有效地将这些经验转化为持久、内化能力的路径。未来的工作方向被确定为改进在稀疏奖励、长程设置下的表现,以及降低与技能引导探索相关的测试时计算成本。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。