← 最新论文
🤖 machine learning

Learning While Acting: A Skill-Enhanced Test-Time Co-Evolution Framework for Online Lifelong Learning Agents

本文提出了 LifeSkill,这是一个两阶段强化学习框架,它通过验证器引导的技能提取和在线技能内化,使在线终身学习智能体能够将测试时反馈持续内化到其参数中,从而克服了静态检索式方法的局限性,并显著提升了在长程任务上的性能。

原作者: Bo Mao, Jie Zhou, Yutao Yang, Xin Li, Xian Wei, Qin Chen, Xingjiao Wu, Liang He

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Bo Mao, Jie Zhou, Yutao Yang, Xin Li, Xian Wei, Qin Chen, Xingjiao Wu, Liang He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人玩一款复杂的视频游戏。在旧的方法中,如果机器人失败了一个关卡,它只会是在笔记本上写下一条笔记:“不要在这里跳跃”,然后在下次尝试时试图记住这条笔记。机器人的大脑(其内部代码)从未真正改变;它只是依赖于翻阅笔记本来避免错误。

论文 LifeSkill 提出了一种新的训练 AI 智能体的方法,使其不仅仅是“记住”错误,而是通过改变其大脑的工作方式来真正地“学习”错误。

以下是该系统的运作方式,分为简单的步骤:

1. 问题所在:“笔记本”的局限性

目前的 AI 智能体就像是那些被禁止预习教材的学生;他们只能在考试期间查看一张“小抄”(记忆库)。

  • 问题: 如果 AI 失败了一项任务,它可能会写下一段反思,比如“我应该更小心一点”。但这种反思只是作为文本留在笔记本里。AI 实际的“大脑”(其参数)并没有改变。它每次都必须不断地阅读这本笔记本,随着笔记本变得巨大,这会变得既混乱又缓慢。

2. 解决方案:“在行动中学习”

作者创建了一个名为 LifeSkill 的两步过程。把它想象成一位教练和一名学生在实时共同工作。

步骤 A:教练寻找正确的教训(验证器引导的技能学习)

当 AI(学生)失败一项任务时,它需要弄清楚为什么

  • 旧方法: AI 可能会仅仅猜测一个听起来很聪明的理由,比如“我需要更有礼貌”,即使这对于解决数学问题毫无帮助。
  • LifeSkill 方法: AI 会生成几种可能的“教训”(技能)。然后,一个严格的验证器(Verifier,类似于裁判)会对每个教训进行测试。
    • 类比: 想象 AI 尝试修理一辆坏掉的汽车。它提出了三种工具:锤子、扳手和螺丝刀。裁判尝试用每种工具去修理汽车。如果扳手真的修好了引擎,AI 就会因为提出了“使用扳手”而获得奖励。如果锤子只是制造了噪音,它就得不到任何奖励。
    • 结果: AI 学习提取有用的技能(如“使用扳手”),而不是仅仅提取听起来像模像样的文本。

步骤 B:学生内化教训(在线技能内化)

一旦 AI 找到了有效的技能(例如,“使用扳手”),它不应该只是在下次使用时把这个技能写在笔记本里,它应该将其内化

  • 神奇之处: 系统会提取那个使用了“扳手”技能的成功尝试,移除“使用扳手”这一指令,然后训练 AI 的大脑在没有该指令的情况下解决问题。
  • 类比: 想象一位厨师学习烤蛋糕。起初,他们需要一张写着“加入糖”的食谱卡。一旦他们掌握了,你就把卡片拿走。如果他们在没有卡片的情况下仍然能完美地烤出蛋糕,说明他们真正掌握了这项技能。
  • 结果: AI 的大脑进行了更新。它不再需要查阅笔记本中的教训;知识已经成为了它 DNA 的一部分。

3. 结果:更聪明、更快速的学习者

研究人员在名为 LifelongAgentBench 的基准测试上测试了该系统,该测试涉及数据库管理、操作系统和知识图谱等任务。

  • 得分: LifeSkill 以显著优势击败了所有其他方法(平均性能提升了 7 个点)。
  • 获胜原因:
    • 无需训练的方法(仅使用笔记本)因为无法改变其大脑而陷入困境。
    • 其他训练方法虽然尝试学习,但没有一种好的方式来弄清楚从失败中究竟该学到什么。
    • LifeSkill 取得了成功,因为它结合了寻找正确的教训(通过验证器)与内化该教训(通过内化)。

总结

简而言之,LifeSkill 将一个依赖于不断堆叠的小抄的 AI 智能体,转变为一个在工作中真正学习并适应的大师。它让 AI 不再仅仅是“检索”过去的经验,而是开始“内化”这些经验,使智能体随着时间的推移变得更聪明、更高效,而无需随身携带大量的文本库。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →