← 最新论文
🤖 machine learning

Continual Learning in Transition

本文提出了一个三轴框架(何时、如何以及何处)来刻画持续学习中的范式转移,即从传统的以参数为中心的适应转向一种更广泛的系统级演进,该演进纳入了策略内机制、测试时训练以及外部结构组件。

原作者: Zhiyan Hou, Dan Zhang, Tao Feng, Liyuan Wang, Wei Li, Xiangzhao Hao, Hongyan An, Junfeng Fang, Haokai Ma, Zhaohui Xu, Haiyun Guo, Jinqiao Wang, Tat-Seng Chua

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiyan Hou, Dan Zhang, Tao Feng, Liyuan Wang, Wei Li, Xiangzhao Hao, Hongyan An, Junfeng Fang, Haokai Ma, Zhaohui Xu, Haiyun Guo, Jinqiao Wang, Tat-Seng Chua

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人玩世上所有的电子游戏。在旧时代,科学家们认为实现这一目标的唯一方法是在机器人的脑袋里构建一个单一的、超级聪明的“大脑”。他们会给它一个关卡,让它学习,然后给它下一个关卡。但问题在于:每当机器人学习一个新游戏时,它似乎就会忘记如何玩旧的游戏。这就像是在日记里写新的章节,但前几页的墨水却不断晕染并消失了。这个被称为“灾难性遗忘”的问题,曾是被称为**持续学习(Continual Learning)**领域的一个大难题。

长期以来,解决方案似乎很简单:只需微调机器人的内部大脑(其“参数”),使其适应新游戏而不抹去旧知识。但现在,我们正处于大规模、超强力 AI 模型的时代,这些模型可以聊天、编写代码并解决复杂的谜题。这些模型如此庞大且复杂,以至于旧的“仅仅微调大脑”的方法不再奏效了。我们需要一种新的思考方式。与其仅仅询问如何更新大脑,我们更需要问:机器人应该在何时学习?它应该把知识存在哪里?以及它应该如何进行更新?

这篇题为**《转型中的持续学习》(Continual Learning in Transition)**的论文,就像是这张新领域地图。作者们认为,我们正在远离“机器人的大脑是学习发生唯一场所”的观念。他们指出,要让 AI 真正成为通用智能——即像人类一样能够适应变化的世界——我们需要观察整个系统。这不仅仅关乎大脑,还关乎机器人的笔记本、工具箱和规则手册。该论文综述了大量的最新研究,表明学习不再是一个在机器人上岗前发生的单一事件。相反,学习是一个持续的过程,发生在部署前、部署期间,甚至部署之后,它不仅使用大脑,还使用外部记忆和工具。

三个大问题:何时、何处与如何

作者提出了一个通过三个简单问题来观察所有不同方法的新视角。把它想象成是在整理一个关于机器人如何学习的海量图书馆。

1. 何时:学习的时间线
在旧时代,学习发生在一个大的区块中:你训练模型,然后把它派出去工作,任务就结束了。模型是冻结的。

  • 新视角: 学习现在是一场马拉战,而不是短跑。它分为三个不同的阶段:
    • 预训练(Pre-training): 机器人在处理特定工作之前,正从海量的数据流中学习,就像在开始特定工作前读完整个互联网。
    • 后训练(Post-training): 在初始学习之后,机器人进行微调。它学习如何遵循指令、变得礼貌或解决特定的谜题。这就像是一个专门的训练营。
    • 推理时(Inference-time,即“当下”): 这是重大的变化。机器人在工作进行学习。如果它遇到了新情况或得到了反馈,它可以实时更新自己。这就像一个学生不仅在考试前学习,而且在考试过程中也会不断学习并调整答案。

2. 何处:知识的存储
传统上,所有知识都存储在机器人的大脑内部(其内部参数)。如果你想增加一个新事实,你就必须重写大脑。

  • 新视角: 大脑不再是唯一的存储单元。作者引入了**“束缚/支撑”(Harness)**的概念,即大脑之外机器人所使用的所有东西。
    • 记忆(Memory): 想象机器人随身携带的一个笔记本。它可以把事实、对话或经历记录在这里,而无需改变大脑。它可以稍后阅读这个笔记本以唤起记忆。
    • 技能(Skills): 把这些看作工具箱里的工具。机器人不再是将一项新技能硬编码进大脑,而是可以拿起一个新工具(如代码生成器或计算器)并使用它。它甚至可以在过程中构建新工具。
    • 协议(Protocols): 这些是机器人遵循的规则书或剧本。与其让机器人的大脑硬编码游戏的规则,不如将规则写在一张纸上,由机器人阅读并更新。
    • 转变: 论文指出,能力正在向外扩散。它不再仅仅存在于大脑中,而是分布在脑、笔记本、工具箱和规则手册之中。

3. 如何:更新的方法
机器人究竟是如何学习的?

  • 旧方式(离策学习/Off-Policy): 机器人从静态的数据集中学习,就像学习别人写的教科书。它观察旧的例子并试图去拟合它们。这往往会导致遗忘,因为新数据可能会与旧数据产生冲突。
  • 新方式(在策学习/On-Policy): 机器人从自己的行动中学习。它尝试做某事,观察结果,并从那次特定的经验中学习。这就像是通过实际骑自行车并摔倒来学习骑车,而不是仅仅阅读手册。这有助于机器人保持一致性并减少遗忘。
  • 超越梯度(Beyond Gradients): 还有一些方法不使用标准的“数学化”学习方式(反向传播)。
    • 模型合并(Model Merging): 想象将两个不同的已训练大脑在数学上合并成一个超级大脑,而无需重新训练。
    • 提示词演化(Prompt Evolution): 与其改变大脑,不如改变你给它的指令(提示词)。机器人通过演化你与它交流的方式来进行学习。
    • 零阶优化(Zeroth-Order): 这是一种高级说法,指机器人通过猜测和检查来进行学习,而不需要计算其误差的精确数学斜率。

为什么这很重要:宏观图景

作者认为我们正处于一个转折点。我们过去认为解决“灾难性遗忘”只是关于寻找一种更好的数学技巧来更新大脑。但现在,他们认为,解决方案要宏大得多。这关乎系统级的适应

他们指出,如果机器人无法自行管理,仅仅扩大机器人的“笔记本”(记忆)或给予更多“工具”(技能)是不够的。目前,人类通常需要手动更新这些笔记本和工具。论文建议,要让 AI 达到“人工智能通用智能”(AGI)——即能像人类一样真正适应变化的水平——机器人需要能够自动管理自己的记忆、技能和规则。

论文还强调了一些挑战。例如,如果机器人过度依赖其“笔记本”(上下文窗口),一旦笔记本太满,它可能会遗忘事物。如果它过度依赖“大脑”,在学习新事物时可能会忘记旧事物。理想的未来是一个机器人知道何时在笔记本上记录,何时构建新工具,以及何时永久更新其大脑的系统。

未来走向何方?

作者持谨慎乐观的态度。他们并不声称我们已经解决了一切。事实上,他们指出许多这些新方法仍处于早期阶段。我们还没有一个完美的系统能够无缝地在脑、笔记本和工具之间移动知识。

他们建议,未来的 AI 研究不应仅仅关注如何让大脑变得更大。相反,我们需要弄清楚如何协调所有这些不同的部分。这就像建造一座城市:你不仅要盖一栋更大的房子(大脑);你还需要修建道路、图书馆和发电厂(束缚/支撑),并搞清楚它们是如何协同工作的。

简而言之,这篇论文告诉我们,“一个大脑,一次更新”的时代已经结束了。学习的未来是一个动态的、多层次的舞蹈,AI 会利用其系统的每一个部分——从内部神经元到外部工具——来持续学习,从而适应一个永不停歇变化的世界。这是一个从“试图修复破碎的记忆”向“构建一个随经验增长而不断生长的鲜活系统”的转变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →