← 最新论文
🤖 machine learning

When Does Continual Learning Require Learning

本文认为,大语言模型的持续学习必须围绕着在空间和时间变化中提升能力进行重构,并通过一个统一的评估协议证明,没有任何单一方法能在所有场景下都表现卓越,且最优策略——无论是更新模型权重还是使用外部脚手架——从根本上取决于环境变化的特定模式。

原作者: Anne Harrington, Nayan Saxena, Michael Murphy, Anastasia Borovykh, Zeyu Yun, Sridhar Kamath, Ara Eindra Kyi, Trevor Darrell, Jitendra Malik, Yutong Bai

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Anne Harrington, Nayan Saxena, Michael Murphy, Anastasia Borovykh, Zeyu Yun, Sridhar Kamath, Ara Eindra Kyi, Trevor Darrell, Jitendra Malik, Yutong Bai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它知道直到某个特定日期的所有事情。你想随着世界的变化不断教它新知识,同时又不让它忘记旧知识,也不让它感到困惑。长期以来,科学家们一直认为最大的问题仅仅是“遗忘”——就像一个学生为了历史考试而学习,然后立刻就忘了怎么做数学题。但这篇文章,题为《持续学习何时需要学习》(When Does Continual Learning Require Learning),认为真正的挑战要有趣得多:在于如何根据世界变化的不同方式,让机器人进行学习。

作者设置了一个巨大的游乐场,包含四种不同类型的“世界变化”来测试八种不同的学习策略。他们并非凭空猜测;他们使用了一个特定的机器人大脑(Qwen3-8B)进行了真实的实验,并观察了究竟发生了什么。以下是他们的发现,按世界变化的四种方式进行分类:

1. “新学科”挑战(空间维度)

想象你的机器人朋友非常擅长修理汽车,但突然间你要求它烹饪意大利菜,稍后又要求它进行外科手术。这些是完全不同的技能。

  • 测试: 他们教机器人三个完全无关的任务:使用工具、金融数学和生物学。
  • 结果: 一些方法,比如提示词优化(通过聊天消息告诉机器人新指令),就像短跑运动员一样。它们学习新任务的速度极快。但一旦进入下一个任务,它们在之前任务上的表现就会大幅下降。这就像一个短跑运动员,虽然能跑出百米纪录,但跑完之后立刻就摔倒了。
  • 赢家: 那些真正重写机器人大脑的方法(被称为基于蒸馏的方法,如 SDFT 和 SDPO)虽然速度较慢,但更加稳健。它们能够随着时间的推移积累知识。值得注意的是,SDFT 是唯一一种在所有三个任务上的得分都达到或高于初始水平的方法,它成功地在增加新技能的同时保留了旧技能。

2. “事实更新”挑战(时间维度:离散型)

现在想象机器人知道“法国的首都是巴黎”。但随后,在一种奇特的命运转折下,首都在实际情况中变成了里昂(我们假设一下!)。机器人需要仅更新这一个事实,而不必忘记巴黎曾是首都,或者伦敦是英国首都这一事实。

  • 测试: 他们给机器人输入了一系列维基百科更新,其中的特定事实每月都会发生变化。
  • 结果: “短跑选手”(提示词优化)在立即学习新事实方面表现出色。它们把“里昂”写进了指令里,任务完成。但在这样做时,它们不小心破坏了其他并未改变的事实,比如德国的首都是哪里。它们更新得过于急切了。
  • 惊喜: 那些重写大脑的方法(SDFT 和 SDPO)在这里反而遇到了困难。它们试图将新事实与旧事实融合,结果导致了那些本应保持稳定的事实的准确性下降。
  • 真正的英雄: 其中一种使用强化学习(GRPO)的具体方法,是唯一一种能够在更新事实为“里昂”的同时,不让其稳定事实向相反方向偏移的权重更新方法。不过值得注意的是,上下文压缩方法(如 Cartridges)在保持稳定事实方面其实是最干净利落的,即便它们对新事实的学习能力并不强。

3. “噪声趋势”挑战(时间维度:漂移型)

想象你正试图根据一份长达 10,000 字的财务报告来预测股票会上涨还是下跌。市场的规则随着年份缓慢变化。有时一个词组意味着“买入”,而五年后,同一个词组可能意味着“卖出”。信号是微弱且带有噪声的。

  • 测试: 他们逐年向机器人输入 2015 年到 2020 年的财务报告,并要求它预测未来。
  • 结果: “短跑选手”(提示词优化)试图寻找简单的规则,比如“如果出现‘风险’这个词,就卖出”。但这些规则只是针对那一年的幸运猜测。当市场变化时,机器人完全失败了。
  • 赢家: 蒸馏方法(SDFT)在这方面表现得非常好,它在保持过去表现稳定的同时,维持了预测未来年份的能力。然而,上下文压缩方法(Cartridges)实际上是测试中最稳定的方法,它在整个链条中始终保持着相近的准确率,既没有退化也没有过拟合。它就像一位睿智的老水手,知道海洋的变化是缓慢的,而不是在每一波浪潮面前都感到恐慌。

4. “智能体”挑战(时间维度:累积型)

最后,想象机器人正在玩一个游戏,它必须执行一系列步骤,比如“创建一个标签,重命名它,然后发送电子邮件”。陷阱在于,机器人的自身行为会改变下一步的游戏状态。如果它在第一步出错,第二步就会变得不可能。

  • 测试: 他们让机器人玩一个网页任务链(如管理电子邮件),其中任务链的长度从 1 步增长到 10 步。
  • 结果: 如果没有任何学习,机器人在经过短短几步后就会崩溃。但当他们让机器人从过去的尝试中学习(无论是通过更新大脑还是通过保留一份“笔记手册”),它的表现就会好得多。
  • 代价: 即便有了学习,随着链条变长,机器人的表现仍然会变差。当达到 10 步时,成功率显著下降。这表明,虽然学习有所帮助,但在游戏变得复杂时,机器人能承载的记忆量是有限的。

核心启示

该论文指出,并没有一种单一的“万能灵药”可以教机器人如何永远学习下去。

  • 如果世界的变化是通过赋予你新技能,你需要缓慢而稳健地重构大脑(具体使用像 SDFT 这样的方法)。
  • 如果世界的变化是通过更新特定事实,你需要一种能够进行外科手术式大脑编辑的方法(如 GRPO),或者使用外部记忆来避免破坏其他事物。
  • 如果世界的变化是缓慢且带有噪声的趋势,你需要一种能够忽略噪声并找到稳定模式的方法(如 Cartridges 或 SDFT)。
  • 如果世界的变化是累积状态(如一场长游戏),你需要经验,但即便如此,随着游戏的进行,难度也会越来越大。

作者并非仅仅在猜测;他们在数千个案例中进行了测量。他们发现,不同类型的变化需要截然不同的学习方式。这不仅仅是关于“学习更多”,而是关于当游戏的规则发生转变时,如何去学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →