← 最新论文
🤖 machine learning

Overcoming Catastrophic Forgetting in Visual Continual Learning with Reinforcement Fine-Tuning

本文介绍了保留感知策略优化(RaPO),这是一种新颖的强化微调方法,它通过保留奖励塑造和跨任务优势归一化来解决轨迹级漂移不可知性问题,从而在视觉持续学习中缓解灾难性遗忘,并实现了优于现有方法的性能。

原作者: Meng Lou, Hanzhong Guo, Linwei Chen, Yizhou Yu

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Meng Lou, Hanzhong Guo, Linwei Chen, Yizhou Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对论文《通过强化微调克服视觉持续学习中的灾难性遗忘》的解释。

核心问题:“金鱼”式人工智能

想象你正在教一个非常聪明的机器人识别不同种类的鸟。

  • 周一: 你给它看一张麻雀的图片。它完美地学会了。
  • 周二: 你给它看一张的图片。它学会了鹰,但突然忘记了麻雀长什么样。它认为麻雀只是一种小鹰。
  • 周三: 你给它看一只猫头鹰。现在,它既忘记了麻雀,也忘记了鹰。

这被称为灾难性遗忘。这个机器人就像一条只有 3 秒记忆的金鱼;每学到一个新东西,它就会把大脑里的旧东西全部清空。这对于需要在现实世界中持续学习的人工智能来说,是一个巨大的问题。

当前的解决方案(及其不完美之处)

研究人员尝试了两种主要方法来解决这个问题:

  1. 监督微调(SFT): 这就像一位严厉的老师说:“把答案原封不动地背下来。”这种方法效果尚可,但机器人仍然会很快忘记旧答案。
  2. 强化微调(RFT): 这就像一位教练说:“尝试不同的方法来解决这个问题,如果你做对了,我就给你奖励。”最近的研究表明,这种“教练”方法(具体是一种称为GRPO的技术)比“老师”方法更擅长记忆。

然而,本文的作者发现了一个陷阱:即使“教练”方法(GRPO)在任务变得非常困难时,仍然会遗忘大量内容。它比“老师”方法好,但并非完美。

发现:“漂移”侦探

研究人员问道:为什么“教练”方法仍然会遗忘事物?

他们仔细观察了机器人的思考方式。他们注意到一种奇怪的现象,称为轨迹级漂移无差别性

  • 类比: 想象机器人正在参加考试。它可以用两种不同的方式正确解答当前的问题。
    • 方式 A: 它使用的逻辑与它昨天解题时的逻辑非常相似。
    • 方式 B: 它使用了一种完全狂野、全新的逻辑,与昨天的逻辑截然不同。
  • 问题: 当前的“教练”(GRPO)只关注最终得分。如果方式 A 和方式 B 都答对了问题,教练会给它们相同的奖励。它并不在意方式 B 正在“漂移”,偏离了机器人的旧知识。
  • 结果: 随着时间的推移,机器人会不断选择“狂野”的方式(方式 B),因为它们能得分。最终,它漂移得离原始知识太远,以至于忘记了过去所知道的一切。

解决方案:RaPO(保留感知策略优化)

为了解决这个问题,作者创造了一种名为RaPO的新方法。把 RaPO 想象成一位“智能教练”,它关心两件事:答对答案 以及 保持与昨天的自己一致。

RaPO 有两个主要技巧:

1. “记忆锚点”(保留奖励)

  • 工作原理: 每次机器人尝试解决问题时,RaPO 都会检查:“这种新的思考方式与你昨天的思考方式有多相似?”
  • 类比: 想象你正在学习一个新的舞蹈动作。
    • 如果你学习的动作自然地延续了你之前的风格,教练会给你额外加分
    • 如果你学习的动作完全混乱,破坏了你之前的节奏,即使你仍然跳完了舞,教练给你的分数也会更少
  • 目标: 这鼓励机器人在学习新事物时,不要完全抛弃旧习惯。它温和地引导机器人保持靠近其“记忆锚点”。

2. “稳健之手”(跨任务优势归一化)

  • 工作原理: 当机器人从学习“鸟类”切换到学习“汽车”时,任务的难度会突然改变。这可能会让机器人的学习过程感到困惑,使其在过于自信和过于不确定之间剧烈摇摆。
  • 类比: 想象你在开车。突然,你从平坦的高速公路切换到颠簸的土路。如果汽车的悬挂系统对每一个颠簸都做出即时反应,你就会撞车。
  • 修正: RaPO 使用了一种“减震器”(指数移动平均)。它不是对当下的颠簸做出反应,而是随时间平滑这些颠簸。这使机器人的学习节奏保持稳定,即使任务发生剧烈变化。

结果

研究人员在多种视觉任务上测试了 RaPO:

  • 识别新类型的图像(图像分类)。
  • 在图片中寻找物体(目标检测)。
  • 理解视频(视频分类)。

结果:
RaPO 是明显的赢家。它学习新事物的速度与旧方法一样快,但遗忘的内容少得多

  • 在一次测试中,旧方法遗忘了约**20%**的学习内容。
  • RaPO 仅遗忘了约4%

总结

这篇论文不仅仅是在说“人工智能变得更聪明了”。它具体解决了如何教导人工智能在学习新事物时不删除旧记忆的问题。

他们发现,仅仅奖励人工智能的“正确性”是不够的。你还必须奖励它与过去的自己保持一致性。通过在 learning 过程中加入“记忆检查”和“稳定器”,他们创造了一种能够在成长的同时不失去自我身份的人工智能。

注意: 该论文完全专注于计算机视觉任务(图像和视频),并未声称这些方法目前用于医疗诊断、监控或其他特定的现实世界应用。这是一项基础性研究,旨在帮助未来的人工智能系统实现持续学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →