← 最新论文
🤖 machine learning

Balancing Plasticity and Stability with Fast and Slow Successor Features

本文表明,在自然主义且持续变化的环境中,通过多时间尺度突触巩固来稳定后继特征的表现优于专注于可塑性的方法,这表明在深度强化学习中保持预测表征对于平衡稳定性与适应性至关重要。

原作者: Raymond Chua, Doina Precup, Blake Richards

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Raymond Chua, Doina Precup, Blake Richards

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在学习如何行走。在一个完美的世界里,地面总是平坦的,你的鞋子从未改变,你的双腿大小也保持不变。但在现实世界中,情况错综复杂。有时地面变得湿滑,有时结冰,有时你的鞋子变重或变轻。即使脚下的地面在缓慢变化,你也必须保持行走而不跌倒。

本文探讨了一个人工智能(AI)领域的大问题:当周围的世界持续、缓慢地变化时,我们如何教导机器人(或智能体)持续学习?

以下是他们发现的拆解,使用简单的类比来说明。

核心难题:“稳定性与可塑性”的困境

将智能体的大脑想象成一名正在记笔记的学生。

  • 可塑性是快速写下笔记的能力。如果学生过于可塑,他们会迅速记下所有新内容,但立即忘记昨天写下的东西。
  • 稳定性是妥善保存旧笔记的能力。如果学生过于稳定,他们能完美记住一切,却无法学习新事物,因为他们拒绝修改笔记。

大多数 AI 研究关注的是突变(例如学生突然从数学课转到艺术课)。但现实世界更像是一种缓慢的漂移(例如天气在一周内逐渐变冷)。作者发现,在这些缓慢漂移的情境中,稳定性才是真正的英雄。试图表现得“超级灵活”(重置大脑部分)的智能体实际上失败了。它们需要在缓慢适应的同时,牢牢掌握已有的知识。

解决方案:将“后继特征”作为地图

作者并没有仅仅尝试让 AI 的大脑更稳定,而是改变了 AI记忆的内容

想象你在城市中导航。

  • 标准 AI(Q 值):这就像死记硬背具体的逐行转向指令:“在红房子处左转,然后在面包店处右转。”如果面包店搬走了,你的指令就毫无用处。
  • 后继特征(SFs):这就像记忆城市的布局以及地点之间的关系。“面包店通常位于公园附近。”如果面包店搬走了,你仍然知道公园在那里,并且可以推断出面包店现在相对于公园的位置。

本文认为,稳定一个“关系地图”(后继特征)远比稳定一份具体的指令列表要容易得多。

秘密武器:“快与慢”的记忆系统

作者将这些“地图”与一个名为突触巩固的生物学概念相结合。他们构建了一个像一系列不同大小的桶组成的链式记忆系统:

  1. 快桶(可塑性):这是一个小敞口杯。它立即捕捉新信息。它变化迅速,允许 AI 对当下湿滑的地面做出反应。
  2. 慢桶(稳定性):这些是连接在杯子上的大重桶。水(信息)从杯子缓慢流入桶中。一旦水进入桶中,就会停留很长时间。即使天气变化,这也保留了城市的“地图”。

通过拥有多个桶(时间尺度),AI 可以利用杯子对突然的打滑做出快速反应,同时将世界的长期结构安全地保存在桶中。

他们的发现

他们通过两种方式测试了这一点:

  1. 湿滑房间:智能体必须在地板随机结冰导致其向错误方向滑动的房间中导航。
  2. 机器人行走者:一个机器人(如人形机器人或猎豹)必须在自身体重缓慢变化(变重或变轻)的情况下行走。

结果:

  • 稳定性获胜:试图不断“重置”大脑以保持灵活性的智能体表现不佳。它们忘记了太多。
  • 地图胜过指令:稳定了“地图”(后继特征)的智能体,比那些仅仅试图稳定“指令”(标准 Q 值)的智能体表现好得多。
  • 多速系统最佳:在“地图”(后继特征)上使用“快与慢”桶(突触巩固)的系统是明确的赢家。它学习得最快,且没有忘记旧规则。

结论

当世界缓慢而自然地变化时,你不需要一个不断擦除黑板的大脑。你需要一个对即时变化具有快速反应时间,但拥有深厚、缓慢记忆以保持大局稳定的大脑。通过教导 AI 记忆世界的“结构”而不仅仅是具体结果,并通过多速记忆系统保护这种结构,我们可以构建出能够适应漂移世界而不会分崩离析的智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →