想象一下,你正在学习如何行走。在一个完美的世界里,地面总是平坦的,你的鞋子从未改变,你的双腿大小也保持不变。但在现实世界中,情况错综复杂。有时地面变得湿滑,有时结冰,有时你的鞋子变重或变轻。即使脚下的地面在缓慢变化,你也必须保持行走而不跌倒。
本文探讨了一个人工智能(AI)领域的大问题:当周围的世界持续、缓慢地变化时,我们如何教导机器人(或智能体)持续学习?
以下是他们发现的拆解,使用简单的类比来说明。
核心难题:“稳定性与可塑性”的困境
将智能体的大脑想象成一名正在记笔记的学生。
- 可塑性是快速写下新笔记的能力。如果学生过于可塑,他们会迅速记下所有新内容,但立即忘记昨天写下的东西。
- 稳定性是妥善保存旧笔记的能力。如果学生过于稳定,他们能完美记住一切,却无法学习新事物,因为他们拒绝修改笔记。
大多数 AI 研究关注的是突变(例如学生突然从数学课转到艺术课)。但现实世界更像是一种缓慢的漂移(例如天气在一周内逐渐变冷)。作者发现,在这些缓慢漂移的情境中,稳定性才是真正的英雄。试图表现得“超级灵活”(重置大脑部分)的智能体实际上失败了。它们需要在缓慢适应的同时,牢牢掌握已有的知识。
解决方案:将“后继特征”作为地图
作者并没有仅仅尝试让 AI 的大脑更稳定,而是改变了 AI记忆的内容。
想象你在城市中导航。
- 标准 AI(Q 值):这就像死记硬背具体的逐行转向指令:“在红房子处左转,然后在面包店处右转。”如果面包店搬走了,你的指令就毫无用处。
- 后继特征(SFs):这就像记忆城市的布局以及地点之间的关系。“面包店通常位于公园附近。”如果面包店搬走了,你仍然知道公园在那里,并且可以推断出面包店现在相对于公园的位置。
本文认为,稳定一个“关系地图”(后继特征)远比稳定一份具体的指令列表要容易得多。
秘密武器:“快与慢”的记忆系统
作者将这些“地图”与一个名为突触巩固的生物学概念相结合。他们构建了一个像一系列不同大小的桶组成的链式记忆系统:
- 快桶(可塑性):这是一个小敞口杯。它立即捕捉新信息。它变化迅速,允许 AI 对当下湿滑的地面做出反应。
- 慢桶(稳定性):这些是连接在杯子上的大重桶。水(信息)从杯子缓慢流入桶中。一旦水进入桶中,就会停留很长时间。即使天气变化,这也保留了城市的“地图”。
通过拥有多个桶(时间尺度),AI 可以利用杯子对突然的打滑做出快速反应,同时将世界的长期结构安全地保存在桶中。
他们的发现
他们通过两种方式测试了这一点:
- 湿滑房间:智能体必须在地板随机结冰导致其向错误方向滑动的房间中导航。
- 机器人行走者:一个机器人(如人形机器人或猎豹)必须在自身体重缓慢变化(变重或变轻)的情况下行走。
结果:
- 稳定性获胜:试图不断“重置”大脑以保持灵活性的智能体表现不佳。它们忘记了太多。
- 地图胜过指令:稳定了“地图”(后继特征)的智能体,比那些仅仅试图稳定“指令”(标准 Q 值)的智能体表现好得多。
- 多速系统最佳:在“地图”(后继特征)上使用“快与慢”桶(突触巩固)的系统是明确的赢家。它学习得最快,且没有忘记旧规则。
结论
当世界缓慢而自然地变化时,你不需要一个不断擦除黑板的大脑。你需要一个对即时变化具有快速反应时间,但拥有深厚、缓慢记忆以保持大局稳定的大脑。通过教导 AI 记忆世界的“结构”而不仅仅是具体结果,并通过多速记忆系统保护这种结构,我们可以构建出能够适应漂移世界而不会分崩离析的智能体。
技术摘要:利用快慢后继特征平衡可塑性与稳定性
问题陈述
深度强化学习(RL)智能体在非平稳环境中往往举步维艰。虽然 prior 研究已通过突变的任务切换(例如连续的 Atari 任务)解决了“稳定性 - 可塑性困境”,但现实世界环境通常通过自然主义的、持续的非平稳性演变。在此类设定中,动态变化是渐进的而非突变的,且不存在明确的任务边界。标准的 RL 技术,包括那些依赖经验回放或突变参数重置的技术,在这些持续漂移场景中往往无法有效适应,或遭受灾难性遗忘。此外,现有的稳定性和可塑性方法主要在 Q 值或策略层面运作,导致预测表征在此特定背景下的作用 largely 未被充分研究。
方法论
1. 评估协议:自然主义的持续非平稳性
作者引入了一种以平滑、连续的非平稳性为特征且无明确任务边界的持续 RL 评估协议。该协议在两个领域具体实现:
- 滑溜的 3D 四房间(Slippery 3D Four Rooms): 一个导航任务,其中动作结果基于含噪正弦函数被随机替换(模拟湿滑/结冰条件)。
- MuJoCo 控制套件: 连续控制任务(人形、双足、四足、半猎豹),其中智能体的质量随时间通过含噪正弦函数、非周期正弦函数和 Ornstein–Uhlenbeck(OU)过程进行变化。
2. 核心机制:具有突触巩固的后继特征(SFs)
本文提出了一种框架,将**后继特征(SFs)与受神经科学启发的突触巩固(SC)**相结合,跨越多个时间尺度。
- 后继特征(SFs): SFs 将状态 - 动作价值函数 Q(s,a,w) 分解为预测表征 ψ(s,a) 和奖励参数 w。与标准 Q 学习不同,SFs 捕获未来特征的预期折扣占用量,从而实现在具有共享动态的任务间迁移。在本工作中,基特征和 SFs 都必须适应变化的转移动态 p(s′∣s,a;ωt)。
- 突触巩固(SC): 受 Benna & Fusi (2016) 启发,SC 将突触强度稳定建模为一系列 K 个相互作用的变量(u1,…,uK)的链,这些变量具有不同的容量(Ck)和流动强度(gk,k+1)。
- 快时间尺度(u1): 对应可见的突触效能,允许对新经验进行快速适应。
- 慢时间尺度(u2,…,uK): 充当隐藏变量,与邻居进行双向交互,保留稳定知识并防止干扰。
- 实现: 作者将这些变量映射到 SF 参数(ψuk)。最具可塑性的变量(ψu1)通过 Q-SF-TD 损失上的标准梯度下降进行更新。其余变量使用欧拉法进行解析更新,以模拟连续动态。关键在于,作者证明这些更新必须使用**随机梯度下降(SGD)**而非自适应优化器(如 Adam)来执行,以保留巩固动态中固有的相对时间尺度信息。
3. 基线与比较
本研究将提出的SF + SC方法与以下方法进行了比较:
- 侧重可塑性的方法: 参数重置(P-last,重置最后一层)和持续反向传播(CBP,重置最少使用的权重)。
- 侧重稳定性的方法: 弹性权重巩固(EWC)以及应用于 Q 值而非 SFs 的突触巩固(TD3+SC, DQN+SC)。
- 信任区域方法: 近端策略优化(PPO)。
主要贡献
- 自然主义的持续非平稳性协议: 作者在导航和连续控制领域引入了一个基准,使用平滑的随机漂移过程(周期/非周期正弦、OU),超越了突变任务切换范式。
- 瓶颈诊断: 通过系统比较,论文提供了证据,表明在持续非平稳性下的性能下降主要由不稳定性而非可塑性不足驱动。保持稳定性的方法(SC, EWC) consistently 优于注入可塑性的方法(P-last, CBP)。
- SFs 作为更优的巩固目标: 研究表明,将突触巩固应用于后继特征比巩固 Q 值产生更优越的性能。这表明在逐渐变化的环境中,稳定预测表征比稳定价值估计更有效。
- 多时间尺度分析: 论文引入了一种交叉注意力机制来分析快慢巩固变量的相对贡献。结果表明,虽然快时间尺度驱动了大部分学习,但慢时间尺度提供了互补的稳定性,而多个时间尺度的组合(例如 6–9 个变量)对于最佳性能至关重要。
实验结果
- 稳定性与可塑性: 在滑溜四房间和 MuJoCo 环境中,保持稳定性的方法(SC 和 EWC)显著优于注入可塑性的方法(P-last, CBP)。缺乏稳定性的智能体在持续非平稳设定中无法有效学习。
- SF + SC 的优越性: SFs 与突触巩固的结合(SF + SC)实现了最高的性能和学习效率。这在周期、非周期和 OU 漂移过程中均成立。
- 变化幅度: 随着环境变化幅度的增加(从轻微的 25% 到严重的 100% 质量扰动),巩固 SFs(相对于 Q 值)的优势变得更加明显。在轻微变化下,Q 值巩固具有竞争力,但在严重漂移下,SF + SC 明显更优。
- 时间尺度的重要性: 增加巩固变量的数量(引入更慢的时间尺度)提高了学习效率。交叉注意力分析显示,虽然快变量(u2,u3)获得了最高的注意力,但慢变量对稳定性贡献显著。
- 参数效率: SF + SC 方法优于显著更大的基线网络(例如增加容量的 TD3),表明收益源于巩固动态和预测表征,而非单纯的模型扩展。
- 优化约束: 作者指出,该方法需要 SGD;使用 Adam 等自适应优化器会破坏时间尺度的保持。此外,解析更新引入了计算开销,与标准基线相比降低了训练吞吐量(FPS)。
意义与主张
论文主张,对于在自然主义、持续变化的环境中运行的深度 RL 智能体,稳定性通常是主要瓶颈,仅通过参数重置来维持可塑性是不够的。提出的解决方案——预测表征(SFs)的多时间尺度突触巩固——提供了一种原则性的方法,在不需明确任务边界或任务统计信息的情况下平衡稳定性 - 可塑性权衡。
作者将这项工作定位为理解生物系统(通过突触巩固)如何在动态设定中解决持续学习问题的一步,表明跨多个时间尺度稳定预测结构是稳健适应的有效策略。他们承认局限性,包括仅限于基于 SGD 的更新以及不可并行化的解析更新带来的计算成本,但强调了该方法在参数效率方面的优势以及在面对渐进式环境漂移时的鲁棒性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。