← 最新论文
🤖 machine learning

Hierarchical Successor Representation for Robust Transfer

本文介绍了分层后继表示(Hierarchical Successor Representation, HSR),这是一个利用时间抽象和非负矩阵分解来克服经典后继表示中存在的策略依赖和谱扩散问题的框架,从而在复杂的非平稳环境中实现鲁棒、样本高效的迁移以及高效的探索。

原作者: Changmin Yu, Máté Lengyel

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Changmin Yu, Máté Lengyel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在学习如何在一个拥有许多房间、走廊和门的巨大且复杂的建筑中导航。你的目标是找到一个特定的出口。

旧方法(“后继表示法”,Successor Representation)
传统上,AI智能体使用一种叫做“后继表示法”(SR)的方法。你可以把它想象成一张关于“从当前位置到达各处需要多久”的心智地图

  • 如果你在厨房,这张地图会告诉你去客厅需要10秒,去车库需要20秒,等等。
  • 问题所在: 这张地图与你“如何行走”紧密绑定。如果你通常走得很快,地图会显示“5秒”。如果你突然因为搬着重物而不得不走慢点(这种“策略”的变化),你的旧地图就失效了。你必须重新绘制整张地图。
  • “模糊性”问题: 在一个大建筑中,这张地图会变得模糊。就像墨水滴入水中扩散一样,它无法清晰地显示墙壁和走廊的位置,导致难以理解建筑的布局。

新方法(层级后继表示法 —— HSR)
作者提出了一种新方法,称为层级后继表示法(HSR)。你可以把它想象成从“步进式步行指南”升级到了**“战略性旅行指南”**。

与其思考每一个细微的脚步(左脚、右脚),智能体学习的是“宏观动作”或**“选项”(Options)**。

  • 类比: 智能体不再思考“迈步、迈步、转弯、迈步”,而是思考“穿过走廊”、“穿过这扇门”或“跨过这座桥”。
  • 为什么更好: 即使你的行走速度发生了变化(你的底层策略改变了),“穿过走廊到达下一个房间”这一策略本身是不变的。HSR 构建的地图是基于这些稳定的高层策略,而非转瞬即逝的脚步动作。这使得地图具有鲁棒性;如果你的任务发生了变化(例如,目标移动到了另一个房间),你不需要重新绘制整张地图。你只需要查看现有的战略地图并找到新的目标即可。

让地图变得清晰(NMF)
作者还注意到,即使使用了新的 HSR,地图仍然可能有些混乱。为了解决这个问题,他们使用了一个数学工具——非负矩阵分解(N-MF)

  • 类比: 想象一下,你拍了一张模糊且重叠的城市照片,然后使用一个滤镜将其分解为清晰、独立的建筑模块。
  • NMF 获取 HSR 地图,并将其分解为稀疏的、局部的碎片。它不再是一个覆盖整个建筑的模糊色块,而是识别出特定的“块”,比如“北侧走廊”或“东侧侧翼”。
  • 结果: AI 发现了建筑物的自然“瓶颈”(即连接房间的门和走廊)。这些成为了地图的关键特征。这使得地图不仅准确,而且易于 AI 理解和使用。

这实现了什么

  1. 超强迁移能力: 由于地图是基于稳定的策略(如“穿过这扇门”)而非具体的行走风格,AI 可以瞬间适应新目标。这就像拥有一张无论你是开车、骑车还是步行都通用的城市地图。
  2. 更好的探索能力: 在奖励稀缺的环境中(例如在巨大的迷宫中寻找隐藏的宝藏),HSR 能帮助 AI 更高效地探索。它允许 AI 在精神层面实现“跳跃”,意识到“如果我穿过这扇门,我就能到达迷宫的一个全新区域”,而不是在某个小房间里原地打转。

总结
本文认为,通过教导 AI 以时间与策略的“块”(层级)而非单个步骤来思考,并随后将这种思维清理为清晰、独立的组成部分(NMF),我们可以创造出学习更快、能瞬间适应新任务、并在复杂环境中探索得更有效的 AI。它弥合了“快速反应(像反射一样)”与“灵活规划(像规划者一样)”之间的鸿沟。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →