← 最新论文
🤖 machine learning

TSN-Affinity: Similarity-Driven Parameter Reuse for Continual Offline Reinforcement Learning

本文提出 TSN-Affinity,一种新颖的持续离线强化学习方法,该方法利用微型子网络(TinySubNetworks)和决策 Transformer(Decision Transformer)实现任务特定参数化与相似度驱动的知识共享,为基于回放策略提供了一种内存高效的替代方案,能有效缓解离散与连续控制任务中的灾难性遗忘问题。

原作者: Dominik Żurek, Kamil Faber, Marcin Pietron, Paweł Gajewski, Roberto Corizzo

发布于 2026-04-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Dominik Żurek, Kamil Faber, Marcin Pietron, Paweł Gajewski, Roberto Corizzo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人玩电子游戏并操控机械臂。难点在于:你不能让机器人在现实世界中练习,因为成本太高或风险太大。相反,你必须利用一个包含人类执行这些任务的老视频记录(数据集)的库来教导它。

现在,想象你每周都要教这个机器人玩一款新游戏。在“持续离线强化学习”(CORL)中,最大的问题就是遗忘。如果你教机器人玩《打砖块》(Breakout),它可能会在那款游戏上变得非常擅长,以至于忘记了如何玩《乒乓球》(Pong)。如果你试图在不删除旧数据的情况下教它玩《乒乓球》,机器人会感到困惑,导致两款游戏都玩砸。

本文介绍了一种名为TSN-Affinity的新方法来解决这个问题。以下是其工作原理,使用简单的类比来说明:

1. 旧方法:“一个大脑”的问题

大多数以前的方法都试图用一个巨大的共享“大脑”来教导机器人。为了防止遗忘,它们会保存旧视频的小片段(重放),并将它们与新片段混合。

  • 缺陷:这就像一边说英语一边学法语,然后一边说英语和法语一边学西班牙语。最终,语言会混淆,或者你需要一个巨大的旧磁带库来理清一切,这会占用太多空间。

2. 新方法:TSN-Affinity(“模块化工具箱”)

作者提出了一种更聪明的方法,使用微型子网络(TinySubNetworks)。想象机器人的大脑不是一个巨大的整体,而是一个装有多个小型专用抽屉的工具箱。

  • 专用抽屉(子网络):当机器人学习新任务(如《打砖块》)时,它不会重写整个大脑。相反,它会打开一个特定的微小抽屉,并填入该游戏所需的精确工具。一旦那个抽屉关闭,它就保持原样。如果你后来学习一款新游戏,你会打开一个不同的抽屉。这意味着机器人永远不会忘记旧游戏,因为旧工具被锁起来且未受干扰。

3. 秘密武器:“亲和路由”(聪明的图书管理员)

如果每个新任务都获得一个全新的抽屉,工具箱会变得巨大且混乱。本文的创新之处在于一个智能图书管理员(称为路由机制),它决定使用哪个抽屉。

在机器人开始学习新任务之前,图书管理员会问:“这个新任务看起来像我们已经有工具的旧任务吗?”

图书管理员检查两件事:

  1. 动作亲和性(动作):“这个新游戏所需的动作是否像我们已经知道的?”(例如,如果新游戏需要跳跃,而我们已经有一个“跳跃”抽屉,也许我们可以使用它)。
  2. 潜在亲和性(感觉):“新任务在机器人内部‘感觉’是否像旧任务?”(例如,即使图形不同,游戏的模式看起来是否相似?)

决策

  • 如果它们相似:图书管理员说:“太好了!让我们重用现有的抽屉。”机器人使用旧工具(它们是冻结且安全的),并仅在其上添加一些新的微小工具。这节省了空间并提高了性能。
  • 如果它们不同:图书管理员说:“不,这太不同了。”它为新任务打开一个全新的空抽屉。

4. 结果:电子游戏 vs. 机械臂

作者在两个截然不同的挑战上测试了这种方法:

  • 电子游戏(Atari):这些是快速的、基于像素的游戏,使用简单的按钮(离散动作)。

    • 结果:该方法取得了巨大成功。“专用抽屉”方法完全阻止了机器人忘记旧游戏。“智能图书管理员”通过重用正确的工具帮助机器人表现得更好,通常能达到仅一次训练一款游戏的机器人的性能水平。
  • 机械臂(Panda):这涉及在三维空间中移动物理手臂,进行平滑的连续运动(如拿起杯子)。

    • 结果:这要困难得多。“智能图书管理员”在决定重用哪些工具时更加困难,因为运动如此复杂且多变。虽然该方法仍然比旧的“一个大脑”方法表现更好,但它表明在复杂的物理任务中重用工具是棘手的。机器人必须在保持旧技能安全的同时,学习新的、困难的物理运动。

总结

TSN-Affinity就像给学生一套单独的、带标签的笔记本,而不是一本巨大的教科书。

  • 当他们学习新科目时,他们会打开一本新笔记本。
  • 如果新科目与旧科目相似,他们会检查是否可以将旧笔记作为基础(重用它们),而不是从头开始。
  • 这确保了他们永远不会忘记过去所学的内容,也不会因为混淆不同科目而感到困惑。

本文证明,对于从旧数据中学习而不搞乱过去,拥有一个系统来知道何时重用旧知识以及何时从头开始,比仅仅试图将所有内容记忆在一个大堆中要好得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →