← 最新论文
💻 computer science

Multisensory Continual Learning: Adapting Pretrained Visuomotor Policies to Force

本文提出了 MuSe,一种多模态持续学习框架,该框架通过多阶段融合与经验回放,有效地将预训练的仅视觉机器人策略适配到新的力/力矩模态,从而在增强处理富接触任务性能的同时,避免遗忘原有的能力。

原作者: Jaden Clark, Changhao Wang, Yihuai Gao, Seongheon Hong, Hojung Choi, Mark Cutkosky, Yifan Hou, Shuran Song

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Jaden Clark, Changhao Wang, Yihuai Gao, Seongheon Hong, Hojung Choi, Mark Cutkosky, Yifan Hou, Shuran Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你训练了一个机器人成为一名顶级大厨,但你只通过“眼睛”来教它。它通过观看成千上万个视频,学会了如何切菜、搅拌和摆盘。它非常擅长观察该做什么,但它不知道该用多大的力气,也不知道物体何时会从手中滑落。

现在,想象你想教机器人一项新技能:感觉。你想让它使用力传感器(就像一种敏感的触觉)来处理精细的任务,比如擦拭一个花瓶而不将其弄碎,或者拧紧一个灯泡而不使其开裂。

这里有一个问题:你并没有一个同时包含机器人的“眼睛”和它新“触觉”传感器的海量视频库。你只有一份关于这些新传感器的极小的、全新的数据集。如果你仅仅尝试用这小部分新数据来教机器人,它可能会感到困惑,并忘记之前学到的所有视觉知识。这被称为“灾难性遗忘”。

这篇论文介绍了一种名为 MuSe(多模态持续学习)的解决方案。把 MuSe 想象成一个聪明的学习指南,它能帮助机器人在学习新感官的同时,不忘记原有的感官。

以下是 MuSe 如何运作的,我们使用简单的类比来解释:

1. “双向车道”连接(多阶段融合)

通常,当你为机器人增加一种新感官时,你只是把它附加在最后,就像是在一顿饭里加了一道配菜。MuSe 则不同。它在机器人的“眼睛”和新的“触觉”传感器之间创建了一条双向车道。

  • 早期融合(Early Fusion): 它在过程的最开始就将“触觉”数据与“视觉”数据混合在一起,就像在烘焙前将面粉和鸡蛋混合。这让机器人能够立即理解触觉和视觉是如何相互关联的。
  • 后期融合(Late Fusion): 它也会在过程的中后期进行检查,就像品尝员在烹饪中途调整调料一样。
  • 结果: 机器人不仅仅是在“看”或“感觉”;它学习到了一种统一的理解,即视觉和触觉可以相互辅助。

2. “未来水晶球”(多模态未来预测)

为了确保机器人真正理解了这种新感官,MuSe 不仅仅要求它“完成任务”,它还要求机器人去预测未来。

  • 机器人被训练去猜测:“下一秒我会看到什么?下一秒我会感觉到什么?我应该采取什么行动?”
  • 类比: 想象一名司机正在学习雨天驾驶。他们不仅仅是在开车,还要预测:“如果我现在转动方向盘,车会打滑吗?”以及“雨刷器能否刮掉水滴?”
  • 通过强迫机器人同时预测视觉场景和力信号,它建立了一个关于物理世界运作方式的深度内部映射。这有助于它实现泛化,意味着即使在它从未见过的任务中,它也能运用其新的“触觉”技能。

3. “闪卡复习”(经验回放)

这是防止机器人遗忘最关键的部分。当机器人学习新的“触觉”技能时,MuSe 会强制它在学习的同时继续练习旧有的“视觉”技能。

  • 类比: 想象一名学生在学习法语的同时,还要努力保持自己的西班牙语水平。如果他们只学习一个月法语,他们可能会忘记西班牙语。MuSe 就像一位老师,会对学生说:“每学习一小时法语,你必须花 30 分钟复习西班牙语。”
  • 在机器人的案例中,它将微小的、新的“触觉”数据与庞大的旧“视觉”数据混合在一起。当机器人遇到一个没有触觉数据(因为旧数据中没有触觉)的任务时,MuSe 只需遮盖住“触觉”部分的问题,让机器人仅根据视觉进行回答。这让旧有的技能得以存续。

他们的研究发现了什么?

研究人员在真实的机械臂上测试了这些方法。

  • 正向迁移(学习新事物): 机器人使用新的触觉传感器,在接触密集型任务(如擦拭花瓶或插入插销)方面表现得更出色。它不仅学会了完成任务,还学会了如何通过“感觉”来应对。
  • 负向迁移(不遗忘): 令人惊讶的是,在学习使用触觉传感器后,机器人在原本仅靠视觉完成的任务上也变得更强了。看起来,学习如何“感觉”有助于它更好地理解物理世界,从而让它的“视觉”技能也变得更加敏锐。
  • 跨模态泛化: 即使在训练期间从未向机器人展示过触觉数据的任务中,机器人仍然能够预测原本会产生的力。它学习到了一个通用的“力”的概念,并能将其应用到任何地方。

核心结论

MuSe 表明,你并不需要一个包含每种可能传感器的完美海量数据集来训练机器人。你可以拿一个已经是视觉专家的机器人,给它少量的新的“触觉”数据,并利用这种特殊的训练方法来升级它。机器人学会了新的感官,保留了旧有的技能,并且整体上变得更加聪明了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →