← 最新论文
🤖 machine learning

When Dynamics Shift, Robust Task Inference Wins: Offline Imitation Learning with Behavior Foundation Models Revisited

本文提出了一种面向行为基础模型的鲁棒极小极大优化框架,该框架仅利用标称环境数据即可实现有效的离线模仿学习并适应未见过的动态变化,在无需修改预训练的前提下显著优于现有基线方法。

原作者: Rishabh Agrawal, Rahul Jain, Ashutosh Nayyar

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Rishabh Agrawal, Rahul Jain, Ashutosh Nayyar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人走路、跑步或跳跃。传统上,你会向机器人展示专家执行该任务的视频,然后机器人尝试模仿。这被称为模仿学习

然而,这里有一个陷阱:机器人通常是在完美、无摩擦的模拟环境(就像电子游戏)中训练的,但当它们进入现实世界时,情况会发生变化。地板可能会打滑,机器人的关节可能会生锈,或者它的电机可能会变弱。如果机器人只被教导去模仿“完美”的视频,那么一旦现实变得混乱,它很可能会立刻摔倒。

这篇论文介绍了一种教机器人的新方法,使它们在面对这些现实世界的变化时更加坚韧,而无需从头开始重新训练。

以下是使用简单类比进行的分解:

1. 问题:“完美练习”的陷阱

作者使用了一种称为**行为基础模型(BFMs)**的技术。将 BFM 想象成一位品尝过成千上万道菜肴并掌握了烹饪基本“风味特征”的大厨。

  • 通常是如何工作的: 大厨在拥有完美食材的完美厨房中学习这些风味。当被要求烹饪一道新菜时,他们只需查看几种食材,就能迅速找出食谱。
  • 缺陷: 如果大厨试图在一个炉灶坏了、水是咸的或食材变质的厨房里烹饪,“完美厨房”的食谱就会失效。大厨假设厨房仍然是完美的,所以做出来的菜糟糕透顶。

在机器人领域,这意味着如果机器人的环境发生变化(例如重力或摩擦力的改变),标准机器人就会失败,因为它从未学会如何应对“坏掉”的厨房。

2. 解决方案:“最坏情况”大厨

作者提出了一种名为RBFM(鲁棒行为基础模型)的新方法。他们不是让机器人仅仅模仿专家,而是教导机器人在学习任务的同时,为环境的最坏版本做好准备。

想象一下,大厨现在正与一位站在旁边的捣蛋鬼一起训练。

  • 游戏: 大厨试图找出食谱(任务)。捣蛋鬼则通过让炉灶更热、地板更滑或食材变质来破坏厨房(模拟“动力学偏移”)。
  • 目标: 大厨必须找到一种食谱,即使捣蛋鬼使出了浑身解数,这道菜依然美味。
  • 结果: 大厨学会了一种“鲁棒”的食谱。当他们进入现实世界时,即使炉灶有点坏或地板是湿的,菜肴依然能成功,因为他们正是针对这些确切场景进行了练习。

3. 魔法技巧:无需新训练

通常,要教机器人应对坏掉的炉灶,你需要向它展示在坏厨房里烹饪的视频。这既昂贵又难以实现。

这篇论文的重大突破在于你不需要新的视频

  • 他们利用已经在“完美厨房”数据上训练好的机器人。
  • 他们只改变最后一步(称为“任务推断”)。
  • 当机器人被要求执行新任务时,它会进行快速的心理模拟:“如果地板很滑,我该如何移动脚部?如果电机无力,我应使用多大的力?”
  • 它通过假设环境可能略有损坏来计算最佳动作,同时完全使用它从旧数据中学到的内容。

4. 机器人的两个版本

论文提供了两种进行这种“最坏情况”思考的方法,在速度与安全性之间进行权衡:

  • RBFM-Light(快速思考者): 这个版本速度很快。它会快速猜测环境可能有多糟糕,并稍微调整计划。这就像一位司机看到水坑时,为了以防万一而稍微减速。它的计算速度非常快。
  • RBFM-Heavy(谨慎规划者): 这个版本速度较慢,但更彻底。它不只是猜测;它在数学上证明,即使环境以特定且复杂的方式发生变化,其计划依然有效。这就像一位司机在迈出一步之前,先检查地图、天气和路况。它需要多一点时间,但更安全。

5. 结果:在现实世界中获胜

作者在行走、跑步和跳跃的机器人(如人类、狗和猎豹)上测试了这种方法。他们在测试中扰乱了物理规律:

  • 他们增强了重力。
  • 他们使地面变得滑腻或松软。
  • 他们使机器人的关节变得僵硬或无力。

结果:

  • 标准机器人(FB-IL): 当环境发生变化时,它们立刻分崩离析。
  • 旧的“鲁棒”方法: 这些方法效果很好,但速度极慢,完成单个任务需要数小时。
  • 新的 RBFM 机器人: 它们比标准机器人更好地应对了变化,并且比旧的鲁棒方法快数千倍。它们可以在几分钟内适应新的、损坏的环境,而不是数小时。

总结

论文指出:“不要只教机器人模仿专家;要教它在假设世界可能已经坏掉的情况下模仿专家。”

通过在学习的最后一步进行这种“最坏情况”规划,他们创造了一个既超级快速(像基础模型一样)又超级坚韧(像能应对现实世界混乱的机器人一样)的系统,而无需收集新的、混乱的数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →