← 最新论文
💻 computer science

BEACON: Cross-Domain Co-Training of Generative Robot Policies via Best-Effort Adaptation

BEACON 是一个以理论为驱动的框架,通过将协同训练构建为一种感知差异的重要性重加权问题,从而增强生成式机器人策略在跨域场景中的鲁棒性和数据效率,该框架联合优化基于扩散的视觉运动策略与每个样本的源域权重,以最小化目标域的泛化误差。

原作者: Antong Zhang, Han Qi, Heng Yang

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Antong Zhang, Han Qi, Heng Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教机械臂如何堆叠积木。你拥有两类训练数据:

  1. ** “源”数据**:一个庞大的视频库,展示了机器人在完美的计算机生成世界(仿真环境)中执行该任务。这些视频有数千个之多,但其光照、纹理和物理特性与现实世界略有不同。
  2. ** “目标”数据**:一小批珍贵得多的视频,展示了真实机器人在你实际厨房中执行该任务。这些数据获取成本高且难以获得,但对于最终任务而言,它们才是真正至关重要的。

问题所在:
如果你只是将所有计算机生成的视频与那少量真实视频混合,并让机器人从所有数据中同等地学习,机器人就会感到困惑。计算机世界与现实世界差异过大(摩擦系数、光照、相机角度均不同)。机器人可能会在仿真环境中完美地堆叠积木,却在真实厨房中彻底失败。

如果你仅使用那少量真实视频,机器人学到的内容不足,无法实现泛化。

解决方案:BEACON
这篇论文介绍了一种名为BEACON(跨域协同训练的最佳努力自适应)的新方法。请将 BEACON 视为一位智能编辑或策展人,而非教师。

BEACON 并非平等对待每一段训练视频,而是为庞大库中的每一段视频分配一个“相关性评分”(即权重)。

  • “最佳努力”理念:系统会问:“在这数千个虚假视频中,有哪些实际上看起来、感觉起来与我拥有的那少量真实视频相似?”
  • 编辑过程:
    • 如果某个计算机生成的视频显示机器人的运动方式与真实机器人非常相似,BEACON 会给予其高分。它会说:“用这个!它很有帮助!”
    • 如果某个计算机生成的视频显示了一些奇怪或不现实的内容(例如,真实积木是在木头上滑动,而视频里积木却在冰面上滑动),BEACON 会给予其低分(或零分)。它会说:“忽略这个。它会混淆机器人。”

工作原理(魔法技巧):
通常,人们试图通过改变颜色或纹理(就像给照片加滤镜)来强行让计算机世界与现实世界看起来一样。BEACON 的做法则不同。

它并不试图让两个世界看起来相似。相反,它筛选出计算机世界中那些原本就适用于现实世界的特定时刻。

  • 类比:想象你正在学习烹饪一道特定的菜肴。你有一本来自祖母的食谱(真实数据),以及一本来自一位使用不同食材的著名电视厨师的食谱(源数据)。
    • 旧方法:你试图强行让电视厨师的食材与祖母的食材匹配,或者只是将它们全部混合在一起。
    • BEACON 方法:你阅读电视厨师的那一千份食谱,只挑选出那些与祖母技法相匹配的步骤。你忽略其余部分。你从祖母的少数步骤中学习,但用电视厨师食谱中最匹配的步骤来填补空白。

令人惊讶的结果:
论文发现,通过这种“智能筛选”,机器人的大脑(其神经网络)自然地开始更好地理解现实世界。即使系统没有被明确告知要“对齐特征”或“匹配模式”,筛选正确数据这一行为本身,就促使机器人自动学习到了正确的模式。这就像一名只钻研最相关练习题的学生,自然开始洞察该学科背后的逻辑,而无需单独上一门“逻辑”课。

他们测试了什么:
他们在机械臂执行三项任务时测试了该方法:堆叠积木、清理马克杯以及穿针引线。他们将 BEACON 与以下方法进行了比较:

  1. 仅使用那少量真实视频。
  2. 平等混合所有视频。
  3. 使用其他试图强行让计算机世界与现实世界看起来相似的方法。

结果:
BEACON consistently 胜出。机器人学习速度更快,使用的真实世界数据更少,并且在环境发生变化时(例如移动相机或改变桌面纹理)具有更强的鲁棒性。这证明了成为数据的智能策展人比强行让数据看起来相同更为强大。

简而言之:
BEACON 是一个框架,它通过以下方式教导机器人:“我们拥有大量虚假数据和少量真实数据。让我们忽略那些不匹配的虚假数据,并 intensely 聚焦于那些确实匹配的虚假数据,以便我们高效地学习真实任务。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →