← 最新论文
💻 computer science

One Demo is Worth a Thousand Trajectories: Action-View Augmentation for Visuomotor Policies

本文提出了一种数据增强框架,该框架利用一种新颖的鱼眼适配高斯泼溅(Gaussian Splatting)公式和轨迹优化,从真实世界的演示中生成逼真的新视角和无碰撞动作轨迹,从而显著提高视觉运动策略在熟悉及障碍物丰富的环境中的鲁棒性和成功率。

原作者: Chuer Pan, Litian Liang, Dominik Bauer, Eric Cousineau, Benjamin Burchfiel, Siyuan Feng, Shuran Song

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Chuer Pan, Litian Liang, Dominik Bauer, Eric Cousineau, Benjamin Burchfiel, Siyuan Feng, Shuran Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何拿起咖啡杯并将其放在桌子上。你通过在机器人的手上安装一个摄像头(“手眼”视角)并向它展示一次任务来完成教学。机器人通过这段视频进行学习。

问题在于?如果你仅仅稍微移动一下机器人的起始位置,或者不小心在桌上留下了一本书(而原本并没有书),机器人就会陷入恐慌。它看到了从未见过的东西,感到困惑,然后掉落了咖啡杯。这是因为机器人只学习了一种非常特定的方式去做任务,因此它的表现非常脆弱。

论文的核心思想:“1001 次演示”
来自斯坦福大学、哥伦比亚大学和丰田研究院的研究人员提出了一个巧妙的技巧,叫做 1001 Demos。他们的目标是将那一次人类演示,神奇地转化为 1,001 次不同的训练示例,而无需人类实际执行该任务 1,001 次。

他们是如何实现的呢?这里使用了一些创意类比:

1. “3D 相册”(场景重建)

首先,系统获取来自机器人鱼眼相机(一种几乎能看到周围一切的广角镜头)的视频,并构建出房间的 3D 数字孪生体。

  • 类比: 这就像是拍摄一系列房间的照片,并利用这些照片构建一个虚拟的乐高模型。但他们使用的不是标准的乐高积木,而是一种名为 3D 高斯泼溅(3D Gaussian Splatting) 的特殊高科技材料。这使得他们能够极其逼真地重建场景,以至于如果你从新的角度观察,它看起来就像真实的照片一样。
  • 转折点: 因为相机是鱼眼的(弯曲的),标准的 3D 模型会发生畸变。作者发明了一种处理这些弯曲图像的新方法,使 3D 模型保持准确。

2. “虚拟排练”(轨迹优化)

一旦拥有了 3D 模型,他们并不只是简单复制人类的动作。他们使用基于数学的“教练”(轨迹优化)来发明新的机器人手臂运动方式。

  • 类比: 想象人类向机器人展示了如何绕过咖啡桌走向门口。随后,“教练”说:“好,现在假设桌子向左移动了 2 英尺。再次尝试绕过它。”接着,“现在想象有一个巨大的花瓶挡住了路径。尝试绕过那个花瓶吧。”
  • 安全检查: 系统足够聪明,知道它不能穿过桌子或花瓶。它规划出的路径是平滑且符合物理规律的,确保机器人在虚拟练习中永远不会发生碰撞。

3. “魔法相机”(视图渲染)

现在,机器人需要从这些新角度“看到”它正在做的事情。

  • 类比: 在过去,为了教机器人一个新的角度,你必须物理性地移动机器人并重新拍摄。在这里,系统利用 3D 模型进行“渲染”(绘制),模拟出如果机器人在那个新位置时,鱼眼相机会看到什么。它创造出了全新的视频片段,看起来非常真实,但实际上从未真正发生过。

4. 结果:一个超强韧性的机器人

通过将原始的人类视频与这些生成的数千个“假设情况”相结合,机器人学习到了更广泛的经验。

  • 没有这种方法时: 机器人就像一个只会背诵某一道特定数学题答案的学生。如果数字稍有变化,他们就会失败。
  • 有了 1001 Demos 后: 机器人就像一个通过在数百种不同方式下练习同一个概念来掌握问题的学生。它学会了“即使障碍物移动了,我仍然可以拿到杯子”。

他们证明了什么?
研究人员通过两种方式测试了他们的方法:

  1. 在模拟器中(视频游戏世界): 他们展示了使用这 1,001 个生成的演示进行训练的机器人,在处理新的起始位置方面,比仅用原始视频训练的机器人表现得要好得多。
  2. 在现实世界中: 他们将机器人放入一个真实的房间。当加入意料之外的障碍物(如杯子或书本)——即机器人从未见过的物体时,经过“1001 Demos”训练的机器人成功避开了障碍物并完成了任务。而那些没有使用此方法的机器人则经常发生碰撞或失败。

简而言之: 这篇论文提出了一种方法,只需一段简单的机器人执行任务的人类视频,即可利用 AI 模拟出该任务的数千种变体(移动障碍物、改变起始位置)。这把一个容易损坏的、脆弱的机器人,变成了一个灵活的、能够应对突发状况的机器人,而且无需人类花费数天时间去录制新的视频。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →