← 最新论文
🤖 machine learning

Learning in ImaginationLand: Omnidirectional Policies through 3D Generative Models (OP-Gen)

本文提出了 OP-Gen,一种利用 3D 生成模型将单个真实世界演示增强为想象数据集的方法,使机器人能够学习全向策略,从而在比现有基准方法显著更少的演示次数下,成功执行来自多样化初始状态的任务。

原作者: Yifei Ren, Edward Johns

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifei Ren, Edward Johns

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何拿起一个咖啡杯。通常情况下,你必须向机器人展示同一个动作几十次,甚至上百次,从稍微不同的角度进行演示,直到它终于“领悟”了其中的规律。这被称为“模仿学习”(imitation learning),它是我们教机器人在现实世界中移动的主要方式。但问题在于,机器人并不擅长猜测。如果你教机器人如何从正面抓取杯子,然后突然要求它从背面抓取同一个杯子,它往往会陷入停滞或发生碰撞。它并没有学会杯子的“形状”,它只是记住了训练时看到的特定摄像机视角。为了解决这个问题,科学家通常需要收集海量的数据,而这既缓慢、昂贵又枯燥。现在的核心问题是:我们能否通过仅仅一次快速的演示,就教会机器人成为任何角度下的高手?

这篇题为《在想象乐园中学习》(Learning in ImaginationLand)的论文提出了一种疯狂且聪明的解决方案。研究人员 Yifei Ren 和 Edward Johns 建议,与其拍摄一千遍机器人动作,不如使用一种特殊的“AI艺术家”来构思剩下的故事。他们使用了一种名为 3D 生成模型的技术。你可以把它想象成一位超级聪明的雕塑家,在只看到雕像正面后,就能立刻想象并画出它的背面、侧面和顶部的样子,即便他从未见过它们。通过利用这种 AI 来“梦幻”出数千个新的视角,他们创建了一个庞大的、想象中的训练数据集。随后,他们利用这些想象中的数据来训练机器人,希望机器人能学到物体的真实 3D 形状,而不是仅仅学习它被展示的那张特定的图片。其结果是,机器人可以从任何方向拿起物体,即使它站在最初教学时物体的对侧。

想象乐园的魔力

这篇论文的核心思想简单而强大:只要有好的想象力,一次真实的演示就足够了。

研究人员将他们的方法称为 OP-Gen(通过 3D 生成模型实现全向策略)。这个魔术步骤如下:

  1. 单次快照: 首先,人类向机器人展示一次任务——比如抓取电钻、打开抽屉或拿起咖啡壶——只需一次。机器人通过绑在手腕上的摄像机观察这一过程。
  2. AI 梦想家: 团队提取那段单次视频中的少量图像,并将其输入到一个 3D 生成模型(具体是一个名为 EscherNet 的工具)中。这个 AI 扮演着创意总监的角色。它观察物体的正面,然后说:“我知道背面长什么样!”接着,它生成一个完整的物体 3D 模型,填补了机器人从未见过的所有缺失部分。
  3. 无限重播: 一旦 AI 构建了这个完整的 3D “想象”物体,研究人员就会利用它创建一个全新的、大规模的数据集。他们在模拟中让机器人从每一个可能的角度接近物体——顶部、底部、左侧、右侧,甚至是背面。对于每一个新角度,系统都会自动计算机器人的手应该如何移动以到达目标。
  4. 锚定路径: 为了确保机器人不会产生混乱,他们使用了一个名为锚定轨迹生成(Anchored Trajectory Generation)的特殊技巧。想象机器人的手是一台系在绳子上的摄像机。当它向物体移动时,绳子会让摄像机始终正对着目标,无论机器人如何扭转。这确保了机器人即使在奇怪的角度接近时,也能清晰地看到物体。
  5. 最后的课程: 机器人随后在这一巨大的“想象”图像和动作库上进行训练。它学到了物体是一个实体的 3D 物体,而不仅仅是一张扁平的图片。

他们的发现

团队在现实世界中使用机器人手臂(Franka Panda)测试了这个想法,涵盖了六种不同的任务:拿起电钻、咖啡杯、模型飞机、咖啡壶、把垃圾丢进垃圾桶以及打开空气炸锅抽屉。

结果非常出色。当他们在机器人从未见过的角度(“全向”设置)进行测试时,传统方法几乎完全失败了。

  • 无增强(No Augmentation): 如果他们只在单次视频上进行训练而不使用想象力,机器人在新位置下的成功率为 0%。它完全迷失了。
  • 旧招式(Old Tricks): 那些尝试利用部分 3D 扫描(如点云)或有限模拟来猜测形状的方法,成功率仅为 5% 到 28%。它们在“隐藏”的一侧经常猜错形状。
  • OP-Gen(获胜者): 经过 AI 想象力训练的机器人,在完全新的角度下成功率达到了 73.3%。当从接近原始演示的角度开始时,成功率为 85%

这一表现几乎接近了“上限”(Upper Bound)——即使用高端摄像机系统从各个角度扫描物体所能达到的理论完美场景(这需要耗费大量时间和精力)。论文指出,AI 的“想象力”非常出色,以至于它填补缺失部分的程度几乎与真实的完整 3D 扫描不相上下。

细节说明:哪些有效,哪些无效

研究人员谨慎地指出,这并不是包治百病的“魔杖”。

  • 一致性是关键: 他们发现,虽然 3D 模型的质量很重要,但一致性更为关键。AI 不需要成为完美的摄影师,它只需要确保物体从每个角度看起来都是一样的。如果 AI 画出的形状在相机移动时发生扭曲或变化,机器人就会感到困惑。他们的方法保持了物体的连贯性,这也是为什么它效果如此之好的原因。
  • “最后一英寸”问题: 机器人在接近物体方面表现出色,但有时会在最后一步(例如实际闭合夹持器)出错。这是因为 AI 的 3D 模型与真实物体没有完美对齐,导致了微小的运动误差。
  • 目前还做不到的事: 论文明确排除将此用于包含多个物体或耗时较长的复杂场景。目前的 AI 擅长想象单个物体(如咖啡杯),但如果机器人需要同时移动杯子和勺子,或者物体被其他东西遮挡,它就会感到吃力。

为什么这很重要

这篇论文表明,我们可能不需要花费数周时间去收集成千上万段机器人视频来教授一项新技能。相反,我们可以展示一次,让 AI “想象”出其余的可能性,并在那个梦境中训练机器人。它将一次枯燥的演示变成了一个无限的练习乐园。虽然机器人仍需在最后极其精准的动作上稍加帮助,但这种从单次视角学习并处理任何角度的能力,是让机器人能够真正走进我们杂乱、不可预测的家庭生活的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →