想象一下,你想教一个机器人如何收拾凌乱的厨房台面。为了安全且廉价地完成这项任务,你宁愿在电子游戏(模拟环境)中进行练习,也不愿冒着打破真实餐具的风险。但问题在于,大多数电子游戏世界要么过于简单(比如只有一张平坦的桌子和漂浮的物体),要么过于混乱(物体相互穿模,或者违背重力规律)。如果机器人在一个“破碎”的世界里练习,它会养成坏习惯,导致在现实世界中执行任务时失败。
TabletopGen 是一个全新的工具,它扮演着“魔法建筑师”的角色,为机器人的训练世界进行构建。它只需通过阅读一段文本描述或观察一张照片,就能从零开始构建出符合物理规律的写实桌面场景。
以下是它的工作原理,分为三个简单的步骤:
1. “陶艺雕塑家”(生成式实例提取)
想象一下,你有一张杂乱书桌的照片。你想把照片中的每一件物品(一个咖啡杯、一台笔记本电脑、一个订书机)都变成可以被抓取的 3 维物体。
- 问题: 如果你只是简单复制照片,物体看起来会很扁平,或者出现破洞,因为你看不到它们的背面。
- TabletopGen 的解决方案: 它就像一位熟练的雕塑家。它观察照片,识别出每一件物品,并“填补空白”,为每一个物体创建一个完整的、实心的 3D 模型。然后,它会将这些物体全部竖直立起,就像陶工在转盘上对齐陶罐一样,准备好被放置在桌面上。
2. “风水大师”(姿态与比例对齐)
现在你拥有了一堆 3D 物体。你需要将它们排列在桌面上,使其既看起来像原图,又不会悬浮在半空中或陷进木头里。
- 问题: 如果你只是凭感觉摆放,一本书可能会倒过来,或者一个杯子可能会悬浮在桌面上方两英尺处。
- TabletopGen 的解决方案: 它使用两个特殊的工具来确保排列的完美无瑕:
- 旋转调节器 (DRO): 它微调每个物体的旋转角度,直到其形状和阴影与原图完全匹配。
- 俯视图规划器 (TSA): 它想象从正上方俯瞰桌面(就像无人机一样)。它利用“常识性”物理规则(例如:“杯子应该放在桌子上,而不是陷在桌子里”)来确定物体的精确大小和位置,确保它们不会互相碰撞。它会选取一个可靠的物体作为“标尺”,以确保所有东西的大小比例正确。
3. “游戏构建者”(交互式模拟)
一旦物体排列完毕,该工具就会将它们放入物理引擎(游戏引擎)中。
- 结果: 它将这个场景变成了一个可玩的关卡。机器人现在可以尝试“拿起”杯子或“移动”书本。如果机器人试图把书推下桌子,书会掉下去;如果它试图把书推向墙壁,书会撞击并弹开。
- 加分项: 由于物体是独立且分离的,你可以轻松地将咖啡杯换成茶壶,或者将笔记本电脑移到另一边,从而瞬间创造出数千个全新的练习场景,而无需重建整个世界。
为什么这很重要?
论文证明了在这些“魔法建筑师”构建的世界中接受训练的机器人,能够胜任现实世界的任务。
- 测试: 研究人员拍摄了一张真实桌子的照片,构建了该桌子的模拟环境,并在模拟环境中训练机器人手臂移动水果和积木,然后让机器人对真实的桌子执行完全相同的任务。
- 结果: 机器人成功了!它不需要在真实的桌子上进行任何额外的练习。这表明“魔法建筑师”构建的世界足够精确,足以教会机器人现实世界的技能。
简而言之: TabletopGen 是一个工具,它能将单张照片或一句话转化为一个完美的、符合物理规律的机器人训练场,让机器人能够快速、安全地学习复杂任务,而无需昂贵的现实世界数据采集。
技术摘要:TabletopGen
问题陈述
机器人操控,特别是桌面环境下的操控,高度依赖大规模、高质量的交互数据来训练视觉-语言-动作(VLA)模型。虽然现实世界的采集成本高昂且难以扩展,但仿真提供了一个充满前景的替代方案。然而,现有的 3D 场景生成方法无法有效地生成可用于仿真的桌面环境。
- 基于检索的方法 受限于固定的资产库,存在多样性不足和几何失配的问题。
- 基于 LLM 的文本驱动方法 通常侧重于房间规模的布局,无法处理桌面环境下特有的高密度、小物体功能性排列以及强语义约束。
- 单图重建方法 往往会产生物理上不合理的布局(例如,物体相互穿透或悬浮)以及由于单视角遮挡和缺乏物理先验导致的网格不完整问题。
因此,这些场景无法可靠地导入物理仿真器进行运动规划,从而形成了自动化操控数据合成的瓶颈。
方法论
TabletopGen 是一个无需训练、全自动的框架,能够从文本描述或单张图像生成高保真、实例级交互式的桌面场景。该框架分为三个递进阶段运行:
1. 生成式实例提取
系统首先将文本输入转换为详细的提示词并合成参考图像(或使用提供的图像)。随后提取并重建 3D 资产:
- 分割与补全: 多模态大语言模型(MLLM)执行开放词汇类别识别,并结合 GroundedSAM-v2 进行实例掩码提取。为了解决遮挡问题,系统使用多模态生成模型来补全并重绘实例掩码,而非使用传统的图像修复技术。
- 3D 重建与规范化: 补全后的 2D 实例通过 Image-to-3D 模型重建为 3D 网格。至关重要的是,系统应用旋转校正,将每个物体的局部垂直轴与世界坐标系的 Z 轴向上方向对齐,确保资产是“Z 轴向上规范化”的,可以直接放置。
2. 位姿与尺度对齐
这是核心创新点,通过将旋转、平移和尺度的估计解耦为两个专门的阶段,以确保物理合理性:
- 可微旋转优化器 (DRO): 该阶段优化每个实例绕垂直轴的旋转 (ri)。它使用可微渲染器生成纹理图像、软轮廓和边缘图,通过最小化三模态损失(通过软 IoU 实现形状一致性、通过 Chamfer loss 实现轮廓匹配、通过 DINOv2 特征实现外观相似性)来逼近目标实例。
- 顶视图空间对齐 (TSA): 该阶段利用物理先验推断平移 (ti) 和尺度 (si):
- 堆叠先验: MLLM 推断堆叠关系,以防止物体悬浮或垂直穿透。
- 顶视图合成: 生成式模型合成场景的顶视图以提取 2D 边界框,确保物体保持在桌面边界内。
- RMA-Score: “比例匹配与面积加权得分”(Ratio-Matched and Area-Weighted Score)根据长宽比一致性和像素面积选择可靠的锚点物体。该锚点决定了一个全局缩放因子,用于推断所有物体的度量 3D 尺度和水平平移。
3. 交互式仿真
对齐后的实例被组装在物理仿真器(Isaac Sim)中。通过凸分解生成碰撞几何体,并启用物理属性(重力、摩擦力)。该框架支持:
- 任务生成: 根据语义标签自动生成操控任务(例如,“把杯子放入盒中”)。
- 数据合成: 执行无碰撞轨迹,以收集多模态数据(RGB、关节状态、动作)。
- 场景扩展: 通过场景内编辑(添加、删除、替换、重新排列)生成多样化的场景变体,而无需重新运行整个流水线。
核心贡献
- TabletopGen 框架: 一个自动化的、无需训练的引擎,可从文本或单张图像生成可用于仿真的桌面场景,同时实现了视觉真实感、实例级交互性和物理合理性。
- 新型对齐方法: 一种解耦的位姿与尺度对齐方法,利用 DRO 进行精确的旋转优化,并利用 TSA 进行受物理约束的平移与尺度推断,克服了单视角重建的局限性。
- 全面验证: 通过广泛的实验证明了其在视觉保真度和物理有效性方面达到了最先进的性能,并通过零样本实到虚再到实(real-to-sim-to-real)的策略迁移进行了验证。
结果
- 定量性能: 在与图像驱动基准(ACDC, Gen3DSR, MIDI)和文本驱动方法(MesaTask, Holodeck-table)的对比中,TabletopGen 在视觉/感知指标(LPIPS, DINOv2, CLIP)和 GPT-4o 评估中均取得了最高分。
- 物理合理性: TabletopGen 显著降低了碰撞率。当基准方法的场景级碰撞率(Col_S)在 67% 到 98% 之间时,TabletopGen 的 Col_S 仅为 7.69%,且网格级碰撞率(Col_O)仅为 0.42%。
- 用户研究: 在一项包含 128 名参与者的研究中,TabletopGen 在 83.13% 的案例中更受青睐,在视觉保真度、图像对齐度和物理合理性方面显著优于基准方法。
- 现实世界迁移: 在一项零样本实到虚再到实的实验中,仅在 TabletopGen 生成的合成数据上训练的策略被部署在真实的 AgileX PiPER 机械臂上。这些策略实现了极高的成功率(例如,放置芒果的成功率为 84%,放置草莓的成功率为 80%),且无需任何现实世界微调,验证了生成场景的物理准确性。
重要性
论文声称 TabletopGen 可作为机器人操控可靠的数据引擎。通过解决生成物理合理、实例级交互场景的瓶颈,它实现了低成本、可扩展的多模态操控数据合成。这种能力对于训练通用的 VLA 模型至关重要,并支持“从仿真到现实”(sim-to-real)范式,允许机器人在仿真中学习复杂的操控策略,并能有效地迁移到物理世界,而无需大量的现实世界数据采集。该框架通过场景内编辑支持场景扩展的能力,进一步为覆盖多样化的具身智能仿真环境提供了可扩展的路径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。