← 最新论文
💻 computer science

MiniVLA-Nav v1: A Multi-Scene Simulation Dataset for Language-Conditioned Robot Navigation

本文介绍了 MiniVLA-Nav v1,这是一个公开可用的仿真数据集,包含跨越四个高保真 Isaac Sim 环境的 1,174 个 episodes,该数据集将自然语言指令与同步的视觉数据和专家动作数据配对,旨在为 NVIDIA Nova Carter 机器人基准测试语言条件化的物体接近导航任务。

原作者: Ali Al-Bustami, Jaerock Kwon

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Ali Al-Bustami, Jaerock Kwon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何走进一个房间,找到特定的物体(比如“红色的椅子”或“灭火器”),并正好停在它面前,而整个过程你只给它一个简单的口头指令,例如:“去椅子那里。”

这正是论文《MiniVLA-Nav v1》所探讨的内容。作者们创建了一个庞大的“数字训练场”(一个模拟数据集),以帮助机器人学习这项特定技能,而无需在现实世界中让真实机器人碰撞数千次。

以下是他们构建内容的简要说明,使用了简单的类比:

1. “电子游戏”训练场

研究人员没有使用真实机器人和真实的办公室或医院,而是在一个名为Isaac Sim的强大计算机程序中构建了四个不同的“虚拟世界”。

  • 世界:他们创建了办公室、医院、完整仓库以及带有多层货架的仓库的逼真照片级版本。
  • 机器人:他们使用了一个真实机器人的数字孪生体,名为Nova Carter(一种双轮机器人,移动方式像 Roomba,但转向方式像汽车)。
  • 目标:机器人接收文本指令(例如“驶向垃圾桶”),并必须在虚拟房间中导航,找到该物体,并在距离其 1 米范围内停下。

2. “完美导师”(专家)

要教机器人,你需要一个确切知道如何完美完成任务的人。在这个数据集中,“导师”是一个计算机程序(比例控制器),它像一个完美的 GPS。

  • 它看到物体,计算最短路径,并在每一刻精确告诉机器人该以多快的速度行驶以及以多急的角度转向。
  • 该数据集记录了1,174 次成功的行程,其中这位“完美导师”引导机器人到达了目标。
  • 为何重要:就像学生通过观察主厨烹饪学得最好一样,机器人通过模仿这些完美记录的移动学得最好。

3. “训练菜单”(多样性是关键)

如果你只在空旷的走廊里练习直线行走,你就学不会在拥挤的厨房里导航。作者确保训练数据具有多样性:

  • 不同距离:机器人从距离目标的三个不同位置开始:近(仅几步之遥)、中(穿过房间)和远(横跨整个建筑)。
  • 不同措辞:他们使用了30 种不同的句子模板。有些说“去椅子那里”,有些说“驶向椅子并停下”,或者说“找到椅子”。这教会机器人不同的词语可以表达相同的意思。
  • 不同物体:共有12 种类型的物体(椅子、桌子、灭火器、桶等)。其中一些用于训练,另一些则被“隐藏”,以测试机器人能否对从未见过的物体做出正确反应。

4. “感官包”

每当机器人在模拟中迈出一步时,数据集都会保存机器人体验的完整“快照”,所有数据均同步记录:

  • 眼睛:一张 640x640 的彩色照片(RGB)。
  • 深度感知:一张显示所有物体确切距离的地图(度量深度)。
  • 焦点:一个遮罩,精确高亮显示哪些像素属于目标物体(实例分割)。
  • 课程: “完美导师”在该确切时刻命令的确切速度和转向角度。

5. “期末考试”(评估)

研究人员并没有只是 dumping 数据;他们将数据组织成五个不同的测试组,以观察机器人的学习效果:

  • 标准测试:它能否使用以前听过的句子找到它认识的物体?
  • 改写测试:如果它只接受过“去椅子那里”的训练,它能否理解“前往椅子那里”?
  • 新物体测试:如果它只接受过“椅子”和“桌子”的训练,它能否找到“桶”?

论文实际发现

  • 效率: “完美导师”非常高效。机器人行驶的距离几乎与它出发时距离目标的距离完全相同(一条直线)。这证实了训练数据的高质量,且没有包含不必要的绕路。
  • 难度: “仓库”场景比“办公室”场景更难。机器人需要更长的时间和更多的步骤来导航杂乱的仓库,证明该数据集捕捉到了现实世界的难度。
  • 局限性:
    • 色盲:当前版本的模拟不知道物体的颜色(所有物体都是“未知”的)。因此,像“去红色椅子那里”这样的指令目前已被从训练数据中移除。
    • 选择偏差: “导师”在非常狭窄的走廊(如医院场景)中表现挣扎,因此数据集中关于导航急转弯的示例较少。它主要展示开阔的路径。
    • 模拟与现实:因为这是一个电子游戏,光照和纹理是完美的。在此处训练的机器人在面对真实房间中杂乱、不完美的光照时可能会感到困惑。

总结

MiniVLA-Nav v1 是一个包含1,174 堂完美驾驶课程的数字图书馆,专为机器人设计。它教导机器人如何聆听指令、环顾虚拟房间,并径直驶向特定物体。其设计目的是帮助研究人员构建更好的“视觉 - 语言 - 动作”模型——即能够同时看、理解语言并移动的机器人。

论文明确指出,这是一个数据集发布和流程描述。实际的训练结果(特定 AI 模型在此数据上的表现)将保留在将来的“配套论文”中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →