← 最新论文
💻 computer science

HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments

本文介绍了 HumanoidVLN,这是一个基于 NVIDIA Isaac Sim 构建的具有物理基础的模拟器和基准测试,它通过支持多种具身形态、生成具备碰撞感知能力的指令数据集以及展示强大的仿真到现实迁移能力,解决了多样化类人机器人视觉-语言导航所面临的独特挑战。

原作者: Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:机器人不再仅仅是像遥控车那样在轮子上滚动,而是在学习像我们一样用双腿行走、踉跄和保持平衡。这就是“人形机器人学”的前沿领域,该领域正试图制造出能够穿梭于我们混乱的现实家庭和办公室中的机器。为了教会这些机器人如何移动,科学家们使用了一个叫做“视觉-语言导航”(Vision-Language Navigation, VLN)的领域。把 VLN 想象成一场机器人的“老师说”(Simon Says)游戏:人类给出一个口头指令,比如“走到厨房并在冰箱旁停下”,然后机器人必须观察四周,理解这些话语,并物理性地移动到正确的位置。

困难之处在于,如今大多数机器人是在视频游戏或模拟器中进行测试的,在那些地方它们可以从一个点“瞬间移动”到另一个点,忽略重力、平衡以及行走之难。但真实的行走充满了物理特性;如果机器人试图转弯太快,它可能会摔倒。这篇论文解决了这样一个核心问题:当我们试图教这些行走机器人如何在不摔倒的情况下遵循指令时,该如何让它们真正地“行走”,以及当每个机器人的外观和动作都略有不同时,我们如何公平地测试它们?


论文:HumanoidVLN

开发 HumanoidVLN 的研究人员意识到,旧有的机器人导航测试方式就像是在泥泞小路上测试一级方程式赛车,然后却把它当作自行车来对待。他们构建了一个全新的、超真实的“游乐场”(模拟器),专门针对行走机器人。他们没有让机器人进行“瞬间移动”,而是通过系统强制它们遵守物理定律。如果机器人尝试跨出的步子太大或转弯太急,它真的会绊倒并摔倒,就像真实的人类可能会发生的那样。

他们为这个游乐场设置了四种不同类型的“人形”机器人。这些机器人并不尽相同;它们的范围从 1.17 米高的机器人(大约是一个高个青少年的高度)到 1.80 米高的巨人。它们还拥有不同数量的腿部关节,这意味着有些机器人比其他的更灵活。团队建立了一个“分层控制”系统来管理它们。你可以把它想象成一个两人小组:一个“运动教练”(强化学习策略),负责教机器人如何保持平衡并行走而不摔倒;以及一个“导航员”(路径追踪器),负责根据人类的语音指令告诉教练该往哪里走。这种设置确保了每一次测试都是真正的物理挑战,而非视频游戏中的小把戏。

为了使测试既公平又真实,团队不仅使用了卡通化的 3D 模型。他们构建了 87 个不同的环境,涵盖了从温馨的客厅到繁忙的工作场所。他们确保每个房间都足够大(至少 100 平方米),这样机器人就不会卡在狭窄且不可能通过的角落里。其中一些房间是由艺术家绘制的,而另一些则是利用一种被称为“3D 高斯泼溅”(3D Gaussian Splatting)的酷炫技术——即将照片转化为 3D 世界的技术——从现实生活中扫描而来的。他们甚至确保摄像机的视角会像真实机器人行走时那样摇晃和摆动,捕捉双足步态带来的颠簸感。

给机器人的指令也是经过精心设计的。他们没有仅仅输入随机的句子,而是使用了一个“多智能体标注”(Multi-Agent Annotation)系统。想象一下一个由 AI 作家、编辑和事实核查员组成的团队在协同工作:两个 AI “生成器”根据机器人行走的视频创建一个路径,一个 AI “审核员”检查该路径是否符合地图逻辑,然后一个“改写器” AI 将指令以三种不同的风格进行重写:正式风格(像老板)、自然风格(像朋友)以及随意的风格(像短信)。最后,真实的人类会对工作进行检查,以确保指令的安全性和准确性。这最终产生了 933 个独特的测试剧集。

在运行测试时,他们发现了一些令人惊讶的事情。他们测试了四种不同的 AI 导航模型,以观察哪一个最擅长在不摔倒的情况下遵循指令。名为 JanusVLN 的模型表现最佳,成功到达目标的概率约为 43.55%,并且能够紧贴路径。然而,结果显示机器人的身体构造非常重要。那个较高的机器人(Unitility H1)比其他机器人挣扎得多,在某些模型下,它的摔倒率接近 70%,而较矮、较稳定的机器人摔倒的频率则低得多。这证明了你不能仅仅在一个机器人上测试导航 AI,就假设它在另一个机器人身上也能奏效;机器人的物理形状和平衡能力改变了一切。

团队还进行了一项“从模拟到现实”(sim-to-real)的试点测试,将其中一个 AI 模型从计算机中取出,应用到真实房间里的真实机器人上。他们发现,机器人在计算机模拟中的表现与在现实世界中的表现几乎完全一致,在偏离航线的程度方面具有极强的相关性。这表明,他们基于物理规律的模拟器是现实世界行为的可靠预测器。

简而言之,HumanoidVLN 不仅仅是一个新的数据集;它是一种看待机器人导航的新方式。它主张,如果我们希望机器人能走上我们的街道、打扫我们的家园,我们就必须停止在那个“无法摔倒”的世界里测试它们。通过将测试植根于真实的物理法则和多样化的机器人躯体,这篇论文向我们展示了:通往实用的行走机器人的道路,是由平衡而非仅仅是代码铺就的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →