← 最新论文
💻 computer science

CrossTracer: Cross-Embodiment Navigation via VLA Model Reasoning and Trace Residuals Adapting

CrossTracer 是一个层级化框架,它通过结合基于 VLA 的轨迹提议器与通过自动化 CE-RRT* 训练的具身条件残差适配器,来实现跨具身机器人导航,从而生成在物理上可行的像素空间导航规划,并显著超越了最先进的基准模型。

原作者: Yao Wang, Siyuan Wang, Zhirui Sun, Wenzheng Chi, Liang Lin, Jiankun Wang, Wenjun Xu

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yao Wang, Siyuan Wang, Zhirui Sun, Wenzheng Chi, Liang Lin, Jiankun Wang, Wenjun Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在拥挤、凌乱的房间里行走。你可能会对它说:“去把桌子上的那个红杯子拿过来。”一个超级聪明的机器人大脑(被称为视觉-语言-动作模型)能完美理解这句话。它知道什么是“红杯子”,知道“桌子”通常在哪里,也知道“拿取”是什么意思。但棘手的地方在于,这个机器人大脑并不知道这个机器人是一个摇摇晃晃的双足步行者、一个平滑的四轮小车,还是一个蹦蹦跳跳的类狗机器。对于聪明的脑子来说,迈一小步上路缘石看起来就像一条简单的路径。但对于轮式机器人,这个路缘石就是一堵墙;对于腿式机器人,这却是一个有趣的跳跃。如果机器人试图遵循一条不符合其身体特征的路径,它就会发生碰撞。这篇论文解决的正是一个这样的问题:我们如何将一个聪明的、通用的路径构想进行微调,使其真正适用于尝试走这条路的特定机器人?

开发 CrossTracer 的研究人员意识到,解决这个问题最好的方法不是强迫聪明的脑子同时学习每一种机器人的身体构造。相反,他们构建了一个两步走的团队。首先,一个“视觉-语言轨迹提议者”(我们称之为“梦想家”)观察房间和目标,并在纸上画出一个粗略的、理想的路径。这条路径对于“旅程的概念”来说是完美的,但它并不关心机器人拥有的是轮子还是腿。然后,第二个团队成员——“CE-适配器”(即“现实检查员”)会观察那幅粗略的图画和特定的机器人身体。它会说:“嘿,‘梦想家’忘了轮子不能爬楼梯了,”然后画出红色的小箭头,将路径推离楼梯,引导至平坦的地面。他们将这些微调称为“轨迹残差”。

为了教会“现实检查员”如何做到这一点,而不需要人类手动绘制成千上万条完美的路径,该团队发明了一个巧妙的训练技巧,叫做 CE-RRT*。想象一个虚拟机器人,它能瞬间看清整个房间,并且确切知道哪些地面对轮子是安全的,哪些对腿部是安全的。这个虚拟机器人运行一个快速的计算机搜索,为每种机器人类型找到最安全的路径,并使用这些计算机生成的路径作为“正确答案”来教导“现实检查员”。这就像拥有一个超快速的模拟器,承担了处理物理规律的繁重工作,这样 AI 就可以从错误中学习,而不会在现实中撞毁真实的机器人。

当他们测试这个系统时,结果非常令人印象深刻。在名为 NaviTrace 的标准测试中,CrossTracer 得分为 45.68 分。这大幅超过了他们对比的最强的通用 AI 模型(Gemini-2.5-Pro)——高出了约 10 分,即 28% 的提升。论文指出,这一巨大的飞跃来自于“现实检查员”修正“梦想家”错误的能力。当他们移除“现实检查员”,只让“梦想家”绘制路径时,得分大幅下降至 22.56,证明了“微调”这一步骤是必不可少的。

他们不仅在计算机测试中进行了实验,还在现实世界中将该系统应用于真实的机器人。他们将该系统安装在了一个轮式机器人和一个腿式机器人上。结果显示,Cross-Tracer 帮助机器人更频繁且更快地达到了目标。对于轮式机器人,成功率从 40% 提高到了 65%;对于腿式机器人,则从 45% 跳升到了 70%。论文表明,这种方法使机器人变得更加可靠,帮助它们避免碰撞,并找到符合其特定身体结构的更平滑的路线。虽然该系统仍然依赖于计算机“看清”地面的能力(如果计算机误将地毯识别为墙壁,机器人可能会感到困惑),但这种方法表明,将“做什么”与“怎么做”分离是一种让机器人变得更聪明、更安全的高效方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →