LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation
本文提出了“LocalNav”,这是一个将前沿视觉语言模型中复杂的空间语义推理能力蒸馏到轻量化 4B 参数模型中,并通过 E-RLVR 和量化技术进行优化,从而使资源受限的边缘设备能够在不依赖云端执行的情况下,实现高性能、低延迟的目标导向导航框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明但非常沉重的机器人大脑。这个大脑就像一个巨大的知识图书馆,能够理解复杂的指令,比如“找到微波炉下面的抽屉”。问题在于,这个大脑实在太庞大、太沉重了,无法装进小型机器人的体内;它必须住在远方一个巨大的云端计算机里。每当机器人需要做出决策时,它都必须向云端发送一条消息,等待回复,然后行动。这既慢又贵,而且如果机器人在没有网络的地方,就完全无法工作。
这篇论文介绍了一个名为 LocalNav 的新方法,它能将那个巨大的大脑缩小,使其能够装入小型机器人(例如配备了 Jetson Orin 芯片的机器人)中,并完全实现自主运行,无需依赖云端。
他们是如何实现的,主要分为三个简单的步骤:
1. “影子学生”(蒸馏/Distillation)
把那个巨大的云端大脑(比如 Claude 或 GPT)想象成一位名厨。名厨可以烹饪出完美且复杂的佳肴,但由于他需要使用巨大的厨房,所以耗时很长。研究人员想要教一位学生厨师(一个拥有 40 亿参数的小型模型 Qwen3.5-4B)如何烹饪同样的菜肴。
他们并没有强迫学生厨师去阅读数百万本食谱,而是向学生展示了大约 500 个名厨解决导航谜题的具体案例。他们说:“看名厨是如何思考的:‘我看到一个微波炉,所以抽屉一定在它下面。’”通过模仿这些特定的例子,学生厨师学会了像名厨一样进行导航,但其大脑规模足够小,甚至可以装进一个背包里。
- 结果: 这个小型机器人大脑实现了 34.5% 的成功率,非常接近于巨大云端大脑的 39.7%。
2. “简洁教练”(E-RLVR)
但这里有一个问题:这位学生厨师有点过于啰嗦了。当被要求寻找抽屉时,名厨可能会说:“我看到一个银色的电器,看起来像微波炉,而且我记得抽屉通常在微波炉下方,所以我准备去那里。”这说了太多话!对于一个电池容量和处理能力有限的机器人来说,打出这么多文字需要耗费太长时间。
为了解决这个问题,研究人员使用了一种叫做 E-RLVR(具身强化学习,基于可验证奖励)的技术。想象一下一位严厉的教练在观察这位学生机器人:
- 如果机器人回答时间过长或说了太多废话,教练就会给一个“差评”。
- 如果机器人能快速找到物体,并且只用寥寥数语说出“找到抽屉。完成!”,教练就会给它一个“金星”。
机器人学会了“去做”而不是“去说”。它学会了如何用最少的文字来完成任务。这让它思考和说话的时间缩短了 71.8%。
3. “紧凑套装”(量化/Quantization)
最后,为了让机器人运行得更快,他们给机器人的大脑穿上了一件“紧凑套装”。这是一个被称为量化的技术手段,就像是将一张高分辨率照片压缩成较小的文件格式,同时又不丢失重要的细节。这使得机器人的大脑在小型硬件上运行得更加迅速。
最终成果
通过结合这三种技巧:
- 向大师学习(蒸馏),
- 学习保持简洁(E-RLVR),以及
- 压缩大脑(量化),
研究人员创造出了一个能够理解复杂指令(如“找到坐在桌子旁的人”)并在真实的公寓里完全自主导航的机器人。
在现实世界的测试中,他们将一台手持机器人送入一间公寓,完成了四个不同的任务:寻找沙发、钢琴、浴缸和一个人。机器人成功地构建了房间的心理地图,找到了目标物体,并准确地停在了需要的位置,这证明了小型本地大脑完全可以胜任巨大云端大脑的工作。
简而言之: 他们把一个超级聪明但反应迟钝的云端大脑,教给了一个能模仿其思维方式的小型本地大脑,又教会了这个小脑不再喋喋不不,最后将其挤进了一个精巧的包装中。现在,机器人可以在设备端快速思考并行动。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。