PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model
本文介绍了 PGN,这是一个基于 OpenPangu-7B 基础模型的离线视觉-语言导航系统,该系统采用两阶段训练策略来对齐视觉与语言模态并适应专家轨迹,在利用 Ascend 910B 硬件进行混合精度计算和 DeepSpeed 加速的同时,在留出数据集上实现了 62.29% 的归一化动作匹配率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人不再仅仅遵循僵化、预设的指令列表,而是能像人类朋友一样理解你的世界。这就是“具身智能”(Embodied AI)的梦想——赋予机器一个身体(或摄像头和轮子),以及一个能够观察房间、聆听你的声音并思考如何移动的大脑。巨大的挑战在于连接两种截然不同的语言:像素与色彩构成的视觉世界,以及句子与指令构成的语言世界。这就像是试图仅凭一幅用诗歌编写的地图来教一只狗如何在房子里穿行。你需要一种方法,将“走过厨房”转化为一系列物理性的转向和步伐。这就是视觉-语言导航(VLN)的核心谜题。它不仅仅是识别物体;它关乎理解一个房间随时间变化的叙事,记住你曾去过哪里,并根据一句简单的句子决定下一步该做什么。
于是有了 PGN,这是一个由电子科技大学的研究人员构建的新系统,旨在利用一个被称为 OpenPangu-7B 的强大“大脑”来解决这个谜题。你可以将 OpenPangu 想象成一个超级智能的预训练语言模型,它已经掌握了如何说话和写作,但它还不知道如何观察和移动。研究人员的目标是通过向它展示图片和指令,教会这个语言巨头如何在虚拟房屋中导航。他们并没有直接把机器人扔进深水区;而是建立了一个两阶段的训练营。首先,他们通过一个名为 Q-Former 的转换模块,将机器人的语言大脑与其专门的摄像头眼睛(视觉编码器)相连,从而教会机器人如何“看”。这让机器人能够理解一张花瓶的照片与“花瓶”这个词之间的联系。
一旦机器人能够理解图像与文字之间的联系,第二阶段便开始了:学习移动。团队向系统输入了数千个由“专家”(一个永不犯错的计算机程序)完成的完美导航路径示例。机器人学会了观察最近连续的五张房间快照,阅读指令,然后——至关重要的一点是——在行动前进行思考。它不是直接脱口而出“左转”,而是被训练在做出动作之前先生成一段简短的推理文本,就像人类会说:“好吧,我看到厨房在我的左边,所以我应该向左转,”然后再执行动作。他们在 500 条隐藏测试路径上测试了这个系统,在这些路径中,机器人被给予了正确的历史观测信息,并被要求预测下一步动作。结果令人期待:在最新的版本(V9)中,机器人在 62.29% 的情况下与专家的动作一致,并且几乎总是给出非空回答(100% 的情况)。然而,作者非常谨慎地指出,这是一个“教师强制”(teacher-forced)测试。这就像是一个学生在做选择题,而老师在每一步都举着正确答案的钥匙。机器人尚未经过测试,以验证如果它犯了错误,它是否能够恢复,或者在没有帮助的情况下,它是否能在真实、混乱的环境中成功到达目标。虽然该系统表明大语言模型可以被改编以理解导航指令并与专家动作对齐,但论文结论指出,要测试这个机器人是否真的能在没有帮助的情况下独立在房子里导航,仍是未来的任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。