Latency-Tolerant Cloud-Edge Collaborative Vision-Language-Action Models via Emergent Representational Specialization
本文介绍了 CloudEdgeVLA,这是一个云边协作框架,通过训练云端编码器生成鲁棒且缓慢变化的任务特征,并利用轻量化边缘头将其与实时局部观测进行集成,从而解决了视觉-语言-动作模型中的延迟-控制冲突,并在现有方法失效的显著网络延迟情况下实现了高成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人不再仅仅是笨重的金属盒子,而是能够理解你的声音、像我们一样观察世界,并能真正为你做事的好帮手。这就是“视觉-语言-动作”(VLA)模型的梦想。把它们想象成机器人的大脑,结合了一个巨大的知识库(语言)、一双敏锐的眼睛(视觉)和一双手(动作)。问题在于,这些大脑太庞大了。它们如此巨大且沉重,以至于无法装进一个小型的、由电池驱动的机器人中。因此,科学家们尝试将大脑进行拆分:沉重的思考过程发生在遥远的强大“云端”计算机中,而机器人则在自己的身体上保留一套微小的、快速的反射系统。
但问题在于,云端很遥远,发送信息需要时间。如果机器人等待云端说“拿起杯子”,可能杯子已经掉在地上了,或者机器人已经移动了位置。这就像是在玩一款视频游戏,你的控制器连接着地球另一端的服务器;当你按下“跳跃”指令时,你可能已经掉下悬崖了。大问题是:我们如何让机器人既足够聪明,能使用巨大的云端大脑,又足够敏捷,能对现实世界做出反应,而不至于陷入僵死状态?
这正是开发 CloudEdgeVLA 的研究人员试图解决的问题。他们意识到,以往尝试拆分机器人大脑的方法之所以失败,是因为它们试图强迫云端和机器人保持完美的同步,而当网络缓慢或不稳定时,这几乎是不可能的。与其对抗延迟,他们决定教机器人的大脑学会与延迟“共处”。
以下是他们的新系统是如何工作的,这里用一个简单的类比:想象机器人是一名快递员,而云端是一位坐在遥远高塔里的睿智的老导航专家。在旧的方法中,快递员会等待专家每秒钟喊出一次新的方向。如果风把专家的声音吹走了(网络延迟),快递员要么就站在原地等待,要么就会根据过时的指令胡乱猜测。
CloudEdgeVLA 改变了这种关系。云端专家不再喊出具体的、具有时效性的命令,比如“现在左转”。相反,专家会发送一份变化缓慢的“任务简报”,上面写着:“我们的目标是将玩具熊放入箱中。”这份任务简报就像一张即使你看晚了几秒钟也不会发生太大变化的地图。与此同时,机器人快递员拥有自己的眼睛(“边缘”系统),能看到“此时此刻”的世界。快递员通过观察来自云端的任务简报来了解目标,但会利用自己新鲜的视觉来决定如何移动双手,以避开水洼或移动的障碍物。
这种协作方式的精妙之处在于他们是如何训练这个团队的。研究人员不仅教会了机器人遵循指令,还教会了它如何处理“陈旧”的信息。在训练期间,他们会向机器人展示一个场景的图片,然后在几秒钟后展示同一个场景,但要求机器人根据“旧图片”的指令来执行“当前时刻”的动作。这就像是在练习一场音乐延迟的舞蹈:你学习在保持节奏(云端的计划)稳定的同时,利用你的双脚(机器人的本地视觉)即时适应地板的实际纹理。
结果令人印象深刻。在名为 LIBERO 的一系列测试中,机器人必须完成各种任务,如堆叠积木或移动物体,新系统即使在“云端”信号延迟高达 40 步(或帧)的情况下仍能正常工作。而其他试图实现完美同步的系统则几乎完全崩溃失败(成功率降至接近零),CloudEdgeVLA 则保持在 63.8% 到 78.0% 之间的成功率。即使延迟巨大,机器人也不会僵死;它只是利用了它所拥有的最新的“任务简报”,并用自己的眼睛进行调整。
研究人员还在真实的机器人手臂上进行了测试,而不仅仅是在计算机模拟中。当他们增加了 1000 毫秒(整整一秒)的连接延迟时,旧系统完全失效,但 CloudEdgeVLA 仍能实现 70% 到 80% 的成功。这表明,通过将延迟视为一个学习问题而非一个需要修复的漏洞,我们可以构建出既聪明又反应迅速的机器人,即使它们的“大脑”远在千里之外。
简而言之,这项研究表明,我们不需要等待更快的互联网来制造智能机器人。我们只需要教会它们在聆听来自云端的长期计划时,保持双眼对当下的敏锐观察。这是迈向未来的一项实践性举措——让机器人既能拥有高度的智能,又能提供切实的帮助,而不必非要与一台超级计算机紧紧相连。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。