← 最新论文
🤖 AI

Think at 5 Hz, Act at 20 Hz: Asynchronous Fast-Slow Vision-Language-Action Inference for Closed-Loop Driving

本文介绍了一种用于闭环驾驶的异步快慢架构,该架构通过缓存表示将冻结的视觉-语言主干网络(以 5 Hz 运行)与轻量级动作专家(以 20 Hz 运行)解耦,从而消除了控制延迟的权衡问题,并显著提高了路径完成率和安全性指标,优于跳帧基准方法。

原作者: Yun Li, Jiachen Gong, Simon Thompson, Ehsan Javanmardi, Qunli Zhang, Zifan Zeng, Shiming Liu, Peng Wang, Zixuan Guo, Manabu Tsukada

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Yun Li, Jiachen Gong, Simon Thompson, Ehsan Javanmardi, Qunli Zhang, Zifan Zeng, Shiming Liu, Peng Wang, Zixuan Guo, Manabu Tsukada

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一辆机器人车自主驾驶,它拥有一个超级聪明的“大脑”,能够阅读地图、理解交通标志,甚至还能和你聊天讨论目的地。这就是视觉-语言-动作(VLA)模型的世界。你可以把这些模型想象成一个结合了海量知识库、摄像头和一套转向指令的庞大图书馆。它们非常擅长理解复杂的场景——比如“在红房子后面左转,但前提是绿灯亮起”。但是,这些模型也非常臃耗且反应迟钝。

现在,想象一下正在驾驶一辆真实的汽车。汽车不会等待你去思考;它需要每秒钟对方向盘和油门进行 20 次(20 Hz)微小的调整,以保持在车道内并避免碰撞。如果汽车的大脑思考时间过长,它会在下一个念头产生之前就偏离航线或发生碰撞。科学家们一直面临的一个难题就是这种不匹配:这个“聪明”的大脑太慢了,跟不上驾驶所需的“快速”反射。为了解决这个问题,以前的系统不得不玩一种奇怪的“等待,然后猜测”的游戏,即汽车先做一个决定,然后在等待大脑赶上进度时,连续重复执行同一个决定好几秒钟。这意味着汽车往往是在基于过时的信息行驶,忽略了眼前正在发生的情况。

这篇论文介绍了一种修复这种不匹配的巧妙新方法,称为快-慢架构(Fast-Slow Architecture)。研究人员并没有强迫沉重缓慢的大脑去做所有事情,而是将工作分成了两个角色。他们有一个“慢系统”(拥有 70 亿参数的大脑),它扮演着一位睿智图书管理员的角色。它会阅读驾驶的长时历史记录和导航指令,但它每隔几秒钟才会更新一次笔记。至关重要的一点是,它保留了一个世界的“站立表示”(standing representation)——即一个关于目前所见之物的缓存摘要——以便随时使用。然后,他们有一个“快系统”(一个只有 3.37 亿参数的轻量级专家),它扮演着一名反射型驾驶员的角色。这个快速专家每 50 毫秒(每秒 20 次)就会抓取图书管理员的缓存笔记和最新的摄像头图像,从而做出即时的转向决策。

研究人员在名为 CARLA 的计算机模拟器中测试了这个系统。他们发现,通过使用这种拆分方法,汽车可以在每一个时钟滴答声中做出新鲜、及时的决策,而不是跳过节拍。结果是惊人的:旧的方法(由于必须跳帧)仅完成了 37% 的测试路线,而这种新的快-慢系统完成了 94% 的路线。它还将闯红灯的情况减少了三分之一。团队证明了这位“快速”专家足够聪明,能够处理图书管理员的笔记略微过时(他们称之为“陈旧性/staleness”)这一事实,因为他们在训练专家时,专门让它学会应对这种延迟。简而言之,他们证明了你不需要让整个大脑变快;你只需要让一位快速的助手利用慢速大脑的缓存智慧来承担繁重的工作,从而让汽车能够安全、平稳地实时驾驶。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →