FlashDrive: Flash Vision-Language-Action Inference for Autonomous Driving
FlashDrive 是一个算法-系统协同设计框架,它同时优化了自动驾驶视觉-语言-动作(Vision-Language-Action)模型中的四个计算瓶颈,在保持或提高准确率以实现实时部署的同时,使一个 10B 参数模型的延迟降低了 4.7 倍(从 717 毫秒降至 151 毫秒)。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图驾驶一辆思维像人类一样,但动作却像树懒一样缓慢的汽车。这就是目前自动驾驶领域“视觉-语言-动作”(VLA)模型的现状。你可以将这些模型想象成一个超级聪明的副驾驶:它不仅能看到道路(视觉),还能对自己进行思考和对话(语言),并最终实际操控方向盘(动作)。这些模型不再使用针对每种情况的、僵化的独立规则,而是尝试像人类一样对复杂的、混乱的交通场景进行推理。问题在于,它们极其缓慢。目前,做出一个决策所需的时间长到让汽车几乎处于停滞状态,如果是在高速行驶时,这会非常危险。科学家们正在提出的核心问题是:我们如何让这个“超级大脑”思考得足够快,以便在不损失智能的前提下实现实时驾驶?
FlashDrive 应运而生,这是一个旨在将这个行动迟缓的超级计算机转变为速度达人的新框架。研究人员发现,这种缓慢并非由一个大问题引起的,而是由四个较小的、截然不同的瓶颈组成的链条,每个瓶颈都在以不同的方式浪费能量。他们将汽车的大脑比作一条繁忙的工厂流水线,并发现四个特定的环节中,工人们正在做不必要的琐碎杂活。
首先,视觉编码器(眼睛)一直在反复阅读视频中的相同部分。想象一下看电影时,为了理解当前的场景,每一秒钟你都必须重新读一遍之前一小时的剧本。FlashDrive 通过使用“流式处理”(streaming)解决了这个问题,即模型只观察新的帧并记住其余部分,从而将视觉处理时间缩减了约 75%。
其次,预填充阶段(准备思考)也犯了同样的重复阅读错误。模型在重新计算上一时刻已经掌握的上下文。FlashDrive 通过承接上一步的“记忆”解决了这个问题,这样大脑就不必每次都从零开始。
第三,解码阶段(实际思考)表现得过于“礼貌”。它在逐个生成推理词汇,就像一个人在缓慢地低声耳语,尽管答案显而易见且可预测。FlashDrive 引入了一种“投机性”(speculative)方法,利用一个快速、轻量级的草稿模型来一次性预测一整块推理内容。这就像是有一个速读助手迅速写下整个段落,而主脑只需快速检查是否正确。这把一个缓慢的、步进式的过程变成了一次快速的思想爆发。
最后,动作阶段(移动汽车)在细节上过度思考了。它运行了许多复杂的数学步骤来平滑路径,尽管路径的中段其实枯燥且可预测。FlashDrive 意识到,汽车运动的“速度”仅在转弯的起始和结束阶段会发生剧烈变化。因此,它开始对枯燥的中段步骤进行“缓存”(保存),只在真正需要的地方进行繁重的数学运算。
通过将这四种巧妙的捷径与系统层面的技巧(例如优化计算机工作流程以避免排队等待)相结合,FlashDrive 实现了惊人的成就。在一块强大的显卡上,它将做出驾驶决策所需的时间从 717 毫秒 缩减到了 151 毫秒。这意味着 4.7 倍 的加速,将汽车的控制频率从缓慢的每秒 1.4 次提升到了敏捷的每秒 6.6 次。
至关重要的是,论文表明这种速度提升并没有以牺牲安全或准确性为代价。在模拟实验中,汽车保持车道和避开障碍物的能力几乎保持不变,甚至某些指标还有所提升。研究人员在包括高性能工作站和小型边缘设备在内的各种硬件上进行了测试,发现 FlashDrive 让实时、端到端的自动驾驶离现实更近了一步。他们不仅让汽车变快了,还让它快到了足以在道路上实际行驶的程度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。