← 最新论文
💻 computer science

Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model

本文证明了视觉-语言-动作(Vision-Language-Action)模型中的语义驾驶意图可以从早期解码层中线性解码,从而通过剪枝 32 层中的 8 层来实现 1.33 倍的加速,而轨迹误差仅略微增加。

原作者: Harisankar Babu, Benjamin Coors, Christopher Lang, Hendrik Berkemeyer, Tamim Asfour, Simon Foell

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Harisankar Babu, Benjamin Coors, Christopher Lang, Hendrik Berkemeyer, Tamim Asfour, Simon Foell

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人开车。这个机器人不仅仅是盯着路面并踩踏板,它使用了一个由巨大的语言模型构成的庞大“大脑”——这种技术与编写诗歌或回答琐事的技术相同。这个大脑接收来自道路摄像机的视图,像人类一样进行思考,然后向一个更小的、专门的“规划器”低声传递一条秘密指令,由后者实际控制转向。这种设置被称为视觉-语言-动作(VLA)模型。它非常聪明,但有一个问题:这些巨大的大脑反应很慢。它们拥有数十层思考过程,就像一条漫长的流水线,包裹在其中被一个工人传给下一个工人。对于高速行驶的汽车来说,等待全部 32 个工人完成工作太慢了;汽车需要瞬间做出反应。科学家们面临的核心问题是:我们真的需要全部 32 个工人吗?还是说,包裹在经过短短几个站点后就已经准备好发货了,剩下的流水线只是在做不必要的忙碌工作?

这篇论文通过使用一种名为 ORION 的特定驾驶模型,对这个问题进行了深入研究。研究人员将机器人的“大脑”视为一个侦探故事。他们专注于一个神奇的数据片段,叫做“规划标记”(planning token)。你可以把这个标记想象成一个微小的、隐形的便签,机器人通过它来告诉方向盘该往哪里走。机器人的大容量大脑通过 32 层处理这个便签,在每一步都对其进行精炼。研究人员想知道两件事:第一,这个便签是否在早期就包含了“去哪里”的“想法”(比如“左转”)?第二,这个便签是否包含了方向盘实现平稳驾驶所需的“精确指令”?

他们发现了一个迷人的时间线分歧。指令的“想法”几乎是立即准备就绪的。仅仅在经过大脑的第一层之后,机器人的内部便签就已经对指令清晰度达到了 97.7%(例如“合并车道”或“停止”)。这就像机器人甚至在完成第一个念头之前就已经知道自己想做什么了。然而,指令的“精确度”则需要更长的时间。如果你试图使用第一层的便签来实际驾驶汽车,那将会是一场灾难,会大幅偏离目标。只有当便签经过全部 32 层处理后,它才会变得足够精确以实现安全驾驶,并在最后阶段达到最佳精度。

但巧妙之处在于:研究人员意识到,仅仅因为便签在早期层级看起来很混乱,并不意味着信息不存在。它只是意味着便签是用一种方向盘尚无法理解的“代码”书写的。当他们尝试使用一个特殊的解码器来翻译早期的便签时,他们发现信息确实存在,只是格式不对。

那么,我们可以删减中间的工人来让汽车跑得更快吗?团队通过尝试从大脑的流水线中移除层级来进行测试。他们发现,并非所有的层级都同样重要。有些层几乎没有改变便签,只是对其进行了轻微的旋转而没有增加新的含义。通过识别并移除那 8 个做“旋转”工作最少的层,他们可以将大脑从 32 层缩减到 24 层。这并没有让汽车开得完美无缺,但仅使驾驶误差增加了约 5%,这是一个极小的幅度。结果如何?大脑的速度提升了 1.33 倍。

论文总结道,虽然我们不能在不导致撞车的情况下直接砍掉一半的大脑,但我们绝对可以“修剪脂肪”。通过理解“想法”来得早而“精确度”来得晚,并通过移除中间冗余的步骤,我们可以让这些聪明的驾驶机器人变得既快速又智能。这是针对这一类机器人大脑的一个经过衡量且具体的发现,表明通过适当的剪枝,我们可能很快就能拥有既聪明又敏捷的 AI 驾驶员。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →