← 最新论文
💻 computer science

ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-LLM Sparsification for Vision-Language-Action Models

该论文提出了 ETA-VLA 框架,通过引入受人类驾驶员注意力启发的“层内稀疏聚合器(ILSA)”,利用文本引导和时序一致性动态剪枝冗余视觉 Token,在显著降低自动驾驶视觉 - 语言 - 动作模型计算量的同时,保持了与最先进基准相当的性能。

原作者: Yiru Wang, Anqing Jiang, Shuo Wang, Yuwen Heng, Zichong Gu, Hao Sun

发布于 2026-03-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiru Wang, Anqing Jiang, Shuo Wang, Yuwen Heng, Zichong Gu, Hao Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 ETA-VLA 的新方法,旨在让自动驾驶汽车变得更聪明、更快速,同时又不那么“烧脑”(节省算力)。

为了让你轻松理解,我们可以把自动驾驶系统想象成一位正在开车的“超级司机”,而这篇论文就是给这位司机配备的一套**“高效驾驶辅助系统”**。

1. 核心问题:司机“脑子”不够用了

现在的自动驾驶模型(VLA)非常强大,它们像人一样能看懂路、听懂指令(比如“左转”),然后做出动作。但是,为了开得稳,它们需要同时处理:

  • 多视角:车上有 6 个摄像头(前、后、左、右等),就像司机有 6 只眼睛。
  • 多帧历史:为了判断车速和趋势,司机不能只看眼前这一秒,还得回想过去几秒发生了什么。

这就好比: 这位司机不仅要同时盯着 6 个屏幕,还要把过去 10 秒钟里这 6 个屏幕上的每一帧画面都背下来,然后在大脑里(大语言模型 LLM)进行复杂的思考。

  • 后果:大脑(算力)瞬间过载,反应变慢,甚至死机。这就是论文里说的“计算负担太重”。

2. 解决方案:ETA-VLA 的两大绝招

为了解决这个问题,作者给这位司机装了两套“外挂”:

第一招:时间融合模块 (TFM) —— “记忆压缩术”

  • 比喻:想象司机在开车时,不需要把过去 10 秒里每一帧画面都原封不动地记在脑子里。他只需要记住关键的变化。
    • 比如:过去 5 秒里,前面的车一直匀速行驶,司机大脑会自动把这段“无聊”的时间压缩成“车在匀速前进”这一个概念。
    • 只有当有突发情况(比如有人突然冲出来)时,才会保留详细的画面。
  • 作用:这个模块把过去多帧、多视角的杂乱画面,自动“压缩”成一段精炼的、包含关键信息的“记忆摘要”。这样,司机的大脑就不需要处理海量的原始数据了。

第二招:LLM 内部稀疏聚合器 (ILSA) —— “智能注意力过滤器”

这是论文最精彩的部分。即使压缩了记忆,大脑里要处理的信息还是很多。这时候,ILSA 就像一位**“精明的副驾驶”**。

  • 传统做法的缺点:以前的系统像是一个**“平均主义者”**。它不管你在直行还是转弯,都均匀地分配注意力给所有摄像头。
    • 场景:当你被要求“直行”时,它依然花大量精力去分析左后方的摄像头(那里可能只是空荡荡的停车场),这就浪费了算力。
  • ETA-VLA 的做法(模仿人类):
    1. 听指挥(文本引导):副驾驶会看司机的指令。如果指令是“直行”,它就会把注意力**90%**集中在正前方的路面上,自动忽略那些不重要的背景。
    2. 防遗漏(多样性保留):但是,副驾驶很聪明,它知道虽然主要看前面,但绝对不能完全忽略盲区。所以,它会强制保留每个摄像头里的一小部分“最独特”的画面(比如侧后方突然出现的行人),防止因为过度聚焦而撞车。
    3. 不看位置看内容:以前的系统容易受“画面位置”干扰(比如觉得离得近的就重要),而这个新系统只看**“内容是否相关”**。不管物体在画面的哪个角落,只要它和“直行”这个任务有关,就保留;无关的,直接扔掉。

3. 效果如何?

这套系统就像给司机装了一个**“超级大脑”**,既保留了人类的直觉,又去掉了多余的杂念。

  • 省资源:它砍掉了 85% 的无用画面信息(Token),让计算量减少了 32%。这意味着可以在更便宜、更小的车载电脑上运行,不需要昂贵的超级计算机。
  • 不降质:虽然扔掉了那么多信息,但它的驾驶水平(评分)依然保持在 94% 以上,甚至超过了之前的顶尖模型。
  • 更安全:因为它模仿了人类司机“该看哪里就看哪里”的注意力分配机制,所以在处理复杂路况时更稳健。

总结

ETA-VLA 的核心思想就是:不要试图记住所有东西,要像人类一样,学会“抓重点”和“略过无关项”。

它通过压缩历史记忆和智能筛选当前画面,让自动驾驶汽车在算力有限的情况下,依然能像老司机一样,眼观六路、耳听八方,既开得稳,又跑得快。这为未来把高级自动驾驶装进普通家用车里铺平了道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →