← 最新论文
💻 computer science

DriveStack-VLA: Render-Teacher Alignment for BEV-Based DeepStack Vision-Language-Action Model

DriveStack-VLA 是一个基于鸟瞰图(Bird's-Eye-View)的视觉-语言-动作框架,通过集成 DeepStack 式的 BEV 表示、用于感知一致性的渲染教师(Render-Teacher)对齐以及用于轨迹精细化的自我批判模块,增强了自动驾驶中的空间智能与运动规划能力,并在 NAVSIM 和 Bench2Drive 基准测试中实现了最先进的性能。

原作者: Jingke Wang, Zhenru Zhao, Shuangming Lei, Hao Su, Yuehao Huang, Yijia Xie, Kai Tang, Guanglin Xu, AiXue Ye, Yukai Ma, Yong Liu

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Jingke Wang, Zhenru Zhao, Shuangming Lei, Hao Su, Yuehao Huang, Yijia Xie, Kai Tang, Guanglin Xu, AiXue Ye, Yukai Ma, Yong Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于 DriveStack-VLA 论文的解释,通过使用日常类比将其拆解为简单的概念。

大局观:教机器人开车

想象一下,你正在尝试教一个全新的机器人如何开车。你有两种主要的方法可以做到这一点:

  1. “书本知识”法: 你给机器人一个庞大的驾驶手册和规则库(这就像是一个大型语言模型或 LLM)。它完美掌握了理论,但从未真正见过马路。
  2. “街头智慧”法: 你让机器人观看数小时的行车记录仪视频(这就是视觉部分)。它看到了发生的一切,但并不理解交通规则。

DriveStack-VLA 是一个结合了这两者的全新系统。它选取了一个已经掌握了规则的机器人(“书本知识”),并通过向它展示视频片段来教授驾驶技巧,但它还加入了一个特别的转折,以确保机器人不会被摄像头的视角所迷惑。


问题所在:“鱼缸效应”

论文指出,目前的 AI 驾驶员有一个重大缺陷:它们通过透视相机(类似于人类眼睛或手机摄像头)来看待世界。

  • 类比: 想象你通过一面哈哈镜来看城市的地图。你可以看到建筑物,但距离被扭曲了,布局也发生了变形。
  • 问题: 当 AI 查看标准的相机图像时,它看到的是一个“哈哈镜”视图。它可能看到一辆车因为离得近而显得巨大,或者一条车道看起来弯曲得非常厉害。这使得 AI 很难规划安全路径,因为它缺乏真实的几何感(距离和形状)。

解决方案:DriveStack-VLA

作者构建了一个三步走的训练过程来解决这个问题。把这看作是机器人的三个学期的课程。

第一步:“蓝图”与“老师”(SFT)

在第一阶段,机器人学习同时以两种不同的方式观察道路。

  1. 蓝图 (BEV DeepStack):

    • 类比: 机器人不再仅仅盯着哈哈镜看,它还被给予了一张鸟瞰图 (BEV)——一张平面的、自上而下的道路蓝图,就像一个棋盘。
    • 创新点: 他们使用了一个“DeepStack”连接,将这个蓝图直接注入机器人的大脑,同时它也在观察相机画面。这就像是在你开车时,有一张 GPS 地图投影在你的挡风玻璃上,这样你就能始终清楚自己相对于车道的精确位置。
  2. “老师” (Render-Teacher Alignment):

    • 类比: 有时,真实的道路是很杂乱的——有阴影、眩光和污垢。为了教机器人哪些东西是重要的,他们使用了一个“老师”图像。这是一个**计算机生成的(栅格化)**道路版本。它是干净、明亮的,并清晰地标注出了车道和车辆的位置。
    • 创新点: 机器人同时观察杂乱的真实照片和干净的“老师”照片。系统强制要求机器人关注这两张图像中的相同事物。如果机器人在真实照片中看向一棵树,它也必须在干净的照片中看向那棵树。这教会了机器人忽略干扰因素(如阳光眩光),并专注于重要的事物(车道和车辆)。

第二步:“教练”(强化学习微调)

在第二阶段,机器人开始练习。

  • 类比: 想象一位驾驶教练坐在副驾驶座上。机器人尝试驾驶,而教练会给它评分。
  • 创新点: 机器人生成几种不同的可能路径(轨迹)。系统充当“教练”(使用一种称为 GRPO 的算法),奖励机器人进行安全、平稳的驾驶,并惩罚其碰撞或驶离道路的行为。这有助于机器人学会选择最好的路径,而不只是一条路径。

第三步:“自我批判者”(评分与精炼)

在最后阶段,机器人学会了评价自己的工作。

  • 类比: 想象一个正在考试的学生。在交卷之前,他们会检查一遍答案,意识到其中一个看起来不太稳妥,然后进行修正。
  • 创新点: 系统包含一个“评论家”模块。它查看机器人生成的路径并进行评分。如果最佳路径还不够好,评论家会建议进行微小的调整以使其更安全。这确保了在汽车实际移动之前,最终的决策是高质量的。

结果

论文声称,这个新系统 DriveStack-VLA 是同类中最优秀的。

  • 它在标准驾驶测试 (NAVSIMv1) 中获得了 91.6 分,击败了所有类似的 AI 模型。
  • 它在避免碰撞和保持在车道内方面表现更好,因为它理解道路的“几何结构”(得益于蓝图)并且能忽略视觉干扰(得益于老师)。

总结

DriveStack-VLA 是一种不仅能“看见”道路,还能“理解”地图的驾驶 AI。通过结合顶层蓝图和干净的“老师”图像,它教会了 AI 忽略视觉噪声,并专注于驾驶安全所需的几何信息。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →