← 最新论文
💻 computer science

FLARE: Learning Future-Aware Latent Representations from Vision-Language Models for Autonomous Driving

FLARE 是一个新颖的框架,它通过自监督未来特征预测目标和组相对策略优化,利用预训练视觉 - 语言模型实现自动驾驶,在无需劳动密集型语言标注的情况下,于 NAVSIM 基准测试中实现了最先进的性能。

原作者: Chengen Xie, Chonghao Sima, Tianyu Li, Bin Sun, Junjie Wu, Zhihui Hao, Hongyang Li

发布于 2026-03-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Chengen Xie, Chonghao Sima, Tianyu Li, Bin Sun, Junjie Wu, Zhihui Hao, Hongyang Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教机器人开车。你有两种主要方法:

  1. “健谈老师”法:你向机器人展示一段视频,让它用文字描述所见(“车是红色的”、“灯是绿色的”),然后让它解释为什么应该转弯。最后,你让它把驾驶指令写成一句话。

    • 问题:这就像试图只靠阅读一本用外语写成的手册来开车。机器人花费太多时间将“文字”翻译成“方向盘动作”。这种方法既缓慢又低效,而且常常错过道路上那些微妙、未言明的感觉(比如繁忙路口的“氛围”)。
  2. “FLARE”法(本文提出):与其让机器人说话,不如让它想象

核心理念:“心理模拟”

作者创建了一个名为FLARE的系统。与其强迫机器人生成关于未来的文字描述,他们训练它在一个特殊的、高层级的“心理地图”中预测下一场景的样子

可以这样理解:

  • 旧方法:机器人看着道路,思考“我看到一个停车标志,所以我必须停下”,然后把它写下来。
  • FLARE 方法:机器人看着道路,瞬间可视化接下来的几秒钟。它不会说“我会停下”,而是直接知道如果停下与继续前行,视野分别会是什么样子。它通过在其内部视觉而非词汇库中玩“接下来会发生什么?”的游戏来学习。

工作原理(三大魔法技巧)

1. “未来凝视”(自监督学习)
通常,为了教机器人,人类必须编写成千上万个标签,如“向左转”或“避开行人”。这既昂贵又缓慢。
FLARE 跳过了人工标签。它观察一段汽车行驶的视频,并问道:“如果汽车继续做它正在做的事,2 秒后道路会是什么样子?”
它尝试重构那个未来时刻的详细“心理快照”(使用名为 DINOv2 的特征图)。通过不断猜测未来并将其答案与实际视频进行比对,机器人无需任何人告诉它任何单词,就能学会驾驶的物理原理和交通流。这就像通过摔倒再爬起来学习骑自行车,而不是阅读物理书籍。

2. “智能翻译器”(融合模块)
机器人拥有两个“大脑”:一个负责观察世界(摄像头),另一个负责感知车辆状态(速度、加速度、转向)。
FLARE 使用一种特殊的“翻译器”将这两个大脑融合在一起。它不是简单地将所有数据堆砌在一起,而是问道:“鉴于我们正以 30 英里/小时的速度左转,此刻道路图像的哪一部分最重要?”这确保了机器人的决策既基于其所见,也基于车辆的实际运动状态。

3. “安全教练”(GRPO)
一旦机器人掌握了基础知识,作者就使用了一种名为组相对策略优化(GRPO)的技术。
想象机器人正在练习驾驶。与其仅仅模仿人类驾驶员(模仿学习),机器人会为同一情境生成
六种不同的可能路径

  • 路径 A:漂移得太靠近卡车。
  • 路径 B:停得太突然。
  • 路径 C:平稳、安全且保持在车道内。
    “教练”(GRPO)审视所有六条路径,选出最好的一条(路径 C),并告诉机器人:“多做这类,少做其他类。”这教会机器人优先考虑安全和舒适,而不仅仅是模仿人类的行为。

结果

该团队在著名的驾驶基准测试NAVSIM上对此进行了测试。

  • 得分:FLARE 在所有使用视觉 - 语言模型(VLM)的系统中取得了最佳结果
  • 效率:它仅使用一个摄像头(就像普通汽车一样)就做到了这一点,而许多其他顶级系统则使用昂贵的 3D 传感器(激光雷达)或多个摄像头。
  • 惊喜:它击败了规模大两倍的系统(80 亿参数对比 40 亿参数),以及那些依赖大量人工编写文本标签的系统。

为什么这很重要

该论文认为,我们不需要强迫机器人“说话”来理解世界。通过直接教它们可视化未来,我们可以释放大型 AI 模型内部巨大的知识潜力,而无需承担人工标注的高昂成本。这是一种从“教机器人写日记”到“教机器人梦想道路”的转变。

简而言之:FLARE 通过让自动驾驶汽车在脑海中玩“接下来会发生什么?”的游戏,用安全教练来优化其答案,并完全跳过撰写文字描述的枯燥环节,从而教会自动驾驶汽车。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →