想象一下,你正在教机器人开车。你有两种主要方法:
“健谈老师”法:你向机器人展示一段视频,让它用文字描述所见(“车是红色的”、“灯是绿色的”),然后让它解释为什么应该转弯。最后,你让它把驾驶指令写成一句话。
- 问题:这就像试图只靠阅读一本用外语写成的手册来开车。机器人花费太多时间将“文字”翻译成“方向盘动作”。这种方法既缓慢又低效,而且常常错过道路上那些微妙、未言明的感觉(比如繁忙路口的“氛围”)。
“FLARE”法(本文提出):与其让机器人说话,不如让它想象。
核心理念:“心理模拟”
作者创建了一个名为FLARE的系统。与其强迫机器人生成关于未来的文字描述,他们训练它在一个特殊的、高层级的“心理地图”中预测下一场景的样子。
可以这样理解:
- 旧方法:机器人看着道路,思考“我看到一个停车标志,所以我必须停下”,然后把它写下来。
- FLARE 方法:机器人看着道路,瞬间可视化接下来的几秒钟。它不会说“我会停下”,而是直接知道如果停下与继续前行,视野分别会是什么样子。它通过在其内部视觉而非词汇库中玩“接下来会发生什么?”的游戏来学习。
工作原理(三大魔法技巧)
1. “未来凝视”(自监督学习)
通常,为了教机器人,人类必须编写成千上万个标签,如“向左转”或“避开行人”。这既昂贵又缓慢。
FLARE 跳过了人工标签。它观察一段汽车行驶的视频,并问道:“如果汽车继续做它正在做的事,2 秒后道路会是什么样子?”
它尝试重构那个未来时刻的详细“心理快照”(使用名为 DINOv2 的特征图)。通过不断猜测未来并将其答案与实际视频进行比对,机器人无需任何人告诉它任何单词,就能学会驾驶的物理原理和交通流。这就像通过摔倒再爬起来学习骑自行车,而不是阅读物理书籍。
2. “智能翻译器”(融合模块)
机器人拥有两个“大脑”:一个负责观察世界(摄像头),另一个负责感知车辆状态(速度、加速度、转向)。
FLARE 使用一种特殊的“翻译器”将这两个大脑融合在一起。它不是简单地将所有数据堆砌在一起,而是问道:“鉴于我们正以 30 英里/小时的速度左转,此刻道路图像的哪一部分最重要?”这确保了机器人的决策既基于其所见,也基于车辆的实际运动状态。
3. “安全教练”(GRPO)
一旦机器人掌握了基础知识,作者就使用了一种名为组相对策略优化(GRPO)的技术。
想象机器人正在练习驾驶。与其仅仅模仿人类驾驶员(模仿学习),机器人会为同一情境生成六种不同的可能路径。
- 路径 A:漂移得太靠近卡车。
- 路径 B:停得太突然。
- 路径 C:平稳、安全且保持在车道内。
“教练”(GRPO)审视所有六条路径,选出最好的一条(路径 C),并告诉机器人:“多做这类,少做其他类。”这教会机器人优先考虑安全和舒适,而不仅仅是模仿人类的行为。
结果
该团队在著名的驾驶基准测试NAVSIM上对此进行了测试。
- 得分:FLARE 在所有使用视觉 - 语言模型(VLM)的系统中取得了最佳结果。
- 效率:它仅使用一个摄像头(就像普通汽车一样)就做到了这一点,而许多其他顶级系统则使用昂贵的 3D 传感器(激光雷达)或多个摄像头。
- 惊喜:它击败了规模大两倍的系统(80 亿参数对比 40 亿参数),以及那些依赖大量人工编写文本标签的系统。
为什么这很重要
该论文认为,我们不需要强迫机器人“说话”来理解世界。通过直接教它们可视化未来,我们可以释放大型 AI 模型内部巨大的知识潜力,而无需承担人工标注的高昂成本。这是一种从“教机器人写日记”到“教机器人梦想道路”的转变。
简而言之:FLARE 通过让自动驾驶汽车在脑海中玩“接下来会发生什么?”的游戏,用安全教练来优化其答案,并完全跳过撰写文字描述的枯燥环节,从而教会自动驾驶汽车。
技术摘要:FLARE——从视觉语言模型中学习面向未来的潜在表征以用于自动驾驶
1. 问题陈述
当前的端到端自动驾驶(AD)系统在整合视觉语言模型(VLMs)时面临两个主要局限:
- 标注瓶颈与语义偏差:现有方法严重依赖劳动密集型语言标注(例如视觉问答、场景描述)来将 VLM 与驾驶任务对齐。这种范式收益递减,引入了与实际驾驶行为不一致的语义偏差,且未能充分利用大型 VLM 的参数容量。
- 离散 - 连续不匹配:VLM 使用的离散语言令牌与驾驶轨迹的连续性质之间存在根本性的不兼容。将动作令牌化会导致离散化误差、稀疏的监督信号以及不稳定的控制策略,使其难以处理细粒度的运动规划。
该论文认为,依赖显式文本生成或动作令牌化会阻碍 VLM 有效学习驾驶动力学中那些 tacit(意会)、不可言说的细微差别。
2. 方法论:FLARE 框架
FLARE(面向未来的潜在表征)是一个新颖的端到端框架,旨在激活预训练 VLM 的视觉语义能力,而无需语言监督。它通过三个核心组件弥合了高层推理与底层控制之间的差距:
A. 自监督未来特征预测
FLARE 不将目标对齐于文本,而是引入一个自监督目标,直接在潜在空间中预测未来的场景动态。
- 机制:模型被训练以重建未来帧的细粒度DINOv2 特征图块,而非生成文本或像素级图像。
- 原理:预测语义图块迫使骨干网络捕捉空间明确的场景动态和物体持久性。这提供了稠密的、连续的梯度,比稀疏的动作令牌更有效地利用了 VLM 的容量。
- 心理模拟:通过将预测器条件化于计划的动作意图,模型执行“动作条件”的未来模拟,预判特定决策如何影响环境。
B. 基于分层的查询融合模块
为了有效利用 VLM 的输出进行规划,FLARE 采用了两阶段的多模态注意力池化(MAP)机制:
- 视觉压缩:视觉令牌被压缩为一组紧凑的视觉潜在变量,提炼出场景级的语义内容。
- 状态条件聚合:一个动作 MAP 模块将这些视觉潜在变量聚合成单个决策向量。关键在于,该过程使用车辆的自车状态嵌入(速度、加速度、历史轨迹)作为初始化查询。这确保了视觉聚合是基于车辆的动态状态和导航意图进行条件化的。
C. 双头预测与 GRPO 优化
该框架采用双头架构:
- DiT 规划器:一个条件扩散 Transformer(DiT)生成多模态未来轨迹,其基础是融合的动作查询和物理约束。
- 未来特征预测器(FFP):辅助头预测目标帧的 DINOv2 特征。
训练策略:
- 阶段 1(监督微调 - SFT):模型通过复合损失进行联合优化,该损失平衡了轨迹生成(去噪分数匹配)和未来特征预测(幅度回归和方向对齐)。
- 阶段 2(强化微调 - RFT):为了解决模仿学习在处理罕见安全违规方面的局限性,FLARE 采用组相对策略优化(GRPO)。该方法基于安全、进展和舒适度,使用不可微的奖励函数(PDM 分数)来优化策略,而无需单独的价值网络。同时引入行为克隆(BC)正则化损失以防止策略崩溃。
3. 主要贡献
- 未来特征预测目标:一种新颖的自监督任务,通过重建空间 DINOv2 图块,使 VLM 能够从无标签视频数据中学习鲁棒的运动表征,并缓解了纯动作令牌监督的稀疏性问题。
- 基于查询的融合与 GRPO 集成:一种两阶段融合机制,对齐视觉和状态模态,并结合 GRPO 对轨迹策略进行微调,以优化安全关键结果,而非简单的模仿。
- 最先进的性能:在仅使用单摄像头输入的情况下,FLARE 在 SFT 和 RFT 设置下均在 NAVSIM 基准测试中取得了 VLM 类方法的新 SOTA 结果。
4. 实验结果
作者在NAVSIM基准测试(v1 和 v2)上评估了 FLARE,使用了 PDM 分数(PDMS)和扩展 PDM 分数(EPDMS)。
- SFT 性能:FLARE-4B 实现了86.9 的 PDMS,超越了 ReCogDrive-8B(86.8),同时参数减半(4B 对 8B)。它显著优于基线 QwenVL3-4B(+6.1 PDMS),尽管仅使用单摄像头,仍缩小了与 DiffusionDrive(88.1)和 WoTE(88.3)等多传感器端到端模型的差距。
- RFT 性能:通过强化微调,FLARE-4B 达到了91.4 的 PDMS,优于 ReCogDrive-2B(90.8)和 ReCogDrive-8B(90.5)。虽然其他方法(如 DriveVLA-W0)报告了更高的分数,但它们依赖于“最佳 N 选”采样策略;在公平的单样本评估下,FLARE 在基于 VLM 的方法中取得了最佳性能。
- NAVSIM v2:FLARE 实现了86.3 的最高 EPDMS,证明了其在安全性和舒适度(NC、TTC)方面的平衡优于那些往往牺牲一方以换取另一方的基线方法。
- 消融研究:
- 预测目标:空间 DINO 预测(本文方法)取得了最高性能(86.9),优于全局特征预测(85.9)和像素级预测(84.7),证实了保留空间粒度的重要性。
- 融合模块:移除两阶段 MAP 融合或自车状态注入分别导致性能显著下降(PDMS 分别下降 1.9 和 2.1),验证了状态条件视觉聚合的必要性。
5. 意义与主张
该论文主张,FLARE 验证了一种高效的自动驾驶范式:通过预测性自监督而非显式语言生成来利用 VLM 的世界知识。
- 范式转变:它证明了 VLM 可以有效地适应驾驶,而无需大规模语言标注数据集带来的成本和偏差。
- 鲁棒性:通过预测未来潜在特征,模型学会了直接预判场景动态和自车运动,弥合了离散令牌与连续控制之间的不匹配。
- 可扩展性:该方法提供了一条可扩展的路径,用于利用大规模无标签轨迹数据,有望克服当前模块化或纯监督端到端系统的数据覆盖局限性。
作者得出结论,FLARE 成功解锁了 VLM 用于连续控制的视觉语义推理能力,在单摄像头设置下实现了最先进的安全性和规划质量。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。