← 最新论文
🤖 AI

Driving on Registers

本文介绍了 DrivoR,这是一种用于端到端自动驾驶的纯 Transformer 架构,它利用相机感知寄存器标记(camera-aware register tokens)将多摄像头特征压缩为紧凑的表示形式,从而实现高效的轨迹生成与带有可解释子分数的评分,并在多个基准测试中超越或匹配了最先进的基线模型。

原作者: Ellington Kirby, Alexandre Boulch, Yihong Xu, Yuan Yin, Gilles Puy, Éloi Zablocki, Andrei Bursuc, Spyros Gidaris, Renaud Marlet, Florent Bartoccioni, Anh-Quan Cao, Nermin Samet, Tuan-Hung VU, Matthieu
发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Ellington Kirby, Alexandre Boulch, Yihong Xu, Yuan Yin, Gilles Puy, Éloi Zablocki, Andrei Bursuc, Spyros Gidaris, Renaud Marlet, Florent Bartoccioni, Anh-Quan Cao, Nermin Samet, Tuan-Hung VU, Matthieu Cord

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人开车。传统上,你可能会给机器人一本厚厚的说明书,里面有成千上万页,详细告诉它在每种情况下该做什么。这篇论文介绍了一种更聪明、更快速、更简单的教导机器人的新方法,叫做 DrivoR

以下是它的工作原理,使用了日常生活的类比:

1. 问题所在:信息量过大

想象一下,你正在开车,并透过六个不同的窗口(摄像头)观察。标准的计算机视觉系统试图查看每个窗口中的每一个像素,这会产生如山一般的海量数据。这就像是在开车时试图阅读一整个图书馆的书籍;计算机在决定转向还是停车之前,会被处理这些信息的压力压垮。这使得系统运行缓慢且成本高昂。

2. 解决方案:“寄存器”记录员

DrivoR 的作者们意识到,机器人并不需要读完整个图书馆,它只需要记下一些关键笔记。

他们引入了被称为 “寄存器标记”(Register Tokens) 的概念。你可以把这些想象成坐在每个摄像头旁边的每一组专门的 “记录员”

  • 与其让计算机尝试处理整张图像,这些记录员会扫描视野,并只写下最重要的细节(例如“前方有车”、“红灯”或“空旷道路”)。
  • 他们将一张巨大且杂乱的图像压缩成一份精简、整洁的摘要。
  • 结果: 计算机现在只需要阅读几句话,而不是读完一整本书。这使得系统在不丧失感知危险能力的前提下,变得极其快速且高效。

3. 两步决策过程

一旦记录员完成了场景摘要,机器人就必须决定该做什么。DrivoR 将这项工作分为两个独立的团队,就像 教练裁判 一样。

  • 教练(轨迹生成器): 这个团队查看摘要后会说:“在接下来的几秒钟内,我们有 100 种不同的行驶方式。”他们能快速生成许多可能的路径(轨迹)。
  • 裁判(评分系统): 这个团队查看这 100 条路径并进行评分。但最酷的部分在于:裁判不仅仅给出一个单一的分数(比如“好”或“坏”),它还会给出一份成绩单,上面有具体的等级:
    • 安全性: “我们发生碰撞的可能性有多大?”
    • 舒适度: “乘客会感到晕车吗?”
    • 效率: “我们到达目的地有多快?”

4. 拥有“个性”的驾驶

因为裁判会针对安全性、舒适度和速度给出分别的评分,所以你可以在不重新训练机器人的情况下改变机器人的“个性”。

  • “安全模式”: 你告诉计算机:“我 100% 看重安全和舒适。”机器人会选择安全性得分最高的路径,即使这样会稍微慢一点。
  • “运动模式”: 你告诉计算机:“我想快点到达。”机器人会选择能最大化进度(前进速度)的路径,即使这样会有些颠簸。

这就像拥有一辆只需转动旋钮就能在“奶奶式驾驶”和“赛车手驾驶”之间瞬间切换的汽车。

5. 结果

论文在一些极具挑战性的驾驶模拟环境(类似于比现实生活更难的电子游戏)中测试了这个系统。

  • 性能: DrivoR 的表现与目前现有的最复杂系统一样出色,甚至更好。
  • 速度: 因为它使用那些“记录员”来压缩数据,它的运行速度比类似的系统快了 3 倍
  • 简洁性: 它不需要庞大的预设驾驶动作词典,也不需要复杂的 3D 地图。它直接从摄像头图像和“记录员”中学习。

总结

DrivoR 是一种构建自动驾驶汽车的新方法,它就像聘请了一支聪明的 记录员 团队来总结路况,一位 教练 来提供多种驾驶选项,以及一位 裁判 根据你的需求(安全 vs 速度)对这些选项进行评分。它证明了你不需要一台超级计算机也能开好车;你只需要一种聪明、高效的信息处理方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →