← 最新论文
⚡ electrical engineering

On-Policy Distillation of Language Models for Autonomous Vehicle Motion Planning

该论文提出了一种基于 GPT-Driver 框架的在线策略广义知识蒸馏方法,成功将大型语言模型的运动规划知识高效迁移至规模缩小 5 倍的轻量级学生模型,使其在 nuScenes 基准测试中性能接近教师模型并显著优于强化学习基线,从而解决了大模型在自动驾驶车载资源受限环境下的部署难题。

原作者: Amirhossein Afsharrad, Amirhesam Abedsoltan, Ahmadreza Moradipari, Sanjay Lall

发布于 2026-04-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Amirhossein Afsharrad, Amirhesam Abedsoltan, Ahmadreza Moradipari, Sanjay Lall

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲的是如何让自动驾驶汽车变得更聪明,同时还能在算力有限的车载电脑上跑得飞快。

为了让你更容易理解,我们可以把整个过程想象成**“教一个新手司机(学生)向一位顶级赛车手(老师)学习开车”**的故事。

1. 背景:为什么需要“教”?

现在的自动驾驶技术里,有一种很厉害的方法叫**“大语言模型”(LLM)。你可以把它想象成一位博学的赛车手老师**。

  • 老师的厉害之处:他读过无数本书,见过各种路况,能像人类一样用“语言”思考(比如:“前面有个行人,我要减速右转”),然后规划出完美的行车路线。
  • 老师的缺点:这位老师太“胖”了(模型太大),脑子转得太慢,而且需要超级计算机才能跑起来。普通的汽车电脑(车载芯片)根本带不动他,就像你没法把一台巨大的服务器塞进汽车里一样。

目标:我们需要培养一个**“瘦小但机灵”的学生司机**(小模型),让他能装进车里,同时还能像老师一样聪明。

2. 核心难题:传统的“死记硬背”行不通

以前教学生,通常是把老师写好的“完美路线”直接给学生背。

  • 问题:这就像学生只背了标准答案,但一上路,只要稍微走错一步(比如第一个转弯角度偏了一点点),后面所有的路线都会跟着错,最后可能直接撞车。这在自动驾驶里叫**“误差累积”**。

3. 论文提出的两种“教学法”

作者对比了两种教学生的方法:

方法 A:强化学习(RL)——“只给分数的教练”

  • 怎么教:学生自己开车,开完一段路后,老师只看学生最后选的那个动作,然后给个分数:“这个动作不错,加 1 分”或者“这个动作不好,扣 1 分”。
  • 比喻:就像你蒙着眼睛开车,开完一段,教练只告诉你“刚才那个方向盘打得还行”,但他没告诉你“其实往左打一点点会更好”或者“往右打会撞墙”。学生只能靠猜,不知道周围还有哪些更好的选择。
  • 结果:学生学得比较慢,而且容易走弯路。

方法 B:GKD(在线策略蒸馏)——“手把手的全知教练”

  • 怎么教:这是论文的主角。学生自己开车,开一步,老师就立刻在他耳边说:“你看,在这个路口,我有 80% 的概率会选左转,15% 的概率选直行,5% 的概率选右转。你刚才选了直行,虽然也能走,但左转其实更优。”
  • 比喻:老师不仅告诉你**“你做得对不对”,还把你“没选的那些路”**的可能性都展示给你看。他让你明白,为什么“左转”比“直行”好,以及“右转”为什么是危险的。
  • 关键点:老师是在学生自己开车的时候实时指导的,而不是等开完了再改作业。这样学生就能在犯错的过程中立刻修正,学会如何处理复杂的连续动作。

4. 实验结果:谁赢了?

作者用真实的自动驾驶数据(nuScenes 数据集)进行了测试:

  • 老师(大模型):80 亿参数,开得最稳,几乎不撞车。
  • GKD 学生(小模型):只有 17 亿参数(是老师的 1/5),成绩惊人地接近老师
    • 路线准确度:只比老师差一点点(约 5%)。
    • 安全性:几乎和老师一样,很少撞车。
  • RL 学生(小模型):也是 17 亿参数,但表现差很多
    • 路线偏差大,撞车率是 GKD 学生的 2 倍多。

5. 为什么 GKD 这么厉害?

这就回到了那个**“坐标”**的问题。

  • 自动驾驶规划路线时,需要输出一连串的数字(比如:x=1.23, y=4.56...)。
  • RL 方法只告诉学生:“你刚才写的'1'是对的”。
  • GKD 方法告诉学生:“在这个位置,'1'是大概率,'2'也有可能,但'9'绝对不行,因为那样车就飞出去了。”
  • 这种**“全知视角”**的反馈,让学生不仅学会了“怎么做”,还学会了“为什么不能那么做”,从而在复杂的驾驶场景中更加稳健。

总结

这篇论文的核心贡献就是证明了一种**“高效且安全”的压缩技术:
我们可以把一位
“超级赛车手老师”的智慧,通过“手把手实时教学”(GKD),完美地传递给一个“小巧玲珑的学生”**。

这意味着什么?
这意味着未来我们的汽车不需要巨大的服务器,只需要一块普通的芯片,就能运行像顶级专家一样聪明的自动驾驶系统,既省钱、省电,又安全。这为自动驾驶真正走进千家万户扫清了一个巨大的技术障碍。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →