← 最新论文
🤖 AI

Scaling Curriculum Learning For Autonomous Driving

本文介绍了 CL4AD,这是首个针对批量自动驾驶模拟器的课程学习框架,该框架能够基于效用函数自适应地优先处理训练场景,与标准的领域随机化和启发式方法相比,在实现 99% 成功率的同时速度提升了 77%,并具有显著更高的样本效率。

原作者: Cevahir Koprulu, David Paz, Feng Tao, Yuliang Guo, Xinyu Huang, Ufuk Topcu, Liu Ren

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Cevahir Koprulu, David Paz, Feng Tao, Yuliang Guo, Xinyu Huang, Ufuk Topcu, Liu Ren

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

教计算机开车并不像教孩子骑自行车。孩子通过尝试、跌倒并重新站起来来学习,逐渐理解道路的感觉。然而,计算机是通过处理海量数据来学习的,通常是在一个数字世界中,它可以在短短几天内经历数百万年的驾驶过程。这个过程依赖于一种被称为“强化学习”的方法,即人工智能尝试不同的动作并接收反馈:到达目的地安全抵达会获得奖励,而发生碰撞则会受到惩ksi(惩罚)。为了使这种学习更有效,研究人员使用模拟器,这些模拟器可以同时运行数千个驾驶场景,为人工智能创建一个用于研究的海量交通情况库。目标是创建一个能够处理现实街道中不可预测的混乱情况(从繁忙的交叉路口到突然的变道)的驾驶智能体,且无需人类指导。

多年来,训练这些智能体的标准方法是一种称为“领域随机化”的方法。想象一位老师将学生扔进每一种可能的交通状况中——从空旷的高速公路到拥堵的市中心——进行随机测试,希望仅仅依靠数量最终能达到精通。虽然这种方法有效,但非常浪费。计算机花费大量时间在那些要么太简单以至于无法教授新知识,要么太难以至于当前版本的人工智能无法取得进展的场景上。这就像一名学生在花费数小时练习已经掌握的数学题,却忽略了那些他刚刚开始理解的题目。这种低效意味着,即使拥有强大的计算机,训练过程也比实际需要的时间更长,并且需要比实际必要更多的量更多的数据才能达到高水平的技能。

一组研究人员现在引入了一种名为 CL4AD 的新方法,它改变了这些数字驾驶课程的组织方式。该系统不再随机向人工智能投放场景,而是扮演着“智能课程设计者”的角色。它不断评估哪些交通状况对人工智能当前的水平最有帮助,并优先考虑这些特定的场景。系统会观察人工智能在给定情况下的表现,并询问:这是否太容易了?这是否太难了?或者这是否正适合学习?通过将训练时间集中在“恰到好处”的场景上——即那些既具有足够的挑战性以教授新知识,又不至于难到让人工智能放弃的场景——研究人员发现他们可以显著加快学习进程。

研究人员使用一个名为 GPUDRIVE 的强大模拟器测试了这个想法,该模拟器可以在专用计算机芯片上同时运行数千个驾驶场景。他们使用旧的随机方法训练了一个人工智能智能体,并将其与新的课程方法进行了对比。结果令人震惊。使用课程训练的人工智能在导航交通场景时,比随机训练的智能体提前十亿步达到了 99% 的成功率。就现实世界的时间而言,这意味着训练速度提高了 77%。课程方法也被证明优于其他组织训练的尝试,例如基于交通密度或车辆速度等简单规则手动选择场景。新系统始终优于这些手动方法,能够自主找到通往精通的最有效路径。

其中一个最有趣的发现是系统如何决定向人工智能展示哪些场景。研究人员设计该系统使用不同的“效用函数”,这些函数本质上是衡量一个场景价值的方式。有些函数关注人工智能距离最佳驾驶行为有多近,有些则衡量人工智能在不发生碰撞的情况下成功到达目标的频率。第三种类型的函数则衡量人工智能的驾驶看起来与人类驾驶员相比有多真实。研究发现,这些不同的衡量标准往往指向不同类型的交通状况。例如,专注于到达目标的系统倾向于优先考虑车辆较少的场景,而关注当前表现与完美表现之间差距的系统则侧于处理更密集、更复杂的交通。这表明不存在单一的“最佳”组织训练的方式;不同的目标需要不同类型的练习。

研究人员还调查了提高人工智能驾驶水平是否也意味着它会驾驶得更像人类。他们发现,这两者实际上是两个不同的目标。人工智能可以被训练得完美到达目的地并避免所有碰撞,但其驾驶方式对于人类乘客来说可能仍然感觉不自然或不舒服。课程方法帮助人工智能更快地实现了目标,但它并没有自动让驾驶风格变得更真实。为了同时实现高水平性能和类人行为,研究人员指出,奖励系统本身需要改变,以专门鼓励真实的驾驶习惯,而不仅仅是成功的结局。

即使研究人员限制了用于训练的计算机算力,课程方法仍然显示出了其价值。在一次使用更小、更弱计算机的测试中,使用课程训练的智能体仍比随机方法快 67% 达到了高成功率。这表明效率的提升不仅仅是拥有大规模计算资源的产物,而是智能组织学习过程带来的根本性益处。该系统的运作方式是将人工智能保持在一种持续且富有成效的挑战状态中,确保每一刻的训练都有助于进步。

研究还揭示了学习过程是如何随时间演变的。随着人工智能变得越来越好,系统会自动转向新的、更困难的场景。它不会卡在同样的问题上,也不会过快地跳到最难的任务中。相反,它创造了一个“移动的学习前沿”,不断调整难度以匹配人工智能不断增长的技能。这一动态过程使系统能够处理现实世界驾驶数据的复杂性,包括数十万种不同的交通情况。通过实时适应人工智能的进度,课程确保了训练的效率和有效性,即使在数据规模增长时也是如此。

最终,这项工作证明了我们如何组织训练数据与数据本身同样重要。通过从随机采样转向智能、自适应的课程,研究人员可以更快、以更少的资源来训练自动驾驶智能体。这些发现为开发更安全、更可靠的自动驾驶汽车提供了一条清晰的路径,表明快速学习的关键不仅在于做得更多,还在于在正确的时间做正确的事。研究人员已向公众开放了他们的系统,允许更广泛的科学界基于此方法进行构建,并继续完善机器如何学习在世界上航行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →