← 最新论文
⚡ electrical engineering

Knowledge-Data-Dual-Driven Reinforcement Learning for Autonomous Vehicle Control in Mixed Traffic

本文提出了一种知识-数据双驱动强化学习(KDDRL)框架,该框架通过综合意图感知轨迹,并将概率数据与物理约束进行融合,以实现异步多时间尺度优化,从而提升混合交通流中自动驾驶车辆控制的安全、效率与舒适度。

原作者: Jie Fang, Wei Zheng, Mengyun Xu, Eui-Jin Kim

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Jie Fang, Wei Zheng, Mengyun Xu, Eui-Jin Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人在繁忙的城市中驾驶汽车。这不仅仅是遵循地图,更像是在玩一场高速进行的国际象棋游戏,而其他的棋子则是真实的人,他们可能会突然变道、刹车或改变主意。这就是**自动驾驶汽车(AVs)的世界,在这个领域,计算机科学家试图制造出能够自主思考和反应的汽车。为了实现这一目标,他们经常使用一种叫做强化学习(RL)**的技术。把强化学习想象成训练一只狗:这只“电脑狗”尝试不同的动作,如果表现良好(比如保持在车道内),就会得到一个“奖励”(零食);如果表现糟糕(比如发生碰撞),则会受到“惩罚”(训斥)。随着时间的推移,这只狗会学会通过做出最好的动作来获得最多的零食。然而,问题在于:真实的驾驶者是混乱且不可预测的。他们并不总是遵守规则,而且他们的意图是隐藏的。如果机器人汽车只观察“当下”正在发生的事情,那么当人类驾驶员突然切入时,它的反应可能会太慢。这篇论文解决了如何教这些机器人汽车在与人类共同行驶时,成为更聪明、更安全、更舒适的驾驶者的难题。

这项研究背后的研究人员——Jie Fang及其团队意识到,目前的机器人驾驶员面临着三个大难题。首先,它们往往过于被动;它们只是对所见之物做出反应,却无法猜测人类驾驶员下一步的“意图”。其次,它们难以应对“长尾”事件——即那些罕见但惊险的时刻,比如突然的切入,由于这些时刻发生得太稀少,导致机器人从未学会如何处理。第三,驾驶涉及两种发生速度完全不同的不同类型的动作:转向和变道(这种动作很少发生,且是一个重大决策)与加速或减速(这种动作持续发生,且需要平顺)。试图同时教机器人完成这两类任务,往往会让学习过程变得混乱。

为了解决这个问题,团队构建了一个名为**知识-数据双驱动强化学习(KDDRL)**的新系统。你可以把 KDDRL 想象成同时给了机器人汽车一个“水晶球”和一个“规则手册”。机器人不再仅仅盯着前方的车,而是使用一种特殊的 AI 工具(一种生成模型)来想象几种可能的未来。它会问:“如果那辆车继续直行,它会在哪里?如果它受惊并突然转向呢?”这让机器人从一个被动的观察者转变为一个主动的预测者。

仅仅靠猜测是不够的,机器人还需要保证安全。因此,该系统将这些猜测与硬性的物理规则(例如“不要撞到前车”)以及关于人类实际驾驶行为的真实世界数据相结合。这就像是一位睿智的驾驶教练(物理规则)坐在一位读过百万个驾驶故事的学生(数据)身边。教练确保学生不会尝试任何危险的行为,而故事则帮助学生理解,有时候人们的行为确实很古怪。

论文还解决了这个“双速度”问题。机器人使用了两个协同工作的不同大脑。一个运行速度极快的大脑(每 0.1 秒一次),负责处理跟随车辆时的平顺油门和刹车;另一个运行速度较慢的大脑(每 2 秒一次),负责处理像变道这样的重大决策。这两个大脑通过一种关于当前情况的“共同语言”进行交流,这样汽车就不会感到困惑。

研究人员在一个使用了德国高速公路真实驾驶数据的计算机模拟环境中测试了这个系统,以使交通状况看起来更加真实。他们发现,这种新方法 KDDRL 帮助机器人汽车比旧方法学得更快,且驾驶得更安全。在这些模拟中,机器人更擅长预测其他驾驶员的行为,能更有效地处理罕见的惊险情况,并保持行驶的平顺与舒适。作者指出,通过将预测人类意图的能力与严格的安全规则相结合,我们可以制造出能够应对混合交通中混乱且不可预测之现实的自动驾驶汽车。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →