想象一下,高速公路就像一条由汽车组成的漫长河流。长期以来,科学家们一直试图让这条河流流动得更顺畅,方法是教导那些“聪明”的汽车(即拥有计算机和互联网连接的汽车)进行紧密、同步的编队行驶,这种编队被称为车队(platoons)。把车队想象成一列紧随其后的汽车,它们之间的间距非常小,这样可以节省燃料并让更多车辆通过同一段道路。
然而,现在有一个大问题:目前大多数道路上的汽车还并不“聪明”,它们是普通的由人类驾驶的汽车,或者是无法相互通信的老款自动驾驶汽车。传统的车队策略忽略了这些“笨”车,但这并不符合现实情况。
这篇论文提出了一种处理交通的新型、更灵活的方式:让“笨”车加入“聪明”的车队,但配备一位“聪明的管理者”。
以下是研究人员如何用简单易懂的方式解决这个难题的:
1. 问题:“长队陷阱”
研究人员意识到,如果你只是让任何车辆在想加入的时候就加入车队,车队就会变得过长。
- 类比: 想象一群人手拉手排成一队。如果你不经过检查就让每个人都立刻加入队伍,这支队伍就会变成一条巨大的、摇晃的蛇。如果最前面的人绊了一下,队尾的人就会被猛烈地拽动。在交通中,这意味着领头车的轻微刹车动作会导致整条线路上产生大规模且危险的“冲击波”式制动,从而导致交通拥堵和事故。
2. 解决方案:“深度强化学习”教练
为了解决这个问题,作者利用一种被称为**深度强化学习(DRL)**的人工智能技术,创建了一个数字“教练”。
- 工作原理: 想象一位正在观察足球比赛的教练。教练不仅仅是告诉球员“跑快点”,相反,教练会观察整个球场,观察球员的位置,然后决定:“好吧,在这里组成一个小组,但在那边把那个小组拆散,以保持稳定。”
- 神奇之处: 这个 AI 教练通过试错来学习。它尝试不同的方式来对车辆进行分组(有些是 3 辆一组,有些是 5 辆一组,有些则是混合聪明车和笨车)。当交通流动顺畅且节省燃料时,它会获得“奖励”;当交通变得颠簸或危险时,它会受到“惩罚”。通过数百万次的练习(模拟运行),它学会了完美的平衡点。
3. 新游戏的规则
论文为这种新的“混合车队”设定了一套特定的规则:
- “智能”桥梁: 普通汽车(人类驾驶或非联网车辆)可以加入车队,但前提是它必须被夹在两辆“聪明”车(联网自动驾驶车辆)之间。这些聪明车充当了“翻译官”,感知普通车的速度,并将该信息传递给整个车队。
- 没有单独的领头者: 普通车不能作为车队的第一个或最后一个,因为它们无法向车队发出“我领头了!”或“我是尾车!”的信号。
- 限制条件: 你不能在中间排成一长串普通车。如果中间没有聪明车来“架起桥梁”,车队就会解体。这防止了出现“巨大的摇晃长蛇”问题。
4. 模拟实验的结果如何?
研究人员运行了数千次计算机模拟,以观察他们的“教练”是否有效。他们发现了以下结果:
- 稳定性: 受 AI 控制的车队更加稳定。当领头车刹车时,冲击波不会被过度放大。交通流动就像平静的河流,而不是波涛汹涌的大海。
- 安全性: 碰撞风险(通过车辆距离过近程度来衡量)显著下降,尤其是在路面上聪明车还不够多的情况下。
- 效率: 虽然 AI 有时会为了安全而选择规模稍小的车队,但它仍然能够运送大量的车辆。它找到了一个既安全又高效的“甜点位”。
- 更清洁的空气: 由于车辆不再进行剧烈的刹车和加速,它们消耗的燃料更少,排放的污染物(如二氧化碳和氮氧化物)也更少。
核心结论
这篇论文不仅仅是在说“让我们把聪明车编队”。它是在说:“让我们把聪明车和普通车混合在一起,但使用一个超级聪明的 AI 教练来决定这些小组的大小以及谁可以加入,这样我们才不会制造交通混乱。”
其结果是,即使在每一辆行驶在路上的车都实现完全自动驾驶之前,也能拥有一个更安全、更稳定、更清洁的交通系统。AI 扮演着交通交响乐团指挥的角色,确保即使有些乐器(汽车)有点走音,整个交响乐依然能流畅地演奏。
技术摘要:基于深度强化学习的联网、自动驾驶及人工驾驶车辆编队控制
1. 问题陈述
现有的车辆编队策略主要针对由纯粹的联网自动驾驶车辆(CAVs)或联网人工驾驶车辆(CHVs)组成的同质化环境进行设计。这些方法通常排除了非联网车辆,如自动驾驶车辆(AVs)和人工驾驶车辆(HVs),从而无法准确反映当前及近未来的混合交通状况。
虽然近期的“混合”策略试图通过利用CAVs作为信息中继将非联网车辆纳入编队,但这些策略往往存在一个关键局限:HVs/AVs的无管制集成会导致编队快速扩张。这种不受控制的增长会放大交通流中扰动传播的风险,从而加剧了最大化交通吞吐量与维持流量稳定性之间的内在冲突。此外,针对同质化车队设计的传统最大编队长度约束,对于这些新兴的异质化场景而言是不够的。核心挑战在于开发一种控制策略,既能允许灵活地纳入非联网车辆,又能动态平衡交通容量与流量稳定性及安全性。
2. 方法论
本研究提出了一种基于深度强化学习(DRL)的混合编队控制策略,该策略在部分可观测马尔可夫决策过程(POMDP)框架下运行。
2.1. 混合编队模式
作者引入了一种“混合编队模式”(方案 PS2),该模式有条件地允许非联网车辆(HVs/AVs)加入编队。
- 机制: CAVs 利用车载多传感器感知(LiDAR、雷达、摄像头)来感知相邻非联网车辆的状态。随后,该信息通过车联网(V2X)通信广播给其他联网成员,使得非联网车辆的状态在编队内是可观测的。
- 约束: 为确保编队完整性,禁止 HVs/AVs 担任编队领航车或尾车。只有当编队内每辆车状态对联网成员均可观测时,才能形成编队。这限制了编队内连续非联网车辆的最大数量为两辆(例如:CAV–HV–HV–CAV)。
- 对比: 这与方案 PS1 形成对比,在 PS1 中,仅由 CHVs/CAVs 组成编队,且非联网车辆被排除在外。
2.2. DRL 框架
该控制策略采用了使用**近端策略优化(PPO)算法的集中式训练、分布式执行(CTDE)**架构。
- 状态空间: 状态表示集成了多模态数据,包括自车动力学(车辆类型、编队位置、时间车头间隔)以及环境状态(前后两辆车的类型和位置)。这种设计在捕捉局部拓扑结构的同时,避免了维度灾难。
- 动作空间: 离散动作包括加入编队、离开编队或保持独立驾驶。
- 奖励函数: 构建了一个多目标奖励函数,以平衡三个组成部分:
- 交通效率 (rcapacity):基于相对于基准线增加的车道容量百分比。
- 交通稳定性 (rstability):基于混合交通流稳定性判别式 (Gh) 的改善程度,该判别式源自跟车模型的导数。
- 惩罚项 (rpenalty):如果车道容量显著低于基准线,则应用约束惩罚,以防止智能体为了追求过度稳定性而牺牲效率。
- 训练: 策略网络学习动态调整编队结构(规模和分布),以优化容量与稳定性之间的权衡。
3. 主要贡献
- 混合编队模式: 本文定义了一种通过 CAV 中介的信息传播机制,将非联网车辆整合进编队的可行方案,解决了严格联网车队在扩展性上的局限。
- 基于 DRL 的控制策略: 开发了一种超越固定编队规则的新型 DRL 策略。该策略不再假设静态的编队组成,而是学习如何实时动态优化编队结构,以管理吞吐量与稳定性之间的权衡。
- 多级状态表示: 研究将车辆动力学、编队拓扑和交通流状态整合到一个统一的状态表示中,使智能体能够在考虑全局稳定性目标的同时,基于局部观测做出分布式决策。
- 全面评估: 该方法在泛化能力、交通流稳定性、安全性及环境影响四个维度上,针对传统的联网编队(PS1)和无管制混合编队(PS2)进行了严格评估。
4. 实验结果
在单车道道路上,针对 1,000 辆车辆,在不同的 CAV 渗透率 (PCAV) 下进行了数值模拟。
- 训练性能: DRL 策略成功收敛,相比于基准混合策略(PS2),交通稳定性判别式 (Gh) 提升了 27.9%。其实现方式是减少了 28.3% 的最大编队长度(降至约 24 辆),并增加了 19.3% 的编队总数,从而有效地分散了交通密度。
- 泛化能力: 该策略在 PCAV 从 0.1 到 0.5 的范围内表现出鲁棒的泛化能力。当 PCAV>0.1 时,DRL 策略相比于 PS1 和 PS2,将稳定性判别式提高了 51.08%。不同于在较高渗透率下编队规模呈指数级增长的固定策略,DRL 策略将平均编队长度维持在约 35 辆左右。
- 扰动传播: 在涉及前车减速扰动的场景中,DRL 策略显著抑制了速度振荡。在低 CAV 渗透率(PCAV=0.1)下,它比传统编队(PS1)降低了 52.95% 的峰值平均碰撞时间倒数(TTCI)。
- 安全与效率: 与 PS1 相比,该策略将峰值速度标准差降低了高达 38.60%。在环境影响方面,在低 CAV 渗透率下,与传统策略相比,DRL 策略降低了 1.90% 的峰值平均燃油消耗、超过 1.2% 的 CO2 排放以及高达 7.1% 的 NOx 排放。
5. 重要性与主张
作者声称,所提出的基于 DRL 的方法有效地解决了混合交通环境下交通吞吐量与稳定性之间的冲突。通过动态优化编队结构而非遵循僵化的编队规则,该策略抑制了速度扰动的传播,并增强了混合交通流的安全性。
研究强调,虽然传统的混合策略(PS2)通过允许大规模、无管制的编队来最大化容量,但会牺牲稳定性。相反,DRL 策略实现了“非线性平衡”,即接受极小的峰值容量损失(在训练中比 PS2 低约 4.6%),以换取在稳定性与安全性方面的实质性提升。论文得出结论,该方法为存在大量非联网车辆的混合交通过渡期提供了一种稳健的解决方案,并建议未来的工作应解决多车道交互、通信故障以及动态编队分裂等问题。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。