DeCoR: Design and Control Co-Optimization for Urban Streets Using Reinforcement Learning
本文介绍了 DeCoR,这是一种两阶段强化学习框架,能够协同优化城市人行横道布局与自适应信号控制,从而在真实道路走廊上显著降低行人与车辆的延误,并在无需重新训练的情况下适应不同的需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一条繁忙的城市街道,它就像一个巨大而混乱的舞池。在一侧,行人试图穿过;在另一侧,车辆试图驶过。目前,城市规划者往往依据旧的经验法则来布置舞池(即人行横道),例如“每 100 英尺设置一个人行横道”,然后聘请一位 DJ(即交通信号灯)播放固定的节拍,而不管实际上有多少人在跳舞。
本文介绍了一种名为 DeCoR 的新系统,它如同一位超级聪明的编舞师与 DJ 协同合作,在音乐播放的同时重新设计舞池。
以下是其工作原理,分解为简单步骤:
1. 问题:“猜测”带来的差距
目前,我们拥有出色的摄像头和传感器,能够精确统计移动中的人流和车流数量及其去向。但我们很少利用这些数据来改变城市布局。我们测量交通流量,却不根据流量重新设计街道。这导致了危险情况:行人因最近的人行横道太远而闯红灯,或车辆在无法匹配实际人流的信号灯前停滞。
2. 解决方案:两阶段“协同优化”
DeCoR 使用一种名为强化学习的人工智能(可将其想象为通过试错来学习的电子游戏玩家)同时解决两个问题:
- 第一阶段:架构师(设计智能体)。 该 AI 审视地图并提问:“我们应该在哪里设置人行横道,宽度应是多少?”它并非凭空猜测,而是使用一种名为高斯混合模型的数学工具。将其想象为一张“热力图”,它能学习人们最希望通行的路径(即他们的“愿望线”),并建议在人群真正想去的地方设置人行横道,而非依据规则手册规定的位置。
- 第二阶段:指挥家(控制智能体)。 一旦架构师提出新布局,指挥家便接手。该 AI 控制交通信号灯。它不再依赖固定计时器,而是实时观察人流,并即时调整信号灯,让人和车以最少等待时间通过。
3. 训练场:数字孪生
在将其应用于真实街道之前,研究团队在美国一所大学的 750 米路段上对 DeCoR 进行了测试。他们向系统输入了来自以下来源的真实数据:
- 视频摄像头用于统计车辆数量。
- Wi-Fi 日志(来自匿名手机)用于统计行人数量。
他们在数字世界(使用名为 SUMO 的工具)中运行了数千次模拟,AI 在其中尝试不同的人行横道布局和信号灯配时。每当 AI 采取的行动减少了行人与车辆的等待时间,它便获得“奖励”;每当它导致延误,它便受到“惩罚”。
4. 结果:更智能、更快速、更安全
结果令人惊讶地有效:
- 更少的人行横道,更好的效果: 现实街道原本有 7 个人行横道。DeCoR 建议移除部分,仅保留 4 个,但将其设置在更合理的位置。
- 步行更快: 由于人行横道被设置在人们自然希望行走的位置,行人到达最近过街点的速度提升了 23%。他们无需再绕远路。
- 等待时间大幅减少:
- 行人: 与旧有的固定计时系统相比,在信号灯前的等待时间减少了 79%。事实上,他们的等待时间几乎与在无管制路口(直接穿行)一样短,同时仍享有信号灯的安全保障。
- 车辆: 等待时间减少了 65%。信号灯自适应调整,使车辆无需不必要的停车。
- “协同优化”的“超能力”: 本文测试了如果在系统训练完成后改变街道布局会发生什么。
- 如果你在一个固定的平面布局上训练 DJ(控制智能体),然后突然增加新的人行横道,DJ 会感到困惑并导致交通拥堵。
- 但由于 DeCoR 的 DJ 是在平面布局变化的过程中学习的,它变得极其灵活。即使团队添加了 AI 从未见过的新人行横道,系统仍能保持交通顺畅,与采用传统方式训练的系统相比,等待时间减少了 97%。
核心结论
DeCoR 证明,如果你倾听数据(感知人和车实际的去向),并让设计(人行横道的位置)与控制(交通信号灯)相互沟通,你就能让城市对每个人来说更安全、更快捷。它将僵化的、基于规则的系统转变为灵活、有生命的有机体,能够适应人群需求。
注意: 本文严格聚焦于基于真实数据模拟中旅行时间的改善和延误的减少。它并未声称已在现实世界中消除了事故或死亡,也未声称适用于全球所有类型的城市街道,而是仅针对其测试的特定走廊。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。