长期以来,自动驾驶一直依赖于模块化方法,即由不同的计算机程序处理不同的任务,例如观察道路、预测其他车辆的行驶路径以及决定转向方向。这些系统协同工作,但往往过于僵化,难以适应复杂多变的情况。最近,一种被称为“视觉-语言-动作”(Vision-Language-Action)模型的新型人工智能脱颖而出,成为了一种极具前景的替代方案。这些模型更像是一位人类驾驶员,能够观察场景、理解口头指令或复杂的交通状况,并立即做出物理动作,而这一切都在一个统一的大脑中完成。虽然这些模型在创造更平顺、更安全的驾驶方面展现出巨大潜力,但它们也面临着一个重大障碍:对计算资源的消耗极高。它们需要海量的处理能力和内存,往往会使当前自动驾驶汽车中所配备的专用图形芯片不堪重负。这造成了一个瓶颈,即汽车的计算机无法跟上模型的需求,导致难以在不牺牲速度或安全性的情况下将这些先进系统安装到真实的车辆上。
香港城市大学与穆罕默德·本·扎耶德人工智能大学的研究人员开发出一种运行这些强大模型的新方法,在不改变模型本身的情况下解决了这一资源问题。他们并没有强迫整个人工智能“大脑”都在图形芯片上运行,而是将工作分配给了图形芯片和汽车的主中央处理器。他们发现,虽然图形芯片擅长处理“观察”道路的初始任务,但通常在这些繁重视觉任务期间处于闲置状态的中央处理器,完全有能力处理后期的推理阶段。通过将模型划分为不同的层,并将前几层分配给图形芯片,后几层分配给中央处理器,他们创建了一个平衡的系统。此外,由于汽车在不断移动并接收持续的图像流,研究人员设计了一个流水线机制:中央处理器处理当前时刻的推理,而图形芯片已经开始处理下一个时刻的任务。这种任务重叠的方式让两个处理器都能保持忙碌状态,显著加快了决策过程。
当团队在两种领先的自动驾驶模型上测试这种方法时,结果非常显著。对于一个名为 Orion 的模型,做出驾驶决策所需的时间从 521 毫秒降至 408 毫秒,减少了近 22%。对于另一个名为 MindDrive 的模型,时间从 443 毫秒降至 306 毫秒,降幅超过 30%。或许比速度更关键的是对汽车内存的缓解。原始的 Orion 模型需要在图形芯片上占用 45 GB 的内存,如此高的需求导致它无法与测试车辆上的其他基本系统共同运行。新的混合方法将这一需求降低到了 29 GB,使得该模型能够在原始版本完全失败的同一硬件上成功运行。在这些测试过程中,驾驶决策的质量保持不变;汽车并没有开得更差或更频繁地发生碰撞,证明了速度的提升并非以牺牲安全性为代价。
研究人员还发现,仅仅拆分工作是不够的;拆分的时机至关重要。如果分配给中央处理器的任务过多,它就会成为新的瓶颈,从而拖慢整体速度;如果分配得太少,图形芯片则会依然过载。他们找到了一个特定的平衡点,使工作量得到均匀分布,从而使系统达到最快速度。他们还证实了重叠流水线是必不可少的。如果没有它,系统仍必须等待一个任务完全完成后才能开始下一个,从而抵消了使用两个处理器的益处。通过让处理器同时处理不同的视频帧,系统实现了一种稳定、高速的决策流。
这项工作表明,当前自动驾驶硬件的局限性并不一定是死胡同,而是重新思考如何分配任务的一个信号。研究表明,通过将汽车的计算机视为一个专家团队而非单一的强大核心,就有可能在现有车辆上部署先进的大规模人工智能模型。研究人员通过在真实车辆上运行其系统,并结合一套标准的驾驶软件,验证了这种混合方法不仅是一种理论上的改进,更是一种可以与驾驶汽车所需的复杂软件共存的实际解决方案。研究结果表明,高效的系统设计,而非仅仅等待更强大的硬件,才是将这些复杂的驾驶模型带入现实世界的关键。
技术摘要:面向混合架构的视觉-语言-动作(VLA)高效块层并行推理
1. 问题陈述
视觉-语言-动作(VLA)模型正成为自动驾驶领域的一种极具前景的新范式,它统一了场景理解与决策制定。然而,在现有的车载平台上部署这些大型多模态模型面临着重大挑战:
- 资源失衡: VLA 推理高度依赖 GPU,导致高推理延迟和剧烈的 GPU 显存压力。相反,为模块化流水线配置的传统车辆平台在执行 VLA 时,其 CPU 资源往往处于闲置状态。
- 部署约束: 由于 GPU 显存预算不足,直接将 VLA 模型与其它车载系统(如感知、定位)共同部署往往会失败。例如,原生 Orion 模型需要约 45 GB 的 GPU 显存,当与完整的 Autoware.Universe 技术栈共存时,超出了可用容量。
- 简单卸载的低效性: 仅仅将模型的大部分内容卸载到 CPU 是无效的,因为 CPU 在 Transformer 执行方面的速度远慢于 GPU,可能会成为新的瓶颈。此外,标准的单帧推理仍是串行的,限制了异构执行带来的收益。
2. 方法论
作者提出了一种专为自动驾驶流式特性设计的混合 CPU–GPU 推理框架。该方法由三个核心组件组成:
A. 块层划分(Block-Layer Partitioning)
该框架并非在算子层面(这会破坏结构完整性)或全模型层面(这缺乏灵活性)进行划分,而是在 Transformer 块层粒度上对 VLA 主干进行划分。
- 执行拆分: 视觉编码器(ViT)和 LLM 前缀层(prefix layers)在 GPU 上执行。LLM 后缀层(suffix layers)则被卸载到 CPU 上。
- 边界: 一个特定的划分点 p 将模型分为 GPU 执行的前缀部分和 CPU 执行的后缀部分。边界隐藏状态(boundary hidden state)在设备之间进行传输。
- 原理: 这种粒度在保持模型结构完整性和特征连续性的同时,提供了一个可调度的边界,以重新分配计算和内存负载。
B. 跨帧异步流水线(Cross-Frame Asynchronous Pipeline)
考虑到驾驶 VLA 工作负载是时间连续的(流式帧)而非孤立的查询,系统采用了异步流水线:
- 重叠(Overlap): 当 GPU 处理当前帧(t)的前缀时,CPU 同时处理前一帧(t−1)的后缀。
- 吞吐量: 这将单帧内的串行依赖关系转化为帧间的重叠执行。稳态吞吐量由较慢的阶段(GPU 前缀或 CPU 后缀 + 传输)决定,而非所有阶段的总和。
- 通信开销: 每帧仅传输边界隐藏状态张量。作者指出,该开销(约 0.41 ms)相对于计算阶段而言可以忽略不计。
C. 灵活的资源调度与硬件优化
- 动态调度: 轻量级调度器根据实时系统状态(如 CPU/GPU 利用率和流水线积压情况),动态调整划分边界(特别是靠近分割点的“动态区”内的层)。这使得系统能够适应不同的车载资源需求。
- CPU 加速: 为确保 CPU 不会成为瓶颈,框架针对 CPU 驻留层使用了硬件感知优化栈,包括 Intel AMX(高级矩阵扩展)、IPEX(Intel Extension for PyTorch)、图融合以及 NUMA 感知线程绑定。
3. 核心贡献
- 块层异构推理框架: 一种新颖的架构,通过在块级别对 VLA 模型进行划分,有效地利用了原本闲置的 CPU 资源,同时降低了 GPU 显存压力,且无需改变原始模型架构。
- 跨帧异步并行推理: 一种利用驾驶数据连续性来实现 GPU 和 CPU 执行在不同帧之间重叠的策略,显著提高了持续推理频率。
- 灵活调度与真实世界验证: 一种资源感知的调度机制,并在真实的车辆技术栈(Autoware.Universe)中,针对两种代表性的驾驶 VLA 模型(Orion 和 MindDrive)进行了实证验证。
4. 实验结果
该框架在 Bench2Drive 基准测试中进行了评估,使用的硬件为 NVIDIA L20 GPU 和 Intel Xeon Platinum 8470Q CPU。
- 延迟降低:
- Orion: 平均延迟从 521 ms 降至 408.0 ms(降低了 21.7%)。
- MindDrive: 平均延迟从 443 ms 降至 306.2 ms(降低了 30.9%)。
- 显存占用:
- Orion: 估计峰值 GPU 显存从 45 GB 降至 29 GB。
- MindDrive: GPU 显存从 21 GB 降至 14 GB。
- 实车部署:
- 原生 Orion 模型由于 GPU 显存溢出,无法与 Autoware.Universe 协同运行。
- 混合版本可在完整的车辆技术栈中成功运行,实现了 1.89 Hz 的推理频率。
- 驾驶性能:
- 轨迹精度(L2 误差)和碰撞率与原生模型几乎完全一致,证实了加速过程并未损害驾驶安全性或质量。
- 消融研究:
- 划分点: 最优划分(例如 Orion 在第 16 块后进行划分)能平衡 GPU 和 CPU 的负载。划分过浅会导致 CPU 成为瓶颈;划分过深则会导致 GPU 成为瓶颈。
- 异步性: 若不使用跨帧流水线,混合执行实际上会增加延迟(783 ms 对比 520 ms),这归因于串行化问题。异步流水线对于实现 408 ms 的结果至关重要。
- CPU 优化: 若没有硬件感知优化(AMX, IPEX),CPU 执行速度比优化后的技术栈慢 15.3 倍,这凸显了这些优化对于混合执行可行性的必要性。
5. 重要性与主张
本文主张,系统级混合执行是实现大规模 VLA 模型在自动驾驶中实时部署的一条切实路径。
- 资源重分配: 该工作证明,通过将计算和内存负担从 GPU 转移到 CPU,可以使大型 VLA 模型部署在资源受限的车载平台上。
- 能力保持: 该框架在不修改底层模型架构或降低驾驶性能指标的情况下,实现了显著的延迟和显存降低。
- 可行性: 通过在完整的自动驾驶环境(Autoware.Universe)中进行验证,作者表明异构推理可以与其它关键车辆模块共存,解决了 VLA 驱动驾驶系统工业化应用中的一个关键障碍。
作者总结道,其工作为在现实车辆侧资源限制下的异构大模型推理研究提供了动力,并强调高效部署不仅需要模型优化,还需要系统级的资源调度和跨设备并行技术。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。