Before Parc Fermé: RL-Time Pruning for Efficient Embodied LLMs in Autonomous Driving
该论文提出了“赛前准备”(Before Parc Fermé, BPF),一种新颖的剪枝策略,通过在强化学习过程中进行迭代式模型压缩来优化用于自动驾驶的具身大语言模型控制器,实现了优于后训练剪枝或选择更小稠密模型的性能-显存权衡,且解码吞吐量提升高达 27%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你拥有一个名叫 RobotxR1 的天才、超级聪明的机器人驾驶员。这个驾驶员由一个被称为“大语言模型”(LLM)的“大脑”驱动。把这个大脑想象成一位世界级的一级方程式赛车(F1)工程师,他读过每一本关于驾驶的书籍,了解每辆车的物理特性,并且能理解你用任何自然语言给出的指令。
然而,问题在于:这个工程师太庞大了。他背着一个装满书籍的巨大背包(记忆),并且在给出指令前需要思考很长时间(延迟)。如果你试图把这个沉重的背包放在一辆小巧、快速的赛车(实际的机器人)上,这辆车就会变得无法进行实时比赛。这就像是试图背着一台钢琴去跑马拉松。
问题所在:何时缩小大脑?
为了让机器人变得更快,工程师通常尝试对大脑进行“剪枝”(Pruning)。剪枝就像是编辑一份手稿:你删掉不必要的句子、段落或整个章节,使书变得更短、更轻。
但棘手的地方在于:你何时进行编辑?
- 比赛结束后?(训练后/Post-training):你训练完整的脑,让它学习一切,然后尝试将其缩小。问题是,大脑已经记住了那些错误的、沉重的部分,而进行切割可能会破坏它的驾驶能力。
- 开始训练之前?(预训练/Pre-training):你先对大脑进行切割,然后再进行训练。问题是,在脑尝试驾驶之前,你还不知道哪些部分实际上是没用的。
解决方案:“围场封闭前”(Before Parc Fermé, BPF)
该论文的作者提出了一种名为 “围场封闭前”(Before Parc Fermé, BPF) 的新策略。
要理解这个名字,请想象 一级方程式赛车。在比赛开始前,赛车会进入一个“围场封闭”(Parc Fermé,即封闭车库)状态,车辆被封存起来。没有人被允许再去触摸或修改赛车了。进入车库的那辆车就是最终参赛的那辆。
在 AI 训练的世界里,“围场封闭”是指训练结束且模型被固定下来的时刻。作者认为,你不应该等到模型被锁进车库时才开始编辑它。相反,你应该在赛车还在赛道上进行调校时就开始编辑。
他们称之为 RL-Time Pruning(强化学习阶段剪枝)。
它是如何工作的:两种变体
论文测试了两种在“赛道上”进行编辑的方法:
- BPF-RL(迭代编辑): 想象机器人驾驶员正在学习驾驶赛道。每隔几圈,工程师就会介入,查看驾驶员的笔记,并说:“你不需要这段关于轮胎压力的特定段落;把它删掉吧。”然后,驾驶员在接下来的几圈中带着更轻的笔记继续行驶,学习如何适应缺失的信息。他们重复这个过程,直到笔记的大小恰到好处。
- BPF-SFT/RL(两阶段编辑): 首先,在驾驶员学习基本规则(监督微调/SFT)时,进行一次轻量级编辑。然后,一旦驾驶员开始在实时模拟中进行比赛(强化学习/RL),他们进行重度编辑,在驾驶员积极应对赛道时,切掉更多的冗余内容。
结果:更轻、更快、更聪明
研究人员在一个包含两个部分的真实自动驾驶设置上进行了测试:
- DecisionxR1: 决定做什么的“大脑”。
- MPCxR1: 实际控制转向的“双手”。
以下是他们的发现:
- 更好的权衡: 如果你只是选择一个天生较小、较弱的大脑(一个 1.5B 的模型)而不是一个大的大脑,赛车的表现会更差。但如果他们使用 BPF-SFT/RL 方法来缩小大模型,得到的这个“微型大脑”在平衡尺寸与性能方面,比最初直接选择那个小的模型要好 1.69 倍。它保留了大模型的“智慧”,却拥有了小模型的“重量”。
- 现实世界的速度: 当他们将这些模型部署在配备了 Jetson AGX Orin 计算单元的真实机器人车上时,经过剪枝后的模型生成指令的速度快了 27%。
- “冗长”陷于陷阱: 他们发现了一个令人惊讶的转折。有时,减小模型规模并不一定会让整个系统变快。为什么?因为较小的模型有时会开始写出更长的句子来解释它们的决策。这就像是一个体型更轻盈的跑者,却在跑步过程中不停地自言自语,从而拖慢了速度。这告诉他们,不能只看模型大小,必须观察整个流水线。
核心结论
这篇论文声称,对于需要实时思考和行动的机器人(如自动驾驶汽车),你不应该等到训练结束后再让 AI 变小。相反,你应该在它学习的过程中对其进行缩减,让机器人能够实时适应自身的“手术”。
这种“围场封闭前”的方法创造了一个既足够轻盈以保证速度,又足够聪明以处理复杂驾驶任务的机器人驾驶员,其表现优于那些沉重的原始模型以及天生较小的模型。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。