RAP: Runtime Adaptive Pruning for LLM Inference
本文介绍了 RAP,这是一个由强化学习驱动的框架,通过联合优化模型权重与 KV 缓存保留策略,在实时动态调整大语言模型推理剪枝策略的同时,针对不同内存预算和工作负载条件最大化效用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位巨大且极其聪明的图书馆助手(大型语言模型,或称 LLM),它能写故事、回答问题并解决难题。但有一个问题:这位助手如此庞大,以至于需要整整一个仓库的书架(内存)和一支庞大的工人团队(计算能力)才能维持其运行。
如果你试图在小型设备(如智能手机或笔记本电脑)上运行这位助手,它往往会崩溃,因为空间不足或速度过慢。
问题所在:“一刀切”的错误
目前,大多数人试图通过永久性地削减这位巨人的部分来缩小它,例如根据固定规则移除书架或解雇工人。他们会说:“好吧,我们将永远削减图书馆的 30%。”
该论文认为这是一个糟糕的主意,因为图书馆的需求每天都在变化。
- 场景 A:用户问了一个非常短的问题。助手只需要极小的空间来记住对话。
- 场景 B:用户要求助手写一部 1 万字的小说。助手突然需要巨大的空间来容纳“草稿纸”(称为KV 缓存),用于追踪故事进展。
如果你为了适配手机而永久削减助手 30% 的“大脑”,当有人提出长问题时,它可能会崩溃。如果你不削减任何东西,它根本无法在手机上运行。现有的方法就像一套僵硬的盔甲:要么太重无法穿戴,要么为了减轻重量而切割后,让你暴露无遗。
解决方案:RAP(运行时自适应剪枝)
作者提出了RAP,这就像给助手提供了一套智能、有弹性的制服,能够实时改变形状。
RAP 并非一次性永久削减助手,而是使用一个强化学习(RL)代理。你可以将这个代理想象成一位技艺高超的交通指挥官或舞台经理。
- 观察人群:在助手开始工作之前,代理会查看具体的请求。这是一个简短的问题吗?还是一个长篇故事?手机的内存是否因为其他应用程序运行而已满?
- 即时决策:基于所见,代理会立即决定暂时隐藏哪些部分。
- 如果请求简短且内存紧张,它可能会隐藏一些沉重的“思考”部分(FFN 层)以节省空间。
- 如果请求很长且内存已满,它可能会隐藏一些用于追踪长篇故事的“注意力”部分(MHA 层)。
- 保留最佳部分:代理知道并非大脑的所有部分都同等重要。某些层对特定任务更为关键。它使用一种特殊的“重要性扫描器”(称为贪婪顺序重要性)来精确找出哪些部分可以安全地收起来,而不会破坏答案。
工作原理(类比)
想象你在为旅行打包行李箱,但你还不知道天气如何。
- 旧方法:你决定总是把厚重的冬衣和游泳裤留在家中。如果下雨,你会淋湿;如果阳光明媚,你却没有泳装。
- RAP 方法:你有一个智能机器人助手。
- 你告诉它:“我有一个小行李箱(内存限制),我要去海滩(长对话)。”
- 机器人立即将厚重的冬衣换成轻便的 T 恤,并保留游泳裤。
- 你告诉它:“我有一个小行李箱,我要去山区(短对话)。”
- 机器人将游泳裤换成温暖的帽子。
这个机器人通过经验(强化学习)学习,确保每次都进行完美的替换,保证你能装进行李箱,同时仍拥有针对特定旅行所需的一切。
他们的发现
该论文在几个流行的 AI 模型(如 Llama 和 Qwen)上测试了这个“智能机器人”。
- 更好的结果:当内存紧张时,RAP 比旧的“固定削减”方法能让 AI 运行得更好。它不会崩溃,且答案依然智能。
- 灵活性:它能够处理不同类型的请求(短对话与长对话),而无需人工重新调整。
- 速度:做出决策的“机器人”如此快速且小巧,以至于完全没有拖慢整个过程。它几乎为对话增加了额外的时间。
核心结论
RAP 是一种在小型设备上运行大型 AI 模型的新方法。它不是永久性地砍掉 AI 的部分,而是动态地实时重塑 AI,仅保留特定任务和可用空间所需的部分。这之间的区别,就像穿着僵硬沉重的制服与穿着智能、有弹性且能适应你当天任何活动的制服之间的差异。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。