SelectInfer: Selective Neuron Loading and Computation for On-Device LLMs
SelectInfer 是一个神经元层级的优化框架,它通过使用离线分析器来识别并选择性地加载和计算最重要的神经元,从而实现高效的设备端大语言模型推理,在不损害任务性能的情况下显著降低内存和计算成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大的知识图书馆,它博大精深,几乎包含了你能问到的任何问题的答案。这就是科学家们所说的“大语言模型”(LLM)。你可以把它想象成一个超级聪明的机器人大脑,它读过了互联网上几乎所有的书。但问题在于:这个大脑如此庞大且沉重,通常需要一个拥有强大超级计算机的大型、昂贵的数据库中心才能运行。这就像是试图把一整个图书馆装进你的背包里;它根本装不下。
最近,人们希望将这个“图书馆”放入更小的设备中,比如你口袋里的智能设备或自动驾驶汽车中的计算机。这些被称为“边缘设备”。问题是,这些小工具的空间和电池电量都非常有限。如果你试图把整个图书馆强行塞进去,设备就会崩溃,或者运行得极其缓慢,变得毫无用处。科学家们曾尝试通过“挤压书籍”(让它们变小但难以阅读)或“扔掉整个书架”(这会让机器人遗忘事物)来缩小图书馆。但这些旧方法往往会破坏机器人的思考能力。大问题在于:我们能否在不损失天才智慧的前提下,让这个巨大的大脑装进一个小背包?
于是,来自帕德博恩大学(Paderborn University)的研究人员提出了一个名为 SelectInfer 的新颖想法,它为解决这个谜题提供了一个聪明的方案。SelectInfer 并没有尝试缩小整个图书馆或随机扔掉书籍,而是像一位非常聪明的图书管理员,精准地知道你“此时此刻”需要哪些书。
以下是它的工作原理,我用一个简单的故事来解释。想象你的机器人大脑是一个拥有数千名工人(称为“神经元”)的巨大工厂。在普通的工厂里,每一位工人每天都会准时到岗,即使他们无事可做。这既浪费空间又浪费能源。研究人员发现,这些工人实际上可以分为两组:一些是“全才”(Generalists),无论什么工作都会出现——就像那些负责维持照明和咖啡机运转的人;另一些是“专家”(Specialists),他们只在特定任务出现——比如修理水管的团队或粉刷墙壁的团队。
论文表明,对于任何给定的任务,你并不需要所有的专家,也绝对不需要那些今天没活干的人。SelectInfer 使用了一个两步走的“魔术技巧”,让这个工厂能在微型设备上高效运转:
选择性加载(背包技巧): 在机器人开始工作之前,研究人员使用一个“离线分析器”(一种侦察兵)来确定哪些“全才”和“专家”是最重要的。然后,当机器人准备就绪时,它只将这些特定的工人和书籍装进它的背包(内存)里。它把剩下的留在了后面。这就像是在去露营时只带上你需要的工具,而不是带上整个五金店。这使得机器人能够适配那些此前容量过小的设备。例如,在一个只有 8 GB 内存(如 NVIDIA Jetson Orin Nano)的设备上,原本需要 9 GB 空间的模型现在可以挤进去了,因为它只携带了 70% 的核心员工。
选择性计算(按需技巧): 即使背着更轻的背包,机器人仍然需要要求每一位工人去做他们的工作,这需要时间。SelectInfer 增加了第二条规则:一旦机器人开始工作,它只要求与当前时刻“最相关”的工人进行数学运算。如果机器人在写诗,它不需要水管工团队来计算韵律。它只会唤醒诗人。这让机器人的思考速度大幅提升。
研究人员在三个不同的机器人大脑(Llama3.2-3B, Llama3.2-1B, 和 Qwen2.5-3B)上对这种微型芯片进行了测试。他们发现,通过使用这种方法,他们可以让这些庞大的模型在以前无法使用的设备上运行。对于 30 亿参数的模型,SelectInfer 的运行速度比目前主流的“挤压数据”(4-bit 量化)方法快了约 1.53 倍,比直接从缓慢的磁盘中提取数据的速度快了 13 倍以上。
至关重要的是,论文指出这种方法并不会让机器人变得“更笨”。事实上,在翻译和摘要等许多任务中,SelectInfer 甚至比其他试图节省空间的方法表现得更准确。研究人员发现,虽然其他方法要么节省了内存但运行缓慢,要么运行飞快但会遗忘事物,而 SelectInfer 成功平衡了这三者:它既节省了内存,又加快了思考速度,还保持了答案的准确性。
论文明确排除了“必须丢弃整个模型或从头开始重新训练”的观点。它还证明了仅仅随机挑选工人留下(随机加载)会导致机器人彻底失效,这证明了你需要一张“智能地图”来了解该保留谁。虽然该方法需要一个一次性的“侦察”阶段来确定哪些工人是重要的,但结果表明,这是将超智能 AI 带入我们口袋里的微型设备中,而无需依赖云端的超级计算机的一种切实可行且强大的方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。