← 最新论文
🤖 machine learning

NeuroPrefetcher: Storage-Aware Sparse LLM Inference via Delta Prefetching

NeuroPrefetcher 是一个具有存储感知能力的 LLM 推理系统,它通过利用 MLP 神经元活动的局部性时间特性,来预测性地仅从存储中预取必要的权重增量,而非依赖于反应式的需求分页,从而在内存受限的边缘设备上实现了显著的加速。

原作者: Nobel Dhar, Md Romyull Islam, Xuechen Zhang, Gongjin Sun, Sahidul Islam, Bobin Deng, Kun Suo

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Nobel Dhar, Md Romyull Islam, Xuechen Zhang, Gongjin Sun, Sahidul Islam, Bobin Deng, Kun Suo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是现代人工智能背后的引擎,能够以曾经看似不可能的流畅度进行写作、推理和翻译。这些系统通过逐个处理单词来工作,根据它们在训练期间学习到的庞大模式来预测序列中的下一个单词。为此,它们依赖于存储在计算机内存中的被称为“权重”的海量数字库。模型越大、越强大,所需的内存就越多。然而,一个显著的差距已经出现:虽然这些模型的规模呈指数级增长,但笔记本电脑、平板电脑和专用边缘计算设备等便携式设备的可用内存并未同步跟进。这为在大型数据中心之外运行先进智能创造了一个根本性的问题。当一个模型大到无法放入设备的内存时,系统必须在快速内存和较慢、较大的存储驱动器之间不断交换数据,这一过程通常会导致性能停滞。

来自肯尼索州立大学和三星的研究人员开发了一种解决此问题的新方法,创建了一个名为 NeuroPrefetcher 的系统,该系统允许这些超大型模型在内存非常有限的设备上高效运行。他们并没有试图缩小模型或强行使其适应内存,而是接受了模型大于可用内存的事实,并将存储驱动器视为计算过程的一个活跃组成部分。他们成功的关键在于对这些模型思考方式的一个简单观察。当模型生成一个单词时,它会激活一组特定的内部路径。当它生成紧接着的下一个单词时,它会再次使用几乎完全相同的路径。研究人员发现,从一个单词到下一个单词,活跃路径中有 82% 到 85% 是保持不变的。这意味着对于绝大部分的工作,必要的数据已经坐在设备的内存中等待被使用了。

NeuroPrefetcher 的创新之处在于它如何管理那少量发生变化的数据。传统系统会在模型需要某 piece 数据之前才去存储驱动器中获取,这是一种反应式的过程,会导致计算机暂停并等待。NeuroPrefetcher 的工作方式不同,它具有前瞻性。它使用一个微小的、专门的预测器来分析当前的单词,并猜测下一个单词将需要哪些新的路径。因为它知道即将发生什么,所以可以在计算机忙于计算当前单词的同时,只抓取来自存储驱动器的特定缺失数据片段。这把一个混乱的、走走停停的过程变成了一个平滑、连续的流动。该系统本质上是预加载了所需要的极小部分的增量信息,而忽略了已经在内存中驻留的大量数据。

为了测试这个想法,团队构建了一个完整的系统,并在一个被称为 Jetson AGX Orin 的强大边缘设备上运行,该设备具有处理器和图形单元共享的统一内存架构。他们在严格的内存限制下,使用 Mistral-7B 和 Llama-3-8B 等大语言模型进行了测试,模拟了模型明显大于可用内存的情况。在这些挑战性的条件下,依赖操作系统管理数据交换的标准运行方法表现很差,经常导致设备卡顿。相比之下,NeuroPrefetcher 保持了设备的运转,实现了比标准方法快近 8 到 12 倍的加速。该系统生成的单词速率超过每秒 3 个,而标准方法甚至难以达到每秒 1 个单词。

研究人员还检查了系统在可用内存发生变化时的行为。他们发现,系统可以通过在内存紧张时将更多模型工作转移到存储驱动器,以及在空间充足时将更多工作移回快速内存来进行适应。即使在最严苛的内存条件下,该系统仍保持了高性能,因为它避免了通常会减慢此类操作的大规模数据传输。它不是在内存和存储之间搬运整个模型的“大脑层”,而是只移动那些微小的、变化的切片数据。这种方法被证明非常有效,即使与许多在这些特定约束下无法运行的先进工具相比,该系统仍然是最快的选择。

这项工作的一个关键部分是确保速度的提升不会以牺牲智能为代价。研究人员测量了系统生成的文本质量,发现其与全量、未压缩模型的质量非常接近。即使在使用最激进的内存节省设置时,该系统也保留了模型预测的准确性,保留了超过 90% 的原始性能。这证实了仅移动必要数据的策略并不会降低模型理解和生成语言的能力。该系统有效地学会了忽略那些对于紧接的下一步并不需要的数据,将其资源集中在真正重要的事情上。

这项研究强调了我们看待在日常设备上运行人工智能的方式转变。多年来,在小型硬件上运行大型模型的解决方案一直是使模型变小或对其进行压缩,但这有时会降低其能力。NeuroPrefetcher 提供了一条不同的路径:保持完整模型不变,并以极高的精度管理其数据的移动。通过预测模型下一步的需求并仅抓取那特定的变化,该系统将存储驱动器从瓶颈转变为一个得力的伙伴。这种方法允许强大的智能在原本过小无法容纳它的设备上运行,为在本地运行先进 AI(而无需连接远程服务器)打开了大门。结果表明,通过正确的管理数据流,可以在不牺牲模型本身力量的情况下,克服物理内存的限制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →