← 最新论文
💬 NLP

Neuromorphic Diffusion Language Models: Addressing Compute and Memory Bottlenecks via Sparsity and Block Denoising

本文提出了神经形态扩散语言模型(N-MDLM),该模型结合了块扩散与基于脉冲的稀疏性,通过实现单次参数访问生成多个标记,并利用非活跃通道跳过来减少有效计算,从而显著提高推理吞吐量和能量效率。

原作者: Dengyu Wu, Clement Ruah, Jiechen Chen, Bipin Rajendran, Osvaldo Simeone

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Dengyu Wu, Clement Ruah, Jiechen Chen, Bipin Rajendran, Osvaldo Simeone

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,人工智能的世界就像一座巨大且极速运转的图书馆,一位机器人图书管理员正负责一个接一个地编写故事。在现有的这些“大语言模型”(LLMs)这一代中,这位图书管理员非常细致,但也非常笨拙。为了写出每一个新词,图书管理员必须跑遍整个图书馆的尽头,取出整本百科全书(模型的参数),通读一遍,然后回到书桌前只写下一个词。这种不断的往返奔波非常消耗体力;它消耗了大量的能量,也耗费了大量的时间,使得维持这位图书管理员的工作既缓慢又昂贵。

科学家们曾尝试通过教图书管理员一次写一整个段落而非仅仅是一个词来解决这个问题。这被称为“扩散”(diffusion),它之所以有效,是因为图书管理员只需跑一次那段长长的路,就能写下许多个词。然而,这里有一个陷阱:即使是在写段落时,图书管理员仍然必须阅读百科全书中的每一页,哪怕那些页面对于特定的句子根本不需要。这就像是为了找盐而读了一整本食谱。这篇论文介绍了一位全新的、超级聪明的图书管理员,她不仅学会了“一次写多个词”,还学会了“忽略无关的页面”。通过将“一次写多词”的技巧与“跳过无用页面”的技巧相结合,这个新系统有望让现有的强大计算机运行得更快,且消耗更少的能量。


论文:一种新型聪明图书管理员

这项研究背后的研究人员(与伦敦的机构合作)正在解决人工智能领域的一个重大难题:如何让这些庞大的语言模型在不损失智能的前提下,运行得更快、成本更低。他们提出了一个名为神经形态掩码扩散语言模型(Neuromorphic Masked Diffusion Language Models)的新系统,简称 N-MDLM

要理解 N-MDLM 是如何工作的,让我们来看看它们结合使用的两个技巧。首先是扩散部分。想象你在猜一个秘密单词。与其一个字母一个字母地猜,不如从一堆空白处开始,通过几个回合逐渐填满它们,不断完善你的猜测。这使得模型可以使用与标准模型生成单个词相同的“图书馆往返次数”(内存访问),来生成一整块词组(例如一次生成 4 个或 8 个词)。这对于速度非常有益,但它仍有一个问题:模型在生成每个词时,仍然会检查其大脑的每一个部分,即使大部分大脑处于静止状态。

这就是第二个技巧——神经形态稀疏性(Neuromorphic Sparsity)发挥作用的地方。把标准计算机想象成一个始终亮着的灯泡,无论是在照亮房间还是在黑暗中待着,它都在消耗电量。而“神经形态”系统更像是一个运动传感器灯。只有当发生某些事情时,它才会开启(触发一个“脉冲”)。在 N-MDLM 中,模型只在绝对必要时才进行繁重的读取和计算工作。如果模型的某个部分没有活跃,它就会保持沉默,从而节省能量并跳过不必要的工作。

作者建立了一个数学模型来预测这种结合的效果如何。他们创建了一个“屋顶线”(roofline)图——一种衡量计算机是受限于思考速度(计算受限)还是受限于获取数据速度(内存受限)的方法。他们的分析表明,虽然“一次写多个词”的技巧在那些获取数据较慢的旧型计算机上表现出色,但在那些受限于思考速度的现代高速计算机上,帮助并不大。然而,当你把“运动传感器式”的稀疏性加入其中时,情况就完全不同了。它极大地减少了思考量,以至于即使在这些现代化的快速计算机上,新模型也变得极其高效。

他们的发现

为了测试他们的想法,研究人员并没有从头构建一个全新的机器人大脑。相反,他们采用了现有的、已经训练好的德语转英语模型,并将其转化为他们的新型 N-MDLM 风格。他们模拟了这个新模型在强大的图形处理器(NVIDIA DGX Spark)上运行的情况,以观察其表现。

结果令人振奋。当他们在模拟一个模仿现代高速计算机芯片(他们称之为“片上存储系统”)的系统中运行时,标准的“一次写多个词”的模型(MDLM)并没有比旧的“一次写一个词”的模型快多少。因为它陷入了过度思考的困境。但新的 N-MDLM,凭借其跳过非活跃部分的能力,脱颖而出。

在这些模拟中,N-MDLM 生成标记(词)的速度更快,且每个词消耗的能量也显著低于标准模型。研究人员发现了一个“甜点区”:如果他们让词组块变得太大,系统就会因为过多的思考需求而陷入停滞。但如果他们将词组保持在适中规模(例如 4 个词),并调高“稀疏度”(让模型对关注的内容更加挑剔),他们就能获得两者的最佳结合。

具体而言,他们观察到,通过使用一个名为 K 的参数来控制模型的稀疏程度,当 K = 1(最稀疏的设置)时,可以达到最高的能量效率。在这种模式下,模型通过仅在必要时触发其“神经元”来节省能量。代价是翻译质量(通过名为 BLEU 的评分衡量)出现了微乎其微、几乎察觉不到的下降,但其在速度和能量方面的收益是巨大的。

核心结论

论文指出,通过将“分块写作”的能力与“忽略无用信息”的能力相结合,我们可以创造出不仅更快,而且更环保的人工智能模型。作者谨慎地指出,这些结果来自于在标准图形处理器上的模拟,而非专门的神经形态芯片(针对此特定任务,此类芯片目前尚不存在)。然而,数学逻辑和模拟数据强烈表明,这种方法可以解决目前阻碍下一代人工智能发展的能量和速度瓶颈。这是一种聪明的做法,即告诉计算机:“不要只是更努力地工作,要通过知道何时休息来更聪明地工作。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →