← 最新论文
💬 NLP

Sparser, Faster, Lighter Transformer Language Models

该论文提出了一种结合新型稀疏打包格式与定制 CUDA 核函数的方法,利用 L1 正则化在 Transformer 语言模型的前馈层中实现超过 99% 的非结构化稀疏度,从而在几乎不影响下游任务性能的前提下,显著提升了推理与训练过程中的吞吐量、能效及内存效率。

原作者: Edoardo Cetin, Stefano Peluchetti, Emilio Castillo, Akira Naruse, Mana Murakami, Llion Jones

发布于 2026-03-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Edoardo Cetin, Stefano Peluchetti, Emilio Castillo, Akira Naruse, Mana Murakami, Llion Jones

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种让大型语言模型(LLM,比如现在的 AI 聊天机器人)变得更快、更轻、更省电的新方法。

想象一下,现在的 AI 模型就像是一个超级繁忙的巨型图书馆

1. 现状:拥挤的图书馆

目前的 AI 模型非常庞大,拥有数百亿甚至上千亿个“书架”(参数)。每次你问一个问题,图书馆的管理员(AI)必须跑遍每一个书架,哪怕那里只有几本书,或者根本是空的。

  • 问题:这就像让一个快递员去送快递,但他必须把整栋大楼的每一个房间都走一遍,不管里面有没有人。这导致计算量巨大、速度变慢、耗电惊人,而且需要非常昂贵的超级计算机才能运行。

2. 核心发现:其实大部分书架是空的

研究人员发现了一个有趣的现象:当 AI 处理你的问题时,它其实只激活了很少一部分神经元(就像只打开了图书馆里很少的几盏灯)。

  • 比喻:虽然图书馆有 100 万个书架,但每次你问“今天天气怎么样”,真正被用到的可能只有 100 个书架。剩下的 999,900 个书架都在“睡觉”(数值为 0)。
  • 痛点:以前的技术就像是一个死板的搬运工,不管书架上有没有书,他都要把每个书架都搬一遍。因为现代电脑(GPU)是为“搬运满箱货物”设计的,如果强行只搬空箱子,反而因为整理空箱子的过程太麻烦,导致速度比直接搬满箱还慢。

3. 解决方案:聪明的“打包”与“快递”

这篇论文的作者(来自 Sakana AI 和 NVIDIA)发明了一套全新的**“打包格式”和“快递路线”**,专门用来处理这些“空书架”。

A. 新的打包方式 (TwELL 格式)

  • 旧方法:把书按行排列,如果一行只有 1 本书,后面也要留 99 个空位,浪费空间。
  • 新方法 (TwELL):他们把图书馆切分成一个个小方块(Tile)。在每个小方块里,他们只记录“哪几本书在”以及“书的内容”,把空位直接扔掉。
  • 比喻:就像你打包行李。以前是无论有没有东西,都要把整个行李箱填满泡沫;现在,他们发明了一种智能压缩袋,只装实际有的衣服,把空气(零值)全部抽走,并且把打包过程直接集成到了“装箱”这个动作里,不需要额外花时间。

B. 融合运算 (Fused Kernels)

  • 旧方法:先算一步,存起来,再算下一步,中间要反复读写硬盘(显存),非常慢。
  • 新方法:他们把“计算”和“打包”这两个动作合并成一个超级动作
  • 比喻:以前是“先切菜,装盘,再端给厨师,厨师炒好再装盘”。现在是**“切菜的同时直接下锅炒,炒好直接装盘”**。中间少了很多搬运和等待的时间。

4. 训练时的“混合模式”

在训练模型(教 AI 学习)时,内存(显存)是最大的瓶颈。

  • 创新:他们设计了一种**“混合存储”**。对于大多数稀疏(空)的行,用极小的空间存储;只有极少数特别“活跃”的行,才用普通的大空间存储。
  • 比喻:就像开一家酒店。99% 的房间没人住,你就把它们锁起来,只保留一个“前台”记录谁住了;只有那 1% 住满人的房间,才需要全套服务。这样,酒店(显存)就能容纳更多的客人(更大的模型),或者用更小的酒店(更便宜的显卡)来运营。

5. 结果:快、省、强

通过给模型加上一点点“懒惰”的惩罚(L1 正则化),让 AI 学会只使用必要的神经元,同时配合这套新工具:

  • 速度提升:推理(回答问题)速度提升了 17% - 20%,训练速度提升了 20% - 25%
  • 更省电:因为做的无用功少了,能耗降低了约 12% - 18%
  • 更省内存:训练时需要的显存减少了 20% - 28%。这意味着以前需要昂贵显卡才能跑的模型,现在可能用消费级显卡就能跑。
  • 质量不变:最重要的是,虽然 AI“变懒”了(只用了 1% 的神经元),但它回答问题的准确率几乎没有下降,依然很聪明。

总结

这篇论文就像给 AI 行业带来了一套**“极简主义装修方案”
它告诉我们要
利用 AI 天生的“懒惰”特性**(大部分神经元不工作),通过更聪明的打包和运输方式(新算法和代码),让 AI 在不牺牲智商的前提下,跑得更快、更省电、更便宜。

这对于未来让 AI 在普通手机、笔记本电脑甚至更便宜的服务器上运行,具有巨大的意义。作者还承诺开源所有代码,让所有人都能使用这种技术。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →