← 最新论文
💬 NLP

Sparse or Dense? A Mechanistic Estimation of Computation Density in Transformer-based LLMs

该论文提出了一种基于机械可解释性的计算密度估计方法,研究发现大型语言模型的处理通常涉及密集计算,其密度随输入动态变化且与预测稀有令牌正相关、与上下文长度负相关,并指出不同模型对同一输入的密度响应高度一致。

原作者: Corentin Kervadec, Iuliia Lysova, Marco Baroni, Gemma Boleda

发布于 2026-04-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Corentin Kervadec, Iuliia Lysova, Marco Baroni, Gemma Boleda

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给那些拥有“亿万大脑神经元”的超级人工智能(大语言模型,LLM)做一次**“脑力活动扫描”**。

以前,大家一直有个猜想:这些 AI 虽然参数(相当于大脑里的神经元)多如牛毛,但每次回答问题时,其实只有很少一部分神经元在真正干活,大部分都在“摸鱼”。这就好比一个拥有 1000 人的合唱团,每次唱歌其实只有 10 个人在唱,其他人都在打瞌睡。如果真是这样,那我们就可以把那些“摸鱼”的人裁掉,让 AI 变得更轻、更快。

但这篇论文的作者发明了一种新工具(基于“机械可解释性”的密度估算器),专门用来给 AI 的每一次思考过程“拍 X 光片”,看看到底有多少神经元在真正运转。

他们的发现完全颠覆了之前的想象,我们可以用三个生动的比喻来理解:

1. 并不是“少数精英”在干活,而是“全员皆兵”

之前的猜想:AI 像是一个**“精兵简政”的特种部队**,每次只派几个精英去执行任务,其他人都在休息。
现在的发现:AI 更像是一个**“大型交响乐团”。当它处理任务时,绝大多数乐器(参数)其实都在同时发声、参与演奏。虽然有些声音轻一点,有些重一点,但并没有大量的人在“摸鱼”**。这意味着,AI 的计算过程比我们要想的更“拥挤”、更“密集”。

2. 大脑的“忙碌程度”是动态变化的

之前的猜想:AI 的忙碌程度是固定的,要么一直很忙,要么一直很闲。
现在的发现:AI 的忙碌程度像**“交通路况”**,是随着输入内容实时变化的。

  • 有时候遇到简单的问题(比如“今天天气不错”),就像在空旷的乡间小路开车,大家稍微松松油门(稀疏模式),不需要太费脑子。
  • 有时候遇到复杂的问题(比如“解释量子力学”),就像晚高峰的市中心,所有车道都堵满了,所有神经元都得全速运转(密集模式)。
    AI 会根据你问的问题,自动在“悠闲模式”和“加班模式”之间切换。

3. 大家面对同一个问题,反应出奇地一致

有趣的发现:如果你把同一个问题问给不同的 AI 模型,它们“加班”的程度(计算密度)是高度同步的。
这就像是一群不同的厨师,面对“做一道极其复杂的佛跳墙”这道菜,大家都会不约而同地调动所有精力;而面对“煮个泡面”,大家都会不约而同地轻松应对。这说明,问题的难易程度(比如生僻的词、复杂的逻辑)决定了 AI 需要动用多少“脑力”,而不是 AI 自己随便决定的。

总结一下这篇论文的核心意义:

  • 挑战旧观念:它告诉我们,不能简单地认为 AI 里有很多“废参数”可以随便删掉。因为 AI 在处理不同任务时,往往需要调动绝大部分的“大脑”资源。
  • 新视角:它提出了一种新的衡量标准,让我们明白 AI 的“思考密度”是动态的
  • 未来影响:这就像给 AI 做了一次体检,让我们明白,想要让 AI 变快或变强,不能只想着“裁员”(剪枝),可能更需要优化它如何在“堵车”和“畅通”之间更智能地切换。

一句话概括:这篇论文告诉我们,AI 的大脑并不是只有少数人在干活,而是一个全员参与、随任务难度灵活调整忙碌程度的超级集体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →