← 最新论文
💬 NLP

Tracing Computation Density in LLMs

本文介绍了 s-Trace 方法,揭示大语言模型以模块化、两阶段的方式运行:早期层的一个稀疏子图基于浅层统计提供粗略预测,随后由后期层中更密集的计算进行逐步细化,且所需的计算量与模型的不确定性相关。

原作者: Corentin Kervadec, Iuliia Lysova, Iuri Macocco, Marco Baroni, Gemma Boleda

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Corentin Kervadec, Iuliia Lysova, Iuri Macocco, Marco Baroni, Gemma Boleda

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个拥有十亿人的庞大管弦乐团(即大型语言模型)正在演奏交响乐。每次你提出一个问题,这十亿名乐手都会同时开始演奏以生成答案。看起来他们都在同等努力地工作,对吧?

这篇论文提出了一个简单的问题:他们真的如此吗? 或者,是否只有一小部分特定的乐手在承担繁重的工作,而其他人只是站在一旁?

作者开发了一种名为 s-Trace 的新工具来探究这一点。将 s-Trace 想象成一道“聚光灯”,它可以关闭乐团的部分区域,以观察音乐是否依然听起来相同。通过逐渐关闭越来越多的乐手(计算机图中的边),他们精确地计算出了完成工作需要多少乐手。

以下是他们发现的要点,分解为简单的概念:

1. 两幕剧

作者发现,乐团并非按直线运作。相反,音乐的构建分为两个截然不同的阶段:

  • 第一幕:“核心”构建(粗稿)
    想象前排的一小群乐手(模型的前几层)。当聚光灯非常昏暗时,只有这几人在演奏。令人惊讶的是,他们已经能演奏出足够清晰的主旋律,让你确切知道下一首曲子是什么。

    • 神奇数字: 事实证明,模型极小的一部分——大约 0.1% 的所有组件——就足以预测最可能的下一个词。这被称为 “最小核心”
    • 谁在核心中? 有趣的是,这个核心并非只有一种类型的乐手。它是不同工具(残差连接、MLP 和注意力头)的平衡混合,在过程的早期阶段协同工作。
  • 第二幕:“精炼”(润色)
    一旦主旋律确立,乐团的其他部分(后续层)便慢慢加入。他们并不改变歌曲;他们只是添加华丽的装饰、微妙的情感和完美的和声。

    • 代价: 要从“足够好”达到“完美”,你需要开启多得多的乐手。你越想精炼答案,就需要激活这个庞大乐团中的越多部分。这一阶段是模型添加细微差别以实现高质量、类人响应的地方。

2. “难度”计量表

论文还发现,乐团并不总是使用相同的能量。它会适应任务的难度:

  • 简单词汇(高频): 如果下一个词是非常常见的(如“的”或“和”),乐团规模保持很小。“最小核心”就足够了。这就像一名乐手演奏简单、重复的节拍;他们不需要整个乐队。
  • 困难词汇(低频): 如果下一个词罕见或棘手,模型会变得“不确定”。为了应对这种情况,它会开启更多的乐团成员,尤其是后续层,以理清复杂的细节。
  • 关联: 模型对答案越不确定,它招募的“乐手”就越多。模型所做的工作量与输入猜测的难度直接相关。

3. 为何这很重要(根据论文)

作者指出,大型语言模型并非仅仅是巨大、混乱的数学块。它们具有 模块化组织

  • 它们拥有一个 稀疏且高效的核心,负责处理基础任务(如识别简单模式)。
  • 它们拥有一个 密集且扩展的层级,负责处理复杂、微妙的细节。

这类似于人类处理语言的方式:对于常见词汇,我们使用快速、自动的反射;而当遇到罕见或复杂的内容时,我们会调动全部脑力。

总结类比

将模型想象成一位 正在烹饪的厨师

  • 核心(0.1%): 这是厨师抓取基本食材(面粉、水、盐)并进行混合。你可以立即看出他们在做面包。
  • 精炼(其余部分): 这是厨师揉面、烘烤、添加香料并摆盘的过程。第一步之后面包就已经是“面包”了,但要把它做成一条 美味 的酸面包,他们需要动用整个厨房和所有工具。

论文总结道,对于许多任务,“厨师”不需要整个厨房就知道他们在 做什么,但他们确实需要整个厨房才能让食物 尝起来美味

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →