Individual Parameters in Weight-Sparse Transformers Appear Interpretable
本文介绍了一种用于验证 Transformer 中的单个权重是否具有全局可解释函数的自动化大语言模型(LLM)流水线,并发现与稠密模型相比,权重稀疏的模型包含显著更高比例的此类可解释权重(12–31%)。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一台为了写故事和解决问题而建造的巨大、复杂的机器。长期以来,科学家们一直试图弄清楚这台机器是如何运作的。通常,他们会寻找特定的“电路”或协同工作的齿轮组,来完成某项特定的任务,比如识别一个名字或完成一个句子。
但这篇文章提出了一个不同的问题:我们能否理解这台机器中单个微小的螺丝钉本身在做什么?
作者发现,在大多数现代人工智能模型(称为“稠密”模型)中,答案是“不能”。这就像试图理解一把被熔化并重新塑造成实心金属块的瑞士军刀中的一颗特定螺丝。这些螺丝是如此混乱地混合在一起,以至于你无法分辨任何一颗螺丝的具体用途。
然而,本文关注的是一种特殊的模型,称为**“权重稀疏”Transformer**。可以将它想象成这样一台机器:建造者被迫去掉了大部分螺丝。只剩下极少数的螺丝,而且它们排列得非常整齐、有序。
以下是研究人员如何利用简单的类比进行研究并得出结论的过程:
侦探的任务:“这颗螺丝什么时候起作用?”
他们没有问“这颗螺丝是做什么的?”(这很难),而是问,“这颗螺丝实际上什么时候会被用到?”
他们创建了一个自动化侦探团队(由一个名为 LLM 的智能 AI 提供动力)来调查稀疏机器中的每一颗剩余螺丝。
- 测试: 他们取出了特定的螺丝(进行消融处理),并观察机器停止执行什么功能。
- 线索: 他们观察了在缺少该螺丝的情况下,机器出错的具体句子。
- 描述: 他们要求 AI 侦探为这些句子写一条简短的、人类可读的规则。例如:“这颗螺丝仅在它前面的词是一个数字时被使用,” 或者 “当我们在谈论大喊大叫时,这颗螺丝会被激活。”
- 证明: 为了确保 AI 侦探不是在瞎猜,他们将这条规则测试在全新的、AI 从未见过的句子中。如果规则仍然有效,那么这颗螺丝就被认为是“可解释的”。
重大发现
结果令人惊讶:
- 在“稀疏”机器中: 大约有 12% 到 31% 的剩余螺丝具有清晰、可理解的规则。AI 侦探可以可靠地说明:“这颗螺丝是用于检测数字的,”或“这颗螺丝是用于闭合引号的。”
- 在“稠密”机器中: 当他们对普通的、非稀疏模型进行同样的测试时,成功率几乎降至 0%。这些机器中的螺丝过于混乱,无法单独解释。
为什么会有这种差异?
作者将稀疏模型比作一个组织良好的工具箱,其中的每件工具都有特定的工作和清晰的标签。而稠密模型则像是一堆熔化的金属,工具已经融合在了一起。尽管稠密模型在写故事方面可能同样出色,但它们的内部零件如此混乱,以至于你无法指向其中一个部件并准确说出它的用途。
规则看起来是什么样的
AI 发现的规则非常简单且具有局部性。它们并不是复杂的哲学思想,而是类似于:
- “当前单词是一个数字吗?”
- „前一个词是像‘说’或‘喊叫’这样的言语动词吗?”
- “这是句子末尾的一个逗号吗?”
核心结论
文章得出结论:通过强制人工智能模型使用更少的连接(使其变得“稀疏”),我们无意中让它们变得更容易理解。现在我们可以观察机器的很大一部分,并准确解释它们的用途。
重要的局限性:
论文谨慎地指出,这并不意味着我们完全理解了整个机器或它是如何思考的。它只是意味着在这些特定的稀疏模型中,我们可以更好地理解单个部件。此外,他们发现的规则描述的是部件何时处于活跃状态,而不是其一旦活跃后如何处理信息的深层数学奥秘。
简而言之:稀疏模型就像一个透明的玻璃盒,你可以看到里面的每一个齿轮;而稠密模型则像是一个雾气弥漫的盒子,齿轮被隐藏了起来。 这项研究证明,如果你用更少、更清晰的齿轮来构建人工智能,你确实可以解释每一个齿轮在做什么。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。