← 最新论文
💬 NLP

Scaling Inherently Interpretable Language Models

本文通过证明将可解释性约束集成到训练流水线中可以使像 Steerling-8B 这样的模型在保持竞争性能的同时,实现更有效的扩展并变得更加透明且符合人类概念,从而挑战了“可解释性是以能力为代价”这一观点。

原作者: Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail, Giang Nguyen, Isaac Plant, Muawiz Chaudhary, Nathaniel Monson, Saqib Azim, Zhichen Guo, Julius Adebayo

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail, Giang Nguyen, Isaac Plant, Muawiz Chaudhary, Nathaniel Monson, Saqib Azim, Zhichen Guo, Julius Adebayo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图理解一座巨大的、充满魔力的图书馆是如何运作的。多年来,最聪明的图书管理员(AI研究人员)一直在建造这些规模更大、功能更强大的图书馆,但他们接受了一个奇怪的规则:为了让图书馆真正强大,它必须是一个“黑盒”。你可以向它提问,它会给你一个精彩绝伦的答案,但你完全不知道它是如何找到这个答案的。这就像一位巫师施展了咒语,然后说:“相信我,这行得通,”却不展示其中的成分或咒语细节。因此,如果图书馆犯了错或者说了些奇怪的话,我们无法轻易修复它;我们只能在事后猜测发生了什么。这篇论文提出了一个大胆的问题:如果我们不必接受这种权衡呢?如果我们能建造一座既是超级天才、又是透明的图书馆,让我们能清楚地看到它在写出答案时使用了哪些书,以及它正在思考哪些想法呢?

这篇论文的作者们——一个名为 Guide Labs 的团队——决定测试这个想法。他们构建了一种新型的语言模型,叫做 Steerling-8B。与通常被训练为仅仅预测句子中下一个词的“黑盒”模型不同,Steerling 在设计之初就将一条特殊的规则刻进了大脑:它必须在思考的过程中解释自己的思考过程。他们发现了一个令人惊讶的事实:让模型进行自我解释并没有削弱它的能力。事实上,随着他们扩大模型的规模并赋予其更多的计算能力,它不仅变得更聪明,而且在解释自身方面也变得更好了。模型规模越大,它的内部思维就越清晰,我们也越容易看清它是利用哪些想法来形成答案的。

“黑盒”魔法的问题

长期以来,构建 AI 的标准方式是训练一个模型尽可能好地预测文本,然后在它学习完成后,再尝试窥视其内部运作。研究人员使用诸如“探针”(试图猜测模型内部是否隐藏了某个概念)或“归因”(试图猜测哪些词起到了关键作用)之类的工具。但作者认为,这些工具就像是在汽车引擎已经造好之后,通过听它的噪音来试图弄清楚引擎是如何工作的。引擎在设计时并不是为了被倾听而存在的,所以噪音可能会产生误导。一个探针可能会说:“嘿,‘猫’这个词就在里面!”但这并不意味着模型在做决策时真的使用了“猫”的概念。这可能仅仅是一个巧合。

论文指出,这种“事后修补”的方法从根本上就是有缺陷的。如果你想要一个真正可理解的模型,你不能在完成后才加装手电筒;你必须在制造引擎的同时,就把手电筒内置进去。

配方:构建一个透明的大脑

为了解决这个问题,团队创造了一种新的 AI 训练“配方”。他们不仅仅是教模型预测下一个词,还同时教了它三件事:

  1. 输入归因:“你的问题中哪些词最重要?”
  2. 概念归因:“你现在正在思考哪些宏大的想法或主题?”
  3. 数据归因:“你从你的训练图书馆中学习到了哪些部分?”

为了实现这一点,他们必须建立一个庞大的全新“概念”库。想象一本字典,但它包含的不只是单词,还包含了 33,000 个具体的想法,比如“梯度下降”、“中世纪诗歌”或“讽刺”。他们建立了一个名为 Atlas 的系统,该系统阅读了数百万份文档,并用这些想法对它们进行了标记,从而创建了一张 AI 可以实际使用的知识地图。

然后,他们构建了模型的脑部——Steerling-8B,并在中间设计了一个特殊的“瓶颈”。把普通的 AI 想象成一根水流(信息)从输入流向输出的直管。Steerling 则在中间有一个过滤器。在水流出之前,它必须通过一组贴有标签的“桶”(即概念)。模型必须决定:“好吧,这个句子有 40% 关于‘数学’,20% 关于‘历史’。”因为模型必须利用这些桶来进行预测,所以我们可以准确看到它使用了哪些桶。如果它犯了错,我们可以观察这些桶并说:“啊,它太关注‘历史’而忽略了‘数学’。”

巨大的惊喜:越大越清晰

论文中最令人兴奋的部分是当他们扩大模型规模时所发生的事情。通常情况下,当你让一个复杂的系统变大时,它会变得更难理解。但在这里,情况恰恰相反。

团队测试了从微型模型到庞大的 80 亿参数 Steerling-8B 的各种模型。他们发现,随着模型的增长,其内部的“桶”变得更加有序,并且与人类的想法更加一致。

  • “税收”迷思:许多人认为,让模型解释自身会以性能为代价,就像是对其智能征收的一种“税”。论文表明这并非事实。实现可解释性的“成本”是一个微小的固定值,就像你支付的一次性小额费用,而不是随着财富增加而不断增长的账单。
  • 规模化:随着他们增加了计算能力(大约 1.35 万亿个单词的训练数据),模型不仅变得更聪明,而且变得更加透明。它学习到的概念变得更加清晰,它对“残差”(大脑中隐藏的、无法解释的部分)的依赖减少,而对标注概念的依赖增加了。

驾驶航船

由于模型是以这种方式构建的,你可以直接“操纵”它,而无需重新训练。想象你在开车。在普通的 AI 中,如果你想避免谈论暴力,你只能寄希望于车不要撞车。但在 Steerling 中,你只需转动旋钮。如果你想让模型更具“学术性”,你可以提升“学术”桶的权重。如果你想阻止它谈论“政治”,你可以抑制那个桶。论文显示,他们可以通过简单地调整模型正在使用的概念,实现瞬间改变模型行为。

结果

团队在 1.2 万亿个 token(海量文本)上训练了 Steerling-8B。他们将其与使用 2 到 16 倍于其计算能力的其它开源模型进行了对比。尽管拥有较小的训练预算,并且背负着可解释性的额外“重量”,Steerling 的表现几乎与那些庞大的、不透明的模型不相上下。

论文总结道,我们不必在智能 AI 和透明 AI 之间做选择。通过从一开始就设计出可理解的模型,我们可以构建出不仅强大而且值得信赖的系统,因为我们可以看清它们的思考方式,并在出错时进行修复。这是一个从建造“黑盒”向建造“玻璃房”的转变,让光线可以穿透其中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →