← 最新论文
💬 NLP

Recovering Lesion Parameters from Aphasic Picture Naming Error Profiles in Large Language Models

本文表明,尽管由于功能冗余,无法从失语症图像命名错误谱中唯一地恢复特定的 Transformer 层索引,但扰动强度和噪声参数可以被成功反转,以生成能够重现目标行为并区分临床综合征的反事实模型,从而为因果大语言模型可解释性提供了一个稳健的框架。

原作者: Yong Yang, Roger Newman-Norlund, Xiang Guan, Saeed Ahmadi, Regan Willis, Nadra Salman, Kalil Warren, Sophie Arheix-Parras, Srihari Nelakuditi, Leonardo Bonilha, Christopher Rorden, Rutvik H. Desai, Ju
发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yong Yang, Roger Newman-Norlund, Xiang Guan, Saeed Ahmadi, Regan Willis, Nadra Salman, Kalil Warren, Sophie Arheix-Parras, Srihari Nelakuditi, Leonardo Bonilha, Christopher Rorden, Rutvik H. Desai, Julius Fridriksson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图弄清楚一座巨大的、充满魔力的图书馆是如何运作的。你看不见里面的书,也看不见图书管理员,但你可以观察当你向这座建筑低声诉说一个秘密时会发生什么。有时,图书馆会回以一个完美的答案;有时,它会结结巴巴,词语混乱,或者说一些完全不知所云的话。科学家们称这些现象为“大语言模型”(LLMs),它们是许多我们正在使用的智能工具背后的数字大脑。但棘手的部分在于:我们并不真正知道是哪个部分的大脑在说话。这就像仅仅通过观察时钟的面盘,就试图猜出是时钟内部哪个特定的齿轮带动了指针移动一样。

为了理解这一点,科学家经常使用一种叫做“损伤法”(lesioning)的方法。想象一下,你拿着一把微小且精准的锤子,敲击时钟中某个特定的齿轮,看看是否会破坏其计时功能。如果时钟开始运行变慢,你就知道那个齿轮很重要。在人工智能的世界里,研究人员可以通过向数字大脑添加一点“数字噪声”来“破坏”它,就像中风会损伤人类大脑的部分区域并导致言语障碍一样。这篇论文提出了一个迷人的“逆向”问题:如果我们看到时钟运行变慢了,我们能否通过观察时间,准确判断出我们敲击的是哪个齿轮?如果我们猜中了齿轮,并在一个全新的时钟上敲击同一个齿轮,它是否也会以完全相同的方式运行变慢?这不仅仅是为了修理时钟;这是为了证明我们真正理解了这些数字大脑是如何思考的,而不仅仅是在猜测它们的行为。

伟大的 AI 侦探游戏

在这项研究中,一个研究小组决定与一个名为 LLaVA-Vicuna 13B 的数字大脑玩一场高风险的侦探游戏。把这个 AI 看作是一个超级聪明的机器人,它能够观察一张图片并告诉你它是什么。研究人员想要看看,他们是否能仅通过观察机器人犯下的错误,就弄清楚他们究竟是如何“破坏”机器人的。

首先,他们布置了一个大规模实验。他们对机器人进行了 4,840 种不同方式的微小“损伤”(数字损伤)。对于每次尝试,他们改变了三个变量:

  1. 在哪里打击它(触及了机器人 40 层“思考”层中的哪一层)。
  2. 损坏程度(对该层造成了多大程度的破坏,从 0% 到 100%)。
  3. 噪声强度(破坏过程中的混乱程度有多大)。

在以这 4,840 种方式破坏机器人后,他们向它展示了 175 张日常物品的照片,并要求它命名这些物体。他们记录了机器人犯下的每一个错误——无论是把“狗”说成“猫”(语义错误)、创造了一个无意义的新词(新词创造),还是保持沉默。这种错误的集合被称为“错误剖面”(error profile)。

逆向工程挑战

现在到了最难的部分。研究人员构建了一个新的、特殊的计算机程序(一个“逆向模型”)来充当侦探。他们将错误剖面(错误列表)输入给这个侦探,并问道:“根据这些错误,我们究竟破坏了什么?”

侦探必须猜出三件事:

  • 被击中的是哪一层?
  • 这一层被破坏了多少?
  • 破坏的噪声强度是多少?

重大发现:强度 vs 位置
结果令人惊讶,并揭示了这些 AI 大脑构建的一个秘密。

  1. “多少”很容易找到: 侦探非常擅长猜测损坏程度。无论机器人是有些困惑还是完全陷入混乱,侦达都能高精度地分辨出来。这就像仅凭引擎的顿挫声就能判断汽车引擎是“有点不顺畅”还是“彻底报废”一样。
  2. “哪里”很模糊: 侦探并不擅长猜测精确的层级。它只能在约 14.8% 的情况下猜中正确的层级(这比随机猜测要好得多,但仍远非完美)。然而,它通常能猜中正确的“邻近区域”(误差在 5 层以内),准确率约为 77.6%

“魔术表演”测试(反事实验证)
这里是这篇论文最酷的地方。仅仅靠侦探猜中“多少”和“哪里”并不足以证明它是正确的。为了证明这一点,研究人员进行了一个“魔术表演”。他们采用了侦探的猜测,来到一个全新的、未受损的机器人面前,并将那个精确的猜测应用到它身上。

  • 结果:81.4% 的案例中,新的机器人表现出了与原始受损机器人完全相同的错误
  • 转折: 即使侦探猜错了层级,如果它猜对了“损坏程度”,新的机器人仍然会做出同样的错误。

这证明了对于这些 AI 大脑而言,破坏程度破坏位置重要得多。这表明这些机器人的大脑中间部分具有“冗余性”——它们都在执行相似的任务。如果你损坏其中一个中间层,另一个中间层可以某种程度上接管工作,因此机器人的行为变化取决于受损的严重程度,而不是具体的位置

与真实人类的联系

为了确保这不仅仅是关于机器人的游戏,研究人员还将他们的侦探应用于 278 名遭受中风并出现命名障碍(称为失语症)的真实人类。研究人员并没有教给侦探任何关于人类大脑的知识;它只了解损坏的机器人。

当他们将人类患者的错误剖面输入给侦探时,神奇的事情发生了:

  • 侦探关于“损伤强度”(破坏了多少)的预测与患者病情的严重程度完美契合。病情严重的患者被预测为具有“高损伤”,而轻微症状的患者则被预测为“低损伤”。
  • 侦探还根据它所猜测的“位置”,将患者按特定的失语症类型(如布洛卡失语症或韦尼克失语症)进行了分组,尽管它此前从未见过人类。

这意味着什么

这篇论文并不是声称已经解开了人类大脑的奥秘,或修复了所有的 AI 问题。相反,它提供了一种测试我们是否真正理解 AI 的新方法。

  • 它排除了什么: 它表明仅仅观察 AI 使用哪一层是不够的。你不能简单地说“第 10 层是负责名词的”,因为如果损伤程度相同,破坏第 10 层看起来可能和破坏第 15 层一模一样。
  • 它暗示了什么: 这些 AI 大脑的“中间部分”充满了备份系统。它们是灵活且具有冗余性的。
  • 信心来源: 研究人员对“强度”这一发现非常有信心,因为他们在测试新鲜机器人时,该结论在 81.4% 的情况下都是成立的。他们也确信“位置”难以确定,因为即使猜错了层级,机器人的表现依然一致。

简而言之,这项研究教导我们,要理解这些巨大的数字大脑,我们不应该寻找单一的“损坏齿轮”,而应该观察整个机器是如何被剧烈摇晃的。而且最棒的部分是?他们发明的方法——通过猜测损伤,然后在新鲜机器上进行测试——在未来可以被用来检查我们是否真的理解了任何关于 AI 思考方式的部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →