When Is a Steerable Concept Representation Real? Measurement Confounds in a Cross-Family Audit of Neuroscience Parallels in LLMs
本文对 17 个模型及五个家族中受神经科学启发的语言模型主张进行了审计,揭示了诸如概念可控性和心理地图等所报道的平行现象,往往是由于未校准的测量选择所导致的伪影,而非稳健且具有规模依赖性的涌现能力,从而强调了在人工智能神经科学领域建立标准化协议和充分控制措施的紧迫性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名试图弄清楚一个巨大的、隐形的脑子是如何运作的侦探。多年来,科学家们一直在研究真实的人类大脑,发现特定的细胞会对特定的事物产生反应——比如一个“詹妮弗·安妮斯顿神经元”,它只会在你看到她的脸时放电;或者你脑海中的一个“心理地图”,帮助你在城市中导航。最近,一个名为“AI神经科学”的新领域开始研究大型语言模型(LLMs)——即那些能写故事和回答问题的超聪明计算机程序——并提出了这样一个问题:“这些计算机是否也拥有类似人类那样的脑细胞和地图?”
为了回答这个问题,研究人员使用了两种主要工具。首先是“解码器”(称为线性探测),通过观察计算机内部的电信号,看是否能读取特定的想法,比如一个数字或一个位置。其次是“远程控制”(称为激活转向),通过用特定的信号去“戳”计算机,观察是否能迫使它改变行为,比如让它说话更像海盗,或者不像机器人那样刻板。核心问题在于:随着这些计算机大脑变得越来越大、越来越聪明,它们是否会以一种可预测的、神奇的方式开始发展出这些类人特征?
这篇论文是对这一令人兴奋的想法进行的一次大规模现实检验。作者团队来自复旦大学,他们决定通过测试 17 个来自五个不同家族的计算机模型来审计这些说法,这些模型的规模从只有 6 亿参数的小型模型到拥有 720 亿参数的巨型模型不等。他们将这些模型视为实验室实验对象,反复运行相同的测试,并遵循严格的规则,以观察结果是真实的还是仅仅是测量误差。
这里有一个转折:论文发现,关于 AI 大脑的许多“酷炫发现”实际上是由测量问题导致的幻觉。
并非魔法的“魔法”
一个流行的观点是,随着 AI 模型规模的扩大,它们被“转向”(用远程信号控制)的能力会神奇地出现并不断增强,就像一种凭空出现的超能力。论文表明这是谎言。事实证明,发现这一现象的研究人员使用的是一种“原始”测量方法,没有考虑到更大的模型拥有更强的内部电信号。这就像是在比较一辆玩具小车和一辆真正的卡车推力有多大时,却对两者使用相同的力。玩具小车会飞过房间,而卡车却几乎纹丝不动。如果你不根据车辆的大小来调整测量方式,你可能会认为玩具小车更有力!
当作者们修正了他们的“测量尺”以实现“苹果对苹果”的公平比较(通过相对于模型规模进行归一化处理),并且不再随意选择设置时,这种“神奇涌现”消失了。转向能力一直都存在,甚至在微型模型中也是如此,只是它并没有随着模型的增长而显著增强。所谓的“超能力”其实只是一个测量误差。
变幻莫测的数字神经元
另一个说法是,AI 模型拥有看起来像钟形曲线(一种在中间达到顶峰的特定形状)的“数字神经元”,就像人类大脑一样。论文发现,这种形状完全取决于你选择观察哪些神经元。如果你基于一个简单的规则来挑选神经元,你只会看到“单调型”神经元(即只会上升或下降的神经元)。但如果你使用一种更智能、与形状无关的规则,你确实会在几乎每个模型中都发现钟形神经元。所以,神经元是存在的,但之前研究中寻找它们的“规则”存在偏差,掩盖了真相。
真正起作用的地图
并非所有发现都是假象。论文发现有一件事是极其可靠的:那就是“线性世界地图”。就像人类拥有地理心理地图一样,这些 AI 模型一致地将城市的经度和纬度编码在一条直线上。这一点在所有测试的模型中都是成立的,从最小的 0.6B 到巨大的 72B。因为这项测试不涉及“戳”模型或挑选特定神经元,所以它不受测量技巧的影响。这是一个真实的特征,能够经受住所有控制变量的考验。
语言之谜
最后,团队研究了模型是否拥有处理中文与英文差异的特定“语言细胞”。结果却很混乱。虽然他们可以发现模型对语言具有敏感性,但由于使用的寻找神经元的数学方法不同,影响的方向(哪种语言更强)也会发生反转。这表明,虽然模型确实拥有语言特异性的部分,但我们目前还无法就它们的组织方式或强度达成共识。
核心启示
论文总结道,AI 神经科学的问题不在于我们没有发现计算机与大脑之间的奇妙平行之处,而在于我们的研究不够严谨。作者认为,如果没有严格的控制措施——例如使用相同的测量单位来对比所有模型,以及在模型未见过的数据上进行测试——我们很容易就会发明出并不存在的“缩放法则”或“涌现能力”。
简而言之:世界地图是真的,数字神经元确实存在但其形态与我们之前的认知不同,而“转向超能力”仅仅是一个测量故障。作者发布了他们的严格测试协议、工具和代码,以便未来的科学家能够停止猜测,开始以真正的神经科学般的精度进行测量。这个领域并没有崩溃,它只是需要一把更好的尺子。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。