← 最新论文
🧬 biology

Do Language Models Align with Brains? Prediction Scores Are Not Enough

运用严格的 L-PACT 框架,本研究证明,尽管预测分数呈阳性,当前语言模型并未真正与人类大脑表征相一致,因为其表面的成功完全可由对照条件而非结构相似性来解释。

原作者: Xiao Jia

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiao Jia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正在试图弄清楚一个全新的、超级聪明的机器人(即语言模型)是否像人脑一样思考。

多年来,科学家们一直试图通过提问来回答这个问题:“如果我们给机器人一个故事,它能猜出人脑的哪个部分接下来会亮起吗?”如果机器人经常猜对,科学家们就会说:“啊哈!这个机器人一定像人一样思考!”

这篇题为《语言模型与人脑是否对齐?预测分数不足以说明问题》的论文认为,这种思维方式存在缺陷。作者贾晓指出,仅仅因为机器人能做出正确的猜测,并不意味着它真正理解了人脑的内在运作机制。它可能只是基于幸运的模式在猜测,就像一位气象员因为今天是星期二就预测会下雨,而不是因为他懂气象学。

为了证明这一点,作者构建了一个严格的“考试”,称为L-PACT。请将 L-PACT 想象成不是一个单一的测试,而是一个机器人必须通过的四级安检站,以证明它确实与人脑对齐。

L-PACT 考试的四道关卡

想象一个机器人试图进入一个高安全级别的俱乐部(“人脑俱乐部”)。它必须通过四道关卡。如果它连一道都失败了,就会被拒之门外。

  1. 第一关:“比抛硬币更好”检查(预测充分性)

    • 测试内容: 机器人预测大脑活动的能力是否优于无用的随机猜测或“干扰”基线(比如一台坏掉的收音机)?
    • 陷阱: 机器人不仅要胜过随机猜测,还要胜过“严格对照”。想象一下,对照机器人是被打乱的——它的词语被洗牌,句子被反转,或者层级被混合。如果真正的机器人无法击败这个被打乱的版本,那它只是基于噪声在猜测,而非真正的理解。
    • 结果: 本研究中的机器人未能通过。它们无法击败被打乱的版本。
  2. 第二关:“地图检查”(关系充分性)

    • 测试内容: 仅仅猜对答案是不够的;机器人必须像人脑一样组织其知识。
    • 类比: 想象两张地图。一张是由人脑绘制的城市地图,另一张是由机器人绘制的。即使两张地图都能带你到达正确的目的地,如果人脑的地图显示公园在学校旁边,而机器人的地图却把公园放在火山旁边,那么这两张地图就是不同的。
    • 陷阱: 机器人必须证明其内部的关系“地图”与人脑的地图相匹配,而不仅仅是得分正确。
    • 结果: 机器人未能通过。它们的内部地图组织方式与人脑不同。
  3. 第三关:“手术检查”(机制剥离)

    • 测试内容: 这是“反事实”测试。如果我们手术切除机器人大脑的特定部分(例如其理解惊讶或语法的能力),它的性能是否在人脑执行该特定任务时下降?
    • 类比: 如果你把汽车的引擎拆掉,它就不应该能行驶。如果你把机器人的“语法”部分移除,它应该在语法任务上失败,但在其他方面仍然正常。如果移除该部分导致所有任务同等受损,那就说明机器人实际上并没有利用该部分来执行特定任务。
    • 结果: 机器人未能通过。当部分被移除时,造成的损害不够具体,无法证明它们使用了与人脑相同的“机制”。
  4. 第四关:“天花板检查”(可靠性边界)

    • 测试内容: 机器人距离绝对可能性的极限有多近?
    • 类比: 想象人脑是一台相机。即使是最好的相机,其照片的清晰度也有极限(由于颗粒或噪声)。如果机器人的照片模糊,是因为机器人不好,还是因为相机(人脑)本身就有噪声?我们需要知道机器人是否达到了人类可靠性的“天花板”。
    • 结果: 机器人离天花板还差得远。它们的分数太低,不足以被视为真正的对齐。

“阳性对照”:证明考试有效

你可能会问:“也许考试本身坏了?也许它太难了?”

作者通过测试那些应该通过的项来证明考试是有效的:

  • “人脑对人脑”测试: 他们将人脑的一部分与同一人脑的另一部分进行比较。这通过了考试(因为这是同一个大脑!)。
  • “虚假信号”测试: 他们在数据中植入了一个虚假的完美信号。考试正确地将其识别为匹配项。
  • “低层级”测试: 他们检查考试是否能检测像“一个词刚刚开始”这样简单的事情。它可以。

这证明考试没有坏;只是本研究中的机器人没有通过。

主要结论

该论文分析了来自多个真实世界实验的数据(人们听播客、读故事等),并测试了几种流行的语言模型(如 GPT-2 和 Qwen)。

裁决:

  • 146 次尝试中,0 次通过了全部四道关卡。
  • 每一次机器人看起来表现良好时,仔细一看就会发现那只是“假阳性”。它只是击败了微弱的基线,但在面对“严格对照”(被打乱的版本)时却失败了。
  • 作者将这些结果称为“对照解释型”。这意味着,表面的成功完全可以解释为机器人只是捕捉到了简单的、非类脑的模式(如词频或时间),而不是真正模拟了大脑的运作方式。

核心启示

该论文得出结论:预测分数不足以说明问题。 仅仅因为一个计算机模型能猜出你大脑接下来会做什么,并不意味着它像你一样思考。它可能只是一个非常擅长猜测的家伙。

要真正声称一个模型与人脑“对齐”,它必须通过这个严格的四级安检。在这项特定研究中,使用所测试的特定数据和模型,没有任何语言模型通过。表面的相似性是由更简单的统计技巧制造的幻觉,而非深层的结构对齐。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →