← 最新论文
💬 NLP

When Context Misleads: Surprisal, Energy and Attention Entropy as Metrics of Coherence Illusions in LLMs

本文表明,荷兰语语言模型表现出类人的连贯性错觉,即干扰上下文会降低不连贯续接部分的惊异度,而注意力熵和能量指标则揭示了驱动这些效应的底层共同机制。

原作者: Ece Takmaz, Nitin Kumar, Li Kloostra, Jakub Dotlacil

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Ece Takmaz, Nitin Kumar, Li Kloostra, Jakub Dotlacil

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:当你的大脑(以及 AI)被戏弄时

想象你正在读一个故事。突然,你看到一个词,比如**“又”**(again)。你的大脑会立即跳回到故事的开头,去寻找究竟是什么事情在“又”发生。

通常情况下,这运作得非常完美。但有时,这个故事是一个陷阱。存在一个“干扰项”——一个在前面提到过、听起来很像但实际上并不符合逻辑的事件,它看起来足够接近,足以迷惑你的大脑。

论文的发现:
研究人员发现,大语言模型(LLM)——即聊天机器人背后的 AI 大脑——也会掉进同样的陷阱。就像人类一样,当 AI 看到一个带有匹配干扰项的混乱故事时,它会感到困惑,并误以为这个故事是合理的。他们称之为**“连贯性错觉”**(coherence illusion)。


实验:“水果篮”测试

为了测试这一点,研究人员使用了荷兰语故事(因为他们拥有关于人类如何阅读荷兰语的数据)。以下是简化版的设置:

  1. 设定: 一个角色,假设叫作 Megan,她饿了。
  2. 转折: 故事提到了两件事:
    • 目标对象: Megan 吃了一个黄苹果
    • 干扰项:没有绿梨
  3. 陷阱: 下一句话说:“第二天早上,Megan 吃了一个。”

人类的反应:
人类读者看到“又”和“梨”。他们的大脑会感到困惑,因为故事之前说她吃梨。然而,由于“梨”在前面被提到过(尽管是被否定的),大脑有时会出错,心想:“哦,她一定是又吃了一个梨!”这就是错觉

AI 的反应:
研究人员让各种 AI 模型阅读这些故事。他们发现 AI 的表现与人类完全一致:

  • 当故事逻辑完美时,AI 很平静。
  • 当故事不合逻辑(即陷阱出现)时,AI 会感到“惊讶”(这是一个技术术语,指“这很出乎意料”)。
  • 至关重要的是: 当陷阱包含一个匹配的干扰项(即前面提到了梨)时,AI 的惊讶程度降低了。它掉入了错觉,认为这个混乱的故事其实是通顺的。

他们是如何测量这种“戏弄”的

研究人员不仅询问 AI 是否感到困惑,还观察了 AI 的“大脑”内部,看它是如何思考的。他们使用了三种特殊的工具:

1. 意外度(Surprisal,即“惊叹”计)

可以将意外度想象成一个**“惊叹”计**。

  • 如果你读到一个逻辑通顺的句子,你不会惊叹。计数值很低。
  • 如果你读到一些奇怪的东西,你会惊叹。计数值会变高。
  • 发现: 当 AI 阅读这个陷阱故事时,它发出了惊叹(高意外度)。但当陷阱故事包含一个与结尾相匹配的“干扰项”时,AI 停止了惊叹。它被骗了,认为故事很顺畅。

2. 注意力熵(Attention Entropy,即“聚焦”手电筒)

想象 AI 有一把手电筒,照向它正在思考的单词。

  • 低熵(聚焦): 手电筒是一束紧凑的光。AI 正盯着一个特定的词。
  • 高熵(弥散): 手电筒是一束宽阔、模糊的光。AI 同时看着许多词,不确定哪一个才是重要的。
  • 发现: 当 AI 被骗时,手电筒变得模糊了(高熵)。它看向了错误的词,因为干扰项让它产生了困惑。通过关闭负责这种“模糊聚焦”的 AI 特定部分,研究人员可以观察到,正是这些部分在被戏弄。

3. 能量(Energy,即“磁铁”测试)

这是研究人员借鉴物理学引入的一个新工具。想象 AI 的记忆是一个由山丘和山谷组成的景观。

  • 低能量: AI 找到了一个完美的“山谷”,当前的词与过去完美契合。就像一块磁铁吸附到位一样。
  • 高能量: AI 被困在了一座“山丘”上。这个词并不契合,AI 必须努力去理解它。
  • 发现: 当 AI 被干扰项戏弄时,“能量”下降了。感觉这个词完美契合,尽管事实并非如此。这证实了 AI 正在经历与人类相同的错觉:它感受到了一种虚假的连接感。

为什么这很重要(根据论文所述)

论文并没有说这能修复 AI 或治愈疾病。相反,它提出了一个具体且重要的观点:

AI 与人类共享一种类似的“故障”。
人类和这些 AI 模型都依赖于记忆检索。当我们试图回忆故事中之前发生了什么时,我们会使用线索。如果一个线索看起来与答案很像(即使它是错误的),我们的脑部(以及 AI 的数学逻辑)就会被劫持。

研究人员表明:

  1. AI 会被愚弄: 它们不是完美的逻辑机器;它们可以像人一样被上下文所迷惑。
  2. 我们可以识别这种戏弄: 通过测量“意外度”、“注意力”和“能量”,我们可以精确观察到 AI 是在何时以及如何掉入错觉的。
  3. 这是一种共同机制: 让 AI 产生困惑的部分,也是帮助它理解正常故事的部分。这并非漏洞,而是这些系统(以及我们的大脑)运作方式的一个特性。

总结

这篇论文就像是一个揭秘魔术的过程。它展示了当你给 AI 一个带有巧妙干扰的故事时,它不仅仅是在计算答案,它还会以一种模仿人类困惑的方式被“分心”。通过研究这一点,我们了解到 AI 和人类大脑可能都在使用相似的语言处理捷径,而这些捷径有时会将我们双方都带入歧途。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →