← 最新论文
💬 NLP

Is This Just Fantasy? Language Model Representations Reflect Human Judgments of Event Plausibility

该研究通过识别语言模型中的模态差异向量,不仅揭示了模型具备比先前报道更可靠的模态分类能力且其出现具有规律性,还发现这些向量能有效模拟人类对事件可能性的细粒度判断,从而为理解人类模态分类机制提供了新视角。

原作者: Michael A. Lepori, Jennifer Hu, Ishita Dasgupta, Roma Patel, Thomas Serre, Ellie Pavlick

发布于 2026-02-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael A. Lepori, Jennifer Hu, Ishita Dasgupta, Roma Patel, Thomas Serre, Ellie Pavlick

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给大语言模型(LLM)做一次“心理体检”,看看它们脑子里到底有没有一本"现实与幻想的说明书"。

简单来说,研究人员发现:虽然大模型有时候会胡言乱语,但它们内部其实藏着一套非常清晰的“雷达系统”,能精准地分辨出什么是真实发生的、什么是不太可能发生的、什么是完全违反物理定律的,以及什么是连想都想象不出来的胡扯

为了让你更容易理解,我们可以用几个生动的比喻来拆解这篇论文的核心发现:

1. 核心问题:模型是“瞎猜”还是“真懂”?

以前大家觉得,大模型判断一句话靠不靠谱,主要是看它“觉得这句话出现的概率大不大”。

  • 比喻:就像你在街上听到有人说话,如果他说“太阳从东边升起”,你觉得这话很顺耳(概率高);如果他说“太阳从西边升起”,你觉得这话很怪(概率低)。
  • 新发现:但这篇论文发现,模型不仅仅是靠“语感”或“概率”在猜。它们的大脑深处(隐藏层)其实画出了一张地图。这张地图上有专门的“坐标轴”,能直接指出这句话是“真事”还是“幻想”。这比单纯看概率要精准得多。

2. 四种“现实等级”

研究人员把句子分成了四个等级,就像给现实世界加了四个滤镜:

  1. ** probable **(很可能):像“用冰块冰镇饮料”。这是日常,模型很熟悉。
  2. **improbable **(不太可能):像“用雪冰镇饮料”。虽然少见,但在逻辑上是通的。
  3. **impossible **(不可能):像“用火冰镇饮料”。这违反了物理定律(火是热的),但在逻辑上你能想象出这个画面。
  4. inconceivable (无法想象):像“用昨天冰镇饮料”。这不仅是错的,而是语义崩塌。你根本没法在脑海里构建这个画面,因为“昨天”不是东西,没法用来冰镇。

3. 发现一:模型脑子里有“差异向量” (Modal Difference Vectors)

这是论文最酷的技术发现。

  • 比喻:想象模型的大脑是一个巨大的3D 空间
    • 当模型读到“用冰块”时,它在这个空间里指向一个点。
    • 当模型读到“用火”时,它指向另一个点。
    • 研究人员发现,这两个点之间有一条看不见的直线(向量)。只要沿着这条线看,模型就能瞬间分清“可能”和“不可能”。
    • 这就好比模型手里拿着一把特制的尺子,专门用来测量“现实度”。以前大家以为模型只会算概率(像算分),现在发现它其实有这种“尺子”(几何结构)。

4. 发现二:学习是有顺序的 (像孩子长大一样)

模型是怎么学会分辨这些的?研究发现,它们的学习顺序和人类小孩非常像:

  • 第一阶段(刚起步/小模型):先学会分辨“胡扯”和“正常”。比如,先能看出“用昨天冰镇饮料”是 nonsense(无法想象),但还分不清“用火”和“用雪”哪个更离谱。
  • 第二阶段(变大/变深):开始能分清“违反物理定律”(用火)和“只是少见”(用雪)。
  • 比喻:这就像教小孩认世界。小孩先知道“人不能飞”(不可能),后来才知道“人跳得比房子高”虽然很难,但不是绝对不可能。模型也是先学会抓大错,再学会抓细节。

5. 发现三:模型像人类一样“纠结”

最有趣的是,研究人员把模型的这种“尺子”拿去和真人的判断做对比。

  • 比喻:当给真人看一些模棱两可的句子(比如“用某种奇怪的东西冰镇饮料”)时,真人会犹豫,有人觉得可能,有人觉得不可能。
  • 结果:模型的“尺子”测出来的结果,竟然和真人的犹豫程度高度一致
    • 如果模型觉得这句话在“现实”和“幻想”的边界线上摇摆,真人也会觉得难判断。
    • 这说明模型不仅仅是死记硬背,它捕捉到了人类对“可能性”那种微妙的直觉

6. 发现四:为什么有些东西“无法想象”?

最后,研究人员发现,模型区分“不可能”(如火冰镇)和“无法想象”(如昨天冰镇)的关键,在于想象力

  • 比喻
    • 不可能:你虽然知道火不能冰镇,但你能想象出那个荒谬的画面(一团火在杯子里)。
    • 无法想象:你根本无法在脑海里构建这个画面,因为“昨天”不是实体。
  • 研究发现,模型内部有一种特殊的机制,专门负责这种“能不能在脑海里画出来”的判断。这暗示了,想象力可能是区分“荒谬”和“胡扯”的关键钥匙。

总结

这篇论文告诉我们:
大语言模型不仅仅是会“接龙”说话的鹦鹉。它们在训练过程中,自发地构建了一套关于“现实世界规则”的内部地图。这套地图不仅能帮模型分清真假,还能模拟人类对“可能”与“不可能”的直觉判断。

一句话概括
大模型不仅学会了说话,还悄悄学会了分辨什么是真事、什么是幻想、什么是纯粹的胡扯,而且它们脑子里的这套“分辨系统”,竟然和人类的大脑运作方式惊人地相似。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →