How Context Shapes Truth: Geometric Transformations of Statement-level Truth Representations in LLMs
本文提供了关于上下文如何转换大型语言模型中真值向量的首次几何特征描述,揭示了上下文通常会放大真值表示的幅度,而较大的模型主要通过激活空间中的方向变化而非幅度差异来区分相关上下文与冲突上下文。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
把大型语言模型(LLM)想象成一座巨大的、多层结构的图书馆,每一本书都代表着一个不同的想法或信息片段。在这座图书馆内部,关于一个陈述的“真相”并不是用文字书写的;它是以一个指向特定方向的特定箭头的形式存储的。
如果模型认为一个陈述是真的,箭头就会向一个方向指向;如果它认为是假的,箭头则指向另一个方向。你分享的论文研究了当我们给模型提供一段额外的信息(上下文)作为阅读内容后再进行回答时,这些“真相箭头”会发生什么变化。
以下是使用简单类比对他们研究结果的解读:
1. 箭头的三阶段旅程
研究人员观察了这些真相箭头在穿过图书馆不同“楼层”(层/layers)时的移动情况。他们发现了一个一致的三阶段模式:
- 地下室(早期层): 当模型刚开始阅读该陈述时,带有上下文的“真相箭头”与不带上下文的“真相箭头”指向完全不同的方向。它们就像两个背对背站立的人;它们是正交的(呈 90 度角)。此时模型只是在处理原始词汇,额外的上下文尚未让真相变得明朗。
- 大厅(中间层): 随着信息向上移动,箭头突然开始对齐。它们趋于汇聚,指向几乎相同的方向。这是模型真正“理解”的过程。它已经处理了含义,无论是否有额外的上下文,核心思想的“真相”现在都以相似的方式被呈现出来。
- 阁楼(后期层): 在最后的几层,情况变得有趣了。有时箭头会保持完美对齐;有时它们又会再次分离。这种情况主要发生在额外的上下文与模型从训练中已有的“知识”相矛盾时。这就像模型正在进行一场内部辩论,由于它试图决定信任哪种信息,导致箭头发生摇晃或改变方向。
2. 提高音量(模长/幅度)
研究人员还测量了这些箭头的长度。
- 研究发现: 当你加入上下文时,箭头通常会变得更长。
- 类比: 想象一下,一个真实陈述与一个虚假陈述的区别,就像房间里两个人的距离。没有上下文时,他们可能站得 5 英尺远;加入上下文后,模型将他们推得更远,也许到了 10 英尺。这种“分离感”让真与假变得更加清晰和易于辨别。上下文就像一束聚光灯,让对错之分变得更加鲜明。
3. 大模型 vs 小模型:不同的策略
论文发现,大模型和小模型处理这种“额外信息”的方式不同,就像两种不同类型的导航员:
- 大模型(如 LLaMA, Mistral): 这些模型像是拥有巨幅地图的专家制图师。当它们获得相关的上下文时,它们会改变箭头的方向。它们会物理性地转向,面向一个全新的、更准确的角度。它们利用大脑中更广阔的空间指向一个全新的方向,以展示它们对细微差别的理解。
- 小模型(如 Qwen, SmolLM): 这些模型的地图较小。它们无法总是承担转向新方向的代价,以免撞到其他想法。相反,它们保持箭头大致指向不变,但会让箭头变得更长。它们通过“放大”信号(使箭头变长)而非改变角度来传达它们理解了上下文。
4. 有益的上下文 vs 随机噪声
研究人员测试了当上下文确实有用与当它只是随机乱码(例如一串随机单词或打乱的段落)时,模型会发生什么反应。
- 结果: 有关、有用的上下文比随机噪声引起的模型“真相箭头”反应要剧烈得多。
- 例外情况: 如果上下文是矛盾的(告诉模型一些与其训练内容相悖的事实),它会引起最大的几何偏移。这就像模型受到了冲击;箭头会剧烈摆动,因为它必须调和两种对立的事实。
- 法律文本问题: 有趣的是,当上下文是非常复杂、专业的技术性法律文本时,模型很难将其与随机噪声区分开来。箭头的移动并不明显。这似乎表明,当语言过于密集且专业时,模型无法分辨出一个有用的线索与一个随机句子之间的区别。
总结
简而言之,这篇论文表明,当 LLM 阅读带有额外上下文的陈述时,它不仅仅是在“阅读”文字;它在物理上重塑了其内部思维的几何结构。
- 初期,想法是混乱的,指向四处。
- 中期,它们对齐以寻找真相。
- 后期, “真相箭头”会变长(更自信)或改变方向(如果上下文很棘手)。
- 大模型 通过改变箭头的方向来展示理解;小模型 则通过改变箭头的长度来展示理解。
这有助于我们理解,AI 中的“真相”不是一个静态的开关;它是一个动态的形状,会根据 AI 正在阅读的内容而发生变化。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。