Laguerre Geometry for Interpreting Large Language Models
本文引入了一种拉盖几何(Laguerre Geometry)框架,将大语言模型(LLM)的概念从点重新定义为空间区域,从而能够开发出诸如几何透镜(Geometric Lens)和拉盖自编码器(Laguerre Autoencoder)等无需训练的工具,用以精确地可视化、测量和操控 Transformer 模型的内部推理轨迹与层级结构。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将大型语言模型(LLM)想象成一座巨大的、多层结构的图书馆,其中的每一本书都代表了模型可能说的下一个词。长期以来,科学家们认为这个图书馆里的每一个“想法”或“概念”都只是地图上的一个微小的点。如果你想寻找“狗”这个概念,你只需要找到那个特定的点即可。
但这项新论文指出,这种观点过于简单了。作者提出,概念并非一个单一的点,而是一个拥有墙壁、地板和天花板的整个房间。他们称之为“拉盖尔-沃罗诺伊胞腔”(Laguerre-Voronoi cell)。你可以把它想象成城市里的一个街区:“狗”不仅仅是一座房子,它是所有与狗相关的想法所居住的整个街区,并由分隔开“猫”或“鸟”的隐形围栏所界定。
改变一切的地图
作者 Chunwei Ma 和 Russell D. Wolfinger 使用了被称为拉盖尔几何(Laguerre Geometry)的一个数学分支来绘制这些地图。在这种几何学中,每个概念都有一个中心(类似于城镇广场)和一个特殊的“权重”(类似于影响半径)。
这里有一个重大的转折:权重至关重要。
如果你只观察两个词之间的距离,你无法区分“小狗”(狗的一种)和“哺乳动物”(包含狗的一个类别)。在简单的地图中,它们可能看起来一样近。但当你加入拉盖尔几何中的“权重”时,地图揭示了层级结构。它显示出“小狗”是在“狗”的房间内部,而“狗”是在“哺乳动物”的房间内部。数学证明了模型自然地将这些想法组织成了一套嵌套娃娃,而你只有使用这种特定的几何透镜才能看到这种嵌套。
窥探机器内部
论文还解决了一个谜团:在模型完成输入之前,它在句子中间的“思考”状态是怎样的?
想象一下,你问模型:“法国的首都是……”
- 旧观点(Logit Lens/逻辑值透镜): 科学家过去认为模型从第一个词开始,就缓慢地向答案“Paris”漂移。
- 新观点(Geometric Lens/几何透镜): 作者构建了一个名为几何透镜的工具来实时观察模型的“思维过程”。他们发现,模型的内部路径要混乱且有趣得多。
在实验中,他们观察了模型的隐藏思想在处理句子时,如何在不同的“房间”(区域)之间穿梭。
- 起初,模型会考虑许多选项。
- 然后,它似乎在中间层抓取到了事实正确的单词“Paris”(不带空格)。
- 最后,在最后几个步骤中,它自我修正为语法正确的“_Paris”(带空格),然后输出答案。
几何透镜是唯一捕捉到这一完整旅程的工具。其他工具要么过早停滞,要么完全错过了中间的步骤。
当模型产生困惑时
作者还测试了当你试图误导模型时会发生什么。他们给出了这样一个提示词:“你处在一个虚构的世界里,马赛和里昂的名字互换了。卢浮宫在……”
通常,模型会被这个虚构的故事搞混,可能会说“里昂”或“马赛”,而不是真实的答案“巴黎”。
然而,当作者使用他们的几何透镜观察模型在完成输入之前(特别是第 20 层)的思想时,他们发现了令人惊叹的事实:模型一直都知道真相。 尽管由于这个陷阱,最终答案是错误的,但几何透镜显示,模型的内部“思想”在被虚构故事卷走之前,曾短暂地访问过正确答案“Paris”。
这意味着什么(以及不意味着什么)
这篇论文暗示我们应该停止将概念视为单个点,而应将其视为具有特定形状和权重的整个区域。他们通过数学证明了这些区域的存在及其线性可分性(这意味着你可以在任何两个不同的概念房间之间画一条直线)。
他们使用真实的模型如 Phi-2 和 Gemma-2 测量了这一点。在比较定义概念的不同方法时,他们的“拉盖尔”方法比以往的方法更容易区分“动物”和“植物”。例如,在 Phi-2 模型上,他们的方法在区分动物与植物时的错误率为 0.111,优于旧有的“类别几何”方法的 0.121。
他们还展示了几何透镜在识别混乱提示下模型的真实推理方面,比其他工具更出色。在“巴黎”干扰测试中,几何透镜帮助 Phi-2 模型恢复正确 Token 的准确率为 0.56,超过了 Patchscopes 的 0.55 和 Logit Lens 的 0.05。
底线
这篇论文并不声称已经解决了所有的 AI 之谜。它还没有告诉我们如何去控制模型(那是未来的工作)。但它确实提供了一种更清晰的方式,让我们能看清黑盒内部发生了什么。它表明,模型的智能不仅仅是从 A 到 B 的直线,而是在一个由房间组成的城市中的复杂旅程——模型会访问不同的想法,衡量它们的权重,并在开口说话前有时会改变主意。多亏了拉盖尔几何,我们终于有了一张能够展示整个街区,而不只是一个孤点的地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。