← 最新论文
🤖 machine learning

Relational Rank Geometry in Transformers: Detecting and Steering Hidden-State Relation Frames

本文证明,Transformer 隐藏状态中的高阶关系结构可通过普吕克符号熵进行检测,并通过针对关系框架几何的定向干预加以有效调控,从而在不同规模的 Llama 模型中恢复正确的行为输出。

原作者: Mazen Kobrosly

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Mazen Kobrosly

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个大型语言模型(就像那些驱动聊天机器人的模型)是一座庞大而繁忙的城市。在这座城市里,信息流经被称为“隐藏状态”的街道。大多数研究人员通过研究单个建筑(神经元)、单个交通信号灯(注意力头)或特定道路(方向)来观察这座城市。他们问:“这栋特定的建筑是做什么的?”

本文提出了一个不同的问题:“几栋建筑之间的关系作为一个整体看起来是什么样子的?”

作者 Mazen Kobrosly 提出,当模型理解一种复杂关系(例如"A 之于 B 如同 C 之于 D")时,它并非仅仅点亮几个随机的点。相反,涉及的词元(tokens,即单词)会在模型的内部空间中形成一个特定的、刚性的几何形状。本文将此称为"关系框架"(Relation Frame)。

以下是使用简单类比对该论文发现的分解说明:

1. “水管工的水平仪”(检测形状)

为了找到这些形状,作者发明了一种名为普吕克符号熵(Plücker Sign Entropy)的工具。

  • 类比:想象你在三维空间中有一组三根漂浮的棍子。你可以将它们排列成一个金字塔。如果你交换棍子的顺序,金字塔可能会翻转过来或里外颠倒。这种“翻转”是方向(orientation)的变化(就像左手与右手)。
  • 测试:作者观察那些应该相关的词组(例如,构成特定逻辑谜题的三个词)与那些仅仅是乱序的无意义词组。
  • 发现:当模型处理正确的相关词时,它们会排列成非常一致、可预测的几何方向(就像一座建造完美的金字塔)。而当词组被打乱时,它们看起来就像一堆杂乱无章、没有一致形状的棍子。
  • 结果:这种“几何特征”在不同规模的 Llama 模型(80 亿、700 亿和 4050 亿参数)中都被发现了。模型越大,这种形状就越清晰、越一致。

2. “魔法网格”(实验)

为了证明这种形状实际上导致模型正确思考,作者创建了一个名为边缘网格测试(Edge-Grid Assay)的游戏。

  • 类比:想象一个有 8 行 8 列的电子表格。
    • 清洁状态:"YES"标记形成一条完美的对角线(第 1 行连接第 1 列,第 2 行连接第 2 列,以此类推)。模型正确地将其识别为“对角线模式”。
    • 混乱状态:"YES"标记被打乱,导致多行指向同一列。模型正确地将其识别为“重复模式”。
  • 干预:作者拿起了“混乱”状态(模型在此状态下感到困惑),并试图“引导”它。他们不仅仅是轻推模型,而是试图物理重塑代表这些单词的内部“数据云”。

3. “黏土雕塑”(引导模型)

作者试图通过以不同方式移动其内部数据来修复“混乱”的模型。将数据想象成一团黏土。

  • 尝试 A:移动中心(仅质心):他们试图将整个黏土团推向“清洁”答案的方向。
    • 结果失败。模型仍然困惑。移动质心并没有修复逻辑。
  • 尝试 B:添加噪声:他们在数据中添加了随机干扰。
    • 结果失败。模型仍然困惑。
  • 尝试 C:重塑黏土团(仅形状):他们让黏土团保持在同一位置,但重塑它,使其匹配“清洁”答案的几何形状。他们扭转和转动黏土,直到它看起来与“清洁”雕塑完全一样。
    • 结果成功!模型突然开始给出正确的答案。

关键洞察:重要的不是数据在哪里(位置),而是数据如何相对于自身排列(形状)。模型需要这种特定的几何“骨架”关系才能正常工作。

4. “蓝图转移”(跨提示成功)

作者测试了这种“清洁形状”是否是一种通用的修复方法。

  • 他们从某个特定谜题中提取“清洁形状”,并将其应用于另一个具有相同结构但单词不同的谜题。
  • 结果:奏效了!模型解决了新的谜题。
  • 限制:这只有在“清洁形状”来自一个正确解决的示例时才有效。如果他们试图从一个被破坏的示例中转移“清洁形状”,则失败了。这证明模型不仅仅是在记忆特定的单词;它正在学习一种可移植的几何格式来代表“正确性”。

主张总结

该论文提出了三个具体的主张,仅此而已:

  1. 检测:我们可以使用一种名为普吕克符号熵的数学工具,检测模型是否将关系表示为特定的几何形状(关系框架)。
  2. 干预:我们可以通过手术式地重塑关系的内部几何“云”以匹配正确的示例,从而修复模型的推理错误,而无需更改单词。
  3. 特异性:之所以有效,是因为数据的形状,而不仅仅是其位置或大小。模型依赖这种特定的几何排列来获得正确答案。

该论文声称的内容

  • 它不声称发现了人工智能的“灵魂”。
  • 它不声称这适用于每一种类型的问题(它仅在特定的逻辑网格上进行了测试)。
  • 它不声称已经绘制了模型构建这些形状的完整电路(它只观察了形状本身,而不是构建它的“机制”)。

简而言之,该论文表明,在大型人工智能的“黑盒”内部,关系具有独特的、可测量的三维形状,如果你能修复这种形状,你就能修复人工智能的答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →