Relational Rank Geometry in Transformers: Detecting and Steering Hidden-State Relation Frames
本文证明,Transformer 隐藏状态中的高阶关系结构可通过普吕克符号熵进行检测,并通过针对关系框架几何的定向干预加以有效调控,从而在不同规模的 Llama 模型中恢复正确的行为输出。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个大型语言模型(就像那些驱动聊天机器人的模型)是一座庞大而繁忙的城市。在这座城市里,信息流经被称为“隐藏状态”的街道。大多数研究人员通过研究单个建筑(神经元)、单个交通信号灯(注意力头)或特定道路(方向)来观察这座城市。他们问:“这栋特定的建筑是做什么的?”
本文提出了一个不同的问题:“几栋建筑之间的关系作为一个整体看起来是什么样子的?”
作者 Mazen Kobrosly 提出,当模型理解一种复杂关系(例如"A 之于 B 如同 C 之于 D")时,它并非仅仅点亮几个随机的点。相反,涉及的词元(tokens,即单词)会在模型的内部空间中形成一个特定的、刚性的几何形状。本文将此称为"关系框架"(Relation Frame)。
以下是使用简单类比对该论文发现的分解说明:
1. “水管工的水平仪”(检测形状)
为了找到这些形状,作者发明了一种名为普吕克符号熵(Plücker Sign Entropy)的工具。
- 类比:想象你在三维空间中有一组三根漂浮的棍子。你可以将它们排列成一个金字塔。如果你交换棍子的顺序,金字塔可能会翻转过来或里外颠倒。这种“翻转”是方向(orientation)的变化(就像左手与右手)。
- 测试:作者观察那些应该相关的词组(例如,构成特定逻辑谜题的三个词)与那些仅仅是乱序的无意义词组。
- 发现:当模型处理正确的相关词时,它们会排列成非常一致、可预测的几何方向(就像一座建造完美的金字塔)。而当词组被打乱时,它们看起来就像一堆杂乱无章、没有一致形状的棍子。
- 结果:这种“几何特征”在不同规模的 Llama 模型(80 亿、700 亿和 4050 亿参数)中都被发现了。模型越大,这种形状就越清晰、越一致。
2. “魔法网格”(实验)
为了证明这种形状实际上导致模型正确思考,作者创建了一个名为边缘网格测试(Edge-Grid Assay)的游戏。
- 类比:想象一个有 8 行 8 列的电子表格。
- 清洁状态:"YES"标记形成一条完美的对角线(第 1 行连接第 1 列,第 2 行连接第 2 列,以此类推)。模型正确地将其识别为“对角线模式”。
- 混乱状态:"YES"标记被打乱,导致多行指向同一列。模型正确地将其识别为“重复模式”。
- 干预:作者拿起了“混乱”状态(模型在此状态下感到困惑),并试图“引导”它。他们不仅仅是轻推模型,而是试图物理重塑代表这些单词的内部“数据云”。
3. “黏土雕塑”(引导模型)
作者试图通过以不同方式移动其内部数据来修复“混乱”的模型。将数据想象成一团黏土。
- 尝试 A:移动中心(仅质心):他们试图将整个黏土团推向“清洁”答案的方向。
- 结果:失败。模型仍然困惑。移动质心并没有修复逻辑。
- 尝试 B:添加噪声:他们在数据中添加了随机干扰。
- 结果:失败。模型仍然困惑。
- 尝试 C:重塑黏土团(仅形状):他们让黏土团保持在同一位置,但重塑它,使其匹配“清洁”答案的几何形状。他们扭转和转动黏土,直到它看起来与“清洁”雕塑完全一样。
- 结果:成功!模型突然开始给出正确的答案。
关键洞察:重要的不是数据在哪里(位置),而是数据如何相对于自身排列(形状)。模型需要这种特定的几何“骨架”关系才能正常工作。
4. “蓝图转移”(跨提示成功)
作者测试了这种“清洁形状”是否是一种通用的修复方法。
- 他们从某个特定谜题中提取“清洁形状”,并将其应用于另一个具有相同结构但单词不同的谜题。
- 结果:奏效了!模型解决了新的谜题。
- 限制:这只有在“清洁形状”来自一个正确解决的示例时才有效。如果他们试图从一个被破坏的示例中转移“清洁形状”,则失败了。这证明模型不仅仅是在记忆特定的单词;它正在学习一种可移植的几何格式来代表“正确性”。
主张总结
该论文提出了三个具体的主张,仅此而已:
- 检测:我们可以使用一种名为普吕克符号熵的数学工具,检测模型是否将关系表示为特定的几何形状(关系框架)。
- 干预:我们可以通过手术式地重塑关系的内部几何“云”以匹配正确的示例,从而修复模型的推理错误,而无需更改单词。
- 特异性:之所以有效,是因为数据的形状,而不仅仅是其位置或大小。模型依赖这种特定的几何排列来获得正确答案。
该论文未声称的内容:
- 它不声称发现了人工智能的“灵魂”。
- 它不声称这适用于每一种类型的问题(它仅在特定的逻辑网格上进行了测试)。
- 它不声称已经绘制了模型构建这些形状的完整电路(它只观察了形状本身,而不是构建它的“机制”)。
简而言之,该论文表明,在大型人工智能的“黑盒”内部,关系具有独特的、可测量的三维形状,如果你能修复这种形状,你就能修复人工智能的答案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。