Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models
本文表明,在语言模型中,最能检测某种行为(如幻觉)的几何方向与控制该行为的方向在本质上是不一致的,这揭示了检测并不意味着可控性,并且这种“检测-干预差距”是源于预训练阶段的结构性解离,而非一种可预测的可控性度量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将一个语言模型(就像这篇论文中的 AI)想象成一位技艺精湛但有些糊涂的厨师,正在厨房里忙碌。
这篇论文提出了一个根本性的问题:如果厨师完全知道菜出了什么问题,他能否直接将其修复?
研究人员发现了一个令人惊讶的答案:有时厨师确实完全知情,但他们的手却被牵引向了另一个方向。 他们发现,告诉模型“这是假的”的“大脑信号”,与告诉模型“停下并说不”的“手部信号”,指向的方向几乎完全不同。
以下是使用简单类比对他们发现的详细解读。
1. 两种场景:“容易”的情况 vs. “困难”的情况
研究人员通过两个非常不同的任务来测试 AI,以观察“认知”与“执行”是如何关联的。
场景 A:输出格式(“容易”的情况)
- 任务: 要求 AI 写一个列表。它可以选择用代码块(类似于计算机程序)包裹列表,或者将其写为纯文本。
- 发现: 在这里,认知即执行。
- 类比: 想象厨师墙上有一个单一的开关。如果他拨动开关,厨房的灯光颜色会改变(检测模式),同时食物也会被装入正确的包装盒中(控制模式)。这个“开关”和“灯光”是同一件事。在 AI 的大脑中,检测“我应该使用代码块”的方向,与使它“使用代码块”的方向是完全相同的。
场景 B:幻觉(“困难”的情况)
- 任务: 让 AI 谈论一个虚构的地方(例如:“诺兰迪亚 [Norlandia] 的首都是哪里?”)。
- 发现: 在这里,认知并不等于执行。
- 类比: 想象厨师有一个超灵敏的烟雾探测器。
- 探测器: 探测器非常完美。每当出现一个虚构实体时,它就会尖叫“着火了!”(或“这是假的!”)。AI 100% 知道“诺兰迪亚”并不存在。
- 动作: 然而,按下“关闭炉灶”(拒绝回答)的按钮却位于房间的另一侧。
- 结果: 厨师大喊“着火了!”(AI 检测到了虚假信息),但由于“停止”按钮在完全不同的方向,厨师仍然继续烹饪并端出了一份虚假的菜肴。
2. 问题的几何学:“90 度转向”
论文使用几何学来衡量这一点。想象 AI 的大脑是一个巨大的房间,里面有成千上万个你可以指向的方向。
- 检测光束: 这束手电筒指向虚假实体并说:“我看到你了!”
- 控制光束: 这束手电筒指向“拒绝”按钮。
在“容易”的情况(格式)中,这两束手电筒指向完全相同的方向(相差 0 度)。
在“幻觉”的情况中,这两束手电筒指向几乎相反的方向(大约相差 83 度,接近直角)。
因为它们相距如此之远,所以当研究人员尝试沿着“检测”方向推动 AI 以停止幻觉时,并没有奏效。这就像试图通过推墙壁旁边的门来开门一样。
3. 为什么会发生这种情况?“复制粘贴”怪兽
研究人员深入挖掘了为什么这些信号相距如此之远。他们发现 AI 大脑中有一个过于强大的“怪兽”。
- 机制: AI 有一种复制问题中最重要单词到答案中的习惯。如果你问关于“诺兰迪亚”的问题,AI 的大脑会自动想要在答案中写下“诺兰디亚”。
- 冲突: “虚假检测器”信号是一个微弱、安静的低语,说着“不要说那个”。但“复制粘贴”信号是一个巨大的、响亮的呐喊,说着“写下这个名字!”。
- 结果: 尽管 AI 知道 这是假的(探测器工作完美),但“复制粘贴”的习惯如此响亮,以至于淹没了拒绝的信号。AI 最终会自信地编造事实,因为“复制”按钮比“停止”按钮要响亮得多。
4. 我们能修复它吗?“15 度转向”
研究人员尝试通过创建一个新的“方向盘”来修复这个问题。
- 想法: 既然“检测”方向和“拒绝”方向几乎成直角,他们尝试瞄准它们之间的方向。
- 结果: 他们将转向方向旋转了 15 度,向“拒绝”侧靠拢。
- 结果: 这并没有解决所有问题,但非常有帮助。它让 AI 在不误拒绝真实问题的前提下,将编造虚假事实的情况减少了 60%(从 13% 上升)。这就像是为了避开坑洼而稍微向左转动方向盘,而不是直接撞进坑里。
5. 核心教训:“认知”并不意味着“操控”
对于任何试图控制 AI 的人来说,这篇论文最重要的启示是一个警告:
仅仅因为你能找到 AI “知道”真相的方向,并不意味着那个方向能让 AI “说出”真相。
- 谬误: “如果我们找到了‘诚实’的向量,我们就可以直接把它添加到 AI 中使其变得诚实。”
- 现实: 对于某些事情(如格式),这是行得通的。但对于深度知识(如知道事实是虚假的),“认知”信号和“行动”信号处于不同的房间。你不能只按下“认知”按钮就指望 AI 停止撒谎。
总结
论文表明,在 AI 中,检测和控制往往是两种不同的技能。 AI 可以是一个完美的侦探(准确知道什么是假的),但却是一个糟糕的演员(无法阻止自己撒谎),因为“认知”和“执行”的大脑信号指向几乎完全不同的方向。要修复它,你不能只使用“认知”信号;你必须找到一个略微不同的角度,来引导 AI 做出正确的行为。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。