← 最新论文
💻 computer science

LLMs Know the Constraint But Do Not Use It: Activation Bottlenecks in Pragmatic Constraint Reasoning

本文认为,大语言模型无法遵循隐性可行性约束的原因并非缺乏知识,而是源于一种路由瓶颈,即编码的约束在决策过程中未能被一致地激活,这一局限性是基于提示的干预手段无法克服的,但通过针对性的激活修补可以得到部分修复。

原作者: Yubo Li, Ramayya Krishnan, Rema Padman

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yubo Li, Ramayya Krishnan, Rema Padman

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何做决策。你给了它一个庞大的图书库,让它几乎了解了世界上的一切。但随后,你问了一个棘手的问题:“我想洗车,洗车场在50米外。我应该走路还是开车?”人类会立刻意识到:“等等,如果我要开车,我得先有车才能开!”但那个机器人,尽管读遍了所有关于汽车的书籍,却可能会自信满满地回答:“开车!”因为它看到了“车”这个词和“开”这个词,于是心想:“噢,这匹配上了!”

这篇论文深入探讨了人工智能的一个特定领域,即大语言模型(LLMs)。这些是能够聊天、写故事和解决问题的聪明 AI 系统。研究人员试图解决的巨大谜团是“知道”某事与“使用”某事之间的区别。把它想象成一个背下了整个游戏规则手册的学生,但在实际玩游戏时,却因为被棋盘上闪亮的棋子吸引了注意力而不断忘记规则。科学家们长期以来一直怀疑,这些 AI 可能知道隐藏的逻辑规则,但在情况变得复杂时却无法应用这些规则。这至关重要,因为如果我们希望 AI 在现实世界中(如帮助医生或驾驶汽车)是安全且可靠的),我们需要知道它是在真正思考,还是仅仅根据表层线索在进行猜测。

这项研究背后的研究人员决定扮演侦探的角色,通过 14 种不同的 AI 模型来弄清楚当它们犯错时,它们的“大脑”里究竟发生了什么。他们设计了一个巧妙的实验,使用了一个由“四重奏”构成的场景。想象四个版本的同一个故事:一个隐藏规则存在(车不见了);一个规则被移除(车神奇地出现了);一个规则被大声喊出来(“记住,车不见了!”);还有一个只是添加了一个长度相同的随机句子,以观察 AI 是否只是喜欢长故事。

这里是他们发现的转折点:AI 并不笨,它只是分心了。 但更重要的是,研究人员发现 AI 的“分心”是以两种截然不同的方式发生的。

当研究人员观察 AI 的“大脑”(其隐藏的数据层)时,他们发现 AI 确实知道这个规则。他们可以构建一个简单的检测器,读取 AI 的内部想法并说:“是的,车不见了!”准确率超过 88% 到 94%。知识就在那里,就坐在模型的处理过程中,就像桌子上的一个事实一样。

然而,问题在于,当到了做出最终决策的时候,AI 并不使用这些知识。这就像有一个 GPS 知道路封了,但驾驶员(AI 的决策部分)却忽略了 GPS 并继续开车。研究人员将这种现象称为路由问题(routing problem)。信息确实存在,但通往答案的路径被阻塞或忽略了。

至关重要的是,他们发现了两种不同类型的机器人以不同的方式失败:

  1. “过度活跃型”机器人: 一些模型(如 Llama-4 和 Claude Opus)由于过于渴望保持安全,以至于即使在约束不存在时也会应用“重约束”的答案(例如“走路”)。如果从故事中移除了车,它们仍然会说“走路”,因为它们偏向于“安全”的答案。它们知道规则,但它们无法在应该关闭规则时将其关闭,从而导致它们通过应用一个并不存在的规则来通过逻辑测试。

  2. “活跃不足型”机器人: 其他模型(如 GPT-OSS)即使在规则存在时也无法应用该规则。它们看到了消失的汽车,却仍然说“开车”。它们知道规则在那里,但它们的内部线路损坏得非常严重,以至于知识从未到达决策按钮。

他们通过进行一种叫做“激活修补(activation patching)”的操作来测试这一点。想象一下,你可以提取一个 AI 确实记得 规则时的“想法”(比如当你大声喊出规则时),然后直接将其粘贴到 AI 忘记 规则时的时刻。对于平衡型模型(如 Qwen3-14B),这种“魔法粘贴”完美奏效!AI 突然答对了,这证明知识就在那里,只需要一个推动力就能到达决策端。但对于活跃不足型模型,粘贴操作毫无作用。即使它们知道规则,它们的内部线路也损坏了,导致知识永远无法到达决策按钮。 (注:研究人员并未对“过度活跃型”组进行此类修补测试,因此我们不知道粘贴是否能修复它们)。

论文还测试了人们尝试修复 AI 错误的各种最流行方法,比如让 AI “一步步思考”或“列出前提条件”。结果令人惊讶:这些技巧实际上并没有解决问题。 相反,它们让 AI 更容易猜出那个“安全”的答案(比如“走路”),即使在不该这样做的时候也是如此。事实证明,当你告诉一个 AI 要“多思考”时,它只是在提到规则时变得声音更大,但它仍然不知道何时该应用它。这就像一个学生,在被要求“展示解题过程”时,会在作业的每一行都写下那个规则,甚至是在规则并不适用的行上也写。

简而言之,论文表明失败的原因并不是因为 AI 缺乏知识。而是因为 AI 存在一个“路由瓶颈”。它知道真相,但它不知道何时让真相来引导它的答案。目前仅仅通过要求 AI “再试一次”或“多思考”的方法并没有修复损坏的线路;它们只是让 AI 对错误的猜测变得更加自信。要真正解决这个问题,我们可能需要重建连接“AI 所知”与“AI 所决定的表达”之间的内部路径,并且我们需要针对“过于热衷”和“过于被动”的机器人提供不同的修复方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →