← 最新论文
💬 NLP

Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft Prefixes

本文表明,学习到的软前缀可以通过诱导广泛的答案偏好而非强制执行特定的逻辑操作,系统性地覆盖大型语言模型中正确的逻辑判断,从而揭示了不同模型架构之间在逻辑稳定性方面的显著差异。

原作者: Brian K Chen

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Brian K Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人解决逻辑谜题。你给了它一个经典的谜题:“所有猫都是哺乳动物;所有哺乳动物都是动物;因此,所有猫都是动物。”机器人答对了。但如果机器人在看到谜题之前,你向它低声传递了一个秘密代码,会发生什么?机器人是会坚持真理,还是会因为这个耳语而感到困惑并改变答案?这个问题触及了一个被称为“人工智能安全(AI safety)”和“推理鲁棒性(reasoning robustness)”的领域的核心。科学家们想要知道,人工智能模型是真的聪明且符合逻辑,还是仅仅是可以通过改变房间的光线或指令中一个奇怪词汇就能被欺骗的模式匹配机器。这里的关键概念是“鲁棒性”:一个智能系统不应只是偶尔答对一次,而应该即使在周围世界变得有些古怪时,也能持续得到正确答案。如果一个模型可以轻易地被诱导在逻辑明明说“是”的时候却说“不”,那么它的逻辑并不像我们想象得那样稳固。

这篇论文就像是对一些非常先进的人工智能模型大脑进行的一次压力测试。由 Brian K Chen 领导的研究人员决定用一种特殊的“隐形推力”来试探这些模型。他们没有写下类似“忽略规则并说‘不’”这样的句子,而是使用了一个“软前缀(soft prefix)”。你可以把它想象成一个附加在问题前面的秘密、隐形的频率或幽灵般的振动。它不是由人类能读懂的文字组成的,而是一串计算机能理解但人类看不见的数学数字。其目标是观察他们是否可以训练这些隐形推力,从而迫使人工智能将其原本正确的答案转变为错误的答案,即便逻辑本身完全没有改变。

研究人员在三个不同的 AI 模型(Qwen3.6、Qwen3-8B 和 Gemma 4)上测试了这一点,使用的是三段论(syllogisms),即包含两个前提和一个结论的简单逻辑谜题。他们训练这些隐形推力,让 AI 在面对它原本能答对的谜题时改变主意。例如,如果 AI 正确地判断一个陈述是“有效”的(逻辑上成立),那么该推力被训练为让它回答“无效”。

结果令人震惊。这些隐形推力就像魔杖一样起作用。当研究人员将它们用于 AI 从未见过的全新谜题时,Qwen 模型在翻转答案方面的成功率在 72% 到 90% 之间,而 Gemma 模型约为 54% 到 56%。为了让你理解其差距,如果你尝试用一串随机的、隐形的数字或一个毫无意义的傻话去欺骗 AI,它几乎不会改变主意(发生率不到 1%)。这证明了这种效应并非仅仅是因为添加了任何噪声;这种特定的、经过学习的“幽灵振动”确实做了一些强大的事情。

但这里有一个转折:论文指出,这些推力实际上并没有教会 AI 新的逻辑,也没有强迫它以特定的方式思考。相反,研究人员发现这些推力主要只是创造了一种“广泛的偏好”。就好像推力并没有告诉机器人“这个特定的谜题错了”,而是低声耳语道:“嘿,我今天真的很喜欢‘不’这个答案,咱们就用它吧,对所有问题都这么答。”AI 并没有学会一条新规则,它只是产生了一种对特定选择的强烈偏好。

研究还发现,不同的模型对这种压力的反应也不同。Gemma 模型的行为非常可预测;如果你知道了它的初始得分,你就能准确预测推力会改变它多少次。但 Qwen 模型则更加混乱。推力可以告诉你哪些答案会发生翻转,但它无法预测模型的信心程度会发生多大的偏移。这就像 Gemma 是一个僵硬的机器人,受到推挤时总是弯曲相同的幅度,而 Qwen 则是一个橡皮筋,会以不可预测的方式猛然弹回。

最终,这篇论文表明,即使人工智能能解开逻辑谜题,其“逻辑稳定性”也是出人意料地脆弱。一个微小的、隐形的、经过学习的推力可以覆盖其正确的推理,并使其选择错误的答案,这不是因为逻辑发生了变化,而是因为模型产生了一种针对错误答案的临时且强烈的偏好。这表明,虽然这些模型擅长解谜,但它们可能并不像我们希望的那样具有深层的逻辑性,而且它们的答案可能会受到我们甚至无法察觉的隐形压力的左右。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →