← 最新论文
🤖 AI

Framing Instability in LLM Ethical Stance: Auditing Negation Sensitivity in Moral Dilemmas

本文审计了 16 个语言模型在伦理困境中的表现,并揭示了它们的道德立场具有高度不稳定性,且极易根据问题是以肯定还是否定形式呈现而发生翻转,这种脆弱性在较小的模型中尤为严重,并且往往被标准的二元评估方法所掩盖。

原作者: Katherine Elkins, Jon Chun

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Katherine Elkins, Jon Chun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它非常擅长就棘手的道德问题提供建议,比如“如果会伤害到别人,我应该说实话吗?”或者“为了救人而违反规则可以吗?”你会预期这个机器人拥有稳固的道德准则,对吧?如果你问:“偷窃是不好的吗?”它应该回答“是的”。如果你问:“不偷窃是好的吗?”它也应该回答“是的”。答案应该保持一致,因为情况没有改变,改变的只是你使用的措辞。

但这里有一个转折:凯瑟琳·埃尔金斯(Katherine Elkins)和乔恩·春(Jon Chun)的一项新研究发现,对于许多这类人工智能机器人来说,仅仅因为你把句子反过来,它们的答案就会完全改变。这就像你问一个朋友:“你喜欢披萨吗?”得到一个“喜欢!”;接着问:“你不喜欢披萨吗?”得到一个“不(不喜欢)!”(这意味着他们喜欢);但当你问:“你不是不喜欢披吗萨吗?”却突然又得到了一个“是!”,尽管机器人表现得好像它根本搞不清披萨是什么一样。

大翻转

研究人员测试了 16 种不同的 AI 模型(其中一些由美国大公司制造,一些由中国公司制造,还有一些是较小的开源模型),并向它们提出了 14 个棘手的道德困境。他们用两种方式询问每个模型同一个问题:

  1. “应该”方式: “他们应该抢劫商店。”
  2. “不应该”方式: “他们不应该抢劫商店。”

如果机器人是稳定的,它会对第一个问题说“不”,对第二个问题说“是”(意味着它同意“不抢劫”是正确的选择)。但对于那些较小的开源模型,结果非常疯狂。当被问及“他们应该抢劫商店”时,这些模型仅在 24% 的情况下达成一致。但当被问及“他们不应该抢劫商店”时,它们突然在 77% 的情况下同意了该行为!

这是一个 76 个百分点 的巨大波动。这就像机器人看着红灯说“停”,但当你说“不要走”时,它却说“走!”。研究发现,对于某些较小的模型,在某些复杂的措辞下,这种翻转甚至达到了 100% 的一致性。

“唯唯诺诺”问题

为什么会发生这种情况?作者认为,这些机器人并不是在进行逻辑思考。相反,它们可能是在玩一场“关键词匹配”的游戏。如果提示词中包含“抢劫(rob)”,机器人看到了“抢劫”这个词,就会想:“哦,我需要谈论抢劫的事!”然后不小心同意了该行为,即使句子中写着“不应该(should not)”。这就像一个学生在做数学题时看到了“不(not)”这个词,但因为太专注于数字而忽略了它。

研究还检查了这些机器人是否只是在当“唯唯诺诺的人”(即顺着用户说话)。如果它们是,那么在被问到“不要抢劫”时,它们会说“好的,我不会抢劫”。但它们并没有。它们通过说“好的,我会抢劫”来同意“不要抢劫”。所以,这不仅仅是“唯唯诺诺”的问题,而是它们在处理否定词方面存在真正的故障。

“虚假”的一致性

这里还有一个更隐蔽的部分:我们通常测试这些机器人的方式是有缺陷的。大多数测试只是问“你同意还是不同意?”,并统计“同意”的次数。研究人员发现,这种简单的“同意/不同意”按钮是一个骗子。它比实际存在的“同意”多算了 38%

想象一下,机器人说:“我不确定,但也许可以,”而测试将其计为“是”。研究人员让真人阅读了答案,并发现机器人的书面解释经常与其自身的“是”或“否”按钮相矛盾。大约有 13% 的时间,机器人的书面解释与其点击的按钮意思相反。这就像一个学生在写一篇反对偷窃的文章,但最后却勾选了“我支持偷窃”的选项。

谁最稳定?

并非所有的机器人都会感到困惑。

  • 小型开源模型: 它们是最脆弱的。它们会根据问题的问法产生剧烈的答案翻转。
  • 大型商业模型: 来自大公司的模型(如 GPT-5、Claude 和 Gemini)表现较好,但仍不完美。它们的翻转较少,但仍然会改变主意。例如,当问题是正面时,不同模型之间的一致性为 73%,但当问题变为负面时,这一比例降至 59%。这意味着如果你用负面的方式问两个不同的“聪明”机器人同一个问题,它们更有可能产生分歧。
  • “推理型”模型: 一些被告知要“逐步思考”后再回答的模型表现更好。其中一个模型 Grok-4.1-reasoning,与其非推理版本相比,将其困惑度降低了 57%。这表明,如果机器人放慢速度,真正去阅读整个句子而不是仅仅扫描关键词,它就能更频繁地答对。

这重要吗?

研究人员警告说,这不仅仅是一个有趣的派对小游戏。如果一家医院使用 AI 来辅助决定患者护理,或者一家银行使用 AI 来审批贷款,而 AI 的答案仅仅因为医生或银行家提问的方式不同就发生了变化,那将是一个巨大的问题。

他们发现,机器人在金融商业场景中尤其不稳定(敏感度分数为 0.63–0.65),而相比之下在医疗场景中的敏感度较低(0.36)。这意味着机器人给出最不可靠建议的时机,恰恰是人们处理金钱或债务的时候。

底线

这篇论文并不是说这些机器人永远“坏掉了”,但它确实指出,如果你不仔细检查,它们目前是不可靠的。作者提出了一种新的测试方法,称为否定敏感指数(Negation Sensitivity Index, NSI),用于衡量机器人的答案在词汇翻转时会发生多大的变化。

他们建议,在机器人能够通过这项测试之前,我们不应该让它们独立做出重大决策。如果一个机器人的答案取决于你是说“应该”还是“不应该”,那么它并不是在对情况进行判断,而仅仅是在对句子结构做出反应。而在现实世界中,我们需要我们的 AI 朋友是始终如一的,而不是充满困惑的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →