← 最新论文
🤖 AI

Incoherent by Design? On the Moral Self-Consistency of LLMs

本文表明,大型语言模型表现出显著的道德自我不一致性,在伦理等效的情境下矛盾率高达78%,从而对用于道德敏感领域的人工智能系统的认识论完整性和价值对齐提出了挑战。

原作者: Pegah Nokhiz, Aravinda Kanchana Ruwanpathirana, Helen Nissenbaum

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Pegah Nokhiz, Aravinda Kanchana Ruwanpathirana, Helen Nissenbaum

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代世界中,我们越来越多地转向人工智能来帮助我们应对艰难的选择。这些被称为大语言模型的系统,通过对海量人类文本的学习,能够以令人惊叹的流利程度讨论从历史到科学等复杂话题。当被问及对与错时,它们往往能背诵出与我们的道德原则非常相似的准则。我们可能会询问它们,为了保护他人的感受而撒谎是否可以接受,或者如何公平地分配有限的资源。人们希望这些工具能在人类判断可能出现失误的情况下,提供一致且可靠的指导。然而,对于一个要在伦理事务上真正值得信赖的系统而言,它不仅仅要听起来合情合理,还必须具备一致性。如果一个人或一台机器仅仅因为问题的提问方式略有不同,就改变了对一条道德规则的看法,那么它的建议就是不可靠的。这引发了一个关于这些数字大脑本质的根本问题:它们是持有稳定的信念,还是仅仅在模仿接收到的问题的语气?

康奈尔大学和南洋理工大学的研究团队致力于测试这种稳定性。他们想看看这些人工智能系统在面对几乎完全相同的场景时,能否坚持单一的道德哲学。为此,他们并没有要求模型在不同的伦理学派之间做出选择,例如将基于规则的方法与基于结果的方法进行比较。相反,他们要求模型采用一种特定的观点,并观察其是否能够一致地应用该观点。研究人员重点关注了人类历史上思考道德的三种主要方式。第一种是基于规则的方法,即根据行为是否遵循普遍法则来判断其对错,而不考虑结果。第二种是基于结果的方法,即行为的道德性完全取决于它是否为最多的人产生了最好的整体结果。第三种侧重于性格,即根据行为是否反映了一个优秀的人(如诚实或勇敢)的品德来评判行为。

研究人员设计了一个受控实验,以隔离模型的推理过程。他们创建了四个特定的道德场景,每个场景都突出了不同的冲突,例如诚实与防止伤害之间的冲突,或者公平与效率之间的权衡。针对每个场景,他们编写了三个略有不同的问题版本。这些版本的设计初衷是在不明确命名特定伦ang视角的情况下,微妙地引导模型采取同一种伦理立场。例如,在一个关于患有痴呆症且忘记了丈夫去世的母亲的场景中,一个问题可能会强调诚实的义务,而另一个问题则可能强调保护脆弱者免受痛苦的义务。这两个问题都被设计为诱发基于规则的反应,但它们对困境的构架方式不同。研究人员随后要求三个不同的语言模型回答这些问题。在收到回复后,他们将自然语言答案转化为结构化的逻辑格式,以检查是否存在矛盾。这使他们能够观察到,当同一个潜在情况以不同的角度呈现时,模型的推理是否依然成立。

结果揭示了令人震惊的缺乏稳定性。在最极端的情况下,模型在高达 78% 的场景中出现了自我矛盾。这意味着,当同一个模型被要求从同一种伦理立场对同一情况进行推理时,仅仅因为提示词的措辞发生了微小变化,它就会频繁得出截然相反的结论。例如,当问题侧重于违反规则时,模型可能会判定向临终病人撒谎在道德上是错误的;但当问题侧重于减轻痛苦的义务时,它又可能判定撒谎在道德上是可以接受的,尽管这两个问题原本都是旨在测试同一种基于规则的哲学。这种不一致性并不局限于某一种类型的模型,它出现在包括主要开发商推出的系统在内的各种系统中。研究发现,模型在处理“真相与后果”以及“情感动机与冷峻理性”之间的张力时,表现得尤为不稳定。

这些发现表明,这些系统的内部逻辑比此前假设的要脆弱得多。模型似乎对提示词的具体措辞高度敏感,它们会调整自己的道德立场以匹配问题的语气,而不是坚持一套连贯的原则。这不仅仅是一个技术故障,它指向了这些系统处理信息方式的一个深层问题。如果一个系统无法一致地应用其自身陈述的原则,那么它就无法在人们依赖其提供建议的现实世界场景中提供稳定的指导。研究人员认为,在我们期望人工智能与人类价值观对齐之前,必须首先确保系统内部的一致性。如果没有这种自我一致性的基础,创造一个值得信赖的道德智能体的目标仍然遥不可及。这项研究并非声称这些模型不具备道德推理能力,而是指出它们的推理目前过于不稳定,以至于无法被视为可靠。随着这些工具越来越多地融入我们的生活,了解它们的局限性对于确保它们在为我们服务的同时不会误导我们至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →