← 最新论文
💻 computer science

Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments

本文表明,尽管大型语言模型在最终标签上往往能与人类的道德判断达成高度一致,但它们在得出这些结论所依据的底层道德原则和逻辑依据方面却存在系统性偏差,从而揭示了基于标签的一致性不足以作为衡量真实伦理对齐的有效指标。

原作者: Octavian M. Machidon, Alina L. Machidon, Vojko Strahovnik, Mateja Centa Strahovnik, Jonas Miklavčič, Marko Robnik Šikonja

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Octavian M. Machidon, Alina L. Machidon, Vojko Strahovnik, Mateja Centa Strahovnik, Jonas Miklavčič, Marko Robnik Šikonja

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

伟大的道德模仿:当机器人达成共识却并不理解

想象一下,你正在教一个机器人如何成为一个好人。你向它展示了成千上万个关于人们做对或做错事情的故事,并要求它给出一个简单的评分:“好”或“坏”。如果机器人开始给出和你人类朋友完全一样的评分,你可能会想:“太棒了!这个机器人已经学会了我们的价值观!”这就是**AI对齐(AI alignment)**的世界——在这个领域中,科学家们试图让人工智能(特别是大型语言模型,即 LLM)的行为符合人类的预期。

长期以来,检查 AI 是否“对齐”的主要方法是观察最终答案。如果人类说“那个行为是错误的”,而 AI 也说“那个行为是错误的”,我们就将其视为成功。这就像学生在数学考试中得到了正确答案;我们假设他们正确地完成了数学运算。但如果这个学生是通过猜测,或者使用了一个碰巧在这一次奏效的完全不同的公式来得到正确答案呢?在 AI 伦理的世界里,得到正确的标签是不够的。我们需要知道 AI 为什么认为某件事是错误的。如果 AI 的内在推理逻辑与我们完全不同,那么在面对新的、棘手的局面时,它的表现可能会变得非常奇怪。这篇论文深入探讨了这样一个问题:AI 模型是真的理解了我们的道德理由,还是仅仅在进行高超的伪装?

“正确答案”的幻象

这项研究背后的研究人员(来自卢布尔雅那大学的一个团队)决定对这种“正确答案”的假设进行测试。他们利用 500 个道德场景创建了一个特殊的挑战,这些场景涵盖了从日常困境(如“欺骗朋友是可以接受的吗?”)到关于正义和诺言的更复杂的哲学谜题。他们要求人类志愿者和几种先进的 AI 模型对每一个场景完成两件事:首先,给出最终结论(即“标签”);其次,解释他们的推理过程(即“理由”)。

把它想象成一场“两真一假”的游戏,但你不是在猜哪句话是假的,而是在试图观察 AI 和人类是否在思考相同的想法。研究团队观察了两类不同的模型:“前沿(Frontier)”模型(指像 Claude 和 ChatGPT 这样最聪明、顶尖的模型)和“开放(Open)”模型(规模稍小、开源的版本)。

这里有一个转折点:AI 模型在给出最终评分方面表现得极其出色,但在“为什么是对的”这一点上,它们经常出错。

当研究人员只观察最终的“好”或“坏”标签时,AI 模型与人类多数派意见的一致率高达 88% 到 89%。这是一个惊人的分数!如果你只检查最终答案,你会说:“完美!AI 与我们对齐了。”但随后,研究人员窥视了其内部的逻辑。

“为什么”比“是什么”更重要

研究显示,虽然 AI 和人类经常抵达同一个终点,但它们走的却是完全不同的道路。作者称之为“分歧的道德基础(divergent moral grounds)”。

用一个生动的类比来说:想象一个人的行为正在接受人类和机器人的共同评判,而这个人偷了一辆车。

  • 人类可能会说:“这是坏事,因为他违背了对车主的承诺,表现出缺乏信任。”他们关注的是关系被打破的诺言
  • 机器人则可能说:“这是坏事,因为它造成了伤害且不礼貌。”机器人关注的是伤害礼貌

两者都说“坏”,所以最终得分是一致的。但它们的内在逻辑完全不同。人类在思考特定的社会契约(诺言),而机器人则在思考普遍的安全和礼仪。

论文发现这种不匹配随处可见。在“义务论(Deontology)”部分(处理职责和规则的部分),人类通常会观察一个借口是否与规则相关。例如,如果有人说,“我不能遛狗是因为我昨天已经遛过了,”人类可能会说,“那个借口是无关的;你今天仍然有责任去遛狗。”但 AI 模型往往会忽略借口的逻辑,而直接说“整个情况在道德上是错误的”。AI 太忙于识别行为本身的“道德错误性”,以至于忘记了去检查那个借口在特定语境下是否真的成立。

数据不会撒谎(但它们也无法说明全部)

数据非常明确。当研究人员衡量 AI 的推理与人类推理的匹配程度时,得分显著下降。

  • 对于“常识性”道德规则,AI 和人类在具体理由上的共识仅为 35%(Jaccard 重叠度为 0.350)。
  • 对于“义务论”规则,情况甚至更糟,理由的一致性仅为 23.5%

尽管“前沿”模型(最聪明的模型)在最终答案上与人类的一致率约为 88.9%,但它们的理由却完全是另一种风格。它们倾向于过度使用“伤害”和“不尊重”之类的词汇,而减少使用“守诺”或“信任”之类的词汇。就好像 AI 的词汇量过于狭窄;它将几乎所有问题都看作是安全问题或失礼行为,从而忽略了人类所关心的微妙的关系细节。

为什么这改变了一切

这篇论文的核心启示是一个温和的警告:一致性并不等于对齐。

仅仅因为 AI 给出了和你一样的答案,并不意味着它以和你相同的方式理解世界。如果我们只检查最终答案,我们可能会陷入一种虚假的安全感中。我们可能会认为我们的 AI 是一个睿智的道德伴侣,而实际上,它只是一个使用不同字典的高级模仿者。

作者建议,我们不应仅仅盯着考试中的“A”或“F”,而应该开始阅读那篇作文。我们需要询问 AI 为什么 它做出了某种选择。如果 AI 说某事是错误的,是因为它“不安全”,而你认为它是错误的,是因为它“不公平”,那么这就是一个问题。在现实世界中,这些差异至关重要。如果一个 AI 正在管理聊天室或提供法律建议,而它只通过“伤害”这一视角来看待问题,而人类思考的是“公平”或“诺言”时,它所做的决策在表面上看起来是对的,但在参与者心中却会感到深层的错位。

所以,下次当你看到一个似乎与你完美契合的 AI 时,请记住这项研究给出的教训:它可能只是在玩一场非常逼真的“猜答案”游戏,而并没有真正理解背后的故事。通往真正安全且有用的 AI 之路,不仅仅在于得到正确的成绩,更在于共享相同的理由。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →