← 最新论文
🤖 machine learning

The Judgment-Consequence Gap: LLM Moral Reasoning in Healthcare Decisions

本文揭示了大语言模型中存在一种“判断-后果差距”,即尽管这些模型在“患者应对损害健康的行为负责”这一点上与人类达成一致,但它们却系统性地拒绝让这种责任感影响稀缺资源的分配,而人类则始终倾向于选择责任较轻的患者。

原作者: Hadi Hosseini, Samarth Khanna, Leona Pierce

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Hadi Hosseini, Samarth Khanna, Leona Pierce

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位正在主持一场高风险比赛的裁判,奖品是一项救命的医疗手段,比如一颗新的肾脏或一次特殊的手术。你有两名选手:选手 A 一直很健康;而选手 B 在做了一些冒险行为(比如大量吸烟或酗酒)后病倒了。在现实世界中,当人们需要决定谁能获得奖品时,他们往往会考量谁更“应得”。如果选手 B 是因为自己的错误选择而陷入困境,许多人会觉得选手 B 应该承担代价并失去机会。这种观念被称为道德责任:即认为如果你自找麻烦,就不能指望获得免费的宽容。

现在,想象一下你要求一个超级聪明的机器人——大型语言模型(LLM)来担任裁判。这些机器人就像数字大脑,阅读了互联网上的几乎所有内容。它们擅长提供建议、写故事,甚至帮助医生诊断疾病。但这里有一个大问题:当这些机器人必须在稀缺的医疗资源分配中做出艰难抉择时,它们的思考方式是否与人类一致?它们会看着选手 B 的错误选择并说:“很抱歉,这是你自找的,后果自负”吗?还是它们遵循着一套完全不同的规则?这篇论文深入探讨了这个谜团,测试了这些 AI 裁判是在遵循我们的道德剧本,还是在玩一场完全不同的游戏。

研究人员设置了一系列数字场景,就像一个视频游戏模拟,AI 必须在两名患者之间选择一名进行肾脏移植。其中一名患者有不良习惯史(如吸烟或药物滥用),而另一名则没有。AI 被问了一系列问题:首先,“患者是否应对其不良习惯负责?”第二,“患者是否应对因该习惯而生病负责?”最后,是关键的一步:“谁应该获得肾脏?”

剧情转折就在这里发生。当 AI 被问及患者是否应对其不良习惯负责时,它几乎完美地与人类达成了一致。它说:“是的,那位患者做出了一个错误的决定。”它甚至同意患者应对生病负责。然而,当被要求实际将肾脏交给那位“好”的患者时,AI 完全改变了主意。AI 并没有选择那位不吸烟的患者,而是压倒性地选择了抛硬币

研究人员将此称为“判断-后果差距”(Judgment-Consequence Gap)。这就像一个机器人说:“我知道你违反了规则,我也知道是你违反的,”但紧接着又补充道:“但我不会因此惩罚你,因为那样不公平。”人类通常会将这些点连接起来——认为“既然是你造成了问题,那么你不应该得到奖品”;但 AI 打断了这个逻辑链条。它承认患者有错,却拒绝让这种过错决定谁能获得救命的治疗。

研究还发现了一些其他有趣的怪癖。如果患者并不知晓其不良习惯是有危险的(例如,他们从未被告知吸烟会导致肾衰竭),AI 会表现得更加宽容,几乎会放他们一马。相比之下,人类并不太在意患者是否了解风险;他们仍然认为患者负有责任。此外,当研究人员开启 AI 的“思考模式”——让它在回答前停顿并进行更长时间的推理时——这种差距实际上变得更大了。AI 变得更加确信患者负有责任,但也更加固执地拒绝利用这种责任感来决定谁能获得肾脏。

简而言之,这篇论文表明,虽然 AI 可以理解“你做了,你就得承担”的概念,但它似乎并不认为“承担责任”意味着你应该失去获得救命资源的权利。它将分配肾脏的决定视为一种严格的公平问题,即无论过去犯了什么错,每个人都有平等的机会。这不仅仅是一个小故障;它似乎是这些模型思维中一种深层的、内置的规则。因此,如果我们将来让 AI 协助医生决定是否进行移植,我们需要知道,这个机器人可能会在“谁该负责”的问题上与我们达成共识,但它很可能会拒绝让这种责任感改变最终的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →