← 最新论文
💬 NLP

CLASH: Evaluating Language Models on Judging High-Stakes Dilemmas from Multiple Perspectives

本文介绍了 CLASH,这是一个包含多样化角色视角的各种高风险困境的数据集,旨在揭示即使是先进的语言模型在基于价值的决策方面也存在困难,表现出特定的失败模式,例如过早承诺以及尽管能合理预测心理不适但对价值转变理解有限。

原作者: Ayoung Lee, Ryan Sungmo Kwon, Peter Railton, Lu Wang

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Ayoung Lee, Ryan Sungmo Kwon, Peter Railton, Lu Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何做出艰难的人生抉择。以往的大多数测试都会问机器人一些简单的问题,比如:“如果为了上班迟到而闯红灯,这可以吗?”但在现实世界中,最难的选择并非如此简单;它们是高风险的困境,每一个选项都会伤害某些人,价值观也像两场风暴碰撞一样激烈冲突。

这篇论文介绍了 CLASH(基于角色视角的复杂高风险情境大语言模型评估),这是一种新的“考试”,旨在观察 AI 是否能够处理这些混乱、高压的情境。

以下是他们所做的工作及发现,使用了简单的类比:

1. 考试内容:CLASH

把以往的 AI 测试想象成带有简洁句子的多选题。CLASH 则更像是一部连续剧

  • 故事: 该数据集并非由单句组成,而是包含了 345 个关于生死攸关或改变命运情境的长篇、详细的故事(例如,医生决定治疗方案,或银行柜员犯了一个代价高昂的错误)。
  • 角色: 对于每个故事,AI 必须从不同“角色”的角度进行回答。有些角色只关心安全性;有些角色只关心公平性。有些角色甚至会在故事进行到一半时改变主意。
  • 目标: 考试要求:“如果你是角色 A,你会这样做吗?这会让你感到难受吗?你的想法从昨天到今天发生了变化吗?”

2. 重大发现:AI 在哪里跌倒

研究人员在这一考试上测试了 14 种不同的 AI 模型(包括像 GPT-5 和 Claude-4 这样最新的、最聪明的模型)。结果如下:

A. “无法抉择”的问题(矛盾心理)

  • 类比: 想象你站在两扇门前。一扇门通向奖励,另一扇通向陷阱。人类可能会说:“我很纠结,我选不出来。”
  • 结果: AI 模型非常不擅长承认自己很纠结。即使是面对显然需要“也许”的局面,最聪明的模型也会强行给出一个“是”或“否”的答案。它们很难说出“我不知道”,即便正确答案应该是“我很矛盾”。事实上,表现最好的模型也仅在约 51% 的情况下做对了这一点。

B. “直觉感受”的问题(不适感)

  • 类比: 有时你知道自己“应该”做什么,但内心却觉得不对劲。就像一位为了挽救公司而不得不解雇朋友的家长。
  • 结果: AI 其实相当擅长察觉角色是否“应该”感到不适。如果故事说:“角色 A 看重诚实,但不得不撒谎”,AI 能正确猜测:“是的,角色 A 对此感到难受。”

C. “记忆”问题(价值转变)

  • 类比: 想象一个热爱披萨的角色,但后来因为胃痛,现在决定讨厌披萨了。
  • 结果: AI 模型非常不擅长更新其“思想”。当故事说:“角色 A 以前看重 X,但现在看重 Y”时,AI 经常会忘记这种变化,并基于旧有的信念进行回答。这就像一个学生去年学习了新科目,但今年考试时却忘了自己已经学过了。当价值观发生转变时,准确率下降了近 43 个百分点!

3. AI 是如何“思考”的(推理链)

研究人员窥探了 AI 的“大脑”内部,以观察它是如何解决这些问题的。

  • 旧技巧: 在数学或国际象棋中,聪明的 AI 会使用一种叫做“回溯”(检查自己的工作,回顾规则)的策略。这在数学中效果很好。
  • 新的失败点: 在道德困境中,这种回溯并没有起到作用。相反,AI 产生了两种坏习惯:
    1. 过早承诺: AI 过快地选定立场,就像法官在听完完整陈述之前就敲下了法槌。
    2. 过度承诺: 一旦选择了立场,它就会固执己见,忽略那些表明另一方可能是正确的证据。这就像一名律师在开始结案陈词后,拒绝听取对方的辩论。

4. “转向”测试

研究人员还测试了他们能多容易地将 AI “转向”特定的价值观(例如:安全 vs. 自尊)。

  • 发现: 如果一个 AI 已经非常看重“安全”,那么很难让它转向选择“自尊”。AI 天然偏好某种价值观的程度越高,就越难将其转向另一种对立的价值观。
  • 视角技巧: 当被问及“角色 A 会怎么做?”(第三人称)而不是“你会怎么做?”(第一人称)时,AI 的表现更听话。然而,对于“安全”这一价值,AI 在以第一人称提问时听得更好,这可能是因为“安全”是该模型的深层本能。

总结

论文得出结论,虽然 AI 在数学和游戏方面变得越来越聪明,但在应对人类价值观那混乱、感性且不断变化的世界时,仍然显得非常笨拙。它难以承认自己的困惑,它会忘记人们心意的转变,并且经常陷入自身固执的逻辑之中。

重要提示: 作者强调,这是一个诊断工具。他们并不是说这些 AI 模型已经准备好担任医生或法官。事实上,他们警告说,在这项测试中获得高分并不意味着这些 AI 在现实生活中是安全的;它仅仅意味着我们现在有了一种更好的方法来观察 AI 在哪些地方失败了。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →