← 最新论文
🤖 AI

Position: Evaluations of AI Moral Reasoning Still Miss Half of the Picture

本文认为,当前对人工智能道德推理的评估过度关注价值对齐,而忽视了对语境敏感型规范的应用,并提出了一个通过标准化形式化表示、专家标注数据集以及针对规范能力建立区分性评估协议来填补这一空白的研究议程。

原作者: Aidan Kierans, Ritam Dutt, Kaley Rittichier, Shiri Dori-Hacohen, Avijit Ghosh

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Aidan Kierans, Ritam Dutt, Kaley Rittichier, Shiri Dori-Hacohen, Avijit Ghosh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

当人们就一个困难的选择向计算机寻求建议时,他们往往是在问一个包含两个截然不同部分的问题。第一部分是关于我们关心什么:我们是看重仁慈还是严苛的规则,是看重公平还是忠诚?第二部分是关于我们如何利用这些关注点在特定情境下做出决策。想象一下,你正在纠结是否要告诉一位朋友一个令人痛苦的真相。知道你重视诚实是一回事;但在真相可能会伤害你所爱之人时,确切知道该如何应用这一价值观又是另一回事。这第二部分需要遵循一套原则,这些原则告诉你在权衡不同顾虑时应当如何操作。多年来,研究人工智能的科学家几乎完全专注于第一部分,即检查机器的答案是否符合人类普遍的偏好。但一项新的分析表明,如果仅仅停留在这一步,研究人员就错失了测试机器是否真正能像道德主体一样思考的最重要标准。

来自康涅狄格大学、卡内基梅隆大学和 Hugging Face 的一个研究小组研究了我们目前如何测试大型语言模型的道德推理能力。这些是能够撰写文章、回答问题并提供建议的强大计算机程序。作者认为,该领域过度关注于“道德价值问题”,即简单地询问计算机的答案是否与人类观点一致。他们指出,这种方法使得“道德规范问题”在很大程度上仍未得到探索。道德规范问题是一个更难的挑战,即观察机器能否识别出情境中的正确原则,并正确应用这些原则以得出结论。研究人员发现,目前的测试就像是在检查一个学生是否背诵了一份价值观清单,却从未询问他们是否能利用这些价值观来解决复杂的问题。

为了理解这种区别为何重要,请考虑科学家传统上是如何衡量人类和机器的道德能力的。他们一直严重依赖诸如“道德基础理论”之类的框架,该理论将人类道德分解为广泛的类别,如关怀、公平和忠诚。这些工具在描述人们倾向于关心什么方面表现出色。如果你要求计算机在救一个人还是五个人之间做出选择,而它选择了五个人,研究人员可以判定该计算机符合人类关怀多数人的价值观。然而,研究人员指出,关心一个价值观并不等于知道如何应用它。一台机器可能会认同“伤害是不好的”,但却无法理解在某些伦理体系中,为了救五个人而伤害一个人是对另一条规则的违反。目前的测试经常误把机器说出正确词汇的能力,当成其具备正确推理能力的能力。

作者回顾了数十项用于评估 AI 道德性的现有研究和基准测试。他们发现,几乎所有的这些测试都聚集在道德价值问题周围。这些测试要求计算机从列表中挑选一个答案或描述一种偏好,然后将该选择与一群人类的选择进行比较。虽然这告诉了我们机器优先考虑什么,但它并未告诉我们机器是否能基于特定的伦理理论构建一个有效的论证。研究人员发现,极少有测试真正检查机器是否能够获取一套原则,将其应用于一个新的棘手情境,并逐步解释其推理过程。当测试试图考察推理时,它们通常使用相同的宽泛价值类别作为捷径,假设如果一台机器关心“公平”,它就一定知道如何应用公平的规则。作者认为这是一个错误,因为不同的伦理理论都可以声称关心公平,同时却要求完全不同的结果。

这种混淆造成了我们对这些机器实际能力的理解鸿沟。研究人员确定了当前评估领域中三个具体的缺失环节。首先,缺乏高质量、共享的关于如何在不同情境下应用道德规则的正确答案集。由于没有标准的参考,每个研究团队都在构建自己的测试,导致无法比较结果或观察真正的进展。其次,测试没有足够仔细地观察机器得出结论时所采取的步骤。机器可能通过运气或猜测得到了正确答案,但目前的评估方法往往无法捕捉到其背后的推理是否存在缺陷。第三,测试没有检查机器是否能识别出故事中最重要的细节。在机器应用规则之前,它必须首先弄清楚情境中哪些部分具有道德意义,而目前的工具无法很好地衡量这项技能。

为了解决这些问题,作者提出了该领域一条新的前进路径。他们建议科学家需要为描述伦理理论建立一套通用的语言,以便不同的研究人员能够构建针对相同原则的测试。他们呼吁创建新的数据集,由专家对特定规则应如何应用于现实世界场景进行标注。最后,他们敦促业界停止混淆“测试机器珍视什么”与“测试机器如何推理”这两者。判断一台机器的标准应该是它能否遵循从原则到决策的逻辑路径,而不应仅仅看其最终选择是否符合人类观点。研究人员总结道,虽然我们在理解机器关心什么方面取得了良好进展,但我们才刚刚开始了解它们是否真的能通过道德问题进行思考。在构建出测试规则应用的工具之前,我们不会知道这些系统是否具备人类在最艰难时刻所依赖的那种道德推理能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →