Beyond Binary Moral Judgment: Modeling Ethical Pluralism in AI
本文提出了一种通过规范性伦理单纯形上的概率分布来表征道德推理、利用双流语义架构和堆叠集成学习在涵盖后果论、德性伦理和义务论的伦理困境分类中实现88.89%准确率的框架,以实现对人工智能中伦理多元主义的建模。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人如何做出道德决策。目前大多数尝试都像是手持红笔的严厉老师,只允许两个答案:"好"或"坏"。如果情况复杂,机器人只会选一边,然后继续前进。
本文作者认为,现实生活中的道德并非简单的开关。它更像是一个调色板,其中不同色调的“对”与“错”相互融合。他们的目标是构建一种人工智能,它不仅能选边站队,还能理解决策中所涉及的多种道德哲学的混合状态。
以下是他们方法的简要说明,使用了简单的类比:
1. 问题:“二元”陷阱
目前,人工智能往往将伦理学视为一场拔河比赛。你向左拉(这是坏的)或向右拉(这是好的)。但在现实世界中,单一行为可能同时因一个原因而“好”,又因另一个原因而“坏”。
- 论文的观点:与其说是拔河,不如想象一张三维地图。
- 一个轴是后果论(它是否产生了好的结果?)。
- 一个轴是义务论(它是否遵守了规则?)。
- 一个轴是德性伦理学(它是否展现了良好的品格?)。
- 道德决策不是直线上的一个点,而是漂浮在这个三维空间中间的某个点,同时受到这三个轴的影响。
2. 解决方案:“道德棱镜”
研究人员构建了一个像棱镜一样的系统。当道德困境(用纯英语书写)穿过这个棱镜时,它不会只吐出“是”或“否”。相反,它将光线分解成光谱,显示出该决策在多大程度上属于三种主要道德理论及其 15 种具体子理论(如“康德义务”或“功利主义幸福”)。
3. 构建方法:“双流厨房”
为了训练这个人工智能,他们并没有仅仅喂给它一百万个随机故事。他们精心烹制了一份包含两种主要成分(流)的特定食谱,并将它们混合在一起:
流 A:“哲学作弊表”(规范先验)
在查看故事之前,人工智能获得了一份道德理论的“作弊表”。它学会了估算:“基于这个故事的整体基调,它听起来有多少像遵守规则?有多少像追求结果?”这就像在人工智能阅读细节之前,就为它指明正确哲学方向的指南针。流 B:“故事侦探”(语义上下文)
人工智能的这一部分阅读实际故事。但它不仅仅是阅读文字,而是寻找具体线索,例如:- 谁做的?(行为主体)
- 谁受伤了?(受害者)
- 后果持续了多久?
- 意图是什么?
它将故事转化为一个复杂的数学地图(“超向量”),捕捉情境的细微差别。
4. “堆叠集成”团队
为了做出最终决定,他们没有只使用一个聪明的人工智能。他们组建了一个专家团队(“堆叠集成”):
- 随机森林:一个从数据多个不同角度进行观察的群体。
- XGBoost:擅长在复杂数据中发现模式的专家。
- SVM(支持向量机):一种线性思维者,能在类别之间划出清晰的界限。
- 元学习器:一位“教练”,倾听所有三位专家的意见并做出最终裁决。
这种团队方法使人工智能不仅能学习答案是什么,还能学习不同道德理论如何重叠以及如何产生分歧。
5. 结果:“模糊”更好
该人工智能在识别哪种具体道德理论(共 15 种选项)最能解释某种情况时,达到了约**89%**的准确率。
但最有趣的发现不仅仅是分数,而是不确定性。
- 类比:想象天气预报。简单模型会说“下雨”。复杂模型会说“有 70% 的概率下雨,20% 的概率晴天,10% 的概率暴风雨”。
- 研究人员发现,他们的人工智能经常表示:“我不 100% 确定这里适用哪种道德理论。”他们使用熵(一种混乱程度的度量)来衡量这种“不确定感”。
- 为什么这很重要:在论文中,这种不确定性是一个特性,而非缺陷。它表明人工智能认识到情境在道德上是“灰色”的,不同的理论正在争夺主导地位。这比机器人自信地给出错误答案更像人类。
总结
该论文认为,要使人工智能真正具备道德性,我们需要停止要求它充当手持法槌的法官(非好即坏),转而要求它成为一位外交官,能够理解不同的文化和哲学对同一事件有不同的看法。
通过使用“双流”方法(结合哲学规则与故事细节)以及利用“专家团队”分析数据,他们创建了一个能够描绘现实世界道德模糊且重叠本质的系统,向我们展示了道德界限模糊的确切位置。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。