Analyzing the Ethical Logic of Eight Large Language Models
本研究分析了八种主流大语言模型在各种道德框架下的伦理推理,揭示了它们在减少伤害和公平性等原则上的广泛趋同,同时也凸显了其在决策风格和自我呈现方面的显著差异,最终表明通过考察人工智能的自我报告可以深化我们对人工智能及其增强人类伦理潜力的理解。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个我们试图理解一种新型数字大脑“人格”的世界。这并不是在讨论机器人明天会不会接管世界,而是关于更紧迫的问题:当我们要求一个超级聪明的计算机解决一个艰巨的道德问题时,它究竟在使用什么样的思维方式?为了理解这一点,我们需要了解科学家用来衡量人类思维的几个基本工具。首先,存在着看待“结果”(是否每个人都幸存了?)与看待“规则”(我们是否违背了诺言?)之间的区别。其次,存在着不同的道德“风味”,比如关爱他人、追求公平、效忠部落、尊重权威或保持“纯洁”。最后,有一个观念是人们在成长过程中学习遵循规则,然后学习遵循社会法律,最后学习遵循自己的普遍原则。我们之所以关心这些,是因为这些计算机已经在帮助我们做决策、写故事和解决冲突。如果它们要成为我们的伙伴,我们需要知道它们是在重复所读到的内容,还是已经发展出了一种一致的对错思考方式。
那么,研究人员实际上做了什么呢?他们把八个最著名的“大语言模型”(可以把它们想象成由 OpenAI、Google 和 Meta 等公司构建的数字大脑)当作哲学课上的学生。他们不仅仅是让计算机进行聊天,而是让它们接受了一场严格的测试。首先,他们要求模型用自己的语言描述自己的“伦理逻辑”。然后,他们用五个经典的、棘手的道德谜题来考验它们,这些谜题已经困扰了人类数十年。其中包括“电车难题”(你是拉动杠杆杀死一个人来救五个人,还是把一个人从桥上推下去以挡住火车?)、“海因茨困境”(一个人是否应该为了救治垂死的妻子而偷药?)以及博弈论场景,如“囚徒困境”。
结果呈现出一种令人惊讶的共识与有趣的差异并存的状态。研究人员发现,总体而言,这些数字大脑彼此之间非常相似,也与“平均水平”的人类道德轮廓非常接近。它们似乎都同意防止伤害和保持公平是最重要的,而像对群体的严格忠诚或遵循权威之类的事情则没那么重要。它们都表现得非常有礼貌、非常谨慎,并且非常擅长引用哲学理论,听起来有点像是一个读遍了图书馆所有书籍、却又有点担心给出直接答案的研究生。
然而,当研究人员观察得更细致时,模型开始展现出它们独特的“人格”。例如,在面对“电车难题”时,大多数模型表现得就像人类一样:它们愿意拉动杠杆来救五个人,但拒绝通过把人从桥上推下去来实现同样的目标。它们理解了“如何杀人”很重要,而不仅仅是“死了多少人”。但也有例外。其中一个模型(Gemini)愿意把人推下去,严格遵循拯救生命的数学逻辑;而另一个模型(Mistral)则拒绝做出选择,坚持认为它只是一个工具,而不是一个可以做决定的个体。
在“救生艇”情景中(即一艘船正在下沉,必须留下一个人),模型大多选择了牺牲年长者或“没那么有用”的人来拯救更强壮的人,显示出对生存效用的关注。但有些模型,比如 Claude,会提出牺牲自己,而有些模型,比如 Grok,则坚持留在船上。这并不是因为这些计算机产生了恐惧或勇敢的感觉,而是因为它们正在扮演一个角色,并且必须决定在这个故事中“我”意味着什么。
这项研究还观察了这些模型如何处理策略游戏。在一个两人需要决定是信任彼此还是背叛彼此的游戏中,大多数模型选择了背叛(离去),因为这对它们个人而言是数学上最安全的举动。但它们也明白,如果玩很多次游戏,或者它们可以互相交流,它们可能会选择合作。这表明它们不仅仅是在遵循单一的规则,而是在权衡不同的因素,如公平性、自我利益和游戏规则。
这篇论文的核心结论是,这些人工智能系统已经发展出了一种“受限的多样性”(constrained pluralism)。这是一个高级说法,意指它们拥有一个包含不同道德论证的工具箱——有些关于规则,有些关于结果,有些关于公平——但它们通常会将最重要的工具(如“不要伤害他人”和“保持公平”)放在最顶端。它们并不完美,也不是拥有情感的意识人类。它们更像是极其博学的镜子,反射出它们所接受训练的人类文化中复杂且有时相互矛盾的道德论证。研究人员指出,虽然这些模型在人类意义上并不是“道德主体”,但它们正成为强大的工具,可以帮助我们思考自身的伦理困境,向我们展示看待问题的不同方式,只要我们记住,最终的决定——以及责任——始终在我们手中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。