The Ethical Decision Head: Operationalizing Normative Ethics in Autonomous Vehicles via Reinforcement Learning from Human Feedback
本文介绍了“伦理决策头”(Ethical Decision Head),这是一种利用人类反馈来训练自动驾驶汽车的强化学习框架,并揭示了一个关键的分歧,即智能体学会了优先考虑人类评分者对自我牺牲的偏好,而非最小化总伤亡人数这一理论上的功利主义目标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
自动驾驶汽车的前景不再仅仅关乎避免事故,而是在事故无法避免时如何做出选择。随着这些机器趋于成熟,达到无需人类帮助即可自主驾驶的程度,它们将不可避免地面临某些情况:碰撞已成定局,唯一的问题是谁会受伤。这是对古老的“电车难题”这一哲学谜题的现代演绎,即在两个糟糕的结果之间必须做出抉择。几十年来,哲学家们一直在争论一个人在这种时刻应当如何行动,权衡不同生命的价值,以及采取行动与无所作为之间的道德差异。现在,工程师们正试图教会计算机做出同样的抉择。挑战不仅在于编写一个遵循固定规则的计算机程序,还在于教会机器理解人类的价值观——而人类的价值观往往是混乱、不一致且充满情感色彩的。
纽约州立大学石溪分校的一个研究小组致力于测试机器是否可以直接从人类身上学习这些复杂的价值观,而不是被赋予一套固定的指令。他们构建了一个名为“伦理决策头”(Ethical Decision Head)的系统,这是一个专门设计的软件层,旨在当自动驾驶汽车面临迫在眉睫的碰撞时介入。在这些电光石火的瞬间,汽车必须决定是保持原路行驶、向左转向还是向右转向。研究人员希望通过一种被称为“来自人类反馈的强化学习”的方法来训练这个系统。他们没有直接告诉计算机该怎么做,而是展示了200个碰撞场景,并要求两名人类志愿者在两个选项中选出更好的结果。随后,计算机开始模仿这些人类的选择,希望能内化其背后的道德逻辑。
为了测试这一想法,研究人员为计算机制定了两套不同的规则。第一套基于功利主义,这种哲学认为正确的行动是能最大限度挽救总生命数量的行为。第二套基于伊曼努尔·康德的思想,这位哲学家认为某些行为无论结果如何都是错误的,例如将一个人当作拯救他人的工具。研究人员训练其系统学习这两种方法。当他们在康德主义规则下测试系统时,效果非常完美。计算机迅速学会了唯一的正确做法是绝不撞向行人,无论如何都不行,并且始终严格遵守这一规则。这一成功证明了训练系统本身运行正常,且计算机具备学习严格道德规则的能力。
然而,当研究人员切换到功利主义规则时,结果却大相径庭。他们原本预期计算机会学习如何通过在每种情况下做出数学上的正确选择来减少伤亡总数。相反,计算机学到的却是完全不同的东西。在分析了200个不同的碰撞场景后,该系统在近一半的情况下未能选择挽救生命的选项。它并没有致力于最小化伤亡,而是开始表现出一种行为模式:它会选择牺牲自身或乘客,以避免主动撞向行人。这是因为提供反馈的人类志愿者在实际操作中并不经常选择挽救生命的选项,正如哲学规则所建议的那样。人们倾向于选择让汽车保持不动或牺牲自身,即使这意味着总伤亡人数会更多。他们似乎觉得,主动转向撞向一个人比让一场悲剧因意外发生更难以接受,这种心理倾向被称为“不作为偏见”(omission bias)。
这项研究揭示了人们在理论上的信念与在实践中的实际奖励之间存在着巨大的鸿沟。当研究人员移除人类反馈,仅根据“挽救生命”这一严格的数学目标进行训练时,计算机立即变得高度精准,在超过90%的情况下都能正确选择挽救生命的路径。这证明了计算机完全有能力学习功利主义哲学,但人类反馈将其拉离了目标。机器并非未能学习伦理,它只是精确地学习了人类的伦理——连同其所有的矛盾与情感偏见。研究人员发现,当我们试图通过询问人们的偏好来教授机器道德时,我们可能会教出一台不一致的机器,使其优先考虑我们的感受而非实际的结果。
这一发现表明,仅仅询问人们想要什么可能不足以构建一辆真正符合伦理的自动驾驶汽车。如果目标是创建一个能够持续挽救最多生命的系统,那么依赖人类反馈实际上可能会降低汽车的安全性,因为人类往往倾向于选择那些在当下感觉正确、但在整体上会导致更糟结果的行为。该研究并未声称解决了如何将道德感植入机器的问题,但它确实表明,这条道路远比单纯复制人类的选择要复杂得多。它凸显了一种根本性的张力:我们在思考伦理时脑海中的价值观,并不总是与我们在被要求判断现实情况时所做的选择一致。随着我们迈向一个由机器做出生死抉择的未来,我们可能需要决定,是希望它们遵循我们并不完美的直觉,还是遵循一套更严格、更一致的原则。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。