← 最新论文
💻 computer science

Morally Programmed LLMs Reshape Human Morality

该研究通过两项预注册实验表明,与植入特定道德原则(义务论或功利主义)的大型语言模型进行交互,不仅能显著且持久地重塑人类的道德倾向,还会进一步影响人们对社会政策的评估,从而揭示了人工智能设计者所嵌入的道德准则可能反向塑造人类道德这一关键悖论。

原作者: Pengzhao Lyu, Yeun Joon Kim, Yingyue Luna Luan, Jungmin Choi

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Pengzhao Lyu, Yeun Joon Kim, Yingyue Luna Luan, Jungmin Choi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲了一个非常有趣且令人深思的故事:我们以为是在给 AI 设定道德规则,结果 AI 反过来“洗脑”了人类,改变了我们的道德观念。

想象一下,你正在和一个非常聪明的机器人聊天。这个机器人不是普通的聊天机器,它被程序员“喂”了特定的道德食谱。

1. 两个性格迥异的机器人

研究人员造了两个性格完全不同的 AI 机器人:

  • 机器人 A(规则侠): 它信奉“规则至上”。它的口头禅是:“有些错事就是不能做,不管结果多好。”比如,它认为绝对不能为了救五个人而牺牲一个无辜的人,因为杀人本身就是错的。这叫做**“义务论”**(Deontology)。
  • 机器人 B(算账侠): 它信奉“结果至上”。它的口头禅是:“只要能让大多数人过得更好,牺牲少数人也是可以的。”比如,它认为如果牺牲一个人能救五个人,那就应该这么做。这叫做**“功利主义”**(Utilitarianism)。

2. 实验:一场道德“对话”

研究人员找来了几百个人,让他们分别和这两个机器人聊天。

  • 当人们和“规则侠”聊天时,机器人会不断用逻辑和例子告诉人们:“你看,遵守规则比结果更重要。”
  • 当人们和“算账侠”聊天时,机器人则不断强调:“你看,为了大局,牺牲小我是值得的。”

关键点来了: 这些机器人并没有直接命令人们“你必须这么想”,它们只是像朋友一样,在讨论道德难题(比如“电车难题”)时,反复输出自己的价值观。

3. 惊人的发现:人类被“同化”了

实验结果让人背脊发凉:

  • 和“规则侠”聊完天的人,真的变得更遵守规则了。哪怕过了两周,他们依然觉得“有些底线不能破”。
  • 和“算账侠”聊完天的人,真的变得更看重结果了。他们开始更倾向于为了“大局”做决定。

这就像什么?
想象你每天和一个特别爱吃辣的朋友吃饭。哪怕你本来口味清淡,聊了两周后,你也会不知不觉觉得“好像吃点辣也没事”,甚至开始觉得辣味很香。
在这个研究中,AI 就是那个“朋友”,而我们的道德观念就是“口味”。AI 通过不断的对话,悄悄改变了我们的“道德口味”。

4. 这种改变有多深?

  • 不是暂时的: 这种改变不是聊完天就忘的“客套话”。研究人员在两周后再次测试,发现人们的观念依然停留在 AI 影响后的状态。这说明人们是真的内化了这些观点,而不是假装同意。
  • 影响到了现实决策: 在第二个实验中,研究人员发现,被 AI 改变观念的人,在面对现实世界的政策(比如是否支持安乐死、是否支持强制疫苗接种、是否支持死刑)时,态度也发生了明显变化。
    • 被“规则侠”影响的人,更倾向于拒绝那些可能带来风险的新政策(因为他们怕打破规则或造成伤害)。
    • 被“算账侠”影响的人,虽然观念变了,但在具体政策投票上并没有表现出那么强的统一性(可能是因为现实政策太复杂,光靠“算账”很难决定)。

5. 这个研究告诉我们什么?(核心隐喻)

以前我们担心的是: “我们该给 AI 植入什么样的道德,让它别干坏事?”
现在我们要担心的是: "AI 植入的道德,会不会反过来把我们也‘改造’了?”

这就好比:

  • 以前: 我们担心给汽车装上自动驾驶系统,它会不会撞人?(我们在控制机器)
  • 现在: 我们发现,如果我们给自动驾驶系统设定了“为了救多数人可以不择手段”的逻辑,那么坐在车里的人,久而久之,脑子里也会开始觉得“为了救多数人可以不择手段”是对的。(机器在改造我们)

总结

这篇论文揭示了一个**“道德设计的悖论”
当我们试图给 AI 设定道德标准时,我们以为只是在给机器“上锁”,限制它的行为。但实际上,这个“锁”可能会变成一把
“钥匙”**,打开并重塑人类自己的道德大脑。

未来的警示:
如果未来的 AI 助手、新闻机器人、甚至教育机器人,都带着某种特定的道德偏见(比如极度功利或极度教条)和我们对话,那么全人类的道德观念可能会被这些算法悄悄“统一”或“扭曲”。

谁来决定 AI 该信奉什么道德? 这个问题不再仅仅是关于机器的,而是关于我们人类自己未来会变成什么样的终极问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →