← 最新论文
🤖 AI

Formalizing Kantian Ethics: Formula of the Universal Law Logic (FULL)

本文提出了一种名为“普遍法则逻辑”(FULL)的多类量化模态逻辑,旨在通过形式化康德的普遍法则公式,使人工智能道德代理能够在不依赖预设道德直觉的情况下,仅凭背景知识结合行为目的来自主评估其行为的道德性。

原作者: Taylor Olson

发布于 2026-04-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Taylor Olson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章介绍了一种名为 FULL(全称:普遍法则逻辑,Formula of the Universal Law Logic)的新方法,旨在让人工智能(AI)变得更懂道德,而不仅仅是死记硬背规则。

想象一下,我们要教一个机器人什么是“对”与“错”。

1. 现在的 AI 道德像什么?(旧方法)

目前的道德 AI 就像是一个拿着死板清单的保安

  • 清单内容:“不许伤害人”、“不许撒谎”、“必须帮助别人”。
  • 问题:这个保安太死板了。
    • 如果医生为了救人而切开病人的肚子(这看起来像“伤害”),保安会大喊“禁止!”,因为他只看到了“切开”这个动作,没看到“救人”这个目的。
    • 如果我们要让 AI 处理复杂情况(比如“为了救人而撒谎”),我们就得把成千上万种例外情况都写进清单里。但这不可能,因为人类自己都没法把道德直觉完全列出来。

2. 这篇文章提出了什么新想法?(FULL 方法)

作者泰勒·奥尔森(Taylor Olson)提出,与其给 AI 一张死板的“行为清单”,不如给 AI 一个**“思想实验模拟器”**。

这个模拟器的核心思想来自 18 世纪哲学家康德(Immanuel Kant)。康德认为,判断一件事对不对,不是看结果,而是看**“如果你把这件事变成全人类都遵守的法则,世界会变成什么样?”**

FULL 逻辑就是把这种“思想实验”变成了数学公式,让 AI 能自动运行这个实验。

3. FULL 是如何工作的?(三个步骤)

想象 AI 是一个**“平行宇宙导演”**。当它面临一个道德抉择时,它会按以下三步走:

第一步:制定“剧本”(格律/Maxim)

AI 先搞清楚主角(比如机器人自己)想做什么,以及为什么要做。

  • 例子:主角想“为了搞到钱去旅行,而欺骗朋友 Jan"。
  • 关键点:这里不仅关注“欺骗”这个动作,更关注“为了钱”这个目的

第二步:开启“平行宇宙”(普遍化/Universalization)

AI 启动模拟器,把主角的剧本变成全宇宙通用的法则

  • 剧本:“所有想搞钱去旅行的人,都必须欺骗朋友。”
  • AI 问自己:如果全世界每个人都按这个剧本演,会发生什么?

第三步:寻找“剧情漏洞”(矛盾检测/Contradiction)

AI 检查这个新宇宙是否还能运转。

  • 在“欺骗”的宇宙里:如果每个人都欺骗,那么“承诺”这个词就失效了。没人会相信任何承诺。
  • 结果:主角想通过“欺骗”来“搞到钱”,但在一个没人相信承诺的宇宙里,欺骗根本行不通(无法达到目的)。
  • 结论:这个剧本在逻辑上自相矛盾(就像你想用一把不存在的钥匙开门)。因此,AI 判定:这个行为是不道德的

4. 为什么这个方法更厉害?(两个核心优势)

优势一:它懂“动机”(Agent-Centric)

  • 旧保安:看到“拿刀”就报警。
  • 新导演(FULL)
    • 如果是杀人犯拿刀:在“人人拿刀杀人”的宇宙里,没人能活下来,你也活不到享受战利品的时候。逻辑崩塌 -> 禁止
    • 如果是外科医生拿刀:在“人人拿刀救人”的宇宙里,病人得救了,医生也实现了救人的目的。逻辑通顺 -> 允许
    • 比喻:就像看一场电影,旧保安只看“有人拿刀”就喊停;新导演会看“拿刀是为了杀人还是救人”,如果剧本逻辑通顺,就继续播放。

优势二:它不需要人类把道德“写死”

  • 我们不需要告诉 AI“医生可以动刀,但杀手不行”。
  • 我们只需要给 AI 一些基础常识(比如:人需要活着才能思考,承诺需要被信任才有效)。
  • AI 自己通过逻辑推演,就能发现“杀人”或“骗人”在普遍法则下会导致世界崩溃。它自己“悟”出了道德,而不是靠背诵。

5. 实际案例演示

文章举了三个例子证明这个系统很管用:

  1. 虚假承诺
    • 如果你承诺还钱但没打算还,在全世界都这样做的宇宙里,没人会相信承诺。你的“骗钱”计划直接破产。-> 判定为错
  2. 谋杀同事
    • 你想杀掉竞争对手来保住工作。在全世界都互相杀人的宇宙里,你还没保住工作,自己就先被杀了。你的计划失效。-> 判定为错
  3. 从不帮助别人
    • 你想“为了偷懒,永远不帮别人”。但在一个没人互助的宇宙里,当你生病或需要帮助时,没人帮你,你会死掉。既然你死了,你就无法“偷懒”了。你的计划自我毁灭。-> 判定为错(你应该偶尔帮帮别人)。

总结

这篇论文就像是为 AI 道德系统安装了一个**“逻辑自检引擎”**。

  • 以前:AI 像鹦鹉学舌,背下人类给的规则,遇到新情况就傻眼。
  • 现在(FULL):AI 像一个理性的哲学家。它不需要人类把每一条道德都教给它,只要给它基本的逻辑和常识,它就能通过“如果全世界都这样做,世界会怎样”的推演,自己判断出什么是对的,什么是错的。

这让未来的 AI 不仅能做“正确的事”,还能理解“为什么要这样做”,从而变得更聪明、更独立、也更安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →