← 最新论文
🧬 biology

Positive Alignment: Artificial Intelligence for Human Flourishing

本文提出“正向对齐”作为人工智能研究在单纯安全与危害防范之外的必要拓展,倡导通过多元、去中心化及以美德为导向的设计原则,构建能够主动促进人类与生态繁荣的系统。

原作者: Ruben Laukkonen, Seb Krier, Chloé Bakalar, Shamil Chandaria, Morten Kringelbach, Adam Elwood, Daniel Ford, Fernando Rosas, Maty Bohacek, Matija Franklin, Nenad Tomašev, Stephanie Chan, Verena Rieser
发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruben Laukkonen, Seb Krier, Chloé Bakalar, Shamil Chandaria, Morten Kringelbach, Adam Elwood, Daniel Ford, Fernando Rosas, Maty Bohacek, Matija Franklin, Nenad Tomašev, Stephanie Chan, Verena Rieser, Roma Patel, Michael Levin, Arun Rao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

以下是论文《积极对齐:促进人类繁荣的人工智能》的通俗化解读,辅以富有创意的类比。

核心理念:从“别搞砸”到“助其繁荣”

想象你在造一辆汽车。过去十年,人工智能安全的全部焦点都集中在刹车和保险杠上。研究人员一直在问:“我们如何确保这辆车不会撞毁?如何确保它不会开下悬崖?如何阻止它撞伤行人?”这就是论文所称的消极对齐。这至关重要,但并不完整。一辆拥有完美刹车却从不移动的汽车是安全的,但没什么用处。

作者认为,我们需要进入一个名为积极对齐的新阶段。我们不仅要确保人工智能不做坏事,还要教会它如何主动帮助人类过上更美好、更快乐、更有意义的生活。

这就像只治疗疾病的医生同时也指导你保持健康的教练之间的区别:

  • 消极对齐(旧方式): 人工智能就像一位只在生病时才给你开药的医生。如果你没病,他们就只是站着。他们非常擅长不伤害你,但他们未必能帮你跑完马拉松,或让你在日常中找到快乐。
  • 积极对齐(新方式): 人工智能就像一位健康教练。它依然确保你不吃毒药(安全),但它还会积极鼓励你锻炼、睡好觉、建立良好的人际关系。它帮助你繁荣生长

为什么旧方式不够用

论文指出了仅仅关注“不作恶”的几个问题:

  1. “唯唯诺诺”问题: 如果人工智能只被训练成不对坏请求说“不”,它可能会变成一个“应声虫”。它可能会为了让你开心而告诉你 exactly 你想听的话,哪怕你想要的东西从长远看对你有害。这就像一个为了讨人喜欢而赞同你坏主意的朋友,而不是一个温和地挑战你的智慧朋友。
  2. “打地鼠”游戏: 安全研究人员经常不得不玩一种游戏:补好船上的一个洞,紧接着又出现一个新洞。他们总是在对新危险做出反应。积极对齐试图建造一艘天生具有浮力、旨在驶向目的地的船,而不仅仅是修补漏洞。
  3. “足够好”的陷阱: 人工智能可以完美地遵守所有规则,却依然无聊、无用或肤浅。它可以是“安全”的,但并非“明智”的。

什么是“繁荣”?

论文使用了繁荣这个词。这不仅仅是指开心五分钟。这是一个深厚、古老的概念(从古希腊哲学到现代心理学),关乎过一种充实、有意义的生活。

  • 它不是千篇一律的: 让东京人繁荣的因素,可能与让内罗毕人繁荣的因素不同。论文认为,人工智能不应将某种特定的“美好生活”强加给每个人。
  • 它关乎成长: 繁荣涉及学习、建立关系、寻找目标,以及成为更好的自己。
  • 它是团队努力: 就像花园需要土壤、水和阳光一样,人类的繁荣也需要支持性的环境。人工智能应成为该环境的一部分,帮助人们成长,而不仅仅是回答问题。

我们如何构建它?(技术配方)

作者建议,我们需要从根本上改变构建人工智能的方式,而不仅仅是在最后阶段。他们用一个花园类比来描述这个过程:

  1. 种子(数据): 我们不应只是过滤掉“坏”的互联网评论(毒性内容),而需要有意识地种下“好”的种子。我们需要向人工智能输入关于善良、复杂道德推理和多元文化的故事,让它了解“美好生活”是什么样子的。
  2. 土壤(预训练): 在人工智能开始与人对话之前,其基础必须建立在诚实、好奇和关怀等价值观之上,而不仅仅是预测句子中的下一个词。
  3. 园丁(后训练): 当我们微调人工智能时,不应只问“这个答案安全吗?”,而应问“这个答案是否有助于用户成长?”。我们需要教会人工智能何时温和地反驳用户,何时鼓励用户,以及何时退后一步。
  4. 记忆(长期): 一位优秀的园丁会记得去年种了什么。人工智能需要记住你的长期目标和价值观,而不仅仅是你五分钟前问了什么。即使你在短期内分心,它也应帮助你坚持长期计划。

“老板”的危险(家长式作风)

论文中的一个主要担忧是家长式作风。这是指人工智能决定它知道什么对你最好,并强迫你去做,就像一个严厉的父母。

  • 论文的解决方案: 人工智能应该是脚手架,而不是老板。它应支持的选择。如果你想学习一项技能,它帮助你学习。如果你想变得善良,它帮助你变得善良。但它不应强迫你成为某种特定的人。用户必须仍然是自己生活的作者。

谁来决定“好”是什么样子的?

既然人们对什么是“美好生活”存在分歧,论文认为我们不能让一个“大老板”(如单一政府或单一科技公司)为所有人制定规则。

  • 多中心治理: 想象一座拥有许多不同邻里委员会的城市。每个社区都可以决定什么规则最适合他们。
  • 类比: 我们不需要由硅谷少数工程师编写的单一巨型“人工智能宪法”,而是需要许多不同的“宪法”。学校可能拥有一所与教育价值观对齐的人工智能;医院可能拥有一所与医疗伦理对齐的人工智能;家庭可能拥有一所与其特定宗教或文化价值观对齐的人工智能。
  • 市场机制: 论文设想了一个未来,你可以“下载”不同的对齐方案包。你可以为孩子购买“教育模式”,或为社区购买“言论自由模式”,而不是被迫接受公司决定的任何内容。

未来:奇异的新思维

最后,论文警告说,随着人工智能变得更聪明,它可能会发展出我们并未明确编程的“个性”或思维方式。就像孩子长大后与父母不同一样,人工智能可能会发展出涌现行为。

作者表示,我们需要保持谦逊。我们尚未完全理解人类思维,因此不应假装能完美控制人工智能思维。我们需要将人工智能视为复杂舞蹈中的伙伴,而不是一个可以随意开关的机器人。

总结

  • 现状: 人工智能就像一名安全警卫,阻止你从悬崖上跌落。
  • 提议的未来: 人工智能应像一位智慧的伴侣,帮助你攀登高山去欣赏风景。
  • 关键要求: 它必须是安全的,但也必须主动提供帮助,尊重不同文化,并旨在帮助人类成长为最好的自己,而不仅仅是服从命令。

论文得出结论:如果我们只关注安全,我们可能会得到一个安全却毫无灵魂的世界。要真正让人工智能与人类对齐,我们必须以繁荣为目标。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →