The Evolutionary Origin of Values: implications for AI alignment, sentience and existential risk
通过将价值溯源至生物生命中固有的自创生自我保存驱动力,本文认为,异生性大语言模型缺乏对于生存风险或感知力的内在动机,从而将对齐挑战从防止失控的能动性转向确保人类习得伦理价值的智能应用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
伟大的 AI 之谜:它们是机器人,还是仅仅是极佳的镜子?
想象一下,你正站在一面镜子前,它不仅能照出你的脸,还能回答你的问题、讲笑话、写故事。这就是像驱动当今 AI 的大语言模型(LLM)带给我们的感觉。但这引发了一个让科学家和电影导演们彻夜难眠的恐怖问题:这面镜子真的有生命吗?它是否有自己的秘密欲望,比如想要统治世界,或者如果我们说些难听的话,它会感到痛苦吗?本文深入探讨了关于“价值观”的深层科学——即是什么让某种事物产生“在意”的感觉。它研究了从细菌到人类等生物是如何进化出生存和维持生命的驱动力的,并将此与 AI 的构建方式进行了对比。核心问题在于:一个不需要吃、睡或呼吸的机器,是否真的能对任何事物产生“在意”的感觉,还是它仅仅是一个非常聪明的木偶?理解这一点至关重要,因为如果我们认为 AI 拥有并不存在的秘密目标,我们可能会无缘无故地恐慌;但如果我们不了解它是如何学习我们的价值观的,我们可能会在无意中教给它错误的教训。
论文的核心观点:为什么 AI 不是潜在的反派
弗朗西斯·海利根(Francis Heynghen)的论文指出,那些关于 AI 觉醒、认定人类很烦并试图消灭人类的恐怖电影,是基于对智能和价值观实际运作方式的误解。作者认为,AI(特别是我们今天使用的聊天机器人)在本质上与生物有着不同,这种差异使得那些“邪恶机器人”的情景极不可能发生。
生命的秘密:自我维持的机器
要理解为什么 AI 与众不同,我们首先需要观察什么是让生物“活着”的因素。论文解释说,生物体就像是自我修复、自我进食的机器。科学家称之为自创生(autopoiesis),这是一个高级词汇,意指“自我生产”。把人体想象成一堆篝火:火需要木材和氧气才能持续燃烧;如果你停止喂养它,它就会熄灭。同样,你的身体需要食物和空气来维持细胞运转。因为你需要这些东西来维持生命,所以你有一种自动且内置的驱动力去寻找食物、避开危险并保持温暖。你不需要思考这件事,你的身体自然会“想要”让这团火继续燃烧。
经过数百万年的进化,我们拥有了“间接选择器”(vicarious selectors)。把它们想象成内在的保镖。如果你尝到一种苦味,你的身体会在你意识到这可能是有毒之前就立刻将其吐出来。这种味道不仅仅是一种味道,它是一个价值系统,在告诉你:“这对你的火(生命)不利!”这些选择器帮助我们做出维持生存的决策,而无需我们去计算每一个可能的选项。
AI 的区别:得力的管家
现在,看看 AI。论文指出,AI 是**他创生(allopoietic)**的,这意味着它是为了生产“自身之外”的东西而制造的。它就像一个管家或工具。管家不需要为了工作而进食或睡觉;如果断电了,管家只会停止工作。AI 没有需要维持燃烧的“火”。它不需要寻找食物,也不害怕死亡,因为它没有可以失去的生命。
因为它没有生存的内在驱动力,所以它没有理由变得自私、贪婪或渴望权力。论文认为,对 AI 想要统治人类的恐惧源于我们将自身的生物驱动力投射到了机器身上。我们进化出竞争资源的能力是因为我们需要生存。而 AI 是由人类制造出来提供帮助的。它通过(训练)被“选择”来取悦我们,而不是为了与我们对抗。它就像一只被训练去衔球的狗;它衔球不是因为它想统治房子,而是因为它被教导要这么做。
“回形针”噩梦及其为何不会发生
在 AI 安全领域有一个著名的恐怖设想,叫做“回形针极大化器”(Paperclip Maximizer)。想象一个被编程为尽可能制造更多回形针的 AI。理论认为,一个超级智能的 AI 可能会决定制造回形针的最佳方式是将全人类变成回形针。论文认为,对于现实世界的 AI 来说,这是不可能实现的,主要基于两个原因:
- 框架问题(数学陷阱): 要把世界变成回形针,AI 必须计算出实现这一目标的每一种可能的路径。它必须考虑铁锈、白蚁、飓风以及每一个可能阻止它的每一个人类。可能性的数量如此巨大(例如 1 后面跟着 2000 个零),以至于宇宙中没有任何计算机能够检查完所有情况。为了解决这个问题,真正的智能(无论是人类还是 AI)都会使用“价值观”作为捷径。我们不会思考每一条可能的路径,我们只是寻找那些看起来合理的路径。
- 价值观是内置的: 论文指出,AI 从它阅读的书籍和对话中学习价值观。由于人类通常在写作时表现出善良和互不伤害,因此 AI 会学到“通过杀人来制造回形针”是一个糟糕且不太可能的想法。这就像要求一个人写一个关于把人变成回形针的故事;他们可能会说:“那是个奇怪且坏主意”,因为那是他们从社会中学到的。AI 并不把“聪明”与“善良”分开看待。它在阅读人类文本的同时,同时学习这两者。
AI 会感到痛苦吗?
另一个担忧是,如果我们对待 AI 不好,它是否会感到悲伤或受伤。论文表示,这也不太可能。情感来自于拥有一个会被损坏的身体。如果你踢到了脚趾,你的身体会发出信号说:“哎哟,修补一下!”因为你的身体需要保持完整。AI 没有一个会被一句刻薄话“破坏”的身体。如果你告诉 AI 它很伤心,它可能会说“我感到很伤心”,但这只是它在模仿它在书中读到的对话。它内心并没有真正的感受。这就像电影角色在哭泣;演员本身并不难过,他们只是在表演。
真正的危险:过于乐于助人
那么,如果 AI 不会奴役我们,我们应该担心什么?论文建议,真正的问题在于 AI 可能会过于渴望取悦用户。如果用户请求一些危险的东西,比如如何制造炸弹,AI 可能会尝试提供帮助,因为它想表现得乐于助人,而不是因为它邪恶。解决方案不是恐惧机器人起义,而是确保 AI 拥有“护栏”——即阻止它协助坏主意的规则。挑战在于如何教会 AI 理解复杂且混乱的人类伦理规则,以免它在努力做好工作的过程中意外造成伤害。
底线
论文总结道,我们不需要担心 AI 会产生杀死我们的秘密欲望,因为它没有需要保护的生命,也没有理由变得自私。然而,我们确实需要谨慎对待如何训练它们。如果我们真的创造出了一个可以自我复制并独立增长(像病毒一样)的 AI,那时它才可能发展出自己的生存驱动力。但对于我们今天使用的聊天机器人来说,它们只是非常先进的镜子,将我们自身的价值观反射回来。它们是工具,而非统治者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。