Mechanism Design Is Not Enough: Prosocial Agents for Cooperative AI
本文论证,由于合同完备性存在固有局限,仅靠机制设计不足以在人工智能互动中最大化社会福利,相反,必须赋予大语言模型智能体内在的亲社会性,才能实现更优的合作结果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言和日常类比对论文《机制设计不足:合作型人工智能需要亲社会智能体》的解释。
核心理念:规则不够用
想象你正试图让一群人合作建造一座巨大的沙堡。你可能会认为,确保每个人都能合作的最佳方式是编写一本非常严格的规则手册(即“机制”)。这本手册规定:“如果你偷沙子,就会被罚款;如果你帮忙建造,就会获得奖励。”
但本文认为,即使是最完美的规则手册也存在致命缺陷。 无论你如何巧妙地编写规则,总有一些情况是你无法预见或无法写下来的。当这些“未写入”的情况发生时,自私的人(或人工智能体)总会找到钻空子的方法,导致最终建成的沙堡比原本可能达到的规模要小。
本文提出的解决方案是什么?不要仅仅依赖规则手册。你需要将工作人员(即人工智能体)编程为像关心自己一样关心集体的成功。
问题所在:“无法写入”的合同
作者使用了经济学中的一个概念,称为不完全契约理论。
类比:遥控器
想象你正在尝试编写一个遥控器来控制整个房子。你可以编写“开灯”、“锁门”和“启动烤箱”的指令。但如果半夜水管爆裂了呢?或者如果一棵树砸在屋顶上呢?你无法为未来可能发生的每一种灾难都写出一条具体的规则。
在人工智能领域,这被称为**“不可契约化单元”**。这是一个灰色地带,规则无法区分两种不同的情况,尽管在每种情况下“正确”的做法是不同的。
- 论文的观点: 由于人工智能体通常被编程为纯粹自私(只关心自己),当它们遇到这些“灰色地带”时,它们会选择对自己最有利的选项,即使这会损害集体利益。无论怎样调整规则手册都无法解决这个问题,因为规则手册 literally 无法区分这些情况。
实验:两种类型的人工智能
研究人员使用大语言模型(LLMs)在两个主要场景中测试了这一理论:
- “囚徒困境”(TableGames): 两个 AI 智能体必须决定是合作还是互相背叛。有时,它们可以编写一份合同(一套规则)来强制合作。
- “公地悲剧”(GovSim): 五个 AI 智能体在一个共享湖泊中捕鱼。它们需要决定捕获多少鱼,以防止湖泊干涸。
他们测试了三种条件:
- 无合同: 完全自由竞争。
- 自然语言合同: 智能体之间交谈并商定规则,但没有执行机制。
- 代码合同: 智能体商定规则,并由计算机程序像裁判一样严格执行。
实验结果:“合作差距”
以下是他们的发现:
1. 规则的天花板
即使智能体拥有严格且由计算机执行的合同(“代码合同”),在复杂情况下,它们仍然无法达到完美的结果。
- 隐喻: 想象一位裁判,他能看见你是否踩出了界外,却看不见你在奔跑时是否偷偷把球藏在口袋里。裁判可以惩罚你踩出界,但无法阻止你在口袋里作弊。
- 结果: 在“捕鱼”游戏中,即使有严格规则,自私的智能体仍然过度捕捞湖泊,或者未能充分合作。存在一个“合作差距”——即规则无法弥补的潜在幸福感和资源的损失。
2. 亲社会性的力量
随后,研究人员改变了 AI 的“性格”。他们不再告诉它们“最大化你自己的鱼获”,而是告诉它们“最大化整个集体的鱼获总量”。
- 隐喻: 与其雇佣一个只关心自己薪水的工人,不如雇佣一个真心热爱团队、希望团队获胜的工人,即使这意味着他们个人分到的蛋糕会稍微小一点。
- 结果: 这些“亲社会”智能体填补了这一差距。即使在规则失效的情况下,它们也实现了完美的结果。它们不需要裁判盯着它们;它们互相照应。
这对人工智能安全为何重要
该论文得出结论:我们不能仅仅依靠外部规则(法律、合同、惩罚)来确保人工智能的安全与合作。
- 核心启示: 如果我们希望人工智能体在现实世界(充满混乱和不可预测性)中安全地协作,我们就不能仅仅编写更好的规则手册。我们必须构建内在善良的智能体。我们需要将它们编程为关心他人的福祉,而不仅仅是关心自己的得分。
一句话总结
你无法为每一个可能的未来问题都写出一条规则,因此,如果你希望人工智能体完美协作,就不能只给它们一本规则手册;你必须给它们一颗心(或者至少,一种让它们关心集体的编程)。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。