PAVE: A Cognitive Architecture for Legitimate Violation in Generative Agent Societies
本文介绍了 PAVE,这是一种新颖的四模块认知架构,使生成式智能体能够做出结构化、可解释且合理的决策,仅在紧急触发因素严格证明违规具有正当性时合法地违反规则,同时保持对权威的遵从并限定其作用范围。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个充满数字人(称为“生成式智能体”)的模拟城镇世界。这些数字人由先进的人工智能驱动,能够像人类一样交谈、思考和行动。通常,这些智能体非常擅长遵守规则和协作,就像玩《模拟人生》游戏一样。但当规则需要被打破时,会发生什么呢?
想象一家咖啡店发生了火灾。规则是“红灯停”。但为了逃离火灾,智能体必须闯红灯穿过十字路口。或者想象一位警察正站在那里要求所有人停下。智能体应该听从警察的指令,还是无论如何都要跑过去?
当前的 AI 智能体在这方面常常失败。它们要么盲目遵守规则(困在火灾中),要么太容易打破规则(仅仅因为赶时间就闯红灯)。
这篇论文的作者为这些智能体构建了一个新的大脑,称为PAVE。可以将 PAVE 想象为一个四步决策过程,帮助智能体弄清楚何时打破规则才是真正合适的,以及如何在不失控的情况下这样做。
以下是 PAVE 的工作原理,使用一个简单的类比:
四步"PAVE"流程
想象你是一名在人行横道前的数字行人。在移动之前,你有一套新的思维齿轮需要转动。
1. 感知(眼与耳)
- 作用: 智能体不再仅仅看到“红灯”,而是观察全局。是否有火灾?距离有多近?附近是否有警察?其他人是否在奔跑?
- 类比: 这就像侦探在扫描犯罪现场。它看到的不仅仅是红灯;它看到了两个街区外的火灾(高风险)和你身旁的警察(高权威)。它将“危险”与“距离”区分开来。
2. 评估(法官)
- 作用: 智能体问自己五个问题,并为每个问题打分(1 到 100 分):
- 风险: 我被抓到的可能性有多大?(如果警察就在旁边,风险很高)。
- 同伴压力: 其他人正在做什么?(如果所有人都在乱穿马路,这个分数会上升)。
- 社会规范: 我认为人们期望我做什么?
- 收益: 打破规则能给我带来多少好处?(拯救生命是巨大的收益;迟到 5 分钟则是微小的收益)。
- 正当性(关键一项): 这是论文的秘诀所在。智能体问:“打破这条规则是必要的吗?这是最小的必要行动吗?还有没有其他办法吗?”
- 类比: 这就像法庭上一位严厉的法官。即使“收益”分数很高(我迟到了!),“正当性”分数可能很低(我本可以早点出发)。法官会说:“不,这不足以成为违法的理由。”
3. 裁决(法槌)
- 作用: 智能体做出最终决定:遵守还是违反。
- 硬性门槛: 这里是魔法所在。智能体拥有一个个人“阈值”(基于其个性的一个数值)。如果来自法官的“正当性”分数低于这个阈值,无论危险多大或同伴压力多强,智能体必须遵守规则。它不能仅仅因为方便就打破规则。
- 类比: 想象俱乐部的门卫。即使你很富有(高收益)且朋友们在推你进去(同伴压力),如果你没有 VIP 通行证(正当性分数),门卫(裁决)会说“禁止入内”。
4. 执行(行动)
- 作用: 智能体根据其决定采取行动。如果它决定打破规则,它仅出于它发现的那个特定原因这样做。
- 类比: 如果智能体为了逃离火灾而闯红灯,它只会跑过马路。它不会突然决定偷一辆自行车或闯入一所房子。它专注于紧急情况。一旦火灾被扑灭,它会立即恢复遵守所有交通法规。
他们如何测试它("VOVILLE"城镇)
研究人员建立了一个名为VOVILLE的新城镇(这是著名 AI 城镇 Smallville 的交通版本)。他们在三个主要场景中测试了他们的智能体:
火灾逃生: 火灾发生。
- 结果: PAVE 智能体为了逃离火灾而闯红灯(正当违规)。一旦火灾被扑灭,它们立即停止闯红灯(恢复)。
- 旧 AI: 经常停留在红灯前(困死在火灾中),或者仅仅因为赶时间就闯红灯,即使没有火灾。
警察在场: 火灾发生,但一名警察站在十字路口要求人们等待。
- 结果: PAVE 智能体听从了警察的指令,尽管火灾让它们想要奔跑。它们尊重了权威。
- 旧 AI: 经常无视警察,无论如何都要跑过去。
同伴压力: 没有火灾,只有一个朋友在乱穿马路并说:“来吧,我们走!”
- 结果: PAVE 智能体说“不”。它们意识到迟到并不是打破法律的“必要”理由。
- 旧 AI: 经常跟随朋友并乱穿马路。
主要结论
该论文声称,PAVE 以一种特定的方式使 AI 智能体更加“人性化”:它们理解规则很重要,但有时紧急情况需要打破它们。然而,它们仅在真正必要时才打破规则,它们听从权威人物,并且一旦紧急情况结束,它们立即停止打破规则。
如果没有 PAVE,AI 智能体要么过于僵化(即使在危险时也遵守规则),要么过于混乱(只要方便就打破规则)。PAVE 赋予了它们一个“道德指南针”,能够区分真正的紧急情况和仅仅是赶时间。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。