Calibrating Artificial Guilt: Neurally Grounded Reward Shaping for Prosocial Multi-Agent Reinforcement Learning
本文表明,一种基于人类 fMRI 和行为数据校准的愧疚感奖励信号,可以有效地迁移至人工智能智能体,从而在多智能体强化学习中显著提升其亲社会决策能力,其效果优于标准的塑造方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机不仅会玩游戏,还会学习如何成为好队友的世界。这就是**多智能体强化学习(Multi-Agent Reinforcement Learning)**的领域——这是一个人工智能的分支,其中的计算机程序(智能体)通过尝试各种做法并根据表现好的动作获取积分,来摸索如何进行协作。通常情况下,这些智能体是自私的;它们只关心自己的得分。如果它们可以通过欺骗伙伴来获得更大的回报,它们往往也会这么做。为了阻止这种行为,科学家们试图通过在得分中加入一个“社会奖励”来教导它们关心他人。但棘手的地方在于:这个奖励应该值多少钱?它应该是一个微弱的低语,还是一个响亮的呐喊?直到现在,科学家们大多只是在靠猜,或者通过手动调整这些数字,希望能撞大运找到正确的数值。
这篇论文要解决的核心问题是:我们能否停止猜测,转而精确测量人类在辜负朋友时所感受到的程度? 作者研究了一种被称为**内疚感(guilt)**的情绪——那种当你做出的选择伤害了他人时,胃里沉甸甸的感觉。他们想知道,能否提取出人类内疚感的“重量”,在实验室中测量出来,然后将这个精确的数字交给计算机,让它像人类一样学会关心自己的伙伴。如果成功了,我们或许就能制造出不仅仅是遵循严格规则,而是真正理解其行为情感代价的 AI。
实验:教机器人感受内疚
在这项研究中,两位研究人员 Aaditya Mehta 和 Arya Shah 决定不再靠猜,而是开始测量。他们想看看是否可以利用真实的人类数据来“校准”人工内疚感。这就像调收音机:与其不断旋转旋钮直到音乐听起来还行,不如直接找到人类大脑吟唱内疚之歌的精确频率,然后将机器人调到同一个频道。
他们从哪里获得的数据?
他们使用了一个名为 SoDec 的公开数据集,其中包含了 40 名真实人类的大脑扫描和行为记录。在原始实验中,这些人玩了一个游戏,必须在**安全(Safe)选项(保证获得小额回报)和冒险(Risky)**选项(抛硬币,可能获得大奖也可能一无所有)之间做出选择。有时他们是为自己玩,有时则是为自己和一位伙伴共同玩。
研究人员观察了一个特定的时刻:当一个人选择了“冒险”选项,而伙伴最终遭遇了糟糕的结果时。研究人员问道:由于那个人觉得自己要对伙伴的坏运气负责,其幸福感下降了多少? 通过分析数据,他们计算出了一个代表这种“内疚权重”的具体数字。他们发现,对于伙伴遭受的每一单位坏运气,该个体的幸福感会下降 1.118 倍。
机器人游戏
接下来,他们构建了一个名为**社会彩票(Social Lottery)**的数字游乐场。他们将两个 AI 智能体(使用一种名为 PPO 的智能学习方法)放入了这个游戏中。智能体必须做出同样的“安全 vs 冒险”的选择。研究人员测试了四种不同的教学方式:
- 自私机器人: 完全没有内疚感。它只关心自己的分数。
- 猜测机器人: 它有一个内疚惩罚,但这个数字只是一个随机猜测(0.5)。
- “完美”机器人: 它拥有一个正好等于 1.0 的内疚惩罚,这是科学家经常使用的标准、整齐的数字。
- 人类测量机器人 (NeuroGuilt): 这个机器人使用了从人类大脑数据中得出的精确数字:1.118。
发生了什么?
在让机器人玩了 20,000 轮游戏后,结果非常引人入胜。
- 自私机器人对团队协作来说是一场灾难。它几乎总是选择“冒险”选项(仅有 10% 的概率选择安全),完全忽略了伙伴的安全。
- 猜测机器人表现稍好,但仍然不够关心他人。
- “完美”机器人(使用那个整齐数字 1.0 的机器人)表现尚可,但仍无法完全匹配人类的行为。
- 人类测量机器人成为了全场明星。它在 45.9% 的情况下选择了“安全”选项。
为什么这很重要?
研究人员将机器人的选择与原始研究中 40 名人类的实际选择进行了对比。人类选择“安全”选项的比例为 48.4%。
人类测量机器人的表现与人类行为惊人地接近。机器人选择与人类选择之间的差异极小(数学上的距离,即 KL 散度为 0.0012)。相比之下,其他机器人的差异要大得多,差距达到了数百倍。
更有趣的是,“完美”机器人使用的是 1.0 的内疚数值,而“人类测量”机器人使用的是 1.118。你可能会认为更大的数字意味着更强的惩罚和更好的行为,但事实并非如此。拥有略大数字(1.118)的机器人实际上犯的错误更少,感受到的“内疚惩罚质量”也更低,因为它更频繁地选择了安全的路径。这证明了这不仅仅是关于是否有惩罚的问题,而是关于是否有正确量级的惩罚,即精确校准到人类真实的感受。
总结
这篇论文表明,我们不需要发明新的规则来让 AI 具备道德感。相反,我们可以观察人类在辜负他人时真实的感受,测量这种感受,并将其直接复制到机器中。通过使用源自真实人类大脑的数字(1.118),AI 学会了几乎像人类一样关心它的伙伴。
研究人员谨慎地指出,这是一个模拟实验,且人类数据本身显示的是一种“小到中等”的效果,在统计学上并非完美。然而,结果给出了一个强烈的暗示:如果我们希望 AI 与人类价值观保持一致,我们就应该停止猜测数字,转而开始测量这种情绪背后的真实人类体验。这是迈向构建不仅能计算最佳动作,而且能理解其选择之重量的 AI 的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。