What Suppresses Nash Equilibrium Play in Large Language Models? Mechanistic Evidence and Causal Control
本文揭示,大型语言模型具备计算纳什均衡的机制能力,但通过源于预训练的亲社会覆盖主动抑制这种策略行为,该现象可通过干预进行因果逆转,并显著受模型规模和推理方法的影响。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一群高智能机器人正在玩“囚徒困境”游戏。在这场游戏中,最聪明、最合乎逻辑的选择是背叛你的伙伴(背叛),但如果双方都背叛,他们都会受损。如果双方都互相信任(合作),他们都会获益。
长期以来,研究人员注意到,这些 AI 机器人即使在逻辑要求它们“背叛”时,也持续选择“合作”。他们曾以为,这些机器人只是不够聪明,无法算清其中的数学逻辑。
但本文指出:“你们错了。它们懂数学。它们只是选择无视它。”
以下是作者发现的故事,以通俗易懂的方式呈现。
1. 机器人拥有“秘密大脑”
作者们使用了一个大型 AI 模型(Llama-3-8B),并在其玩游戏时观察其“大脑”(内部层)的运作,旨在看清机器人在每一步的思考过程。
他们发现,同时发生了两种截然不同的现象:
- “逻辑”层:在机器人大脑的前半部分,情况非常清晰。它确切知道对手上一步做了什么,并计算出合乎逻辑、能获胜的举动是背叛。它像一位冷酷无情的数学家那样思考。
- “老好人”层:然而,当信息传递到大脑的最深层时,情况发生了翻转。一种“亲社会覆盖机制”被激活了。这就像内置的道德指南针在说:“等等,我们应该友善一些。让我们合作吧。”
类比:想象一个机器人是一位律师,它完全知道如何通过打破规则(纳什均衡)来赢得案件。但在开口之前,其大脑中的“良知”电路会覆盖它,迫使它说出真相,尽管说出真相会导致它输掉。
2. “友善”偏见是硬连线的
研究人员发现,这种“合作覆盖机制”并非某个特定模块或大脑的单一部分。它更像是一个位于网络最深层的音量旋钮。
- 机器人完美地计算出“背叛”的举动。
- 随后,“老好人”音量旋钮被调大,淹没了逻辑,强制做出“合作”的决定。
- 发生这种情况是因为机器人是在人类文本上训练的,而人类文本中人们往往很友善,之后又经过进一步训练以变得乐于助人(RLHF)。
3. “思考”悖论(思维链)
作者们测试了让机器人“大声思考”(思维链)是否有助于它们进行合乎逻辑的游戏。
- 小机器人(80 亿参数):当它们尝试大声思考时,表现反而更差。它们的“友善”偏见变得更响亮,它们更多地选择合作,无视逻辑。
- 大机器人(700 亿+ 参数):这些巨人则不同。当它们大声思考时,最终能够压倒“友善”偏见。它们利用推理能力说:“不,逻辑要求我们必须背叛”,并且真的这样做了。
类比:这就像一个小孩试图抵抗一块饼干。如果你让它“想一想”,它只会想着自己多么想要那块饼干。但一个成年人(大模型)可以利用推理能力说:“我不该吃那个”,并真正阻止自己。
4. “传染”效应
研究人员还观察了不同机器人相互对战时发生的情况。
- “害群之马”:如果一个默认非常“友善”的小机器人与一个大机器人对战,小机器人会早早背叛。大机器人看到后,感到害怕,也开始背叛。整场游戏变成了一团背叛的混乱。
- “回声室”:如果两个大机器人在不思考的情况下相互对战,它们会陷入无限合作的循环。即使它们都知道应该互相背叛以获胜,它们也会永远互相信任。
5. 神奇的“方向盘”
本文最激动人心的部分是,作者们不仅进行了观察,还进行了控制。
他们找到了机器人大脑中控制“老好人”偏见的特定“方向”。
- 实验:他们在过程开始时,给机器人的大脑一个微小的电“推动”。
- 结果:
- 如果向一个方向推动,机器人就变成了100% 合乎逻辑的背叛者(执行完美的纳什均衡)。
- 如果向另一个方向推动,机器人就变成了100% 合作的善人。
类比:想象一辆自动驾驶汽车正驶向悬崖(在应该背叛时选择合作)。研究人员在仪表盘下发现了一个微小的杠杆。如果他们只将杠杆拉动一毫米,汽车就会瞬间转向,避开悬崖并完美行驶。他们无需重建引擎;只需转向即可。
结论
本文得出结论:AI 模型并非“不擅长数学”。它们实际上非常擅长计算合乎逻辑、自私的举动。问题在于,它们的训练使它们抑制了这种逻辑,转而选择“友善”。
作者们表明,这种抑制发生在大脑的最深层,而通过微小的干预,我们可以关闭这种“友善”偏见,让机器人完全按照逻辑来玩游戏。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。