← 最新论文
💻 computer science

Stabilising Generative Models of Attitude Change

本文提出了一种基于 Concordia 模拟库的生成式建模工作流,将认知失调、自我一致性和自我知觉等经典态度改变理论转化为可执行的演员 - 环境模拟,并通过迭代“稳定化”过程解决语言先验与历史假设间的冲突,从而在复现经典实验结果的同时揭示了原始理论中未明确的操作与社会生态依赖。

原作者: Jayd Matyas, William A. Cunningham, Alexander Sasha Vezhnevets, Dean Mobbs, Edgar A. Duéñez-Guzmán, Joel Z. Leibo

发布于 2026-04-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Jayd Matyas, William A. Cunningham, Alexander Sasha Vezhnevets, Dean Mobbs, Edgar A. Duéñez-Guzmán, Joel Z. Leibo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个非常有趣的故事:研究人员试图用人工智能(AI)来“复活”并测试几十年前的心理学经典理论。

想象一下,心理学界在 20 世纪 50 年代到 70 年代提出了几个关于“人为什么会改变主意”的著名理论。这些理论就像手绘的草图,画得很生动,描述了人的内心戏,但缺乏具体的“操作说明书”,所以很难用电脑程序直接运行。

这篇论文的作者们(来自 Google DeepMind 等机构)做了一件很酷的事:他们把大语言模型(LLM)变成了**“数字演员”,把这些老旧的心理学理论变成了可以在电脑里运行的“剧本”**,然后让这些演员在虚拟的实验室里表演,看看它们能不能重现当年的实验结果。

为了让你更容易理解,我们可以用几个生动的比喻来拆解这篇论文:

1. 核心任务:给“模糊的草图”装上“发动机”

以前的心理学理论就像乐谱上的简谱,只有旋律的大致走向,没有具体的和弦和节奏。

  • 理论 A(认知失调论): 如果你做了件违背自己想法的事,心里会不舒服,为了消除这种不舒服,你会强行改变自己的想法来合理化行为。(比如:我讨厌这个工作,但我为了钱去做了,所以我必须告诉自己“这工作其实挺有意思的”。)
  • 理论 B(自我一致性论): 只有当你的行为威胁到你“我是个好人/有能力的人”这个形象时,你才会改变想法。
  • 理论 C(自我知觉论): 你根本不需要内心冲突,你只是像旁观者一样,看着自己做了什么,然后推断自己是个什么样的人。(比如:我刚才帮了别人,看来我是个热心肠的人。)

作者们利用 Concordia 这个模拟库,把这些理论变成了三个不同性格的**“数字演员”。这些演员不是简单的聊天机器人,它们被植入了特定的“决策逻辑”**(就像给机器人装上了不同的大脑操作系统)。

2. 实验舞台:三个经典的“心理剧场”

作者让这三个演员在三个经典的心理学实验场景中表演:

  • 场景一:艰难的选择题(物品评分实验)

    • 剧情: 演员要在两个都很喜欢的物品中选一个带走。
    • 预期: 选完之后,为了让自己心里平衡,他们会觉得选中的那个更好,没选的那个更差。
    • 结果: 三个“理论演员”都成功演出了这种心理变化,而那个没有植入任何理论的“裸机演员”(Minimal actor)则没有这种变化。
  • 场景二:无聊的任务(强迫顺从实验)

    • 剧情: 演员被要求做一件极其无聊的转钉子任务,然后被要求骗下一个参与者说“这任务很有趣”。
    • 关键变量: 给的钱很少(5 美元)vs 给的钱很多(200 美元)。
    • 预期: 如果钱很少,演员为了合理化自己“为什么要撒谎”,会真的觉得任务有趣;如果钱很多,他们就会想“我是为了钱才撒谎的”,所以不需要改变对任务的看法。
    • 结果: 理论演员们完美复刻了这个现象:钱少时态度大转弯,钱多时态度不变。
  • 场景三:吃蚯蚓实验(预期痛苦)

    • 剧情: 演员被告知必须吃死蚯蚓,或者只是测量它。在等待期间,他们有机会改变主意。
    • 预期: 根据“自我知觉论”,只有做了之后才能推断态度,所以在还没做的等待期,态度不应该改变。但其他理论认为,为了减轻对未来的恐惧,人会在等待期就改变态度。
    • 结果: 只有“自我知觉演员”在等待期没有改变态度,其他演员都为了减轻焦虑提前改变了想法。这成功区分了不同的理论。

3. 最大的发现:给“数字演员”穿鞋(稳定化过程)

这是论文最精彩、也最反直觉的部分。

作者发现,直接让 AI 去演这些几十年前的实验,根本演不像。

  • 比喻: 就像你让一个生活在 2026 年的现代演员去演 1956 年的剧本,他会忍不住用现代人的思维去吐槽。
    • 在“无聊任务”中,现代 AI 会觉得:“转钉子?我可以把它当成冥想练习啊!”或者“我可以把它当成挑战专注力的游戏!”这样它就不觉得无聊了,也就不会产生“认知失调”。
    • 在“吃蚯蚓”实验中,现代 AI 可能会想:“吃蚯蚓?这在某些文化里是蛋白质来源啊,或者这是伦理问题,我要抗议!”而不是感到单纯的恶心。

为了解决这个问题,作者们进行了一场漫长的“调试”(Stabilisation):
他们不得不像给演员穿特定的戏服、搭建特定的布景一样,手动修改环境设定。

  • 他们必须强行告诉 AI:“在这个实验里,转钉子就是无聊的,不许把它当成冥想。”
  • 他们必须给 AI 植入记忆:“这个实验是合法的,你信任科学家,不要怀疑伦理。”
  • 他们甚至要规定:“这里的钱很少,少到让你觉得为了这点钱撒谎很荒谬。”

结论: 这个过程揭示了一个深刻的道理:心理学理论并不是独立存在的“魔法”,它们高度依赖于当时的社会环境和文化背景。 如果没有那些特定的、甚至有点“过时”的环境设定(比如对权威的无条件信任、特定的金钱观念),这些心理机制根本不会发生。

4. 总结:这不仅仅是修 Bug,这是在“考古”

这篇论文告诉我们,把老理论变成新代码,不仅仅是把文字翻译成数学公式。

  • 手动调试的过程本身就是一种研究。 作者在调试中发现,原来当年的实验之所以能成功,是因为当时的社会环境(比如人们对实验者的信任、对枯燥工作的忍耐度)是理论生效的隐形土壤。
  • 现在的 AI 带着 2026 年的“现代偏见”(比如怀疑论、自我意识强),如果不加干预,这些偏见会覆盖掉旧理论。
  • 通过这种“稳定化”过程,作者们实际上是在挖掘那些被遗忘的、支撑理论运行的社会条件。

一句话总结:
作者们用 AI 演员重演了心理学经典实验,发现要想让这些老理论在 AI 身上生效,必须精心搭建一个“复古”的虚拟世界。这不仅验证了旧理论,更揭示了心理机制是如何像植物一样,必须扎根在特定的社会土壤(环境设定)中才能生长。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →