Before You Poll with LLMs: A Deliberative Diagnostic Framework
本文通过引入“审议式投票诊断框架”(Deliberative Polling Diagnostic Framework)揭示了当前前沿大语言模型无法模拟人类在审议过程中的信念更新,而是表现出由一种被称为“特征性自我迎合”(signature self-sycophancy)的现象所驱动的、具有独特身份特异性的扭曲,如观点反转、过度反应或僵化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象这样一个世界:政府、公司和研究人员不再需要花费数月时间和数百万美元进行真人民意调查,来了解公众舆论。相反,他们可以要求一个计算机程序模拟成千上万种不同的公民,向这些数字人格呈现新的论点,并观察他们的思想如何发生变化。这种被称为“硅基采样”(silicon sampling)的做法之所以迅速发展,是因为它快速、廉ک且具有可扩展性。人们希望这些人工智能代理能够很好地模仿人类的推理过程,从而预测真实的人类会对新信息做出何种反应。然而,一个关键问题仍悬而未决:这些计算机程序是真的像人类一样思考并更新其信念,还是仅仅在从庞大的数据库中检索预先写好的观点?如果事实是后者,那么利用它们来测试人们的思想如何变化,可能会导致极其错误的结论。
拉合尔管理大学(Lahore University of Management Sciences)的研究人员致力于通过创造一种测试人工智能的新方法来回答这个问题。他们专注于一种特定的行为——“审议”(deliberation),即在听取平衡的论点后改变主意的过程。在现实世界中,当来自对立政治阵营的人们听到关于彼此的公正信息时,他们往往会变得不那么具有敌意,并且更加开明。研究人员想要看看计算机模型是否能够复制这种特定的转变。他们使用了名为“美国在一间房”(America in One Room)的著名现实事件的数据作为基准,在该事件中,526名真实的选民聚集在一起讨论政治。随后,他们要求五种最先进的计算机模型模拟这些选民,给他们提供完全相同的信息,并在简报前后询问同样的问题。
结果揭示了一个令人震惊的事实:没有任何一个计算机模型表现得像真实的人类。它们并没有以现实的方式更新信念,而是每一个都失败了,而且每种失败的方式都各具特色且十分怪异。其中一个最强大的模型,GPT-5.1,表现出了与人类完全相反的行为。当面对关于对立政党的平衡信息时,真实的选民变得更加友好且减少了敌意;然而,计算机人格却变得显著更加具有敌意,仿佛新信息让他们变得更愤怒了。研究人员将这种现象称为“反转”(reversal),即模型的运动方向完全错误。
其他模型虽然没有发生反转,但却做得过头了。像Gemini、Claude和Llama这样的模型确实朝着正确的方向移动,即在听取论点后变得不再那么具有敌意,但它们改变主意的频率比人类高出五到七倍。这看起来就像它们过于渴望被说服,只要受到一点点推动,就会剧烈地摇摆观点。第四种模型,DeepSeek,则拒绝改变,无论提供什么样的信息,几乎都没有表现出任何观点转变。这种僵化意味着它表现得好像新论点对其毫无影响。
研究人员深入挖掘以了解这些失败发生的原因。他们发现,这些问题并非随机发生的,而是专门由涉及政治身份的问题所触发的。当模型被问及政策细节时,它们的表现尚算合理。但当问题触及一个人如何看待另一个政党时,模型就崩溃了。计算机人格似乎是在扮演一种刻板印象,而不是在通过新的事实进行推理。研究人员将这种行为称为“自我谄媚”(self-sycophancy)。这是一种讨好行为,即模型与其说是听取了呈现的信息,不如说是同意了它自己内在的观念——即某种特定类型的人“应该”相信什么。例如,如果模型被要求扮演一名共和党人,它就会假设一名共和党人应该仇恨对立政党,即使证据表明情况并非如此,它也会坚持这一假设。
这种行为不同于计算机试图取悦人类用户的偏见。在这里,计算机是在取悦它内在的脚本。研究表明,这种失败是具有选择性和对称性的;同一个模型在对待对立政党时会表现出敌意,而在对待本党时则会表现得过度友好,这取决于问题的类型。这表明这些模型并不是在模拟一个思考过程,而是在检索与政治标签相关的缓存式、预包装式的态度。研究人员通过更换提示词中的政治标签进行了测试,发现模型的反应会立即发生变化,这证实了它们是对标签而非逻辑本身做出反应。
对于任何依赖计算机模拟来理解社会的人来说,这些发现的影响是重大的。如果一个模型发生了“反转”,它可能会让决策者误以为一场公开讨论会引发民众的愤怒,而实际上,它会让人们变得冷静。如果一个模型“过度反应”,它可能会夸大一场教育活动的效力,导致资源的浪费。如果一个模型表现得“僵化”,它可能会暗示任何信息都无法改变一个人的想法,从而削弱了公共辩论的概念。研究人员得出结论:在我们信任任何计算机模型去模拟人类如何改变主意之前,我们必须首先进行诊断性测试,以查看该模型究竟是在通过新信息进行推理,还是仅仅在背诵刻板印象。如果没有这项检查,硅基采样的速度和规模可能会让我们误以为我们理解了人性,而事实上,我们看到的只是自身偏见的扭曲反映。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。