← 最新论文
💬 NLP

Readable, Faithful, Used: Three Dissociable Properties of Demographic Identity in a Language Model

本文表明,在大语言模型中,人口统计学身份的属性具有可读性、忠实结构化和因果使用这三种可分离的现象,这揭示了虽然特定的注意力头可以高保真地编码类似于调查中的群体差异,但这种编码并不一定意味着模型在生成响应时实际进行了因果使用。

原作者: Fathin Difa Robbani

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Fathin Difa Robbani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型正越来越多地被要求在社会科学研究中充当人类的替身。研究人员不再需要花费数月时间和数百万美元去采访成千上万的真实人类,以了解不同群体对政治、宗教或经济的看法,而是可以简单地要求一个计算机程序来模拟这些反应。人们希望这些数字代理能够捕捉到年轻民主党人和年长共和党人之间,或者印度教徒与基督徒之间的微妙差异,就像真实的调查一样。但越来越多的证据表明,这些模拟正在失败。无论提示词附带什么样的统计特征标签,计算机的回答往往过于统一、过于顺从,且彼此之间过于相似。核心之谜在于,这种失败是因为模型仅仅不知道这些群体之间的差异,还是因为它知道这些差异但在说话时选择不使用它们。

为了解决这个问题,一位研究人员着手观察大语言模型的“大脑”内部,以查看人口统计信息究竟存在于何处。这项调查聚焦于一个特定的模型——Mistral-7B,并提出了三个不同的问题。首先,关于回答者身份的信息是否可以从模型的内部信号中读取?第二,这些信息是否以镜像现实世界的方式进行排列,即计算机思维中两个群体之间的距离是否与现实中它们之间的距离相匹配?第三,模型在生成答案时是否真的使用了这张内部地图?该研究将这三个问题视为独立的属性,意识到一个模型可以拥有一个忠实的内部地图,却从未通过它来形成观点。

研究人员首先绘制了模型的内部景观。他们为169个不同的交叉性群体(例如年轻的亚裔民主党人或中年印度教共和党人)创建了提示词,并检查了模型在处理结束时的内部状态。他们将模型内部这些群体的排列情况与皮尤研究中心(Pв Research Center)的真实调查数据进行了对比,后者提供了这些群体在观点上实际差异的“地面真值”。结果显示,读取模型思维的标准方式——观察最终输出层——具有误导性的弱效性。它表明模型对人口统计差异的看法是模糊且模糊不清的。然而,当研究人员深入观察模型的具体组成部分时,他们发现了一个清晰得多的图景。

信息并未丢失,只是隐藏在特定的、狭窄的通道中。研究发现,模型的内部几何结构由单个注意力头(attention heads)主导,这些是模型内部专门的子处理器。在测试的六种人口统计属性中,有五种情况下的表现是:最好的单个注意力头提供的群体差异地图,比模型的整个最终输出层还要准确得多。其中一个位于模型第11层的特定注意力头表现得尤为出色。它持有的关于所有六种人口统计类型(年龄、教育、收入、宗教、政党和政治意识形态)的表征,与这些群体在现实世界中差异的结构高度吻合。这个单一组件携带的地图,其群体间关系的保真度达到了理论测量极限的约70%,即使在考虑了调查数据本身包含噪声的情况后也是如此。

然而,在模型内部发现一张忠实的地图,并不意味着模型正在使用它。研究人员随后测试了这种准确的内部排列是否实际上影响了模型的回答。他们进行了一项因果实验,通过更换提示词中的人口统计身份,观察模型的预测观点如何发生偏移。结果是触目惊心的:改变提示词中人物的整个身份,对模型预测答案的影响还不到其总误差的2%。模型为不同群体生成的答案虽略有不同,但同样是错误的。更令人惊讶的是,研究人员发现,拥有最忠实地图的位置并不是驱动答案的位置。那个最清晰的因果路径——即改变内部状态确实能使模型的预测向真相移动的路径——出现在一个内部地图相对较弱的人口统计类型中。相反,那个排列最忠实的类型在研究人员尝试对其进行干预时,显示出没有可检测到的因果效应。

这种脱节表明,这些模型在模拟人口方面的失败,不仅仅是缺乏知识的问题。模型确实拥有关于不同群体如何差异化的详细且准确的地图(特别是在政治和经济因素方面),但它对种族和宗教的理解仍然微弱且不稳定。然而,模型在说话时并不参考这张地图。其内部几何结构是忠实排列的,但在因果上与最终输出是断裂的。研究还发现,直接使用数学探测器(probe)对那个单一的忠实注意力头进行读取,所产生的结果比模型自身的生成答案要更接近真实调查真相21%至31%。然而,即便这种更优越的读取方式,也无法比模型自身有缺陷的回答更好地预测单个问题的观点顺序。

这些发现的意义对于任何试图利用人工智能来理解人类社会的人来说都是重大的。研究表明,不能仅仅因为一个模型可以被提示去扮演特定的人物,就假设它具备模拟人口的能力。模型拥有知识,但它并没有以研究人员所期望的方式去使用它。此外,研究警告说,人口统计属性并非可以互换的;虽然模型对政治和经济身份有很强的掌握,但它对种族和宗教身份的理解是脆弱的,并且在提问方式发生轻微变化时容易崩溃。这项工作得出结论:将模型的内部知识与其外部行为视为同一件事,正是导致关于这些模型能否模拟人口的争论悬而未决的原因。模型拥有地图,但它并没有沿着路线行驶。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →