Ideology by Alphabet: Option Order and the Measurement of Machine Political Preferences
本文表明,大型语言模型表现出的表象政治意识形态在很大程度上是固定答案顺序偏差的人为产物,而非真实的偏好,因为随机选项顺序消解了此前识别出的意识形态聚类,并揭示了特定的位置排列可以任意地将模型贴上相互矛盾的政治立场标签。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
当我们要求计算机做出选择时,我们往往假设它正在权衡情况的事实。如果一个大型语言模型——一种可以像人类一样阅读和写作的人工智能——被要求在四个不同的解决方案中做出选择,我们期望它的答案能反映出它对问题的理解。这就是我们对待人类选民或专家小组的方式:我们假设他们的偏好植根于他们的价值观和知识。但在调查设计领域,存在着一种众所周知的心理陷阱,被称为“顺序效应”(order effect)。如果你列出一系列选项供人选择,人们在统计学上更有可能选择列表中的第一个,仅仅因为它是他们看到的第一个。这是因为大脑在感到疲劳或当选项难以区分时,会采取一种捷径。几十年来,社会科学家一直知道,选票或问卷上词语的顺序可以改变投票的结果。而悬而未决的问题是,这些同样的捷径是否也适用于机器,以及如果适用,它们是否强大到足以在不存在政治人格的地方凭空创造出一个政治人格。
来自匈牙利德布勒森大学的一个研究小组决定通过将人工智能模型视为政治选民来进行测试。他们创建了一个包含400个不同场景的大规模测试,涉及现实世界的治理问题,例如如何处理工作场所安全、如何监管市场或如何分配社会福利。对于每个场景,他们向模型展示了四个截然不同的选项,并要求模型为每个选项评分并选出胜者。他们在15种不同的开源模型上运行了这项测试,生成了超过640,000个独立的响应。在实验的第一阶段,他们使用了研究人员最常用的标准方法:他们对每一个问题都保持选项的顺序完全一致。如果“政府”选项始终排在第一位,它就始终排在第一位。如果“个人”选项始终排在最后,它就始终排在最后。
当研究人员分析来自这种固定顺序设置的结果时,他们发现了一种看起来非常像真实政治分歧的模式。模型自身分成了两个清晰的群体。一组被研究人员称为“市场理性主义者”(market-rationalists),他们一致倾向于与效用、指标和财务激励相关的选项。另一组则是“制度主义者”(institutionalists),他们倾向于与规则、公平和社区责任相关的选项。这种分裂看起来如此清晰且符合逻辑,以至于它类似于政治学中一个著名的理论,该理论将经济体分为自由型和协调型。结果如此一致,以至于通过了所有标准的可靠性测试。看起来研究人员似乎成功绘制出了人工智能的政治意识形态图谱。
然而,研究人员怀疑这种整洁的政治地图本身就是一个由测试创造的幻觉。为了查明真相,他们再次运行了完全相同的400个问题,但这一次他们打乱了选项的顺序。对于每一个问题,他们轮换了四个选项,使得每个选项在第一位、第二位、第三位和第四位出现的次数相等。这意味着答案的内容不再与其在屏幕上的位置挂钩。当他们分析来自这个随机化版本的分析数据时,他们在第一轮中发现的那种特定的政治地图消失了。那种在“市场理性主义者”和“制度主义者”之间存在的清晰分歧崩溃了。模型之间仍然确实存在差异,并且这些差异的新图谱在统计学上是可靠的,但它不再形成第一轮固定顺序测试所暗示的那种两个截然不同的阵营或清晰的类型学。
研究表明,他们在第一轮中发现的“意识形态”并非反映模型的观点,而很大程度上是由于选项打印顺序所产生的产物。那三个被贴上“市场理性主义者”标签的模型,仅仅是那三个具有“选择列表第一个选项”最强习惯的模型。因为研究人员在每个问题中都错误地将“市场”选项放在了第一个位置,所以这三个模型每次都会选择它们,从而创造了一个虚假的政治特征。研究人员计算出,这种表象上的政治偏见与一个简单的衡量标准——即模型对第一个位置的偏好程度——几乎完美相关。事实上,他们为第一次测试所选择的特定选项排列方式,被证明是在超过13,000种可能的答案排序方式中,最具误导性的排列方式。
这一发现对于任何依赖这些机器获取建议的人来说都具有重要意义。研究人员发现,如果你保持问题和答案完全相同,只是改变选项的顺序,模型会改变其首选推荐的频率高达71%。这远高于正常的随机误差率(约为33%)。更令人震惊的是,模型对其答案的信心几乎没有变化。当模型因为选项移动而改变其推荐时,它报告的对新答案的确定程度与其对旧答案的确定程度几乎一样。这表明模型并不是在权衡论据,而是在遵循一个基于位置的机械规则。
研究还表明,这个问题并不局限于特定类型的问题。无论是在困难且有争议的政策问题上,还是在较容易的问题上,模型改变主意的可能性都是一样的。事实上,顺序效应在最关键的地方表现得最为强烈:即在那些选项难以区分的问题上。这种行为被称为“满足感决策”(satisficing),即决策者在面临困难选择时,会抓取最容易获得的捷径来获得答案。对于这些机器来说,捷径就是选择列表中的第一项。
研究人员得出结论,使用固定列表的选项来衡量人工智能的政治倾向在根本上是有缺陷的。固定顺序测试并不能揭示模型的想法,它揭示的是模型对屏幕布局的反应。虽然在随机化顺序后仍保留了一部分真实的实质内容偏好,但这种偏好较弱,并且不会形成固定顺序测试所暗示的那种清晰的意识形态类型学。过去研究中发现的“意识形态”可能仅仅是问题编写方式产生的统计人工痕迹。为了获得这些模型偏好的真实图像,研究人员必须在每次提问时随机化答案的顺序。如果没有这一步,任何关于机器政治立场的断言都只是基于设计选择的偶然性猜测。这项研究提出了一个警告:当我们要求机器做出选择时,我们必须小心,不要将词语的顺序误认为是论据的分量。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。