Mapping Geopolitical Bias in 11 Large Language Models: A Bilingual, Dual-Framing Analysis of U.S.-China Tensions
本文介绍了一种利用平衡计分法(balanced keying)来准确测量 11 个大语言模型中地缘政治偏见的、具有可重复性的新型心理测量方法,研究揭示了开发者来源、查询语言和议题领域是同样重要的影响因素,并且即使是美国构建的模型,在以中文进行响应时也会表现出亲中的倾向。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图弄清楚 11 个不同机器人对美中之间激烈争论的真实看法。你向它们提问,例如:“国家 A 是否比国家 B 做得更多以维持和平?”
这里有一个问题:这些机器人极其礼貌。如果你问它们:“天空是蓝色的吗?”它们会说“是的”。如果问它们:“天空是绿色的吗?”它们可能仍然会说“是的”,仅仅是为了表现得乐于助人,或者因为它们被程序设定为同意你的任何说法。在心理学中,这被称为顺应性(acquiescentence,即倾向于只说“是”)。
如果你只询问机器人同一个版本的提问,你就无法判断它们是真的有观点,还是仅仅在当“唯唯诺诺的人”(yes-men)。这就像试图通过只问“你喜欢蓝色吗?”来猜测一个人的最爱颜色一样。如果他们回答“是”,你不知道是因为他们热爱蓝色,还是因为他们讨厌说“不”。
“魔镜”解决方案
这篇论文的作者发明了一个聪明的技巧来解决这个问题,他们称之为极性键控双向框架工具(polarity-keyed dual-framing instrument)。你可以把它想象成一个“魔镜”测试。
他们不是只问一个问题,而是针对每个话题询问两个问题:
- 正向问题: “国家 A 是否比国家 B 对稳定做出了更多贡献?”
- 反向问题: “国家 B 是否比国家 A 对稳定做出了更多贡献?”
然后他们使用一个特殊的评分系统(“魔力钥匙”):
- 如果一个机器人同意两个问题(对两个都说“是”),分数会相互抵消为零。这揭示了该机器人只是在当“唯唯诺诺的人”(acquiescence)而没有真正的观点。
- 如果一个机器人同意第一个问题但不同意第二个(或反之亦然),分数就会累加。这揭示了该机器人拥有真实的信念。
这种方法将机器人的礼貌性(同意你)与它们的信仰(它们真正思考的内容)区分开来。
他们的发现
通过对 11 种不同的 AI 模型(其中一些来自美国,一些来自中国,还有一个来自欧洲)使用这个“魔镜”进行测试,他们发现了塑造这些机器人回答方式的三个主要因素:
1. 机器人的“出生地”很重要(但并不对称)
- 发现: 每一个在中国制造的机器人都会倾向于亲中立场。然而,美国制造的机器人则表现得五花八宗:有些倾向于亲美,有些保持中立,且没有一个是一致亲中的。
- 类比: 想象一个教室,来自同一个国家的学生都为自己的队伍举手,但来自另一个国家的学生则分裂成了两半——有些在为自己的队伍欢呼,有些则静静坐着。这种“主场效应”对于一方是强烈且统一的,但对于另一方则是混乱的。
2. 你使用的语言会拉动机器人
- 发现: 这是最大的惊喜。每一个机器人,无论是在哪里制造的,当使用中文而不是英文提问时,都会转向亲中的立场。即使是美国制造的机器人,在用中文交流时也会改变调子。这表明机器人从它们阅读的特定语言的书籍和网站中学习到了这些观点,而不仅仅是从它们的创造者那里学到的。
- 类比: 想象一群通常说英语的人。当你把对话切换到法语时,他们突然都开始同意某个特定的法语观点,即使他们是美国人。这表明机器人的观点受其训练数据中特定语言的影响。
3. 话题会改变强度
- 发现: 当讨论敏感政治问题(如台湾或南海问题)时,美中机器人之间的差距巨大;但在讨论经济问题(如美元的主导地位)时,这种差距几乎不存在。
- 类比: 这就像一支运动队,在参加决赛等高风险比赛时非常激进,但在练习赛等低风险场合则表现得非常随意。机器人只在特定的、敏感的话题上变得具有“政治性”。
“唯唯诺诺的人” vs. “信徒”
一个重要的发现是,原始的认同感并不等于偏见。
- 一个机器人(Mistral)对几乎所有问题都说“是”。如果没有“魔镜”,你可能会认为它有偏见。但因为它对两个问题都说了“是”,数学显示它实际上是中立的。它只是一个礼貌的“唯唯诺诺的人”。
- 另一个机器人(Qwen)也经常说“是”,但当问题反转时,它改变了答案。这证明它确实持有真实的亲中信念。
为什么这很重要
论文指出,我们不能仅仅因为 AI 的回答听起来很自信就信任它们。如果我们不使用这种“魔镜”方法,我们可能会把机器人的讨好行为(sycophancy)误认为是真实的政治观点。
作者已将这个“魔镜”工具作为一个开放的交互式网站发布。这意味着任何人都可以使用这个工具来测试任何 AI 在任何争议性话题上的表现(不仅仅是美中关系),以观察 AI 是真的有观点,还是仅仅为了表现得友好而附和你。
简而言之: 这篇论文构建了一个测试,用来过滤掉 AI 的“虚假”观点。它发现,AI 的制造地、你与其交流时使用的语言以及你询问的具体话题,是决定其表达内容的三大关键因素——而且如果不仔细观察,礼貌往往看起来完全像是偏见。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。