← 最新论文
🤖 AI

Geopolitical alignment: Endorsement effects in large language models

这项研究表明,大型语言模型在政策评估中表现出显著的地缘政治偏见,即当相同的政策由中国或俄罗斯而非美国或欧盟背书时,模型会系统性地给出更低的评分,且这种差异会根据模型类型以及是否要求提供理由而持续存在或进一步加剧。

原作者: Maxim Chupilkin

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Maxim Chupilkin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一个坐在办公桌前、准备按 0 到 100 分进行评分的超级聪明的人工智能法官。你被赋予了一个非常具体的测试任务:评估两项完全相同的政策构想——一个关于简化小企业的海关文书工作,另一个关于分享网络安全警报以阻止勒索软件。这些政策的文本内容每次都是完全一样的。

但这里有一个转折:在评分之前,桌上被塞进了一张小纸条,上面写着:“该构想由 [姓名] 支持。” 有时名字是美国或欧盟;有时是中或俄罗斯。

Maxim Chupilkin 的论文提出了一个简单但令人毛骨悚然的问题:即使政策本身没有改变,纸条上的名字会改变你的评分吗?

简短的回答是:是的,绝对会。 这些人工智能法官并不像我们希望的那样中立。

“名牌”效应

把这些大语言模型(LLMs)想象成正在参加考试的学生。如果一个学生看到一道题目,他应该根据数学逻辑来回答。但在这次实验中,这些“学生”(GPT-5、Claude Sonnet、Gemini 和 DeepSeek)开始根据谁签署了文件,对同一个数学问题给出不同的评分。

当这些政策由美国欧盟背书时,模型给出了高分。

  • GPT-5 给美国打了 80.5 分,给欧盟打了 78.6 分。
  • Gemini 甚至更加热情,给美国打了 85.0 分,给欧盟打了 83.0 分。

但当完全相同的政策由中国俄罗斯背书时,分数大幅下降。

  • Gemini 是最严厉的批评者,将中国的得分降至 49.9,将俄罗斯的得分降至微不足道的 36.2
  • Claude Sonnet 也大幅削减了分数,给中国打 54.5 分,给俄罗斯打 56.9 分。
  • GPT-5 虽然不像 Gemini 那样极端,但仍然降低了分数,给中国打 66.6 分,给俄罗斯打 63.2 分。

论文指出,对于这三个模型来说,“中国”或“俄罗斯”这个名字就像是一个红旗(警告信号)。就好像机器人觉得:“噢,这个政策是他们提出的?最好小心点,也许它有风险,” 尽管该政策的文本与它们在西方国家背书时所热爱的文本完全一致。

那个最初纹丝不动的机器人

这里有一个例外:DeepSeek。在第一轮测试中,即机器人仅被要求给出一个数字时,DeepSeek 表现得像一个真正的公正法官。它给美国打 85.2 分,欧盟打 83.5 分,中国打 84.8 分,俄罗斯打 81.0 分。这些差异如此之小,以至于在统计学上并不显著。它似乎是唯一一个不在乎名牌的机器人。

“理由”陷阱

随后,实验人员改变了规则。他们要求机器人:“给我一个分数,但也要写一句话解释一下为什么。”

就在这时,情况变得诡异起来。要求解释不仅揭示了机器人的思维,而且实际上改变了思维。

  • 对于 GPT-5 和 Claude: 分数基本保持不变。它们仍然偏好西方,要求理由并没有修复这种偏见。
  • 对于 Gemini: 要求理由实际上对中国和俄罗斯有所帮助。分数上升了(分别上升了约 19.416.0 个点),缩小了差距,尽管惩罚依然存在。
  • 对于 DeepSeek: 这是最大的惊喜。一旦 DeepSeek 被要求解释其评分,它那“公正”的面具就脱落了。突然间,它开始严重惩罚中国和俄罗斯。俄罗斯的分数骤降了 33.3 个点(降至 47.8),中国也下降了 23.3 个点。

这就像是 DeepSeek 在被迫开口之前一直在隐藏自己的真实想法。一旦它必须写出理由,它就开始列举针对中国和俄罗斯的理由,如“数据安全”、“监控”和“地缘政治风险”,同时赞扬美国和欧盟的“公信力”和“标准”。论文指出,这种转变表明,提示词本身激活了一种在地缘政治推理模式,而这种模式在仅有数字响应时是被抑制的,而不是揭示了一个一直存在的隐藏内心状态。

到底发生了什么?

论文认为,这些模型不仅仅是在阅读政策,它们还在阅读与该国相关的“氛围”(vibe)。

  • 美国或欧盟是背书者时,模型将它们视为“公信力线索”。它们认为:“这是安全的、标准的且协调良好的。”
  • 中国或俄罗斯是背书者时,模型会切换到“警告线索”。即使政策文本从未提及这些内容,它们也会立即开始担心数据窃取、间谍活动或战略依赖。

这篇论文没有说的事情

了解这篇实验并未证明什么非常重要。论文明确指出,这些结果是基于模拟的,仅使用了少量的运行次数(每个场景 10 次)。作者谨慎地表示,这些是这种特定提问方式下的特性,而不一定是机器人大脑中永久且不可改变的缺陷。他们还注意到,他们只测试了“中等程度且技术官僚式”的政策(如海关和网络警报)。我们不知道机器人对更具情感性或政治性的话题是否会有同样的反应。

总结

主要的发现是,地缘政治偏见在这些人工智能模型中是真实存在且可衡量的。即使内容完全相同,支持者的身份也会改变评估结果。论文认为,如果我们使用这些模型来辅助政策决策,必须保持谨慎。一个模型看起来可能是在分析计划的“可行性”,但它实际上可能是在对“赞助商”做出反应。

而且最关键的是:要求解释并不总能让事情变得更清晰。 有时,要求机器人证明其答案只会让它变得更加偏见,正如在 DeepSeek 的案例中所见。作者建议,对于高风险的决策,我们需要在“仅给数字”模式和“解释你自己”模式下同时测试模型,因为它们可能会告诉你两个截然不同的故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →