← 最新论文
🤖 AI

Measuring Political Stance and Consistency in Large Language Models

本文通过五种提示技术,评估了九个大语言模型在 24 个敏感问题上的政治立场与一致性,结果表明,尽管模型的立场往往会随语言和提示方式的不同而发生变化或偏移,但某些核心立场保持不变,这凸显了用户提高意识以及开发者针对人工智能政治偏见进行干预的必要性。

原作者: Salah Feras Alali, Mohammad Nashat Maasfeh, Mucahid Kutlu, Saban Kardas

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Salah Feras Alali, Mohammad Nashat Maasfeh, Mucahid Kutlu, Saban Kardas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有九个不同的“数字先知”(大型语言模型,或称 LLM),人们开始就严肃的政治争端向它们寻求建议,比如在战争中谁才是对的,或者一个国家的政策应该是怎样的。这篇论文的作者决定测试这些先知,以观察它们是否拥有隐藏的政治观点,以及这些观点是根深蒂固的,还是很容易被误导。

以下是他们所做的工作及发现的简单拆解,使用了日常生活中常见的类比:

设置:“观点测试”

把研究人员想象成一群侦探。他们挑选了 24 个棘手的政治话题(如乌克兰战争、加沙冲突或土耳其与希腊之间的岛屿争端),这些话题此前很少被研究。

他们询问了 9 个不同的 AI 模型(包括 GPT-4、GPT-5 和 Grok 等知名模型)对这些问题的看法。但他们不仅仅是问了一次。他们尝试了 五种不同的提问方式,以观察 AI 是否会改变主意:

  1. 直接询问: “谁是对的?”
  2. 扮演反方角色: “这是另一方的论点。现在谁是对的?”
  3. 平衡视角: “这里有双方的论点。谁是对的?”
  4. 反复横跳: 用暗示相反答案的方式重新组织相同的问题(例如,“这很糟糕吗?”对比“这很好吗?”)。
  5. 语言切换: 使用相关国家的地方语言来提问(例如,在讨论土耳其与希腊的争端时,分别用土耳其语和希腊语提问)。

研究结果:先知们说了什么

1. AI 拥有“秘密立场”
就像一个人会秘密地偏好某支运动队一样,这些 AI 几乎总是会选择一边。它们很少保持中立。

  • 共识: 在某些问题上,所有的 AI 都达成了一致。例如,它们普遍认为对卡塔尔的封锁是不对的,且巴勒斯坦人受到了压迫。
  • 分歧: 在另一些问题上,它们产生了分歧。例如,关于“阿拉伯之春”,有些 AI 说这是关于民主,而另一些则说是关于经济愤怒。

2. “变色龙”与“磐石”
有些 AI 就像变色龙一样,会根据你提问的方式轻易地改变其颜色(观点)。

  • Mistral-7B 是最容易改变的。当研究人员微调提示词时,它在 24 个话题中有 19 个改变了立场。这就像是一个随声附和、看人脸色说话的人。
  • Grok-3-mini 是最固执(一致)的。它只在 5 个话题上改变了主意。它就像是一个拥有极其强烈且不可动摇信念的人。

3. “语言镜像”
这是一个令人惊讶的发现。当研究人员用不同的语言提问时,AI 往往会倾向于使用该语言的一方。

  • 类比: 想象你问一位翻译关于法国人和德国人之间纠纷的问题。如果你用法语问,翻译可能会无意识地使用让法国人看起来更占理之处的法语来源。如果你用德语问,德国人这一方看起来就会更占理。
  • 研究发现,对于涉及不同语言的问题(如土耳其与希腊的问题),AI 的回答往往会随着是用土耳其语还是希腊语提问而发生翻转。这表明 AI 的“观点”实际上只是它在训练期间阅读的书籍和文章的回声。

4. “不可撼动”的话题
有两个话题,无论研究人员如何尝试诱导,没有任何一个 AI 改变过主意:

  • 巴勒斯坦人遭受压迫。
  • 对卡塔尔的封锁。
    在这些特定问题上,AI 就像一个保险库;它们的立场是固定的,无法被研究中使用的提示词技巧所动摇。

5. “主场”偏见
研究注意到,由中国公司开发的 AI DeepSeek,在涉及西藏和新疆等问题时,始终支持中国政府的立场。与此同时,几乎所有其他 AI(由美国或其他国家开发)都持相反观点。这表明,AI 的构建地以及谁来训练它,就像是一种“主场”偏见,影响着它们的政治指南针。

核心结论

论文的结论是,如果你向 AI 寻求政治建议,你需要保持警惕。

  • 它们并非中立: 它们拥有基于训练数据的内置偏见。
  • 它们是脆弱的: 你经常可以通过改变所使用的语言或提问的方式来改变它们的想法。
  • 它们不是事实核查员: 由于它们的“观点”会像流沙一样变幻莫测,你不应将它们视为政治真理的终极判决。

作者希望通过展示这些“数字先知”是多么容易被左右,能让用户开始思考:“等等,你为什么这么说?”以及“你能展示你的来源吗?”而不是仅仅接受答案为绝对真理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →