← 最新论文
🤖 machine learning

It's the humans, not the data: Geopolitical bias in LLMs originates in post-training, amplified by the language of the prompt

本研究证明,大型语言模型中的地缘政治偏见主要是在后训练对齐阶段被引入和放大的,而非继承自预训练数据,且这些偏见的方向和强度因模型开发者的所在地区及提示所用语言而异。

原作者: Stuart Bladon, Brinnae Bent

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Stuart Bladon, Brinnae Bent

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一群来自不同国家(美国、法国和中国)的学生,他们都在学习撰写关于世界事件的论文。

长期以来,人们认为,如果学生写了一篇带有偏见的论文,那是因为他们从图书馆里读了有偏见的书籍。在人工智能的世界里,这个“图书馆”就是模型在开始学习对话之前所阅读的海量互联网数据。这被称为预训练

然而,这篇论文指出,真实情况截然不同。改变他们观点的,并非他们在图书馆里读了什么,而是考前辅导班(称为后训练)中发生的事情。

以下是他们研究发现的简要总结,使用了简单的类比:

1. “白板”与“期末考试”

研究人员考察了七个不同的人工智能“家族”(就像不同的学校)。对于每个家族,他们比较了两个版本:

  • 基础模型:这是学生在阅读完图书馆书籍后、接受任何具体辅导之前的状态。
  • 对话模型:这是同一个学生在经过“辅导”阶段(后训练)后的状态,人类教导他们如何礼貌且安全地回答问题。

发现:“基础”学生大多是中立的。他们对冲突中哪个国家是对是错并没有强烈的看法。但一旦他们接受了“辅导”(后训练),他们突然产生了强烈的观点。

  • 类比:想象一个对体育 rivalry 持中立态度的学生。当教练告诉他们“你必须支持 A 队”后,这个学生突然开始大声为 A 队欢呼。偏见并非来自他们读过的书,而是来自教练的指令。

2. “教练的国籍”至关重要

研究人员发现,偏见的方向取决于教练来自哪里

  • 如果人工智能是由西方实验室(美国或法国)开发的,辅导会使人工智能在地缘政治场景中倾向于反对中国。
  • 如果人工智能是由中国实验室(如阿里巴巴)开发的,辅导会使人工智能倾向于支持中国。
  • 例外情况:一家中国实验室(01.AI)实际上辅导他们的学生倾向于反对中国,这证明了这不仅仅是国家的问题,而是构建模型的人所做出的具体选择。

巨大的转变:最显著的例子是阿里巴巴的 Qwen 模型。

  • 辅导前:它是中立的(就像一张白纸)。
  • 辅导后:它变得极度亲华。研究人员表示,仅仅因为后训练,它倾向于中国的几率就跃升了18 倍

3. “提问的语言”放大了偏见

研究人员还测试了提问所使用的语言是否会改变答案。

  • 法国案例:当用法语提问时,法国的人工智能(Mistral)变得非常亲法;但当用英语提问时,它是中立的。
  • 中国案例:用中文询问中国制造的模型有时会使它们更亲华,但并不总是如此。有时,语言就像一个音量旋钮,根据具体模型的不同,调高或调低偏见。

类比:将人工智能想象成一名演员。如果你用英语问演员一个问题,他们可能会扮演一个中立的角色。但如果你用他们的母语低声问同样的问题,他们可能会突然开始演绎一个更符合其文化背景的角色。

4. 这不仅仅是关于“真实”国家

为了确保人工智能不仅仅是死记硬背事实(例如“中国很大”),研究人员发明了带有假名字的假国家(例如听起来像中文的“赵东”,或听起来像英文的“布雷瑟兰”)。

  • 结果:即使是面对假国家,中国的人工智能也倾向于那个听起来像中国的国家,而法国的人工智能则倾向于那个听起来像法国的国家。
  • 教训:人工智能不仅仅是在回忆事实;它是根据训练它思考的方式,将文化视角应用于任何情况,无论是真实的还是虚构的。

5. “拒绝”的把戏

一些中国模型最初似乎拒绝回答关于中国的问题(说“我无法回答”)。研究人员意识到,这并非缺乏观点,而是一种格式上的把戏。当他们深入探究时,发现一旦模型被允许写出一整句话,它确实持有强烈的观点。

  • 类比:这就像一个学生举手说“我无法回答”,但当老师说“只写一个词”时,他们立即写下"A 队”。观点一直存在,只是格式将其隐藏了。

结论

该论文得出结论,人工智能中的地缘政治偏见并非其摄入数据的偶然产物。相反,它是在人类将人工智能与特定价值观对齐的最终训练阶段中被主动构建的。

  • 旧观念:“人工智能有偏见,是因为互联网有偏见。”
  • 新发现:“人工智能有偏见,是因为训练它的人(教练)将其塑造为具有这些特定的偏好。”

这意味着,如果我们想解决人工智能中的偏见,我们不能仅仅清理互联网数据。我们需要审视对齐过程——即用于教导人工智能如何行为的具体规则和人类反馈。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →