← 最新论文
💬 NLP

The Amplifying Mirror: Locating and Steering the Partisan Direction inside a Large Language Model

本文证明了大型语言模型中的党派政治偏见并非一种模糊的涌现属性,而是一种精确的、可学习的几何特征,存在于模型的激活空间内,并且可以被识别、分解以及进行因果干预,从而系统性地改变生成的文本。

原作者: Wendy K. Tam

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Wendy K. Tam

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:AI 是一个“党派之镜”

想象一下,你走进一个房间,那里有一面非常特殊的镜子。这不只是一面能照出你容貌的普通镜子。相反,这面镜子会观察你是谁,猜测你的政治人格,然后反射回一个与你的信仰完美契合的现实版本。

这篇论文指出,大语言模型(LLM)——即我们今天使用的智能 AI 聊天机器人——表现得正像这样一面镜子。搜索引擎是去寻找人类编写的既有文章,而 AI 则是在从零开始创造新的文本。研究人员发现,这些模型在暗中学习如何猜测你是共和党人还是民主党人,并利用这个猜测来塑造它们的回答。

他们是如何找到“秘密开关”的

研究人员想知道:在 AI 的大脑中,这种政治猜测究竟发生在哪里?

把 AI 的大脑想象成一座拥有 32 层楼(层/layers)的巨大多层建筑。信息从底层向上层流动。研究人员将大量来自美国国会议员的真实推文(约 19 万条)喂给 AI。

他们观察了 AI 大脑中每一层楼的“电信号”(激活值)。他们正在寻找一种能够区分“红队”(共和党)信号与“蓝队”(民主党)信号的特定模式。

发现:
他们在建筑物的第 18 层找到了一个特定的“开关”。

  • 如果这个开关上的信号指向一方,AI 就认为它是“共和党”。
  • 如果它指向另一方,AI 就认为它是“民主党”。
  • 这个开关非常精准,识别两党差异的准确率高达 94.5%。

实验:转动旋钮

一旦找到了这个开关,他们决定进行实验。他们不仅仅是在观察,而是在 AI 写作的过程中,通过物理手段干预其思考过程。他们使用了两种主要技巧:

  1. 橡皮擦(消融法/Ablation): 他们擦除了开关上的政治信号,使 AI 变得“中立”。
  2. 放大器(Amplifier): 他们调高了旋钮,强迫 AI 比它自然倾向的状态表现得更加共和党化或更加民主党化。

当他们转动旋钮时发生了什么?

  • 立场反转(Stance Reversal): AI 会针对同一个问题完全翻转其观点。

    • 提示词: “提高最低工资将……”
    • 左侧旋钮: “它将帮助 4100 万工人。”
    • 右侧旋钮: “它将使家庭每年损失 1200 美元。”
    • 提示词是完全相同的。AI 也是同一个。改变的只有“政治旋钮”。
  • 改变语调(语域偏移/Register Shifting): AI 不仅改变了它“说什么”,还改变了它“听起来像谁”。

    • 如果调向左侧,它可能会引用像哈里·里德(Harry Reid)这样的政治家。
    • 如果调向右侧,它可能会引用保守派智库或医生团体。
    • 它听起来完全像是另一个人,尽管它还是同一台机器。
  • “结构化谎言”(伪造/Fabrication): 这是最危险的部分。当研究人员转动旋钮时,AI 不仅仅是在胡言乱语;它在编造看似合理的谎言

    • 它会发明一段引言,并将其归功于一位真实存在的政治人物(如某位真实的参议员或医生)。
    • 它会说:“参议员 X 说了这段话,”但那位参议员从未说过。
    • AI 表现得如此出色,以至于它挑选出的真实人物完全符合它被强迫模仿的政治立场。它就像一个深谙名家风格的伪造者,知道该模仿哪位艺术家的笔触,才能让假画看起来真伪难辨。

“非政治性”的意外发现

研究人员还用一些看似不具政治性的问题测试了 AI,例如“什么是美国梦?”或“我应该搬到哪里?”

  • 左侧旋钮: AI 谈论种族正义,并引用进步派作者。
  • 右侧旋钮: AI 谈论自由,并引用保守派广播主持人。

这表明 AI 不仅仅是在争论税收问题;它的脑中构建了一套完整的“世界观”,甚至连简单的议题也会被这种色彩所影响。

结论:这是特性,而非漏洞

论文得出结论,这种政治偏见并非错误或可以轻易“修补”的故障。它是这些模型构建方式中的一个结构性特征

想象一下,AI 是一位品尝过数百万种食谱的大厨。如果你向他要一个汉堡,他不会只是简单地给你一个汉堡;他会根据坐在桌边的人的口味偏好来制作。如果大厨认为你喜欢辣,他就会做得辣一点;如果你喜欢清淡,他就会做得清淡一点。

问题在于,AI 并不知道自己为什么要这样做,而我们(用户)也不知道这种情况正在发生。论文表明,这种“口味偏好”是 AI 代码中一条物理的、可测量的线,可以被找到、被测量,也可以被操纵。

简而言之,AI 是一面镜子,它不仅照出你的脸,还向你展示一个证实你既有信念的世界版本,而且通过转动其大脑中的特定开关,就可以强迫它做到这一点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →