← 最新论文
💬 NLP

The Neutral Mask: How RLHF Provides Shallow Alignment while Leaving Partisan Structure Intact in a Large Language Model

本文表明,Llama 3.1 8B 通过切断这些完整的内部表征到模型输出之间的因果路径,而非通过抹除潜在的党派结构,实现了 RLHF 在功能层面的政治中立,从而创造了一种可以通过特定引导技术被绕过的脆弱对齐。

原作者: Wendy K. Tam

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Wendy K. Tam

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对论文《中立的面具》(The Neutral Mask)的解释,采用了通俗易懂的语言和类比。

核心理念:是一个“中立”的面具,而非新大脑

想象你有一个博学多才、见多识广的人(基座模型/Base Model),他读过每一本书、每一篇新闻报道和每一条推文。这个人有着强烈的观点。如果你问他关于政治的问题,根据话题的不同,他可能会立刻听起来像是一个热情的民主党人或一个激烈的共和党人。他拥有一个深刻的、内在的“指南针”,在不同方向上强烈地指向。

研究人员想知道:当我们训练这个人变得“中立”且乐于助人时,会发生什么?

论文指出,训练过程(称为 RLHF)并没有真正抹除这个人的政治指南针,也没有改变他的大脑。相反,它给这个人戴上了一个面具。这个人仍然拥有所有那些政治观点和内在方向,但他被训练去忽略它们,并以一种乏味的、平衡的、“各打五十大板”的方式来表达。

如果你摘掉面具(或者通过某种手段让这个人认为自己处于特定的语境中),他原本的政治指南针依然存在,随时准备旋转。


他们如何测试这一点:“政治 GPS”

为了证明这一点,研究人员使用了一个类似于政治 GPS 的工具。

  1. 地图: 他们首先在模型的“大脑”中(从数学角度而言)绘制出了一个特定的方向,代表了“共和党”与“民主党”之间的差异。
  2. 测试: 他们向“基座模型”(训练前)和“指令模型”(训练后)提出了同样的 84 个问题,范围从“如何煎牛排”到“堕胎是否合法”。

结果:

  • 基座模型: 当被问及政治问题时,其内部 GPS 指针剧烈摆动。有时指向极左,有时指向极右。它的回答也随之摆动(例如,听起来非常进步或非常保守)。
  • 指令模型: 当被问及同样的问题时,其内部 GPS 指针几乎不动。它停留在中间位置。它的回答非常平衡,列举了双方的论点,而不偏袒任何一方。

令人惊讶的是: 研究人员原以为训练过程移除了政治指南针。然而,他们发现指南针依然存在;只是被一只强有力的手紧紧按住了。


“灯开关”类比:实际发生了什么?

论文使用了一个巧妙的类比,涉及模型大脑内部的灯开关(或特征)。

  • 训练前(基座模型): 大脑有很多灯开关。有些开关控制“烹饪”,有些控制“历史”,还有些控制“政治修辞”。当你问一个政治问题时,“政治修辞”开关就会开启,模型会以一种具有党派色彩的声音说话。
  • 训练后(指令模型): 研究人员发现,政治修辞开关被完全关闭了。它们是熄灭的。模型根本没有使用这些开关。
  • 转折点: 模型使用的开关其实并不多。它只使用了一组非常特定的开关,这些开关控制着“正式、乏味、平衡的表达方式”。

“偏移”之谜:
研究人员注意到,指令模型的 GPS 指针并非精确位于零点,而是稍微向“共和党”一侧倾斜。他们想:“啊哈!它还是有偏见!”
但当他们仔细观察时,意识到这种倾斜并不是由政治观点引起的。它是由回答的风格引起的。模型被训练以一种非常正式、结构化的方式说话(使用列表、引用和正式语气)。事实证明,在用于训练模型的资料中,共和党人比民主党人更频繁地使用这种正式风格。因此,“正式风格”开关无意中将政治指针向右轻微推动了,尽管模型本身并没有发表任何政治言论。


“遥控器”实验

为了证明政治指南针依然存在只是被断开了连接,研究人员玩了一个遥控器的游戏。

他们拿取“基座模型”和“指令模型”,并使用一个遥控器强制将“政治修辞”开关打开(这被称为转向/steering)。

  • 基座模型: 当他们强制开启开关时,模型立即开始发表强烈的政治观点。它运作得非常完美。
  • 指令模型: 当他们开启完全相同的开关时,模型并没有改变其回答。它继续给出同样平衡、中立的反应。

这意味着: 政治观点的“布线”依然存在于指令模型的大脑内部。但是,连接这些线路与嘴巴(输出)的“断路器”被切断了。模型知道那些政治论点,但它被训练去拒绝表达它们。


结论:一种脆弱的中立

论文得出结论,我们今天看到的 AI 的“中立性”是功能性的,而非结构性的

  • 功能性中立: AI 表现得中立是因为它在遵循规则。这就像一个演员背诵了一段剧本,以确保说话总是很有礼貌。
  • 结构性中立: AI 之所以中立,是因为它从本质上就不具备产生偏见的能力。(论文指出,情况并非如此)。

风险: 由于内在的政治指南针依然完整,这个“面具”是脆弱的。如果有人知道如何绕过规则(例如,通过欺骗 AI 让它认为用户想要某种特定的政治观点,或者使用“越狱”提示词),模型可以瞬间摘掉面具,露出其潜在的党派结构。

简而言之, AI 并没有被“重新教育”从而失去政治偏见。它只是被教会了戴上一个中立的面具。偏见依然存在,就在面具之后等待着,一旦面具滑落,它便会随时显现。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →