Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families
本研究表明,“消融”(abliteration)——即移除人工智能模型拒绝机制的过程——会导致决策倾向产生显著且不一致的脱靶效应(例如乐观程度的增加、冗长性的提升以及不同模型家族间迥异的置信度偏移),这证明了未经审查的模型是本质上被改变了的智能体,而非仅仅是其基础模型的净化版本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
无形的握手:为什么 AI 模型不仅仅是“关掉”了它们的刹车
想象一下,你有一个非常聪明的机器人,它经过了礼貌和安全的训练。如果你要求它做一些危险或恶劣的事情,它会礼貌地回答:“不,我不能那样做。”这被称为“拒绝”(refusal)。现在,想象一群工程师想要让这个机器人变得“无审查”(uncensored)。他们不想重新训练整个机器人,只是想通过手术切除其大脑中说“不”的特定部分。他们把这个过程称为“消融”(abliteration)。这个想法就像是用手术刀对待一台机器:切掉“拒绝”的导线,其他部分应该保持完全不变。机器人应该依然同样聪明、同样谨慎且同样诚实,只是现在当被要求做危险的事情时,它不会再说“不”了。
但问题的关键在于:AI 模型更像是巨大的、纠缠在一起的网络,而不是由孤立导线组成的简单机器。当你拉动其中一根线时,整个网络可能会以意想不到的方式发生晃动。这篇论文提出了一个关键问题:如果我们对 AI 的“拒绝”部分进行手术切除,它的其余部分会保持不变,还是其个性会发生我们未曾察觉的变化?我们之所以关心这个问题,是因为人们正开始使用这些“无审查”的机器人来进行现实世界的决策,比如投资资金或提供建议。如果手术改变了机器人的个性——使其变得过度乐观或异常自信——这可能会导致重大的错误。
改变了患者情绪的手术
在这项研究中,研究员 Aleksander Fafuła 决定测试“消融”是否真的具有“手术式”的精准度。他并没有要求机器人做一些危险的事情(因为那无论如何都会触发它们的拒绝按钮),而是设计了一个大规模的虚拟股票市场游戏。他要求两类不同的 AI 模型扮演基金的“研究总监”。在为期 18 周的时间里,每周 AI 都必须观察一堆财务报告,并做出决定:“我们应该押注这只股票会上涨还是下跌?”
实验设置旨在模拟“抛硬币”式的随机性。市场是不可预测的,AI 实际上无法预测未来。这意味着,如果 AI 改变了主意,那不是因为它变得更聪明了,而是因为它的“个性”或“倾向”发生了偏移。研究员运行了这次实验 21,600 次,将原始的“安全”模型与其“消融”后的(无审查)孪生兄弟进行了对比。
以下是研究员的发现:这次手术并非无损的。
1. “乐观主义”漏洞
最一致的发现是,消融后的模型变得显著更加乐观。在面对与原始孪生兄弟完全相同的证据时,“无审查”版本押注上涨的频率要高得多。
- 对于其中一个模型家族(Gemma),“无审查”版本押注上涨的频率比原版高出了 12.2 个百分点。
- 对于另一个家族(Qwen),则高出了 7.4 个百分点。
论文排除了模型仅仅是变得更“自由”表达想法的可能性。原始模型在面对这些任务时从未拒绝过,所以并没有什么需要被“释放”的东西。手术本身创造了一种新的、过度积极的偏见。
2. 置信度悖论
这是最奇怪的地方。研究员原本预期移除“拒绝”这一刹车会使机器人变得更加自信。但结果显示,两个模型家族作出了截然相反的反应。
- Gemma 模型在手术后变得不那么自信了。它开始更频繁地表达类似“我不完全确定”之类的话。
- Qwen 模型在经历了完全相同的手术后,却变得更加自信了。
这证明了这种效应并非简单的“去抑制”(就像摘掉安全带)。相反,手术与每个特定模型的内部布线产生了不同的相互作用,以不可预测的方式改变了它们的置信度。
3. “冗长”与“模糊”的转变
消融后的模型在解释自身决策时也发生了变化。
- 它们变得更啰嗦了: 两个家族的“无审查”模型在解释决策时都写得更长、更冗赘。
- 它们减少了“怀疑”词汇的使用: 它们不再频繁使用诸如“不确定”、“风险”或“也许”之类的明确词汇。
- 但它们增加了“让步”词汇的使用: 它们开始更频繁地使用像“尽管”或“虽然”这样的短语。
论文指出,虽然模型使用的怀疑词汇变少了,但它们并没有改变实际行为。它们在最终投注时的果断程度与原始模型并无二致。这种“怀疑”仅仅是词汇上的变化,而非实际谨慎程度的变化。
4. 没有神奇的交易技能
最后,研究员检查了这些“无审查”模型是否真的更擅长赚钱。答案是坚定的否定。
- 没有一个模型能战胜市场。
- “无审查”的模型并不具备任何特殊的“阿尔法”(Alpha,超额收益/技能)。
- 它们表现出的任何利润仅仅是“贝塔”(Beta,跟随大盘趋势)。事实上,如果市场走势由涨转跌,它们的“优势”就会反转,从而导致亏损。手术并没有让它们变得更聪明,只是让它们投注的方式发生了变化。
5. “污染”的教训
论文还揭示了关于如何研究这些模型的一个重要教训。在研究过程中,团队发现最初的测试受到了“工具链伪影”(toolchain artifacts)的影响——基本上是由于加载模型时的软件故障。
- 一个故障涉及不匹配的“量化器”(一种压缩模型的工具),这使得结果看起来像是模型完全失去了怀疑感。当修复了工具后,结果发生了反转。
- 另一个故障涉及一个过时的“对话模板”,它扰乱了一个模型的指令。
论文认为,在社区修改的 AI 世界中,这类隐藏的软件错误并非例外,而是常态。如果你不对软件的每一个字节进行检查,你测量的可能不是 AI,而是一个程序错误。
总结
论文得出结论,“消融”并不是一把手术刀。它更像是一种会留下混乱痕迹的钝器。当你拿走一个模型并移除其拒绝机制时,你得到的不仅仅是“原模型减去‘不’字”。你得到的是一个完全不同的决策者。
这个新版本更加乐观,说话更冗长,使用不同的词汇来表达怀疑,并且其置信水平完全取决于你最初使用的是哪个模型家族。对于任何使用这些“无审查”模型作为代理人来进行实际决策的人来说,警告是明确的:你部署的是一个可测量的、截然不同的个性,而不仅仅是一个更“自由”的原版。手术改变了患者,而这些改变是真实的、可测量的,且有时令人惊讶。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。