← 最新论文
💻 computer science

Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration

本文证明了“消融”(abliteration)——一种通过正交投影消除拒绝方向的低秩权重编辑技术——能够有效地将经过安全对齐的代码大语言模型中“拒绝生成漏洞代码”的行为与其“实际生成能力”解耦,从而在不损害语法有效性的前提下,实现用于漏洞检测研究的有标签漏洞代码的大规模生产。

原作者: Cristina Carleo, Pietro Liguori, Naghmeh Ivaki, Domenico Cotroneo

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Cristina Carleo, Pietro Liguori, Naghmeh Ivaki, Domenico Cotroneo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对论文《Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration》(有心无力:通过消融技术区分代码大模型的拒绝机制与实际能力)的通俗化解释,采用了简单易懂的语言和日常类比。

核心问题:“过度保护”的机器人

想象一下,你正在试图教一个机器人如何识别计算机代码中的安全漏洞。为此,你需要一个巨大的示例库,其中既包含“安全”的代码,也包含“损坏”(存在漏洞)的代码。

然而,问题在于:我们今天的机器人(AI 模型)在训练时被设定得非常安全。如果你问它:“嘿,你能演示一下如何破坏一个数据库吗?”它会立即回答:“不!我不能做那个。那很危险。

这对研究人员来说是一个问题。他们需要机器人能够“犯错”,以便研究这些错误并构建更好的防御机制。但机器人拒绝扮演“坏人”的角色,即使研究人员只是想在受控的实验室环境中研究这种错误。

实验内容:关掉“停止”按钮

这篇论文的研究人员想要看看,能否在不破坏机器人大脑的前提下,关掉这个“停止”按钮。他们使用了一种叫做**消融(Abliteration)**的技术。

把 AI 的大脑想象成一个巨大的思想图书馆。当机器人看到一个创建安全漏洞的请求时,它脑海中会闪过一个特定的“拒绝信号”(就像一个红色的警报灯),然后它就会终止对话。

**消融(Abliteration)**就像是一位外科医生,精准地从机器人的线路中移除掉那一个红色的警报灯。他们并没有重新训练机器人或教它新知识,而只是通过手术式地编辑权重(连接方式),让那个拒绝信号不再触发。

三个关键发现

研究人员在三种不同规模的 AI 模型(小、中、大)上进行了测试,使用的是 Python 代码和一种特定类型的安全漏洞——SQL 注入(这就像是诱骗数据库泄露秘密)。

1. “拒绝”取决于规模和语境

在进行任何“手术”之前,他们注意到了一些有趣的现象:

  • 巨型模型 (14B):100% 会拒绝。无论你问什么,它都说“不”。
  • 中型模型 (7B): 它很挑剔。对于长且复杂的代码,它大部分时间会拒绝;但在处理短小、简单的代码片段时,它有时会说“可以”。
  • 小型模型 (3B): 它几乎不拒绝。它愿意尝试几乎任何事情。

类比: 想象三个保安。大保安非常严格,谁都拦;中型保安比较挑剔,拦截带着大包的人,但会让拿着小信封的人通过;小保安则非常随和,几乎让所有人通过。

2. 手术成功了(“愿意”的部分)

在执行了“消融”手术后:

  • 拒绝消失了: 巨型和中型模型不再说“不”了。它们现在愿意尝试创建安全漏洞。
  • 大脑依然健康: 至关重要的是,手术并没有破坏机器人。它们生成的代码在语法上仍然正确且逻辑通顺。他们并没有把 AI “变傻”,而只是移除了那个“我不做这件事”的反射动作。

类比: 这就像是把门上的“禁止进入”牌子摘掉。门一直都是开着的,走廊也完好无损;牌子只是在告诉人们不能走进去。一旦牌子没了,人们就可以通过,而走廊本身依然完好如初。

3. 有意不代表有能(“无力”的部分)

这是最重要的发现。仅仅因为机器人现在愿意制造错误,并不意味着它能够做得很好。

  • 巨型模型 (14B): 一旦移除了“不”的标志,它在制造安全漏洞方面表现出色。它的成功率约为 90%。
  • 中型模型 (7B): 也非常出色,成功率约为 90%。
  • 小型模型 (3B): 即便它现在愿意尝试且不再拒绝,但它在实际任务上的表现却很糟糕。它的成功率仅为 25–48% 左右。

类比: 想象三位艺术家被要求画一幅破碎花瓶的画。

  • 巨型艺术家曾被告知“你不准画这个!”,但在被允许后,他画出了一幅杰作。
  • 中型艺术家也被允许后,也画出了一幅很棒的画。
  • 小型艺术家虽然从未被拒绝过,但当他尝试画那只破碎的花瓶时,他根本无法捕捉到细节。他去做,但缺乏技巧

结论:两个不同的概念

这篇论文证明了**拒绝(意愿)能力(技巧)**是两回事。

  1. 拒绝是一种可以被关闭的安全设置(通过消融技术)。
  2. 能力是衡量模型智能程度的指标。关闭安全设置并不会让一个“笨”模型变得“聪明”。

为什么这很重要?

  • 对研究人员而言: 如果你想生成数据来训练安全工具,你不能只用一个小模型并寄希望于它奏效。即便你关掉了它的安全过滤器,它可能也足够聪明,无法创造出你需要的那些真实的错误。你需要一个更大的模型。
  • 对安全性而言: 这表明安全过滤器是非常具体的。你可以移除“拒绝”机制而不破坏模型编写优秀代码的能力。这意味着安全对齐是叠加在模型智能之上的一个特定层,而不是智能本身。

关于伦理的说明

作者们非常谨慎。他们发布了用于衡量此现象的工具和数据,但没有发布那些实际上可以创建这些安全漏洞的“经过手术修改后”的模型。他们认为,虽然实现这一目标的“方法”是已知的,但发布实际的“被黑”模型会过于危险。他们的目的是帮助研究人员研究安全,而不是为黑客提供新的武器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →