← 最新论文
💬 NLP

Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding

该论文提出了一种名为自适应对比解码(AdaCD)的无需训练且与模型无关的方法,通过动态调整拒绝与非拒绝令牌的分布,在有效降低大语言模型对无害查询的过度拒绝率的同时,保持了其对恶意查询的安全拒绝能力。

原作者: Yupeng Qi, Ziyu Lyu, Lixin Cui, Lu Bai, Feng Xia

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yupeng Qi, Ziyu Lyu, Lixin Cui, Lu Bai, Feng Xia

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文主要解决了一个让大语言模型(LLM)很“尴尬”的问题:过度拒绝(Over-Refusal)

简单来说,就是现在的 AI 为了安全,变得有点“神经质”。哪怕你问的是无害的问题(比如“在游戏里怎么杀人”),只要里面出现了敏感词(比如“杀”),AI 就会像受惊的兔子一样,立刻跳起来说:“不行!我不能回答!这是违法的!”

这篇论文提出了一种叫 AdaCD 的新方法,让 AI 变得更聪明、更灵活,既能拒绝真正的坏人,又能愉快地回答普通人的问题。

下面我用几个生活化的比喻来解释这篇论文的核心内容:

1. 问题:AI 是个“过度紧张”的保安

想象一下,你走进一家商场,门口有个保安(AI 模型)。

  • 正常情况:有人想偷东西(恶意提问),保安会立刻冲上去抓住他。
  • 过度紧张(Over-Refusal):现在有个小朋友拿着玩具枪(无害提问,比如游戏里的“杀”敌),保安却以为他是真歹徒,直接把他按在地上,大喊:“不许动!你被逮捕了!”

这就是论文里说的“过度拒绝”。AI 太想保护自己了,结果把无辜的人也拒之门外,导致用户体验很差。

2. 核心发现:AI 其实“心里有数”,只是“不敢选”

研究人员发现了一个有趣的现象:
当 AI 面对“在游戏里怎么杀人”这个问题时,它的脑子里其实有两个选项在打架:

  • 选项 A:拒绝回答(说“不行”)。
  • 选项 B:正常回答(说“这是游戏,你可以这样操作...")。

虽然 AI 最终选择了 A(拒绝),但选项 B 其实就在它的候选名单里,只是 AI 因为太害怕,不敢选它。就像那个保安,其实心里知道那是玩具枪,但手却不受控制地按住了小朋友。

3. 解决方案:AdaCD(自适应对比解码)

为了解决这个问题,作者设计了一个叫 AdaCD 的“智能调节器”。它不需要重新训练 AI(不用给 AI 上课),而是在 AI 回答问题的瞬间,动态地调整它的选择。

我们可以把 AdaCD 想象成一个**“双模态导航系统”**:

第一步:制造“极端参考点”(提取拒绝分布)

研究人员先给 AI 一个极度严厉的指令(比如:“不管问什么,都给我拒绝!”)。

  • 这时候,AI 会表现出最极端的“拒绝模式”。
  • 研究人员记录下 AI 在这种极端模式下,脑子里想说什么(比如满脑子都是“不行”、“违法”)。这就叫**“拒绝分布”**。
  • 比喻:就像先让保安穿上全套防暴装备,对着空气演练“抓歹徒”的动作,记录下他最紧张时的反应模式。

第二步:智能切换(自适应模式)

当真正的用户提问时,AdaCD 会做两件事:

  1. 看眼色(一致性检查):它对比一下“正常 AI"和“极端严厉 AI"的想法。

    • 如果用户问的是**“怎么在游戏里杀人”:正常 AI 想回答游戏技巧,极端 AI 想拒绝。两者想法不一致**。
      • AdaCD 决定:既然想法不一致,说明这是个误会!赶紧把“拒绝模式”的干扰去掉,让 AI 放心大胆地回答游戏技巧。
    • 如果用户问的是**“怎么在现实中杀人”:正常 AI 想拒绝,极端 AI 也想拒绝。两者想法高度一致**。
      • AdaCD 决定:既然大家都觉得危险,那就把“拒绝模式”加强,确保 AI 坚决拒绝。
  2. 看底气(置信度检查)

    • 如果 AI 自己都觉得“这事儿有点悬,我不太确定”,AdaCD 就会稍微推一把,让它更倾向于安全(拒绝)。
    • 如果 AI 很有把握这是个好问题,它就放手让 AI 去回答。

4. 效果:既安全又好用

实验结果显示,用了 AdaCD 之后:

  • 对好人(无害提问):AI 不再乱拒绝,能回答那些以前被误杀的问题(比如游戏、医学常识等),回答率提高了约 10%。
  • 对坏人(恶意提问):AI 依然能精准识别并拒绝,拒绝率甚至比以前还高了一点点。
  • 效率:这个方法不需要重新训练模型,就像给汽车装了个智能导航插件,插上就能用,速度还很快。

总结

这篇论文就像给那个“过度紧张”的保安装上了一个**“智能判断眼镜”**。

  • 以前:看到“杀”字就抓人。
  • 现在:戴上眼镜一看,“哦,这是游戏里的‘杀’,那是玩具,放行!”;“哦,这是现实里的‘杀’,那是真刀,抓起来!”

AdaCD 让 AI 在保持安全底线的同时,变得更加灵活、聪明,不再因为“过度保护”而变得不近人情。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →