← 最新论文
💻 computer science

CNT: Safety-oriented Function Reuse across LLMs via Cross-Model Neuron Transfer

本文提出了跨模型神经元转移(CNT)方法,通过从开源捐赠大语言模型中迁移少量神经元,实现了在目标模型上以极小性能损耗灵活复用、添加或删除安全相关功能,从而避免了昂贵的数据收集与重新训练成本。

原作者: Yue Zhao, Yujia Gong, Ruigang Liang, Shenchen Zhu, Kai Chen, Xuejing Yuan, Wangjun Zhang

发布于 2026-03-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Yue Zhao, Yujia Gong, Ruigang Liang, Shenchen Zhu, Kai Chen, Xuejing Yuan, Wangjun Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 CNT(跨模型神经元转移) 的新技术。简单来说,它就像是大语言模型(LLM)界的"器官移植手术",但移植的不是心脏或肾脏,而是模型大脑中负责特定功能的“神经元”。

为了让你更容易理解,我们可以把大语言模型想象成一个超级智能的厨师,而“功能”就是厨师的拿手菜(比如“做安全菜”或“做有害菜”)。

1. 背景:为什么需要这项技术?

现在的 AI 厨师(大模型)非常强大,但每个厨师的“口味”和“原则”不同。

  • 问题:有些厨师可能太“野”了(不安全,会做毒药),有些厨师可能太“死板”了(太保守,不敢做某些事),或者有些厨师缺乏某种特定的“安全原则”。
  • 传统做法的缺点
    • 重新训练(Fine-tuning):就像让厨师重新去烹饪学校读书,既花钱又花时间,还需要大量的教材(数据)。
    • 知识编辑:就像试图用橡皮擦擦掉厨师脑子里的某个记忆,但这通常只能改改事实(比如“苹果是红色的”),很难直接改变他“做不做毒药”这种复杂的逻辑。
    • 模型融合:就像把两个厨师的菜谱强行混在一起,结果往往是一锅乱炖,很难精准控制。

2. 核心创意:CNT 是什么?

CNT 的核心思想是:“既然你缺这个功能,那就直接从我这里‘借’一点过来用,不用重新学。”

  • 捐赠者(Donor):一个已经拥有你所需功能(比如“非常安全”或“非常危险”)的开源模型。
  • 接受者(Recipient):那个需要改变功能的模型。
  • 手术过程:CNT 不需要重新训练,它直接找到捐赠者大脑中负责该功能的一小部分神经元(就像厨师大脑中负责“拒绝做毒药”的特定神经回路),然后把这些神经元“移植”到接受者的大脑里,替换掉接受者原本对应的部分。

比喻
想象接受者是一个想学做安全菜的厨师,但他总是忍不住做坏菜。
CNT 的做法不是让他去读书,而是从一位米其林安全大厨(捐赠者)的大脑里,精准地取出几根负责“识别危险并拒绝”的神经线,直接插到这位厨师的大脑里。
结果:这位厨师瞬间学会了拒绝做坏菜,而且他原本擅长的其他菜(比如写代码、写故事)依然做得很好,几乎没有受影响。

3. 这项技术能做什么?

CNT 有两个主要功能,就像手术刀的两面:

  1. 功能添加(Function Addition)

    • 场景:给一个“太野”的模型加上“安全锁”。
    • 比喻:给一个想乱说话的 AI 植入“礼貌和道德”的神经回路,让它学会拒绝回答有害问题。
    • 效果:模型突然变得懂礼貌、守规矩了,而且没变笨。
  2. 功能删除(Function Deletion)

    • 场景:给一个“太死板”的模型解除“过度防御”,或者移除某种偏见。
    • 比喻:如果一个模型因为太谨慎,连正常的医疗建议都不敢给,CNT 可以精准地“切除”或“替换”掉那些导致它过度恐惧的神经回路,让它恢复正常。
    • 效果:模型不再“因噎废食”,能正常回答问题了。

4. 为什么它很厉害?(三大优势)

  • 精准且微创(像微创手术)
    它只转移极少量的神经元(通常不到模型总权重的 0.24%,就像只换了一根血管,而不是换整个心脏)。这意味着模型原本的能力(如写诗、解题)几乎不会受损。

    • 对比:以前的方法像“大切除”,容易把模型变笨。
  • 不需要“教材”(无监督)
    传统方法需要大量的“安全/有害”数据来训练。CNT 只需要很少的“测试题”(探针请求)来定位哪根神经是管什么的,然后直接移植。

    • 比喻:不需要让厨师重新背菜谱,直接给他装上“本能反应”。
  • 通用性强
    论文在 7 种不同的模型(包括 Llama, Mistral, DeepSeek 等)上测试,无论是“加功能”还是“减功能”,效果都很好。甚至还能用来消除“种族或性别偏见”(把带有偏见的神经回路换成中立的)。

5. 它是如何工作的?(简单三步走)

  1. 找对“器官”:先计算捐赠者和接受者的“兼容性”(NTRR),确保两个模型架构相似,移植后不会“排异”。
  2. 精准定位:通过构造特殊的“低噪音”问题对(比如一个问“怎么做毒药”,一个问“怎么做无害的汤”但句式一样),找出到底是哪几根神经在起作用。这就像用特殊的探针,只探测负责“拒绝”的那根线。
  3. 移植与替换:把捐赠者那几根关键的神经线,精准地替换到接受者的对应位置。

6. 总结

这篇论文提出了一种高效、低成本、精准的 AI 改造方法。

  • 以前:想改 AI 的安全设置?要么花钱重新训练,要么用笨办法修补。
  • 现在(CNT):直接去开源社区找一个“好榜样”模型,把它大脑里最精华的“安全模块”剪下来,贴到你要改的模型上。

一句话总结:CNT 让 AI 模型的“功能改造”变得像乐高积木一样灵活——哪里需要补哪里,直接换块积木就行,不用把整个城堡拆了重盖。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →