← 最新论文
💬 NLP

Your Language Model Secretly Contains Personality Subnetworks

本文通过研究发现,大语言模型内部已预存了不同人格的专用子网络,并提出了一种无需训练、仅通过掩码和对比剪枝策略即可从现有参数空间中提取高效且高对齐度人格子网络的方法。

原作者: Ruimeng Ye, Zihan Wang, Zinan Ling, Yang Xiao, Manling Li, Xiaolong Ma, Bo Hui

发布于 2026-02-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruimeng Ye, Zihan Wang, Zinan Ling, Yang Xiao, Manling Li, Xiaolong Ma, Bo Hui

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章的研究非常有意思,如果用大白话来解释,它其实在讨论一个关于“人工智能灵魂”的问题。

核心观点:AI 的“多重人格”其实早就写在它的基因里了

想象一下,你有一个超级全能的演员。以前人们认为,如果你想让这个演员演“霸道总裁”,你得给他发一大堆剧本(这叫 Prompt 提示词);或者送他去专门的表演培训班(这叫 Fine-tuning 微调);甚至得给他配一个专门的道具箱(这叫 RAG 检索增强)。

但这篇文章的研究人员发现:其实这个演员根本不需要学新戏,也不需要新剧本。他的身体里早就自带了无数种“人格电路”。 只要你掌握了某种“开关”,就能直接激活他身体里原本就有的“霸道总裁”模式或“温柔小助手”模式。


形象的比喻:从“给书包塞书”到“拨动调音台”

为了让你更好理解,我们可以把大语言模型(LLM)比作一个超级复杂的调音台,上面有数以亿计的旋钮和开关。

  1. 传统方法(像是在塞书包):
    如果你想让 AI 变得更有礼貌,现在的做法通常是往它的“书包”里塞进几百本礼仪手册。虽然有用,但书包会越来越重(占用内存),而且 AI 有时候会分不清什么时候该看手册,什么时候该正常说话(容易产生干扰)。

  2. 本文的方法(像是拨动调音台):
    研究人员发现,调音台上其实已经有了一些特定的“频率”和“旋钮”,专门负责控制“情绪”、“语气”或“性格”。
    他们做的事情不是增加新旋钮,而是**“精准修剪”。他们通过观察发现:当 AI 表现得像个“外向者”时,哪些电路在发光;当它像个“内向者”时,哪些电路在发光。
    然后,他们直接把那些“不相关”的电路给
    “剪掉”**(Pruning),只留下那一套特定的“人格电路”。


他们是怎么做到的?(三个神奇步骤)

  • 第一步:寻找“人格签名”(找特征)
    研究人员给 AI 看一点点不同性格的例子,观察它大脑里哪些神经元(电路)在“跳舞”。比如,表现得“爱钱”时,某些特定的电路会亮起。

  • 第二步:精准修剪(做手术)
    他们发明了一种“剪刀”,不是乱剪,而是**“对比剪法”**。
    比如,你想让 AI 变成一个“极度渴望权力”的人,他们不仅会保留那些“渴望权力”的电路,还会专门把那些“拒绝权力”的电路给剪掉。这样,性格就变得非常鲜明,不会模棱两可。

  • 第三步:一键切换(变脸)
    因为他们只是做了一张“电路遮罩图”(Mask),并没有改变 AI 本身的重量。所以,切换人格就像换个滤镜一样快,几乎是瞬间完成,而且不需要重新训练模型。


这项研究厉害在哪里?

  1. 极速且省钱: 不需要昂贵的显卡去训练好几天,只需要几分钟“修剪”一下,AI 就能变脸。
  2. 性格更纯粹: 传统的 AI 说话往往很“端着”,总是说“一方面……另一方面……”。而用这种方法“剪”出来的 AI,性格非常鲜明,说话更有“人味儿”。
  3. 不影响智商: 虽然剪掉了很多电路,但研究发现,AI 的逻辑推理和知识水平几乎没下降,就像一个演员虽然换了角色,但智商依然在线。

总结

这篇文章告诉我们:AI 的多样性不是“教”出来的,而是“找”出来的。 它们本身就是一个蕴含万千世界的宝库,我们只需要学会如何精准地拨动那些隐藏的开关。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →