← 最新论文
🤖 machine learning

Modular Pretraining Enables Access Control

本文介绍了梯度路由辅助模块(GRAM),这是一种具有成本效益的预训练方法,通过在保持通用性能的同时,通过模块消融选择性地禁用特定能力,从而实现对双用途人工智能的可扩展访问控制,且其抗恢复能力优于事后遗忘。

原作者: Ethan Roland, Murat Cubuktepe, Erick Martinez, Stijn Servaes, Keenan Pepper, Mike Vaiana, Diogo Schwerz de Lucena, Judd Rosenblatt, Addie Foote, Cem Anil, Alex Cloud

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Ethan Roland, Murat Cubuktepe, Erick Martinez, Stijn Servaes, Keenan Pepper, Mike Vaiana, Diogo Schwerz de Lucena, Judd Rosenblatt, Addie Foote, Cem Anil, Alex Cloud

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人厨师。这位厨师非常了不起,从救命的疫苗到危险的生物武器,他样样精通。这是一个“双重用途”的困境:同样的知识既可以治愈疾病,也可以制造瘟疫。如果你把这位厨师交给医院,你会得到疗法;但如果你把它交给恶棍,就会带来麻烦。

通常情况下,阻止恶棍的唯一方法是直接解雇这位厨师,但这同时也意味着医院失去了疗法。或者,你可以尝试雇佣五位不同的厨师,每位厨师只接受一种特定技能的训练(一位懂疫苗,一位懂网络安全,一位懂核物理等等)。但雇佣并培训五位独立的厨师既昂贵又缓慢。

于是有了 GRAM(梯度路由辅助模块)。把 GRAM 想象成不仅仅是雇佣五位厨师,而是雇佣了一位拥有神奇模块化围裙的一位大师级厨师。

神奇的围裙

在普通的 AI 中,所有的知识都混合在一起,像一锅巨大的浓汤。如果你想移除“生物武器”这个食谱,你必须搅拌整锅汤,这可能会不小心弄坏“疫苗”的食谱。

GRAM 改变了厨房的布局。它给了厨师一件主围裙(即“核心”),处理所有基础工作,比如切洋葱和烧开水。但它还在围裙上增加了几个较小的、可拆卸的口袋。

  • 一个口袋用于病毒学
  • 一个口袋用于网络安全
  • 一个口袋用于核物理
  • 一个口袋用于特殊代码

这就是魔术所在:当厨师在学习时,厨房只会打开当前课程所需的特定口袋。如果课程是关于病毒的,“病毒学口袋”就会获得所有的关注和更新。“核物理口袋”则会保持拉链紧闭,在当天的课程中不学习任何东西。

结果:一位厨师,多种人格

因为知识存储在这些独立的口袋中,你可以通过在开工前拉开或拉上特定的口袋来控制厨师知道什么。

  • 对于医院: 你让“疫苗”口袋保持拉链开启,而将“武器”口袋拉链紧闭。此时,厨师是治愈方面的天才,但他完全不知道如何制造武器。
  • 对于实验室: 你打开“网络安全”口袋,并关闭其他口袋。

研究表明,这个经过这种模块化围裙训练的单一厨师,其表现几乎与你从头开始训练五位独立厨师的效果几乎一样。事实上,当他们在一个 50 亿参数的模型(一个巨大的大脑)上进行测试时,这个单一的模块化厨师在保持“好技能”和忘记“坏技能”方面,都与那种昂贵的方法一样出色。

为什么这比其他技巧更好

研究人员尝试了其他方法来解决这个问题,并排除了它们:

  • “事后遗忘”(Post-Hoc Unlearning)技巧: 这就像是在厨师已经学会之后,试图抹除他脑中的记忆。论文发现这种方法很弱。如果你试图在以后“遗忘”武器食谱,厨师只需经过一点点练习(微调)就能轻易记起它。这就像试图通过倒着哼唱一首歌来忘记它一样,是记不住的。
  • “模型分支”(Model Branching)技巧: 这就像先让厨师学习基础知识,然后再送他们去五所不同的学校学习特定技能。虽然这种方法效果尚可,但论文发现 GRAM 的“模块化围裙”方法在保持技能分离方面表现更好,尤其是在处理一些标签不明确的混乱数据时。

“部分标签”带来的惊喜

这里有一个奇怪但很酷的发现:有时,你并不知道哪些食谱属于哪一类(也许有 50% 的数据是没有标签的)。

  • 如果你尝试训练独立的厨师或使用“分支”法处理无标签数据,他们会因为把一切都视为“基础”知识,而不小心学到了危险的技能。
  • GRAM 厨师却出奇地聪明。即使有一半的标签缺失,模块化口袋仍然能成功地将危险技能隔离。论文指出,这是因为一旦某个口袋开始专业化,无标签的数据就会自然地“漂移”到同一个口袋中,从而保持核心大脑的纯净。

他们有多确定?

作者对他们的数字非常有信心,但也对局限性保持谨慎。

  • 他们在合成故事和涵盖病毒学、网络安全、核物理和专业代码的真实世界数据上进行了测试。
  • 他们将模型规模从 5000 万参数扩展到了 50 亿参数。
  • 在这些实验中,GRAM 始终能匹配“金标准”(训练独立模型)的表现,同时在他们的五种配置下,使用的计算量(训练成本)仅为后者的 1/5
  • 然而,论文也承认他们尚未在绝对最大的“前沿”模型上进行测试,因此虽然这种趋势在 50 亿参数规模下看起来非常好,但他们无法保证在规模更大的水平上是否完全一致。

底线

GRAM 为 AI 开发者提供了一种实现“最小权限”系统的方法。你不需要给每个人整个厨房,只需通过拉开或拉上正确的口袋,就可以为每个用户提供一个特定的、安全的厨师版本。这是一种既能拥有强大的 AI(吃到蛋糕),又能实现安全访问控制(吃到蛋糕)的方法,而无需为每项工作都重新烘焙一个蛋糕。

论文结论认为,这并不是解决所有问题的万灵药(有些技能实在太纠缠不清,难以分离),但它是迈向更安全、更灵活且无需为每个任务构建新模型的一大步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →