← 最新论文
🤖 machine learning

Mark, Don't Erase: Token Inoculation for Dual-Use Knowledge in LLMs

该论文提出了“标记免疫”(Token Inoculation)方法,该方法通过在预训练阶段将有害内容与一个特殊标记进行绑定,并在微调阶段教导模型根据该标记的存在与否来调节其响应,从而在保留大语言模型中双重用途知识的同时实现精确的安全控制,进而实现了比传统的遗忘或拒绝技术更优越的安全与效用权衡。

原作者: Seunghyun Lee, Dongyoon Han, Sangdoo Yun

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Seunghyun Lee, Dongyoon Han, Sangdoo Yun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一座巨大的、超级聪明的图书馆,它知道世界上发生的一切。它有点像一本神奇的百科全书,可以写故事、解数学题,还能解释宇宙是如何运作的。但有一个代价:这座图书馆也知道一些非常危险的秘密,比如如何制造炸弹或制造病毒。如果有人询问这些秘密,图书馆需要足够聪明,能够说出“不,我不能告诉你那个”,而不至于忘记如何解释那些安全的内容,比如疫苗是如何工作的,或者如何编写一个计算机程序。

长期以来,科学家们认为保持这座图书馆安全的唯一方法是撕掉那些危险的页面,或者在整本书上贴一个巨大的“禁止阅读”标志。但这有点笨拙。如果你撕掉了关于病毒的页面,你也失去了教导人们如何治愈它们的能力。如果你在整本书上贴个告示,图书馆可能会变得困惑,甚至拒绝讨论任何科学话题,哪怕是那些安全的科学。这就像试图阻止一位厨师做出有毒的蘑菇汤,却通过禁止他接触任何菜刀来实现——结果,他连美味的沙拉也做不出来了。

这篇题为《标记,而非擦除》(Mark, Don't Erase)的论文提出了一种更聪明的解决方案。研究人员建议不要删除危险知识,也不要关闭整个图书馆,而是给图书馆一把特殊的“魔法钥匙”。他们称这种方法为令牌免疫(Token Inoculation)。把这想象成训练一只看门狗。你不希望这只狗咬每个人经过的人(那太具攻击性了),也不希望截肢它的牙齿(那会破坏它进食的能力)。相反,你要教这只狗:“如果你看到了红项圈,你可以咬;如果你没看到红项圈,你必须坐下并待着。”

在这项研究中,“红项圈”是一个特殊的令牌(文本流中的一个特定符号),叫做 <|ino|>。研究人员分两步训练了人工智能。首先,他们向人工智能展示了大量的危险信息,但总是将这些信息与这个特殊令牌配对,这样人工智能就学会了将危险事实与该令牌联系起来。第二,他们教会了人工智能一个简单的规则:“如果令牌存在,你可以回答危险问题。如果令牌缺失,你必须拒绝。”

结果非常令人印象深刻。当他们在设计用于处理生物安全问题的模型上进行测试时,他们发现如果没有这个令牌,人工智能在危险问题上的拒绝率达到了 86%(将其在这些问题上的准确率从 79% 降至 18%)。但神奇的部分在于,当他们询问人工智能关于安全的相关话题——如普通生物学或病毒学时——它仍然几乎记得所有内容,保留了 93% 的原始帮助能力。这比旧方法有了巨大的进步,旧方法通常为了阻止人工智能说出危险的事情,而让它忘记安全的事情。

研究人员还检查了这个“魔法钥匙”是否会被窃取。他们尝试通过在用户的提问中放入该令牌来欺骗人工智能(就像一个试图潜入的对手)。但系统足够聪明,它知道只有当令牌来自人工智能这一侧时才有效,而不是来自用户。如果用户试图把令牌偷偷带进来,人工智能仍然会拒绝回答,从而充当了抵御黑客的盾牌。

简而言之,这篇论文表明,我们不需要通过摧毁知识来保证安全。相反,我们可以将知识锁起来,只有当受信任的管理人员持有正确的钥匙时,才能解锁它。这是一种表达方式,即:“我们知道危险的内容,但我们只在应该的时候才谈论它,”这既能让人工智能对科学家有用,又能确保对所有人都是安全的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →