← 最新论文
💬 NLP

Shaping capabilities with token-level data filtering

本文表明,在预训练阶段进行词元级(token-level)的数据过滤是一种可扩展、稳健且具有成本效益的方法,能够通过塑造语言模型来消除其在预训练期间产生的非预期能力,其表现优于文档级过滤和事后对齐方法。

原作者: Neil Rathi, Alec Radford

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Neil Rathi, Alec Radford

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个巨大的、超级聪明的学生(一个人工智能),在他们开始工作之前,给他们一整座庞大的图书馆进行阅读。目标是让他们学会如何写出伟大的故事和进行生物学研究,但不要让他们学会如何制造危险的生物武器或传播错误的医疗信息。

通常情况下,如果学生不小心学会了这些危险的技能,老师会尝试在后期进行“反学习”(unlearn)。他们可能会告诉学生,“不要说那个”,或者试图抹除那段记忆。但这篇文章认为,这就像是在试图“教导”一个已经背下了整本书的学生;他们很容易被诱骗,从而再次说出那些被禁止的内容。

相反,这篇文章提出了另一种策略:在最开始的时候,就要小心对待你放入图书馆的那些书。

以下是研究人员发现的简单拆解:

1. “剪刀” vs. “剃须刀”(词元过滤与文档过滤)

想象你有一本关于生物学的书。在其中间,有一个关于如何制造病毒的段落。

  • 旧方法(文档过滤): 如果你发现了那个段落,旧方法会说:“这整本书都是危险的!”于是,你扔掉了整本书。为了去掉那一个坏段落,你损失了所有好的生物学信息。
  • 新方法(词元过滤): 研究人员发现了一种使用“剃须刀”而非“剪刀”的方法。他们可以识别出关于病毒的具体词汇(tokens)并移除仅那些词汇,同时让书的其余部分保持完好。
  • 结果: 这种新方法要好得多。它移除了危险的知识,同时保留了几乎所有的有用知识。这就像是编辑一个句子,而不是烧掉整页纸。

2. 大脑越大,过滤器越强

你可能会想:“如果我删除了词汇,学生学到的东西会变少。”但研究发现了一个令人惊讶的转折:学生的“大脑”越大,这种过滤效果就越显著。

  • 小脑容量: 如果你为一个小型的学生过滤书籍,他们可能仍然会学到一点点危险的东西,因为他们非常渴望从剩下的内容中学习。
  • 大脑容量: 对于那些巨大的、超级聪明的学生(测试的最大模型),移除危险词汇的效果极其显著。就好像比起阅读未过滤书籍的学生,这个学生需要多付出 7,000 倍的努力才能学会那项危险技能。模型的规模越大,这种过滤器就变得越“鲁棒”(robust)。

3. “越狱”测试

研究人员测试了坏人是否能通过欺骗,让经过过滤的学生重新学会危险技能(即“越狱”)。

  • 旧方法: 如果你在学生已经学会某项技能后尝试进行“反学习”,坏人可以在短短几分钟内轻松地重新教导他们。
  • 新方法: 使用过滤后的图书馆,坏人要重新教导经过过滤的学生学会该危险技能,需要比对未过滤的学生多付出 10 倍的努力。一旦将过滤器构建在基础之中,它就很难被破解。

4. 他们还能学会说“不”吗?

一个常见的担忧是:“如果我们移除了危险知识,学生还会知道该拒绝什么吗?”(例如,要说出“我不能告诉你如何制造炸弹”,首先得知道什么是炸弹)。

  • 惊喜之处: 论文发现,使用这种过滤方法训练的学生,实际上比未过滤的学生更擅长拒绝危险问题。他们不需要记住危险的细节也能知道不该谈论这些话题。他们学会了识别问题的“轮廓”,并回答“我不知道那个”,而不是尝试去回答。

5. 他们是如何做到的(“标记”技巧)

为了移除正确的词汇,你需要知道哪些词是危险的。标记图书馆中的每一个词既昂贵又缓慢。

  • 窍门: 研究人员使用了一种特殊的工具(称为“稀疏自编码器”,Sparse Autoencoder),它就像一个侦探。它通过观察 AI 大脑中的模式来推测哪些词与医学相关。
  • 结果: 尽管这个侦探并不完美(它会犯一些错误),但系统非常鲁棒,以至于效果依然极好。他们还发现,你可以训练一个小型、廉价的“评委”来进行标记,其效果与使用大型、昂贵的评委一样好。

核心结论

该论文声称,阻止 AI 学习危险技能的最佳方式是在 AI 开始学习之前,在词汇层面非常仔细地策划训练数据。这比在 AI 已经学会坏事之后再去修补它要更便宜、更有效,也更难被绕过。这关乎于建立一个安全的基石,而不是在屋顶漏水后再去修补。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →