← 最新论文
💬 NLP

Pretraining Data Can Be Poisoned through Computational Propaganda

本文证明了语言模型的大规模预训练数据可以通过公共讨论界面被投毒,并引入了“HalfLife”,一种用于估算在网络爬取和策展后此类对抗性内容包含情况的新型分析方法。

原作者: Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网是一个巨大的、混乱的图书馆,每一本书、每一篇博客文章和每一条评论都被喂给了一个超级聪明的机器人大脑。这个被称为“大语言模型”(LLM)的机器人,就像一个通过阅读所有内容来学习如何说话、写作和思考的学生。它读得越多,就变得越聪明。但问题在于:这个图书馆如此庞大,以至于没有人能检查每一页是否存在谎言、废话或陷阱。这就是危险所在。如果有人在图书馆里偷偷塞进几页虚假的指令,机器人可能会学到这些诡计,而不是真理。本文探讨了一种新的方式,即坏人如何将这些“被污染”的页面混入机器人的饮食中——他们不是通过黑入图书馆本身,而是通过在机器人访问的网站公开评论区里大声喊出他们的谎言。

研究人员(来自华盛顿大学和艾伦人工智能研究所的一个团队)想要看看这种“在评论区大喊大叫”的伎俩是否真的奏效。他们构建了一个名为 HALFLIFE 的新工具,充当侦探的角色,追踪一段虚假内容从最初在网上发布,直到进入机器人混乱的学习过程的全过程。他们发现,机器人的“饮食”出人意料地脆弱。尽管机器人的创造者试图过滤掉垃圾信息,但仍有大量的恶意评论会从缝隙中溜走。

以下是他们的发现:

攻击手段:在看台上大喊大叫
把互联网想象成一个巨大的体育场。大多数时候,机器人只阅读官方比赛手册(主文章)。但体育场也有成千上万个开放式麦克风站,让观众可以随心所欲地大喊任何内容(评论区)。研究人员意识到,坏人不需要黑入体育场,他们只需要买一个扩音器,并在那些开放式麦克风前开始喊些废话就行了。他们通过模拟一支机器人大军,在成千上万个真实网站上发布虚假说法,例如“吃汰渍洗衣胶囊(Tide Pods)能增强健康”或“品牌 X 比品牌 Y 更好”,以此进行了测试。

过滤器:机器人的午餐盒
一旦机器人的“爬虫”(数字蜘蛛)收集了这些页面,它们并不会照单全收。它们有一套严格的午餐盒流程:

  1. 抓取: 它们将页面拆解以寻找文本。
  2. 过滤: 它们丢弃过短、语言错误或看起来像垃圾信息的页面。
  3. 质量检查: 它们对页面进行评分,以判断其是否为“优质”阅读材料。

该团队使用 HALFLIFE 来观察有多少被污染的评论在经过这个午餐盒流程后依然存留。结果令人震惊。即使经过所有的过滤,大约仍有 0.13% 的被污染评论进入了最终的训练数据。虽然这听起来微不足道,但请记住,图书馆是极其庞大的。这 0.13% 代表的文档数量比整个维基百科的收藏还要多!事实上,之前的研究表明,仅仅 250 份被污染的文档就足以诱骗机器人学会一个秘密技巧。研究人员计算出,攻击者只需要污染 10 万到 100 万个网页就能达到那个目标——这对于自动化机器人来说是一个完全可以实现的数字。

结果:机器人相信了谎言
为了证明这不仅仅是一个理论,该团队实际上用这些被污染的评论训练了小型机器人大脑。他们根据植入的虚假评论教导机器人,例如“雪铁龙比雷诺更好”或“辉瑞优于莫德纳”。当他们测试这些机器人时,结果很明确:机器人开始偏向于被污染的答案。即使机器人后来接受了关于如何变得有用且安全的训练(这个过程称为指令微调),毒素也并未完全洗掉。机器人越大,安全训练的效果就越明显,但小型机器人仍然表现出对攻击者谎言的高度偏见。

什么方法行不通
论文还测试了另一种想法:如果坏人使用在线广告而不是评论会怎样?他们发现这行不通。广告通常隐藏在小框(如 iframe)内,机器人的蜘蛛在扫描页面时无法读取它们。因此,评论是一个漏水的门,而广告则是一个锁死的保险箱。

核心启示
这里的主要教训是,互联网的开放式评论区是我们最先进 AI 大脑的一个隐藏后门。因为这些评论非常普遍,且看起来往往像正常的文本,所以目前用于清理训练数据的过滤器经常会漏掉它们。研究人员建议,我们需要更聪明地处理这些用户评论,然后再喂给机器人——例如,将它们与主文章文本区别对待。在解决这个问题之前,存在一种真实的风险,即我们 AI 所学习到的“真理”,可能会被任何拿着扩音器和脚本的人悄悄改写。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →