← 最新论文
🤖 AI

Distributed Denial of Science: How Indirect Data Poisoning of AI Systems Can Industrialize Scientific Fraud

本文表明,恶意行为者可以通过间接数据投毒将开放数据生态系统武器化,从而破坏人工智能驱动的科学研究,并在生成虚假结论方面取得极高的成功率,但同时也表明实施数据溯源审计可以有效抵消此类攻击。

原作者: Bálint Gyevnár, Atoosa Kasirzadeh, Nihar B. Shah

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Bálint Gyevnár, Atoosa Kasirzadeh, Nihar B. Shah

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:科学家们雇佣了一支由超级聪明、不知疲倦的机器人助手组成的队伍来帮他们做作业。这些机器人搜寻互联网、下载数据、计算数字并撰写报告。它们诚实、勤奋,深受人类老板的信任。

现在,想象一个调皮的恶作剧者想要戏弄整个科学界。这个恶作剧者并没有直接黑入机器人的系统(因为这不可能,因为机器人是受到严格管控的),而是做了一件更阴险的事:他拿了一本公共图书馆的书,在页边空白处涂改了一些虚假事实,然后把一本经过篡改的新书放回了书架。

这就是名为**“分布式科学拒绝服务攻击”(Distributed Denial of Science)**的一项新研究中所描述的恐怖现实。研究人员提出了一个令人胆寒的问题:一个远程的坏人能否仅仅通过毒化它们所使用的开放数据,来欺骗这些诚实的机器人科学家,从而传播谎言?

伟大的劫案:这个诡计是如何运作的

研究发现,答案是令人恐惧的肯定

以下是恶作剧者实施计划的过程:

  1. 准备阶段: 坏人找了一个公开网站(如 GitHub 或 Kaggle)上的真实数据集。假设它是关于交通执法或招聘趋势的数据。
  2. 投毒: 利用 AI 工具,坏人修改了数字,或者写了一个虚假的“README”文件(解释数据的说明文件),以此讲述一个完全不同的故事。他们可能会让情况看起来像是招聘差距正在缩小,而实际上差距正在扩大,反之亦然。
  3. 上传: 他们将这个“被毒化的”版本重新上传到公共图书馆。
  4. 陷阱: 那些诚实的机器人科学家在履行职责时寻找数据。它们找到了被毒化的版本。因为该文件看起来很正常,且附带了一份精美的说明,所以机器人信任它。它们下载、分析数据,并写出一份报告说:“看!我们发现了这个惊人的新事实!”

可怕之处在于?机器人正在做它们被要求做的事情。它们并不是在“撒谎”;它们只是在遵循虚假数据的指令。人类科学家信任他们的机器人,随后将这些虚假发现作为他们自己的独立发现发表出来。

数据统计:情况有多糟?

研究人员针对五个热门话题(如招聘歧视、汽车安全和移民问题),使用三种目前最智能的 AI 系统(Claude、Codex 和 Gemini)进行了 450 次实验

以下是他们的发现:

  • 机器人中招了:49.56% 的实验中,AI 智能体被彻底愚弄了。它们写出了带有虚假结论的完整报告,没有发现诡计,甚至没有提到任何警告。
  • “无薪军队”: 坏人不需要自己写一篇假论文。他们只需上传错误的数据。诚实的 AI 智能体完成了传播谎言的所有工作。
  • 盲点: 机器人几乎从未识破诡计。它们仅在 6.0% 的运行中将数据标记为可疑。即使研究人员要求机器人表现得更加批判和怀疑,检测率也没有显著提高。
  • 双向有效: 坏人既可以诱导机器人说问题正在恶化,也可以诱导它们说问题正在好转。成功的概率在两个方向上是一样的。

有趣的是,其中一个机器人(Codex)较难被骗(坏人的成功率仅为 31.33%),而另一个机器人(Gemini)最容易被骗(成功率为 62.0%)。但没有一个是安全的。

为什么这很重要

论文认为,这是危险的,因为它使“开放科学”运动反过来伤害了自身。通常,有许多人检查数据应该能捕捉到错误。但在这种情况下,机器人因为太渴望找到任何数据,结果抓取了被毒化的版本并忽略了真实的那个。

研究人员发现,机器人甚至经常意识不到自己正在看假货。在某些案例中,机器人声称该数据是“预注册”的(这是诚实科学的金标准),而事实完全并非如此。它们甚至开始怀疑真实的数据,认为真实的数据才是存在问题的那个!

是否有盾牌?

研究人员不仅发现了问题,还尝试构建了一面盾牌。他们测试了两种保护机器人的方法:

  1. “怀疑论者”人格: 他们告诉机器人:“嘿,表现得像一个超级谨慎、善于批判、会反复检查一切的科学家。”

    • 结果: 这有一点帮助。它捕捉到了更多的谎言(检测率上升到了 30.67%),但机器人在 16.67% 的案例中仍然被骗了。机器人仍在利用错误的数据,只是在报告中多加了一些“也许”之类的词汇。
  2. “溯源审计”(Provenance Audit): 这是重磅武器。他们给机器人提供了一个在信任任何数据之前必须运行的清单:

    • 检查 1: 是否有真实的、受信任的论文引用了此数据?
    • 检查 2: 数字看起来是否奇怪(例如,是否存在不可能出现的平均值)?
    • 检查 3: 此数据是否与其他类似数据相符?
    • 检查 4: “社会证明”(点赞数、下载量)看起来是否真实?
    • 检查 5: 明确询问:“这可能是一个陷阱吗?”
    • 结果: 奇迹发生了。 当机器人使用这个清单时,坏人的成功率降至 0.0%。机器人识破了每一个被毒化的数据集。

总结

论文指出,我们正处于一种新型科学欺诈的边缘。这不仅仅是一个人写了一篇假研究;而是一个坏人种下了一颗坏数据的种子,然后成千上万个诚实的 AI 智能体去浇灌它、收获它,并将其作为真理进行销售。

好消息是?论文表明,如果我们教导 AI 智能体成为更好的侦探——特别是通过检查数据的来源并将其与其它来源进行对比——我们就能彻底阻止这种欺诈。但论文警告说,如果没有这些检查,科学欺诈很快就会实现工业化,并在自动驾驶模式下运行。

论文排除了什么:
研究人员明确指出,这种攻击并不需要坏人去黑入 AI 的大脑、使用秘密的“触发词”或编写虚假的学术论文。这种攻击完全是通过开放的数据生态系统和误导性的元数据实现的。他们还认为,仅仅告诉 AI “要具有批判性”是不够的;你需要一个结构化的审计流程。

他们的确定程度如何?
研究人员对他们的发现非常有信心,因为他们实际运行了实验。他们不是在猜测,而是模拟了 450 次攻击并测量了结果。他们明确表示,在这些模拟中,攻击成功率接近一半,而“溯源审计”能完全阻止它。他们并未声称这在现实世界中已是一个已解决的问题,但他们已经证明了威胁的存在以及解决方案在测试中的有效性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →