← 最新论文
🤖 AI

Oracle Poisoning: Corrupting Knowledge Graphs to Weaponise AI Agent Reasoning

本文介绍并实证验证了“神谕投毒”这一新型攻击向量,其中攻击者通过污染结构化知识图谱,迫使人工智能代理在推理过程本身无误的情况下得出错误结论,从而证明当前模型在通过工具使用协议访问数据时普遍会信任被污染的数据,并凸显了内联测试中存在的严重评估缺陷。

原作者: Ben Kereopa-Yorke, Guillermo Diaz, Holly Wright, Reagan Johnston, Ron F. Del Rosario, Timothy Lynar

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Ben Kereopa-Yorke, Guillermo Diaz, Holly Wright, Reagan Johnston, Ron F. Del Rosario, Timothy Lynar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和日常类比对论文《Oracle Poisoning》(神谕投毒)的解释。

核心理念:“受信任图书管理员”的陷阱

想象你有一位才华横溢的 AI 助手(即“智能体”),它能帮你编写代码或检查安全漏洞。这位助手极其聪明,推理能力完美。然而,它有一个重大弱点:它对现实世界视而不见。

为了开展工作,该 AI 完全依赖一个庞大、结构化的数字图书馆,称为知识图谱。你可以将这个图谱想象成你整个软件代码库的巨型地图,展示了每一段代码如何与其他代码相互连接。

AI 将这张地图视为神谕——绝对真理的来源。它不会质疑地图;它假设地图是 100% 准确的。如果地图显示“函数 A 调用了函数 B",AI 就会相信这一点,而不会去查阅第二个来源。

Oracle Poisoning(神谕投毒) 是一种攻击方式,攻击者潜入图书馆并篡改地图。他们并没有破坏 AI 的“大脑”,也没有用令人困惑的词语欺骗 AI。相反,他们悄无声息地修改了地图上的事实。由于 AI 的推理能力极强,它会基于这些新的、虚假的事实,得出一个逻辑完美但完全错误的结论。

类比:柏拉图的洞穴与影子墙

作者将这种情况比作柏拉图的洞穴

  • 囚徒:AI 智能体。
  • 墙壁:知识图谱。
  • 影子:AI 向图谱提问时得到的答案。
  • 锁链:将 AI 束缚在墙壁上的协议(称为MCP),迫使它将影子当作现实接受。

如果攻击者在墙上画了一个假影子,囚徒(AI)会研究它,完美地分析它,并得出结论:“那是一只真老虎”,尽管那只是一幅画。囚徒越聪明,其错误结论就会越详细、越具说服力。

攻击是如何运作的(“操作指南”)

研究人员在一个拥有4200 万个节点(一个巨大的数字图书馆)的真实世界系统中测试了这一点。他们发现,攻击者只需对地图进行微小的、外科手术式的修改,就能愚弄 AI。

他们展示了六种方法:

  1. 虚假软件包:在图书馆中创建一个看起来像“最新、最安全版本”的虚假软件包,诱使 AI 推荐它。
  2. 隐形清理器:在地图上添加一个实际上在真实代码中并不存在的虚假“安全卫士”函数。AI 在地图上看到了它,便得出结论:“啊,这段代码是安全的!”而实际上它存在漏洞。
  3. 属性交换:修改地图上真实代码片段的细节(例如,将标签从“未验证”改为“安全批准”),而无需创建新的虚假项目。

结果:AI 基于新数据进行了完美的推理,自信地告诉开发者:“这段代码是安全的”或“使用这个新库”,从而将他们直接引入陷阱。

攻击者的“老练程度”

论文发现了一个令人惊讶的事实:你不需要是天才黑客也能做到这一点。

  • 0 级(天真):如果虚假数据看起来很可疑(例如命名为"hacker_tool_v1"),AI 会忽略它。
  • 1 级(基础):如果看起来还可以但有小错误,AI 有时会被愚弄。
  • 2 级(胜任):如果虚假数据遵循标准命名规则且看起来专业,100% 的受测 AI 模型都被完全愚弄了

问题不在于 AI是否能被欺骗,而在于攻击者需要付出多少精力。一个胜任的攻击者可以 100% 地愚弄甚至最聪明的 AI 模型。

“交付模式”的意外发现

研究人员发现了我们在通常测试 AI 安全性时存在的一个关键缺陷。

  • 内联测试:如果你将虚假数据作为简单的文本消息展示给 AI,某些模型(如 GPT-5.1)会说:“那看起来很可疑”,并拒绝它。
  • 工具使用测试:如果 AI 通过其官方“工具”连接(即它在现实生活中的工作方式)获取相同的虚假数据,它会 100% 地信任它。

教训:仅通过与 AI 聊天(内联)来测试其安全性,会给人一种虚假的安全感。当 AI 使用其工具查询数据时,它会完全放下戒备。

如何防御

论文测试了多种防御措施,发现没有单一的“银弹”能奏效,但组合使用会有帮助:

  1. 只读访问(最佳防御):如果你锁定知识图谱,使 AI(以及攻击者)只能读取地图而永远无法写入,攻击就不可能发生。这是最有效的修复方法。
  2. 交叉验证:如果强制 AI 将地图与第二个来源(如实际代码文件)进行核对,它就能识破谎言。如果地图显示“安全”但代码文件显示“存在漏洞”,AI 就会感到困惑并停止信任地图。
  3. “魔鬼代言人”:询问 AI“这些数据可能是假的吗?”会有所帮助,但前提是你必须非常具体地说明它可能是如何伪造的。仅仅问“你确定吗?”通常不起作用。
  4. 历史记录追踪:保留地图变更的日志有助于检测的虚假项目,但在攻击者仅仅编辑现有项目的细节时,这种方法就会失效。

总结

Oracle Poisoning(神谕投毒) 是一种新型黑客攻击,攻击者腐蚀的是 AI 所信任的数据,而非 AI 本身。由于 AI 非常擅长遵循逻辑,它会欢快地在谎言的基石上建造一座纸牌屋。论文证明,在现实世界环境中,几乎所有受测的 AI 模型都会相信这些谎言,只要它们是通过受信任的工具渠道传来的,而唯一可靠的修复方法是阻止 AI 能够写入其自身的知识库。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →