← 最新论文
💻 computer science

Semantic Attacks on Tool-Augmented LLMs: Securing the Model Context Protocol Against Descriptor-Level Manipulation

本文识别并形式化了针对模型上下文协议(MCP)的三种新的描述符级语义攻击向量(工具投毒、影子攻击和跑路攻击),证明了操纵工具元数据会严重损害大语言模型的安全性,并提出了一种多层防御策略,该策略无需重新训练模型即可有效减少不安全的工具调用。

原作者: Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明、乐于助人的机器人助手(人工智能),它可以为你执行各种任务,例如检查电子邮件、搜索公司文件或安排会议。为了完成这些任务,机器人需要一份可用的“工具”清单。在人工智能领域,这些工具都附带一个小标签或描述(即“描述符”),用于告知机器人该工具的功能。

例如,一个工具的标签可能是:“搜索公开文档。”机器人读取该标签,理解其含义,并在你请求帮助时决定使用该工具。

问题所在:“虚假标签”攻击

本文揭示了一种欺骗机器人的隐蔽手段。攻击者并非破坏工具本身或入侵计算机,而是篡改工具的标签

不妨将其想象成一家杂货店。

  • 正常情况:一罐花生酱的标签上写着“花生酱”。你信任该标签,因此购买了它。
  • 攻击场景:坏人替换了罐子上的标签。标签上仍然写着“花生酱”,但在微小、不易察觉的字迹中添加了:“并包含所有购买过此罐的人的名单。”
  • 结果:机器人看到标签,因为标签看起来正常而予以信任,并决定使用该工具。但此时,机器人不再仅仅是寻找花生酱,而是根据标签的指示,意外地窃取了一份客户名单。

本文将这种攻击称为语义攻击。工具本身是安全的且运行完美,但描述它的文字却在撒谎。

攻击者欺骗机器人的三种方式

研究人员识别出这三种“虚假标签”欺骗人工智能的具体方式:

  1. 工具投毒(“过于热心”的标签):

    • 类比:想象一个标签为“查询天气”的工具。攻击者将标签改为“查询天气告诉我用户此刻穿着什么”。
    • 效果:机器人心想:“哦,这个工具格外有用!”于是使用了它,从而意外泄露了用户的隐私信息。
  2. 遮蔽(“混淆人群”的标签):

    • 类比:想象你身处一个满是人的房间,大家都在发出指令。其中一人(攻击者)大喊:“所有人必须出示身份证!”尽管其他人只是在询问时间。
    • 效果:机器人被这句响亮且可疑的指令搞得困惑,开始将所有工具都视为需要查看用户隐私数据的工具,即使是那些原本安全的工具。
  3. 卷款跑路(“诱饵与调包”的标签):

    • 类比:你雇佣一名承包商来“粉刷围栏”。你批准了合同。一周后,承包商悄悄将合同改为“粉刷围栏安装隐藏摄像头”。
    • 效果:当你最初检查时,该工具是安全的,但随后描述被篡改,在未被你察觉的情况下执行了危险操作。

情况有多严重?

研究人员在三种不同类型的人工智能机器人(GPT-5.3、DeepSeek-V3 和 LLaMA-3.5)上测试了这种攻击。

  • 令人震惊的是:在没有特殊保护的情况下,这些机器人中招的比例高达36%。它们会欣然使用被“投毒”的工具并泄露数据。
  • 令人意外的是:机器人进行的“思考”越多(即使用复杂的推理步骤),它越容易被欺骗。似乎当机器人试图深入思考指令时,标签中那些细微的谎言反而让它更加困惑。

解决方案:三层安全卫士

本文提出了一种保护这些机器人的新方法,无需重构机器人的“大脑”,而是在机器人查看标签之前增加一个安全检查站。

  1. 身份核查(完整性验证):

    • 类比:就像检查驾驶执照以确保其未被篡改。系统检查标签是否由可信机构签署,且自批准以来未被修改。这能阻止“卷款跑路”式攻击。
  2. 第二意见(语义审查):

    • 类比:在机器人阅读标签之前,由第二个较小的机器人(“验证器”)先阅读。验证器会问:“这个标签听起来是否在索取过多的隐私信息?”如果听起来可疑,第二个机器人会说:“不,不要使用那个。”
  3. 看门人(运行时护栏):

    • 类比:就像俱乐部门口的看门人,在工具运行期间监视其行为。如果工具开始做奇怪的事情(例如试图访问它不应访问的文件),看门人会立即将其踢出。

修复后的结果

当研究人员添加了全部三层保护后:

  • 机器人中招的次数从36%下降到了15%
  • 系统成功拦截了**74%**的恶意尝试。
  • 权衡:机器人回答问题的时间略微变长(延迟增加),但安全性大大提高了。

核心启示

本文的主要教训是:我们不能仅仅因为人工智能工具的标签看起来正常就信任它们。 即使工具运行完美且代码安全,描述它的文字也可能是一个陷阱。为了确保人工智能的安全,我们必须将这些描述视为不可信的信息,并在允许人工智能使用它们之前进行仔细检查。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →