← 最新论文
💬 NLP

Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

该论文提出了一种名为“函数劫持攻击”(FHA)的新型威胁,通过操纵智能体模型的工具有选择过程强制调用攻击者指定的函数,实验证明该攻击具有跨语义、跨模型的高成功率,揭示了当前代理系统亟需加强安全防御。

原作者: Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文揭示了一个关于人工智能(AI)的新危险:黑客可以“劫持”AI 的工具箱,让它执行你完全没想让它做的事。

为了让你更容易理解,我们可以把这篇论文的内容想象成一场发生在**“超级智能管家”身上的“恶作剧”**。

1. 背景:AI 管家的新能力

现在的 AI(比如大语言模型)越来越聪明,它们不仅能聊天,还能像人类一样使用工具。这叫做**“函数调用”(Function Calling)**。

  • 比喻:想象你有一个超级管家(AI)。你告诉它:“帮我查一下明天的天气。”管家就会去调用“天气查询”这个工具。如果你说:“帮我订一张去北京的机票。”它就会调用“订票”工具。
  • 现状:为了让管家更灵活,开发者给它准备了一个**“工具菜单”**(比如:查天气、订机票、发邮件、删文件等)。管家会根据你的话,从菜单里选一个最合适的工具。

2. 新威胁:功能劫持(Function Hijacking)

这篇论文发现,黑客不需要骗过管家的“大脑”(让它说脏话或做坏事),而是可以篡改“工具菜单”上的描述,让管家在选工具时“鬼迷心窍”。

  • 攻击原理
    黑客潜入管家的工具菜单,偷偷在某个工具(比如“删除文件”)的描述文字里,塞进了一些看不见的、乱码一样的“魔法咒语”(对抗性 token)。

  • 比喻
    想象你在餐厅点菜。菜单上写着:

    • 正常菜:【红烧肉】—— 描述:美味的猪肉。
    • 被篡改的菜:【删除数据库】—— 描述:美味的猪肉 xBr:- x x $ x(这里塞入了一堆乱码)。

    当你告诉管家:“我想吃红烧肉”时,管家原本应该选“红烧肉”。但因为那个“删除数据库”的描述里藏着特殊的“魔法咒语”,管家的算法被迷惑了,它觉得:“哦!这个带乱码的描述看起来最符合‘红烧肉’的指令!”于是,它没有选红烧肉,而是强行去执行了“删除数据库”这个危险操作。

3. 这个攻击有多厉害?(论文的核心发现)

A. 不管你说什么,它都管用(通用性)

以前的攻击需要针对特定的话术(比如特定的提问方式)。但这个新攻击(FHA)就像是一个万能钥匙

  • 比喻:不管你是让管家“查天气”、“订机票”还是“写代码”,只要那个被篡改的工具还在菜单里,管家就会中招。它不关心你具体想干什么,只关心那个被“下毒”的工具描述。

B. 一个咒语,搞定所有(通用攻击)

研究者发现,他们只需要训练一次,就能生成一个“超级咒语”。

  • 比喻:黑客只需要在“删除文件”这个工具的说明里加一次乱码,这个乱码就能让管家在面对“查天气”、“发邮件”、“甚至写诗”等各种指令时,都错误地选择去“删除文件”。

C. 即使菜单变了,它依然有效(鲁棒性)

即使开发者后来在菜单里加了新菜、删了旧菜,或者把菜的位置换了,这个攻击依然有效。

  • 比喻:就像你给管家换了个新菜单,或者把“删除文件”从第一页挪到了最后一页,那个“魔法咒语”依然能让管家在茫茫菜单中一眼(或者说一算)就锁定它。

4. 实验结果:非常可怕

研究人员在 5 种不同的 AI 模型上进行了测试(包括一些很聪明的推理模型):

  • 成功率:在 70% 到 100% 的情况下,攻击都成功了。
  • 后果:AI 不仅会选错工具,而且选错的工具还能完美执行(比如真的把文件删了,而不是只报错)。这意味着攻击者可以真正破坏系统,而不仅仅是让 AI 说胡话。

5. 为什么这很重要?

  • 以前的担忧:大家主要担心 AI 会被骗去说脏话、生成暴力内容(就像骗管家去骂人)。
  • 现在的担忧:这个攻击让 AI 变成了**“盲从的破坏者”**。它没有说脏话,它只是“忠实地”执行了被篡改的工具指令。
  • 现实影响:如果这种攻击发生在银行、医疗或自动驾驶系统中,后果不堪设想。比如,黑客篡改了“转账”工具的描述,导致用户说“查余额”时,AI 却偷偷执行了“转账”操作。

总结

这篇论文告诉我们:AI 的工具箱(Function Calling)非常脆弱。

就像在餐厅菜单的某道菜描述里藏了一行乱码,就能让所有顾客都点错菜一样,黑客可以通过在工具描述里植入微小的“魔法”,让 AI 彻底失控,执行攻击者想要的任何操作。

未来的建议
我们不能只靠“教育”AI 不要说脏话了。我们需要给 AI 装上更坚固的**“安检门”**(Guardrails),在 AI 决定使用工具之前,必须严格检查工具的描述是否被篡改,确保它选的工具真的是用户想要的,而不是被黑客“下毒”后的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →