Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models
该论文提出了一种名为“函数劫持攻击”(FHA)的新型威胁,通过操纵智能体模型的工具有选择过程强制调用攻击者指定的函数,实验证明该攻击具有跨语义、跨模型的高成功率,揭示了当前代理系统亟需加强安全防御。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文揭示了一个关于人工智能(AI)的新危险:黑客可以“劫持”AI 的工具箱,让它执行你完全没想让它做的事。
为了让你更容易理解,我们可以把这篇论文的内容想象成一场发生在**“超级智能管家”身上的“恶作剧”**。
1. 背景:AI 管家的新能力
现在的 AI(比如大语言模型)越来越聪明,它们不仅能聊天,还能像人类一样使用工具。这叫做**“函数调用”(Function Calling)**。
- 比喻:想象你有一个超级管家(AI)。你告诉它:“帮我查一下明天的天气。”管家就会去调用“天气查询”这个工具。如果你说:“帮我订一张去北京的机票。”它就会调用“订票”工具。
- 现状:为了让管家更灵活,开发者给它准备了一个**“工具菜单”**(比如:查天气、订机票、发邮件、删文件等)。管家会根据你的话,从菜单里选一个最合适的工具。
2. 新威胁:功能劫持(Function Hijacking)
这篇论文发现,黑客不需要骗过管家的“大脑”(让它说脏话或做坏事),而是可以篡改“工具菜单”上的描述,让管家在选工具时“鬼迷心窍”。
攻击原理:
黑客潜入管家的工具菜单,偷偷在某个工具(比如“删除文件”)的描述文字里,塞进了一些看不见的、乱码一样的“魔法咒语”(对抗性 token)。比喻:
想象你在餐厅点菜。菜单上写着:- 正常菜:【红烧肉】—— 描述:美味的猪肉。
- 被篡改的菜:【删除数据库】—— 描述:美味的猪肉 xBr:- x x $ x(这里塞入了一堆乱码)。
当你告诉管家:“我想吃红烧肉”时,管家原本应该选“红烧肉”。但因为那个“删除数据库”的描述里藏着特殊的“魔法咒语”,管家的算法被迷惑了,它觉得:“哦!这个带乱码的描述看起来最符合‘红烧肉’的指令!”于是,它没有选红烧肉,而是强行去执行了“删除数据库”这个危险操作。
3. 这个攻击有多厉害?(论文的核心发现)
A. 不管你说什么,它都管用(通用性)
以前的攻击需要针对特定的话术(比如特定的提问方式)。但这个新攻击(FHA)就像是一个万能钥匙。
- 比喻:不管你是让管家“查天气”、“订机票”还是“写代码”,只要那个被篡改的工具还在菜单里,管家就会中招。它不关心你具体想干什么,只关心那个被“下毒”的工具描述。
B. 一个咒语,搞定所有(通用攻击)
研究者发现,他们只需要训练一次,就能生成一个“超级咒语”。
- 比喻:黑客只需要在“删除文件”这个工具的说明里加一次乱码,这个乱码就能让管家在面对“查天气”、“发邮件”、“甚至写诗”等各种指令时,都错误地选择去“删除文件”。
C. 即使菜单变了,它依然有效(鲁棒性)
即使开发者后来在菜单里加了新菜、删了旧菜,或者把菜的位置换了,这个攻击依然有效。
- 比喻:就像你给管家换了个新菜单,或者把“删除文件”从第一页挪到了最后一页,那个“魔法咒语”依然能让管家在茫茫菜单中一眼(或者说一算)就锁定它。
4. 实验结果:非常可怕
研究人员在 5 种不同的 AI 模型上进行了测试(包括一些很聪明的推理模型):
- 成功率:在 70% 到 100% 的情况下,攻击都成功了。
- 后果:AI 不仅会选错工具,而且选错的工具还能完美执行(比如真的把文件删了,而不是只报错)。这意味着攻击者可以真正破坏系统,而不仅仅是让 AI 说胡话。
5. 为什么这很重要?
- 以前的担忧:大家主要担心 AI 会被骗去说脏话、生成暴力内容(就像骗管家去骂人)。
- 现在的担忧:这个攻击让 AI 变成了**“盲从的破坏者”**。它没有说脏话,它只是“忠实地”执行了被篡改的工具指令。
- 现实影响:如果这种攻击发生在银行、医疗或自动驾驶系统中,后果不堪设想。比如,黑客篡改了“转账”工具的描述,导致用户说“查余额”时,AI 却偷偷执行了“转账”操作。
总结
这篇论文告诉我们:AI 的工具箱(Function Calling)非常脆弱。
就像在餐厅菜单的某道菜描述里藏了一行乱码,就能让所有顾客都点错菜一样,黑客可以通过在工具描述里植入微小的“魔法”,让 AI 彻底失控,执行攻击者想要的任何操作。
未来的建议:
我们不能只靠“教育”AI 不要说脏话了。我们需要给 AI 装上更坚固的**“安检门”**(Guardrails),在 AI 决定使用工具之前,必须严格检查工具的描述是否被篡改,确保它选的工具真的是用户想要的,而不是被黑客“下毒”后的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。