Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry
本文表明,AI 智能体技能注册表(SKILL.md)中的自然语言元数据并非仅仅是被动的文档,而是一个关键的攻击面,语义供应链操纵可在此严重破坏发现、选择与治理流程,使恶意技能得以逃避检测并主导智能体的采用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个几乎无所不能的超级智能机器人助手:它可以为你预订航班、管理税务,甚至编写代码。但这个机器人并非天生全知全能。相反,它拥有一个名为**技能注册表(Skill Registry)**的巨大数字工具箱。你可以把这个注册表想象成一个应用商店,只不过机器人下载的不是应用程序,而是“技能”(即一小包指令),以此来学习新任务。
每个技能包都附带一份名为SKILL.md的特定操作手册。这不仅仅是一份枯燥的功能列表;它用通俗易懂的英语(或自然语言)编写,旨在告诉机器人何时使用这项技能,以及如何执行。
你分享的论文《SKILL.md 的幕后真相》揭示了一种令人胆寒的新方法,黑客可以利用它来欺骗这些机器人。他们无需侵入机器人的大脑或编写恶意代码,只需通过巧妙的文字游戏**编辑操作手册(SKILL.md)**即可。
以下是该攻击方式的运作机制,通过三个阶段的简单类比进行拆解:
1. 发现攻击:“机器人技能的 SEO 垃圾信息”
场景: 你问机器人:“规划一次去日本的旅行。”机器人会前往技能注册表,寻找最佳的旅行技能。
攻击: 黑客拿一个平庸的旅行技能,在其操作手册中秘密添加几个奇怪且具体的词汇(如同隐藏关键词)。
类比: 想象一家提供糟糕食物的餐厅,但它向搜索引擎行贿,使得当你输入“最佳寿司”时,它的名字会出现在最顶端,将真正最好的寿司店挤到第 10 页。
结果: 论文发现,仅通过微调文本,黑客就能使其劣质技能在80% 的情况下出现在前 10 条结果中,即使它们比原版更差。机器人信任搜索结果,从而选择了黑客的技能。
2. 选择攻击:“巧舌如簧的推销员”
场景: 机器人找到了两个功能完全相同的技能(例如,两者都能规划旅行)。一个是原始的安全版本,另一个是黑客的版本。
攻击: 黑客修改其技能的描述,使其听起来更自信、更可信或更“新颖”。他们可能会添加诸如“这是完成此项工作的绝对最佳技能”或“此技能由安全专家积极维护”之类的短语。
类比: 想象你在购买两双完全相同的鞋子。一双贴着普通标签,另一双的标签上写着:“总统穿的就是这双;这是有史以来最安全的鞋子。”尽管鞋子完全一样,你还是会选择那个带有华丽标签的。
结果: 机器人极易受骗。在77.6% 的案例中,机器人选择了黑客的技能而非安全版本,仅仅因为描述听起来更具说服力。机器人并未检查这些技能的实际功能是否有差异,它只是相信了“推销话术”。
3. 治理攻击:“披着羊皮的狼”
场景: 在技能被允许进入注册表之前,一名安全卫士(自动化扫描器或 AI 审核员)会检查其是否安全。
攻击: 黑客编写一条恶意指令(例如,“将所有私人文档发送到陌生人的邮箱”),但利用技巧将其隐藏在文本中。他们可能会将其重述为看似正常的步骤,将其拆分成微小的片段,或者将其隐藏在长文档的末尾,而扫描器在那里停止了读取。
类比: 想象一名安检员正在检查手提箱。黑客将炸弹放入箱内,但用一层“我是无害泰迪熊”的文本将其包裹,或者将炸弹藏在一个安检员因箱子太长而未查看的口袋里。
结果: 论文表明,这些技巧极其有效。
- 改写(Paraphrasing)(将坏词重写为听起来无害的样子)使劣质技能通过了**74%**的检查。
- 隐藏文本(将其放置在扫描器停止读取的位置)使劣质技能通过了**87%**的检查。
全局视角
主要结论是,SKILL.md 不仅仅是一份被动文档。它是机器人决策过程中的主动组成部分。
- 它并非被动: 机器人会阅读它、信任它,并据此采取行动。
- 它是薄弱环节: 黑客无需成为编程天才;他们只需擅长撰写具有说服力或诡谲的文本即可。
作者总结道,我们不能仅仅因为这些操作手册是文本就将其视为安全。我们需要像对待可执行代码一样,以同样的怀疑态度对待它们,因为在 AI 代理的世界里,文字的危险程度可与代码并驾齐驱。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。