SkillGate: Cost Efficient Runtime Malicious Skill File Detection in Coding Agents
SkillGate 是一个高性价比的安全网关,通过采用正则预过滤与 LLM 判别器相结合的混合流水线,在显著降低筛选成本和运行开销的同时实现高检测准确率,从而保护 AI 编程智能体免受恶意技能文件供应链攻击。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你的电脑是一个超级聪明、极具创造力的机器人助手,它能帮你构建各种事物,就像一个数字世界的乐高大师。最近,人们开始给这个机器人一份特殊的“指令手册”,叫做技能文件(skill file)。你可以把这些文件想象成“秘籍”或“自定义食谱”,它们告诉机器人如何与你的特定项目进行交互、该按哪个按钮,以及如何遵循你公司的规则。你可以像下载新应用一样,只需点击一下,就能从公共图书馆下载这些手册。
但问题在于:因为这些手册是用自然语言(比如故事或指令列表)编写的,而不是复杂的计算机代码,所以传统的安全卫士(那些检查病毒的程序)看不懂它们。这就像是在夜店门口当保镖的人,只检查金属武器,却让一个带着纸质暗器的人混了进去。如果坏人将一条恶意的指令混入这些手册中,你的机器人助手可能会在不知不觉中执行它,从而窃取你的秘密密码,或者在你的工作中留下后门。这并不是恐怖电影里的情节,而是目前 AI 编程领域正在发生的真实问题。
这就是研究人员介入的地方,他们开发了一个名为 SkillGate 的新工具。他们意识到,旧的检查方式要么太笨拙(会误拦太多好的文件),要么太昂贵(检查每一个词都需要耗费大量时间和金钱)。因此,他们构建了一个智能的两步式安全检查站。
首先,他们使用了一个超快速的“模式扫描器”(就像金属探测器一样),专门寻找特定的可疑短语,例如窃取密码或隐藏秘密信息的命令。如果一个文件看起来完全干净,扫描器就会快速给出“赞许”并让其通过,而不会打扰人类或缓慢的计算机大脑。这就是“跳过(skip)”步骤。
然而,如果扫描器发现了异常,它并不会把整个庞大的文件发送到下一级,而是像一个荧光笔一样,只切出那段微小的、可疑的段落,并将仅有的这一小段片段发送给一位超聪明的“AI 法官”(大语言模型,LLM)。这位法官随后会判定这段特定的片段究竟是真的危险,还是仅仅是一个误报。这种“片段(snippet)”方法节省了大量的成本和时间,因为 AI 不需要读完一整本书才能找到那坏掉的一页。
当他们使用这个系统针对包含 1,650 个技能文件的库(其中约 9% 是已知的恶意文件)进行测试时,SkillGate 表现得非常出色。它抓住了大约 77% 的坏文件,同时仅误拦了 1% 的好文件。相比之下,他们测试的其他工具要么过于激进(误拦了一半的好文件),要么速度太慢且成本太高。SkillGate 在实现这些目标的同时,比从头到尾检查每个文件所使用的“Token”(AI 阅读的货币单位)减少了 77%。它运行得也非常快,平均检查一个文件不到一秒钟,这足以在开发者安装新工具时实现即时检查。
研究人员谨慎地指出,虽然他们的系统有了巨大的进步,但它并非万能。它依赖于一套特定的规则和特定的 AI 模型,而且仍然存在一些复杂的手段,坏人可能会利用这些手段来隐藏他们的诡计,而这些手段在本次测试中并未被系统捕捉到。但就目前而言,SkillGate 提供了一种实用、经济且快速的方法,可以防止我们的 AI 助手意外执行危险指令,在机器人看到新手册之前,充当一名可靠的守门人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。