Emerging Challenges in Threat Modeling for GenAI-Augmented Systems: A View from the Trenches
本文对中小企业环境下具备生成式人工智能(GenAI)意识的威胁建模方法进行了探索性评估,结果表明,尽管现有技术可以识别不同的威胁,但目前在针对软件供应链和以人为本的安全相关的 GenAI 特定风险方面仍缺乏足够的支持,同时也存在显著的可用性和工作流集成方面的挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在建造一座宏伟的高科技城堡。在动工砌第一块砖之前,你需要一个“威胁模型”。把这想象成一张特殊的藏宝图,上面标注的不是金子在哪里,而是绘制出所有可能的入侵方式:小偷如何潜入、如何破坏墙壁,或者如何欺骗守卫。几十年来,安全专家一直使用一种名为 STRIDE 的标准清单来绘制这些地图。这就像拥有一份常见的入室盗窃清单:有人冒充守卫(Spoofing/欺骗)、砸碎窗户(Tampering/篡改)或偷走钥匙(Information Disclosure/信息泄露)。对于传统的软件——那些像僵硬、可预测的机器一样的系统——这种方法效果极佳。
但现在,我们正在建造一种新型城堡:一座由生成式人工智能(GenAI)驱动的城堡。这不是一台僵硬的机器,它更像是一个住在城墙内的天才、混乱且偶尔会产生幻觉的巫师。这位巫师可以编写代码、回答问题并创作艺术,但也可以被一句巧妙的低语(“提示词注入”)所迷惑,或者被喂入不好的食材,从而吐出毒素。大问题在于:我们旧有的、僵硬的藏宝图(STRIDE 清单)能否发现戏弄这位新巫师的诡计?如果我们试图用设计给石造要塞的地图去寻找魔法图书馆里的间谍,我们会错过真正的危险吗?这篇论文深入探讨了这一问题,询问我们现有的安全工具是否已经为“AI 巫师时代”做好了准备。
论文的故事:用旧地图测试新巫师
这篇论文的作者们——一支由安全研究人员和行业从业者组成的团队——决定对这个问题进行实测。他们没有仅仅坐在实验室里凭空猜测,而是深入到一家真实公司(一家中小企业,简称 SME)的“阵地”中。这家公司正在构建一个利用 AI 处理客户邮件并生成业务报告的系统。他们想看看三种不同的“威胁建模”方法在这一 AI 增强型系统上的表现如何。
为此,他们首先对最新的研究进行了快速扫描,以寻找专门为 AI 设计的最佳新方法。他们挑选了三个竞争者:
- M1 (AIaaS 框架): 该方法将系统视为一组资产(数据、模型、流程),并追问:“有人会如何破坏这些东西?”
- M2 (ADMIn 框架): 该方法侧重于三个主要的攻击面:数据、模型和输入。
- M3 (ThreatFinderAI): 一种带有工具支持的高级方法,它使用一种特殊的语言来绘制系统的 AI 部分,并连接到一个庞大的已知 AI 攻击数据库,以自动发现威胁。
他们将这三种方法应用于该公司的系统(该系统使用大语言模型 LLM 来阅读邮件并撰写报告)。随后,他们将发现的结果与著名的 AI 风险“前十名”列表(OWASP LLM Top 10)进行对比,以查看哪种方法捕捉到了最重要的危险。最后,他们询问了该公司的实际开发人员对于使用这些方法的看法。
他们的发现:好的、坏的以及缺失的部分
结果既有“还不错”也有“我们需要做得更好”的反馈。
好消息:
所有三种方法在识别“经典”AI 伎俩方面都表现得相当出色。它们成功识别了提示词注入(用户通过诱导让 AI 忽略其规则)、数据投毒(通过坏数据破坏模型)以及敏感信息泄露(AI 不小心泄露秘密)。带有工具支持的方法 M3 是明显的赢家。它发现了最多的威胁,对开发者来说最容易使用,而且感觉最不像是一项苦差事。这就像拥有一个金属探测器,当它发现埋在地下的硬币时会发出响亮的哔哔声,而不是用勺子去挖。
坏消息(差距):
在这里,旧地图显得力不从心。这些方法在识别与软件供应链(例如,如果 AI 模型本身是用被盗或损坏的零件制造的)以及过度代理/权限过大(当 AI 被赋予过多的决策权而无需人类检查时)相关的风险方面,表现出支持有限。
- 供应链: 没有一种方法能提供专门的方式来建模或识别来自 AI “原料”的风险。如果 AI 模型是从一个可疑网站下载的,这些方法缺乏能够有效标记它的特定语法或清单。
- 以人为中心的风险: 他们也忽略了人类过度信任 AI 的危险。如果 AI 写了一段看起来完美但实际上很危险的代码,而人类开发者只是直接复制而没有检查,这就是一个巨大的风险。这些方法无法很好地描绘出这种“盲目信任”是如何破坏系统的。
开发人员怎么说:
尝试过这些方法的开发人员认同数据结论。他们非常喜欢 M3,因为它有一个工具可以承担繁重的体力活。他们觉得其他方法太依赖人工,且耗时太长。然而,他们都指出了一道主要障碍:这些方法无法轻易融入他们的日常工作流。他们需要清单、模板,以及一种能将安全发现直接连接到他们的任务管理软件(如“工单”系统)的方法。一位开发人员说:“有了模板会容易得多,”另一位则指出,如果没有这些工具,他们自己是抓不住数据泄露风险的。
启示:我们需要为新城堡绘制新地图
论文指出,虽然我们目前的工具在捕捉明显的 AI 伎俩方面是一个良好的开端,但对于全貌而言还远远不够。目前,我们在面对来自供应链(AI 从何而来)以及人类过度信任 AI 的风险时,处于盲区。
作者提出,未来的安全建模需要在三个方面发生变化:
- 纳入供应链: 我们需要的地图不仅要展示城堡,还要展示运送砖块的道路以及制造砖块的人。
- 使用工具和提示词: 我们需要自动化工具来帮助我们快速绘制这些地图,甚至可以利用 AI 来帮助我们寻找威胁。
- 关注人类: 我们需要对人类如何与 AI 互动进行建模,特别是要寻找人类可能变得懒惰并盲目信任错误答案,从而将一个小错误演变成一场大灾难的时刻。
简而言之,论文认为我们不能仅仅修补旧地图;我们需要绘制全新的地图,将魔法、供应链以及人类过度信任巫师的倾向都考虑在内。在此之前,我们的 AI 城堡在纸面上看起来可能很安全,但可能仍然存在我们甚至还没想到要去锁上的秘密通道。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。