← 最新论文
📄 other

Hardening vibe-coded web applications with an automated security-audit skill: a controlled comparison of two builds of the same app

本文表明,将自动化安全审计技能集成到“氛围编程”(vibe coding)过程中,能显著提升 AI 生成 Web 应用的安全性,在对两个相同电子商务演示版本的受控对比中,将未缓解风险降低了 99%,并消除了所有高危漏洞。

原作者: Piyush Omanwar

发布于 2026-07-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Piyush Omanwar

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在盖房子,但你不是亲自动手铺砖,而是请了一个超级快速、才华横溢的机器人来帮你。你给机器人一个简单的句子,比如“给我盖一座带红门的小巧温馨小屋”,几秒钟之内,它就递给你一座看起来完美的房屋。这就是“氛围编程”(vibe coding)的世界,在这种模式下,人工智能(AI)可以通过简短的提示词编写出完整的可用应用程序。这就像魔法一样:你瞬间就能得到成品。但问题在于:这个机器人非常擅长让东西“看起来”很棒且“运行”得很快,但它经常会忘记那些枯燥、隐形的安全性工作。它可能会忘了锁上前门,或者忘了安装烟雾报警器,亦或是把后门大开,因为这些东西在快速参观时并不会让房子看起来更漂亮。

在计算机安全领域,这些隐形的缺口被称为漏洞。你可以把它们想象成地基中的隐藏裂缝,或者是没锁好的窗户。对于专业团队来说,会有安全守卫(人类专家)在任何人入住之前检查这些细节。但对于使用 AI 的个人开发者来说,没有人会进行检查。机器人直接把钥匙交给了你,而开发者甚至可能不知道这栋房子是不安全的。这篇论文提出了一个简单而至关重要的问题:如果我们把同一栋房子盖两次——一次是只有机器人,另一次是机器人加上一个特殊的“安全检查员”——那么第二栋房子会变得安全多少?研究人员想看看,添加一个简单的自动化检查,是否能将一个摇摇欲坠、不安全的应用程序转变为一座堡垒,同时又不减慢构建过程中的乐趣和速度。

实验:两个应用,一个核心差异

研究人员设置了一个受控实验,使用了一个名为“Northwind”的虚拟在线商店。他们要求 AI 构建了两次这个商店。第一个版本,我们称之为 App A,是由机器人单独构建的。第二个版本,App B,是由同一个机器人构建的,但这一次,机器人在其基础上附带了一项特殊的“安全审计技能”。这项技能就像是一个不知疲倦的检查员,运行着一个五步循环:它扫描代码、标记问题、修复问题,然后再次扫描以确保修复确实生效。

这次实验的关键在于,这两个应用之间唯一的区别就是这项安全技能。给 AI 的提示词是完全相同的,核心功能(产品、购物车、结账)也完全一样。这确保了任何安全性的差异并非因为 AI 运气好或改变了设计,而纯粹是因为那个安全检查员的作用。

结果:巨大的安全性提升

结果是令人震撼的。当他们根据 16 项不同的安全规则(例如拥有“内容安全策略”,即一条告知浏览器允许运行哪些脚本的规则手册,以及“引用策略”,用于防止应用向其他网站泄露你的浏览历史)对两个应用进行评分时,差异巨大。

  • App A(无安全技能): 得分为 58 分(满分 100)。它存在 16 个安全问题,其中包括四个“高严重性”漏洞。这些是危险的缺口,比如前门缺少锁具。总“风险值”被衡量为 100 个单位
  • App B(有安全技能): 得分为 99 分(满分 100)。安全技能几乎修复了一切。它消除了所有四个高严重性漏洞,并将问题总数从 16 个减少到了仅剩 1 个。总风险值从 100 个单位降至 1 个单位

用直观的数字来说,安全技能将未缓解的风险降低了 99.0%。剩下的那一个风险是一个特定的检查项,该项需要真实的后端服务器(而这个演示程序并不具备),因此该技能诚实地将其标记为仍需人工处理的事项,而不是假装它已被修复。

为什么这很重要:“故障”红利

最有趣的发现之一不仅在于阻止黑客攻击,还在于防止应用自身崩溃。研究人员发现,如果你只是在一个混乱的应用中强行加入严格的安全规则,应用往往会崩溃。例如,如果你告诉浏览器“禁止使用外部脚本”,但应用的某些代码正试图使用外部脚本,那么应用就会停止工作。

安全技能足够聪明,能够意识到这一点。在它添加严格规则之前,它会先回头清理代码,将样式和脚本移动到正确的位置,从而确保应用依然看起来完美且运行顺畅。它不仅修补了漏洞,还加固了整个结构,使得安全规则不会导致房屋坍塌。

论文的观点(以及它并未声称的内容)

论文明确说明了它没有证明的内容。它并不声称该应用现在是“无懈可击”的,或者你可以完全不再担心安全问题。作者强调,这是一个静态演示(一个带有虚假支付功能的虚拟商店),对于涉及真实资金和真实用户数据的现实世界应用,仍然需要专业的安全专家进行深度的渗透测试。那 99% 的提升是针对此类应用中可以自动化的控制项而言的。

然而,论文强烈暗示,对于数百万个由爱好者和独立开发者使用 AI 构建的小型应用来说,这种内置的自动化审计是一个游戏规则的改变者。它表明,通过将安全检查直接融入 AI 的工作流中,我们可以大幅提高软件的“安全底线”,将过去那种危险的“氛围编程”习惯转变为一种更加可靠的方式。研究结论指出,这种方法是一种低成本、高影响力的步骤,通过让“安全路径”成为“默认路径”,使 AI 生成的软件安全性提高了约两个数量级。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →