← 最新论文
💻 computer science

LLM vs. SAST: A Technical Analysis on Detecting Coding Bugs of GPT4-Advanced Data Analysis

本文通过一项受控研究表明,GPT-4(高级数据分析)在检测 32 种安全场景下的代码漏洞方面显著优于聚合静态应用程序安全测试(SAST)工具(SonarQube 和 Cloud Defence),其检测率达到 93.75%,而后者仅为 34.375%,且具有统计学显著性。

原作者: Madjid G. Tehrani, Eldar Sultanow, William J. Buchanan, Mahkame Houmani, Christel H. Djaha Fodja

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Madjid G. Tehrani, Eldar Sultanow, William J. Buchanan, Mahkame Houmani, Christel H. Djaha Fodja

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在试图抓捕一名潜伏在计算机程序代码中的狡猾小偷的侦探。多年来,你一直依靠一支机器人检查员团队(被称为 SAST 工具)来扫描代码。这些机器人非常擅长执行严格的清单:“如果你看到红色的门,就标记它。”但有时,小偷会躲在看起来像红色的蓝门后面,或者使用清单所不知道的诡计。机器人会漏掉这些狡猾的把戏,或者会被弄混,把无害的东西误标为危险。

现在,一名新的侦探加入了团队:GPT-4,一个能像读故事一样阅读代码的超级聪明 AI。大的疑问是:这个新的 AI 侦探能否比旧的机器人检查员更敏锐地发现这些棘手的安全漏洞?

伟大的侦探对决

为了找出答案,研究人员设计了一个公平的测试。他们创建了 32 个特定的“犯罪现场”(安全场景),这些场景基于现实世界的编码错误,比如留下后门或让坏人注入虚假命令。他们将这些场景交给了:

  1. 机器人团队: 两名不同的机器人检查员(SonarQube 和 Cloud Defence)。它们协同工作,如果其中任何一个机器人发现了问题,就算作机器人的胜利。
  2. AI 侦探: GPT-4,它被要求阅读代码并解释哪里出了问题。

计分板

以下是他们对比结果时发生的情况:

  • 机器人团队: 他们抓住了 32 起犯罪中的 11 起。大约成功率为 34%
  • AI 侦探: GPT-4 抓住了 32 起犯罪中的 30 起。其成功率高达 93.75%

研究人员使用了一种特殊的数学测试(称为 McNemar 检验)来确保这不仅仅是运气。结果是一个明确的“是”:在这项受控实验中,AI 侦探在发现这些特定漏洞方面,在统计学上明显优于机器人团队。

这意味着什么(以及不意味着什么)

论文指出,像 GPT-4 这样的 AI 可以成为机器人检查员强大的搭档。它擅长理解代码背后的“故事”,并能发现那些死板清单所错过的复杂诡计。这可以帮助开发人员更快地修复漏洞,甚至可能节省昂贵工具的费用。

然而,论文非常谨慎地表示,并不意味着机器人已经过时了。

  • 它不是魔杖: AI 并非完美无缺。它漏掉了 32 例中的 2 例,而机器人也抓住了一些 AI 没发现的东西。
  • 它不是替代品: 作者认为我们不应该直接丢弃机器人。相反,我们应该利用 AI 来辅助机器人,特别是针对那些需要类人推理能力的复杂案例。
  • 新的危险: 论文警告说,使用 AI 会带来新的风险。就像小偷可以欺骗机器人一样,坏人也可以欺骗 AI(使用诸如“提示词注入”或在训练数据中隐藏恶意指令等手段)。如果我们不小心,AI 甚至可能会生成看起来安全但实际上漏洞百出的代码。

底线

在这个针对 32 个精心挑选的案例进行的特定测试中,AI 侦探证明了它能看到机器人检查员所忽略的东西。但研究人员表示,这仅仅是个开始。我们需要保持警惕,持续测试,并记住,虽然 AI 是一个出色的新工具,但它还不是一个已解决的问题。它是一个强大的伙伴,但仍然需要人类来拿着手电筒并检查它的工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →