← 最新论文
💻 computer science

Detecting Vulnerability-Inducing Commits via Multi-Stage Reasoning with LLM-Based Agents

本文介绍了 VIC-RAGENT,这是一个基于大语言模型(LLM)的多智能体框架,该框架通过采用多阶段推理和专门的智能体,与现有方法相比,显著提高了漏洞诱发型提交的检测能力和可解释性。

原作者: Liyou Chen, Hailong Sun, Xiang Gao, Yue Pan

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Liyou Chen, Hailong Sun, Xiang Gao, Yue Pan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一个繁忙、庞大的建筑工地负责人,成千上万的工人(开发者)正在不断地为一座巨大的、不断增长的摩天大楼(软件)增加新房间、修复漏水或重新设计走廊。每当一名工人提交变更时,他们都会交给你一个“提交”(commit)——这是一个包含一份关于他们做了什么内容的说明以及变更蓝图的小型包裹。

你的职责是识别漏洞诱发型提交(Vulnerability-Inducing Commits, VICs)。这些是工人包裹中微小且往往隐形的错误,这些错误最终可能将一扇无害的新门变成骗子(黑客)的陷阱门。

问题在于,这些错误非常狡猾。一名工人可能会说:“我只是在修理一个吱吱作响的铰链,”但他们实际上却不小心拆除了一把锁。传统的安保人员(旧的软件工具)经常会错过这些微妙的陷阱,因为他们只看表面,或者试图通过快速的一瞥来猜测整个故事。

VIC-RAGENT 应运而生,这是该论文提出的一种新型安全团队。他们不再使用一个疲惫不堪、试图包揽一切的保安,而是使用一个由专业专家组成的团队,他们在严格的、循序渐进的过程中协同工作。

专家团队(多智能体系统)

你可以将 VIC-RAGENT 想象成一家高端侦探社,拥有四个特定的角色:

  1. 结构分析师(代码分析师): 这位专家暂时忽略工人的便条,只严格观察蓝图。他们会问:“这面新墙是如何与建筑物的其余部分连接的?它是否阻塞了消防出口?”他们绘制出代码的物理结构图。
  2. 意图分析师(目标分析师): 这位专家阅读工人的便条(提交信息),并将其与蓝图进行对比。他们会问:“工人说是在修理漏水,但实际上却移动了一面承重墙吗?”如果故事与实际工作不符,这就是一个红旗(警示信号)。
  3. 漏洞检查员(侦探): 这是主要调查员。他们获取结构图和意图故事,开始搜寻特定类型的陷阱(如脆弱的锁、敞开的窗户或暴露的电线)。
  4. 文档专家: 如果检查员发现了一个真正的陷阱,这个人会撰写一份详细的报告,并将其存档到巨大的图书馆中供未来参考。

三阶段推理过程

该团队并不会在看到一个包裹后立即判定其为“安全”或“危险”,而是使用一个三阶段推理过程,随着步骤的推进变得越来越谨慎。

第一阶段:“宁可错杀,不可错过”的全面清查(初步检查)
检查员撒下一个非常广泛的网。他们观察代码并说:“嗯,这可能是个问题。”他们被允许表现得有些偏执。他们的目标是抓住所有可能是漏洞的东西,即使他们还没有 100% 确定。他们会生成一份“嫌疑人”名单。

  • 类比: 这就像机场的金属探测器。它会对皮带扣甚至枪支都会发出鸣叫。它会产生很多虚假警报,但它确保你不会漏掉武器。

第二阶段:“查阅手册”的二次复核(重新分析)
现在,团队拿着那份冗长的嫌疑名单开始认真对待。他们再次检查每一个嫌疑对象,但这一次,他们会使用一本特定的规则手册(预测的漏洞类型)并检查他们的“往事犯罪记录库”(知识库)。

  • 类比: 想象一下金属探测器响了。现在,一名安保人员拿出了手册:“如果它是皮带扣,通常是安全的。但如果它看起来像一把枪,请检查手柄。”他们还会查看过去的盗窃数据库,看看这个物品是否看起来像以前小偷使用的东西。这一步过滤掉了无害的鸣叫,并将注意力集中在真正的威胁上。

第三阶段:最终裁决(决策)
最后,团队做出正式判决。他们会以极度谨慎的态度对剩余的嫌疑对象进行复核。如果哪怕只有一段代码被证实是陷阱,整个包裹都会被标记为危险。

  • 类比: 这是最后的安检关卡。如果官员仍不确定,他们可能会让此人通过(以避免阻碍无辜的人),但如果他们确定了,他们就会拦截包裹。这一阶段旨在非常严格,以避免虚假报警,确保当他们说“危险”时,他们真的意味着危险。

为什么这个团队能胜出

论文将这个团队与其他方法(例如试图包揽一切的单个保安,或者仅仅进行逐步思考的保安)进行了对比测试。

  • 结果: VIC-RAGENT 团队发现的实际漏洞数量是之前最好方法的两倍。它们在捕捉那些被他人遗漏的隐蔽陷阱方面表现得更好。
  • 权衡: 与单个保安相比,这个团队运行起来稍微慢一些,成本也稍高一些(因为他们需要互相交流并查阅图书馆)。然而,在安全领域,捕捉坏人比速度更重要。
  • 图书馆: 因为他们会在每件确认的陷阱上撰写报告并将其添加到图书馆中,所以他们会随着时间的推移变得越来越聪明。如果出现了一种新的陷阱类型,他们可以查找类似的过往案例,从而帮助他们识别。

总结

VIC-RAGENT 就像是从一名单一的保安升级到了一个专门的、多阶段的侦探社。他们不只是猜测;他们将问题分解为理解结构、理解意图、撒网搜寻、对照历史记录,并最终做出严格的、经过验证的决策。这种方法帮助软件团队在漏洞被利用之前就捕捉到危险的 Bug,让数字世界变得更加安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →