← 最新论文
💬 NLP

AnyPoC: Universal Proof-of-Concept Test Generation for Scalable LLM-Based Bug Detection

本文提出了 AnyPoC 框架,通过多智能体协作进行事实核查、迭代生成与独立验证,将大模型生成的静态漏洞报告转化为可执行的证明概念(PoC),从而在跨多种语言的大型软件系统中显著提升了漏洞检测的准确性并发现了大量新漏洞。

原作者: Zijie Zhao, Chenyuan Yang, Weidong Wang, Yihan Yang, Ziqi Zhang, Lingming Zhang

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Zijie Zhao, Chenyuan Yang, Weidong Wang, Yihan Yang, Ziqi Zhang, Lingming Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 AnyPoC 的新系统,它的核心任务可以概括为:给大语言模型(LLM)找到的“软件漏洞”做一个“实锤”验证。

为了让你更容易理解,我们可以把整个软件世界想象成一个巨大的**“城市”,而软件里的 Bug(漏洞)就像是城市里隐藏的“陷阱”**。

1. 现状:只有“目击者”,没有“证据”

以前,我们利用大语言模型(AI)来检查代码,就像雇佣了一群**“超级侦探”**在城市里巡逻。

  • 侦探的能力很强:它们能阅读海量的代码(城市地图),发现很多可疑的地方,并报告:“这里有个陷阱!”
  • 但问题在于:侦探的报告通常只是**“口头猜测”**(比如:“我觉得这里有个坑”)。
  • 人类的困境:作为城市管理者(开发者),你不能只听侦探说“有坑”就立刻去修。你必须亲自跑过去看一眼,确认是不是真的。如果侦探报告了 1000 个坑,其中 900 个是它看错了(误报),你就得累死在去现场的路上。这就是**“人工验证瓶颈”**。

2. 新方案:AnyPoC —— 自动化的“陷阱测试员”

AnyPoC 的出现,就是为了解决这个问题。它不再只给口头报告,而是直接制造一个“陷阱演示视频”(也就是论文里说的 PoC,概念验证)。

  • 它的目标:不管侦探(AI)报告了什么,AnyPoC 都要尝试现场搭建一个陷阱,并让人亲眼看到人掉进去(触发 Bug)。
    • 如果真的能把人掉进去:那就是真凶,证据确凿,立刻修!
    • 如果搭不起来,或者没人掉进去:那就是侦探看走眼了,直接忽略,不用浪费人力。

3. 它是如何工作的?(三个角色的“特工小队”)

AnyPoC 不像以前的 AI 那样单打独斗,它组建了一个**“特工小队”**,分工明确,互相监督:

  • 角色一:分析员(The Analyst)—— “先过脑子”

    • 在动手之前,先仔细读侦探的报告。如果报告里逻辑不通(比如“这里有个不存在的函数”),分析员直接把它驳回,省得后面白忙活。
    • 比喻:就像警察在出警前先看报案内容是否合理,如果是恶作剧就直接挂断。
  • 角色二:生成员(The Generator)—— “动手搭建”

    • 如果报告通过了,生成员就开始动手。它会去代码库里找工具、写脚本、配置环境,试图复现那个 Bug。
    • 它会不断尝试、失败、再调整,直到写出一个能成功触发 Bug 的“演示程序”。
    • 比喻:就像工程队接到指令,开始在现场挖坑、放炸药,看能不能炸出个坑来。
  • 角色三:检查员(The Checker)—— “独立复核”

    • 这是最关键的一步!生成员写好的程序,检查员会完全不知道生成员是怎么想的,在一个全新的环境里重新运行一遍
    • 如果检查员发现:“咦?刚才生成员说炸了,但我怎么没听到声音?”或者“这个演示程序是靠作弊(比如修改了不该改的系统文件)才成功的”,检查员就会一票否决
    • 比喻:就像审计员,完全独立地重新走一遍流程,防止工程队“造假”或“自导自演”。

4. 为什么它这么厉害?(自我进化的“知识库”)

以前,每次遇到一个新系统(比如 Chrome 浏览器、Firefox、Redis 数据库),AI 都要从头学起,非常慢。

  • AnyPoC 有个“智慧大脑”(知识库)
    • 当它在 Firefox 上学会了“怎么调试内存溢出”,下次遇到类似的问题,它就能直接调用这个经验。
    • 它还会自我进化:如果某个方法好用,它就记下来;如果某个方法行不通,它就删掉或修改。
    • 比喻:就像一个拥有“超级笔记”的工匠,每修好一个城市的陷阱,就把经验记在笔记本上。下次遇到类似的城市,他不用重新摸索,直接翻笔记就能干活。

5. 成果:实打实的“战果”

论文里说,AnyPoC 在 12 个世界顶级的软件系统(包括 Firefox、Chrome、OpenSSL 等,这些系统代码量巨大,像几百万行)上进行了测试:

  • 抓真凶:它发现了 122 个 新漏洞,其中 105 个 被开发者确认是真的,86 个 已经被修复。
  • 去伪存真:对于 AI 瞎报的假漏洞,它能9.8 倍 地过滤掉(以前的 AI 工具经常误报,浪费大家时间)。
  • 留下证据:它生成的 45 个 演示程序,直接被这些大项目采纳,变成了官方的**“回归测试”**(以后每次更新代码,都要跑一遍这个程序,确保那个坑不会再出现)。

总结

AnyPoC 就像是给 AI 侦探配了一个“自动验尸官”和“现场重建师”。
它不再满足于 AI 说“这里有鬼”,而是要求 AI 必须**“把鬼抓出来给大家看”。如果抓不出来,就证明没鬼。这让 AI 找 Bug 变得真正实用、可规模化**,不再需要人类开发者一个个去验证那些真假难辨的报告。

这就好比以前是**“听风就是雨”,现在是“不见兔子不撒鹰”**,让软件安全变得既高效又可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →