← 最新论文
💻 computer science

AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation

本综述调查了由“AI 废料”(AI slop)和幻觉引起的 AI 驱动漏洞评估中的信任危机,并指出要弥合概率性大语言模型生成与专家演绎推理之间的鸿沟,需要从被动检测转向主动的神经符号验证,并引入如 CVE-Bench 和 Slop-Score 等具有数学可验证性的评估指标。

原作者: Junchen Ding, Jialiang Dong, Yichen Zhu, Yi Liu, Gelei Deng, Willy Susilo, Siqi Ma, Yuekang Li

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Junchen Ding, Jialiang Dong, Yichen Zhu, Yi Liu, Gelei Deng, Willy Susilo, Siqi Ma, Yuekang Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:漏洞评估中的 AI Slop(AI 废料)与幻觉

1. 问题陈述

将大语言模型(LLMs)集成到网络安全漏洞评估中,引入了由 “AI slop”(AI 废料)扩散驱动的“信任危机”。不同于传统基于规则的静态应用安全测试(SAST)所产生的保守型误报,AI slop 指的是那些具有高度语言流畅性和结构合理性,但缺乏语义有效性或可执行依据的安全产物(报告、概念验证、补丁)。

这些产物包括:

  • 幻觉漏洞: 伪造的常见漏洞披露(CVE)、不存在的 API 以及脱节的执行路径。
  • 错误的补丁合成: 仅解决表面症状而忽略根本原因,或引入新回归问题的修复程序。
  • 语义重组: 将现有的知识或“沉默”(未公开)的修复方案重新包装成看似新颖且权威的报告。

这种现象在人类分拣流水线中造成了类似于拒绝服务(DoS)攻击的认知负担。其核心问题在于根本性的推理差距:人类安全专家依赖于基于系统约束的因果、多步演绎推理,而自回归 LLM 则通过基于统计相关性的概率性 Token 生成进行操作。当信息超出 LLable 的推理视界时,它会默认转向统计学上合理的延续,而非经过验证的事实。

2. 研究方法

本文采用系统性文献综述概念分析来调查经验证据并使问题形式化。

  • 文献检索: 作者使用 LLM 和安全相关的关键词查询了 IEEE Xplore、ACM Digital Library 和 arXiv。两名独立评审员筛选结果,保留了具有 LLM 在安全语境下失效模式经验证据的研究。
  • 分类法构建: 基于推理失败的性质,将失效情况分为三个主要分支。
  • 差距分析: 本文对比了人类认知模型(演绎式、保持不变性)与 LLM 架构约束(概率性、受上下文窗口限制)之间的差异。
  • 指标提议: 作者通过一个可衡量的代理指标——**演绎覆盖度得分(DCS)**将推理差距操作化,并提出了新的评估工具(CVE-Bench、Slop-Score)。
  • 架构审查: 审查了现有的缓解策略(被动检测、水印技术),并对其进行了批判,随后提出了主动的神经符号验证架构。

3. 核心贡献

A. AI Slop 的形式化与分类法

本文定义了网络安全领域的 AI slop,并建立了一个包含三种不同失效模式的分类法:

  1. 幻觉漏洞: 模型为了满足提示词预期而虚构缺陷(例如,伪造的 CVE、不存在的 API)。这包括谄媚式幻觉(在安全代码中寻找漏洞)和Token 偏差混淆(基于表层语法变化改变判断)。
  2. 错误的补丁合成: 模型生成的补丁虽然可以编译并通过表面检查,但未能解决底层问题,或引入了新的安全回归(例如,以一种 CWE 替换另一种 CWE)。
  3. 语义重组: 模型将现有信息(包括来自开源提交的沉默修复)重新塑造为“新颖”的报告。这利用了公开真相在处理未公开修复时的缺失,使得重组后的主张无法通过基于查找的验证来检测。

B. 对推理差距的分析

本文指出根源在于人类演绎推理LLM 概率生成之间的分歧:

  • 人类专家: 构建心理模型,跨越程序边界追踪数据流,并验证约束。他们在证明之前对发现持怀疑态度。
  • LLMs: 根据训练分布估计 Token 概率。它们将熟悉的模式(API 调用、变量名)拼接在一起,而不验证单一的执行路径。
  • 当前缓解措施的局限性: 作者认为思维链(CoT)提示和工具调用智能体(Agents)虽然缩小了差距,但并未消除差距。CoT 通常导致更长但同样错误的推理链,而工具使用往往导致“工具使用臆造”,即智能体误解工具输出。

C. 对被动检测与水印技术的批判

本文认为,目前针对溯源性(确定文本是否由机器编写)的缓解策略与正确性的需求不匹配。

  • 统计检测: 会失效,因为安全报告本质上是公式化的(低词汇多样性),这会导致人类编写的报告产生高误报率。
  • 水印技术: 与安全逻辑不兼容;在受限的代码领域强制执行水印 Token 选择往往会破坏逻辑或创建无效的负载。

D. 提议的解决方案与评估工具

  • 神经符号验证: 作者倡导一种架构,其中 LLM 作为假设生成器,其输出必须经过确定性验证(静态分析、动态模糊测试、符号执行)后才能到达人类分析师手中。
  • 演绎覆盖度得分 (DCS): 一个量化漏洞主张在多大程度上基于显式的、可验证的证据(如特定的代码引用、执行轨迹)而非统计插值的指标。
  • CVE-Bench: 一个旨在测试分拣系统区分有据可查的报告与流畅的虚假漏洞路径能力的基准测试,使用执行验证的地面真值(ground truth)。
  • Slop-Score: 一个连续指标,量化语言流畅度与可验证实质之间的差距,惩罚那些虽流畅但缺乏证据密度或约束满足度的产物。

4. 结果与发现

  • 经验证据: 调查显示,在某些漏洞赏金计划中(例如 2025 年中期前的 HackerOne),大约 20% 的报告被识别为低质量的 AI slop,导致某些计划(例如 2026 年的 cURL 赏金计划)因无法区分有效的报告与 AI 生成的噪声而被迫中止。
  • 落地缺失: 对代表性工作的回顾(表 1)显示,没有任何研究提供 LLM 输出的执行级验证。发现的最强落地手段仅为编译检查或静态分析,这远低于严谨安全推理的要求。
  • 局部桥接的失败: 虽然 ReAct 和检索增强生成(RAG)等工具减少了事实性幻觉(例如,虚构不存在的 CVE),但它们无法解决逻辑幻觉(从准确的事实中得出因果错误的推论)。

5. 重要性与主张

本文定位为一篇综述、概念分析及路线图。其主要意义在于将评估范式从语言流畅度转向数学可验证性

  • 结构性失效: 作者断言,AI slop 不仅仅是一个性能问题,而是一个结构性失效,即概率生成取代了因果验证。
  • 可信度: 通过更好的提示工程或溯源追踪无法实现对 AI 驱动的分拣信任。这需要主动的神经符号验证,将每个流水线组件映射到具有记录限制的先前系统(例如,符号执行的路径爆炸限制)。
  • 未来方向: 本文总结道,网络安全领域可信的 AI 将诞生于将“生成”视为“验证流水线起点”的系统,确保人类判断仅作用于那些已通过确定性测试的主张。所提出的指标(DCS、Slop-Score)和基准测试(CVE-Bench)旨在提供必要的架构,从而从系统中消除这种结构性失效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →