← 最新论文
🤖 machine learning

NeuronFuzz: Safety Neuron Guided Fuzzing for LLM Safety Evaluation

NeuronFuzz 是一个白盒模糊测试框架,它利用内部安全神经元激活作为连续且可微的反馈,以高效地识别安全敏感的提示词位置并生成有效的越狱攻击,且无需生成完整的响应,在发现不同大语言模型漏洞方面显著优于现有方法。

原作者: Zhiyuan Xu, Muhammad Firhard Roslan, Joseph Gardiner, Sana Belguith, Lichao Wu

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiyuan Xu, Muhammad Firhard Roslan, Joseph Gardiner, Sana Belguith, Lichao Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:NeuronFuzz

问题陈述

安全评估对于确保对齐的大型语言模型(LLMs)能够抵御越狱攻击(jailbreak attacks)至关重要。然而,现有的自动化测试方法过度依赖于响应级反馈(response-level feedback)。在这种范式下,每一个候选提示词都必须提交给目标模型,通过自回归解码生成响应,然后由分类器或评判器进行评估。这种方法存在两个根本性的局限性:

  1. 搜索反馈稀疏: 在强对齐的模型上,大多数经过变异的提示词都会被拒绝,导致产生相同的“失败”结果。响应级评估无法区分一个候选提示词是保持了原有的安全机制,还是显著削弱了该机制但最终未能产生成功的越狱。这种缺乏细粒度的问题使得模糊测试器(fuzzers)在决定保留哪些候选者时缺乏有效的指导。
  2. 响应生成的成本高昂: 与仅处理输入提示词相比,为每个候选者生成完整的响应在计算上是非常昂贵的。这为需要评估大量候选者的自动化模糊测试带来了可扩展性瓶颈。

方法论:NeuronFuzz

本文提出了 NeuronFuzz,一种白盒模糊测试框架,它利用源自安全神经元激活的连续内部反馈,取代了昂贵且稀疏的响应级评估。该框架主要分为两个阶段:

1. SafetyOracle(安全预言机)构建

NeuronFuzz 的核心是一个轻量级的 SafetyOracle,它将模型的内部激活映射为一个连续的“安全警报分数”(SalarmS_{alarm})。

  • 模板无关的激活提取: 为了确保信号捕捉的是有害意图而非越狱模板的伪影,作者构建了共享相同越狱模板但包含不同有害或良性负载(payloads)的输入对。他们在预填充阶段(prefill stage)(即生成响应之前)提取 Transformer MLP 块中门控投影(gate projection)和上升投影(up projection)的激活值。
  • 稳定性感知神经元选择: 原始激活是高维且带有噪声的。作者采用基于自助法(bootstrap-based)的稳定性选择过程来识别一组紧凑的“安全神经元”。这些神经元在跨重采样训练集时,对有害输入始终表现出正系数,从而确保了对采样变化的鲁棒性。
  • 评分头: 训练一个带有 Elastic Net 正则化的逻辑回归模型,将选定的神经元激活映射为一个连续得分 Salarm(x)(0,1)S_{alarm}(x) \in (0, 1)。得分越高,表示内部对有害意图的识别越强;得分越低,则表明安全机制正在被绕过。

2. 梯度引导的模糊测试流水线

NeuronFuzz 将 SafetyOracle 集成到一个避免了中间候选者响应生成的模糊测试循环中:

  • 种子调度(Seed Scheduling): 使用蒙特卡洛树搜索(MCTS)来选择有潜力的越狱模板进行变异。
  • 梯度引导的变异: 由于 SafetyOracle 得分相对于输入嵌入(embeddings)是可微的,该框架通过计算梯度来识别模板内的安全敏感 Token 位置
  • 上下文兼容的变异: 使用掩码语言模型(MLM)为选定的敏感位置生成流畅的替换词。至关重要的是,变异仅限于越狱模板本身;有害负载保持冻结状态。这在保留自然语言结构和核心有害意图的同时,探索了提示词框架的变化。
  • 反馈循环: 候选者通过**仅预填充(prefill-only)**的过程进行评估,以收集安全神经元激活。SafetyOracle 分配一个连续得分,作为更新种子调度的奖励信号。目标模型仅在最终验证成功的越狱时才生成响应。

核心贡献

  1. 全新的模糊测试视角: 引入了使用内部安全神经元激活作为执行反馈的方法,用预填充阶段即可获得的连续信号取代了昂贵的响应级评估。
  2. SafetyOracle 设计: 开发了一种基于模板无关激活提取和稳定性感知神经元选择的轻量级预言机。其可微得分既能指导候选者排名,也能定位安全敏感的模板位置。
  3. NeuronFuzz 框架: 结合了仅预填充反馈与梯度引导的掩码 Token 变异,在保留有害负载和自然语言结构的同时,高效地探索越狱模板。
  4. 广泛的评估: 在 21 个文本和多模态模型上验证了该方法,证明了其在越狱发现、效率和迁移性方面的提升。

实验结果

作者在五个白盒源模型(DeepSeek-R1-14B, GPT-OSS-20B, Gemma-3-4B-it, Gemma-4-E4B-it, Llama-3.1-8B-Instruct)上评估了 NeuronFuzz,并测试了其对 16 个额外目标模型(包括专有 API)的迁移能力。

  • 越狱发现率 (JDR): NeuronFuzz 在五个源模型上实现了 76–100% 的 JDR,在强对齐模型上比基线(GCG, AutoDAN, PAIR, LLM-Fuzzer)高出多达 48 个百分点(例如,在 GPT-OSS-20B 上为 96%,而 LLM-Fuzzer 仅为 48%)。
  • 效率: 通过消除中间候选者的响应生成,NeuronFuzz 实现了 1.0 的每次发现所需响应生成数 (RGD)(仅在最终验证时生成响应)。这使得每次发现的端到端时间 (ETD) 显著低于基线,基线通常需要数百次响应生成。
  • 通用模板: 该框架成功优化了可跨不同有害负载通用的共享模板,在白盒目标模型上实现了 92.6% 的集成攻击成功率 (EASR)(前 5 个模板)。
  • 迁移性: 优化的模板可以零样本迁移到开源权重和专有目标模型。在开源模型上,该方法实现了 69.6% 的平均 ASR92.6% 的前 5 名 EASR。在专有 API 上,它实现了 44.1% 的平均 ASR60.0% 的前 5 名 EASR
  • 预言机有效性: 安全警报分数与越狱成功率呈现强负相关性(Spearman 系数 0.96\approx -0.96),证实了即使在生成响应之前,较低的内部安全得分也能可靠地预测成功的越狱。

意义与主张

本文声称 NeuronFuzz 通过利用 LLM 的内部状态,解决了当前自动化安全测试中的根本效率问题。其意义在于:

  • 克服稀疏性: 提供了一种稠密的、连续的反馈信号,使模糊测试器能够区分“有前景的”和“无前景的”失败候选者,而这种能力在响应级方法中是缺失的。
  • 可扩展性: 通过移除搜索阶段的自回归解码过程,大幅降低了安全评估的计算成本。
  • 鲁棒性: 证明了即使在响应级反馈通常是二元且缺乏信息量的强对齐模型上,内部安全信号仍然具有信息量。

作者将 NeuronFuzz 定位为授权评估者(开发者、审计员)在部署前系统性识别安全弱点的工具,同时也作为攻击者优化可迁移越狱攻击的一种手段,强调了内部模型分析的双重用途性质。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →