← 最新论文
🤖 AI

SPARK: Security Knowledge Priming and Representation-Guided Knowledge Activation for LLM-based Secure Code Generation

SPARK 是一个无需重训的推理时框架,它通过将基于检索的安全线索与轻量级的预计算标记偏置相结合,在不牺牲效用的情况下激活潜在的安全知识,从而增强了大语言模型中的安全代码生成。

原作者: Xiaoyun Xu, Lichao Wu, Jona te Lintelo, Siyu Zhang, Stjepan Picek

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoyun Xu, Lichao Wu, Jona te Lintelo, Siyu Zhang, Stjepan Picek

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题: “沉睡的专家”

想象一下,你雇佣了一位才华横溢的大厨,他背下了世界上所有的食谱,包括关于食品安全和如何避免客人中毒的大量章节。然而,当你请他做一道简单的菜时,他往往会忘记安全规则,端上一份危险的食物。

这正是**大语言模型(LLMs)**在编写代码时经常发生的情况。这些模型是在海量数据上训练出来的,其中包含了安全手册和编程错误(漏洞)列表。然而,当被要求编写代码时,它们经常生成容易被黑客利用的不安全代码。

旧的修复方法:
以前,研究人员认为模型只是“不知道”足够的知识。因此,他们尝试了两种昂贵的修复方案:

  1. 重新训练(微调): 强迫大厨回到烹饪学校重新学习安全知识。这既缓慢又昂用,而且每请一位新大厨都需要开一门新课。
  2. 阅读笔记(检索): 在大厨做饭时,递给他一大叠安全手册让他阅读。这会弄乱他的工作空间并降低他的速度。

新思路:SPARK

本文的作者认为,大厨其实已经知道了安全规则;他们只是没有**“醒过来”**去使用它们。模型在工作中处于“睡眠”状态。

他们创建了一个名为 SPARK(安全知识启发与表示引导的知识激活)的工具。可以将 SPARK 想象成一个温柔的“唤醒铃”,也是一个在厨师开始烹饪前发生的“安全提醒”。它既不改变大厨的大脑,也不强迫他阅读新书,它只是提醒他已经掌握的知识。

SPARK 有两个部分:

第一部分:“特定提醒”(组件 I)

SPARK 不仅仅是简单地说“要安全!”(这太笼统了),它会观察具体的任务,并找到适用的精确安全规则。

  • 类比: 假设你正在编写一个 C++ 程序,将一段长字符串复制到一个小盒子里。模型可能会忘记盒子太小,从而导致文本溢出(缓冲区溢出)。
  • SPARK 的做法: 它查找针对这种错误的特定规则(在安全领域称为 CWE-120),并在提示词中添加一条精简且结构化的注释:“嘿,记住:不要让文本溢出!使用一种能检查盒子大小的方法。”
  • 结果: 这个特定的线索唤醒了模型的潜在知识。它意识到:“噢对,我知道这条规则!”并开始编写安全的代码。即使是在无法触及内部结构的闭源模型(如 GPT 或 Claude)上,通过改变发送给它们的文本,这也同样有效。

第二部分:“安全推力”(组件 II)

这一部分仅在你拥有模型内部“思维过程”访问权限(白盒设置)时起作用。

  • 类比: 想象大厨正在决定下一个要选哪种食材。他面前有一份清单,有些是安全的,有些是危险的。通常,他会选择最常见的那个,而那个可能是不安全的。
  • SPARK 的做法: 它计算一个“安全向量”——这是一个数学方向,指向“安全”并远离“不安全”。在编写代码的每一个步骤中,SPARK 都会给模型一个微小的、无形的推力,引导它走向安全的食材。
  • 结果: 这就像一只温柔的手,引导着大厨的手走向安全的香料,确保他不会不小心抓起毒药。这个过程是即时的,几乎不会增加烹饪过程的时间。

他们发现了什么?

研究人员在 9 种不同的开源模型和 7 种商业模型(如 GPT-5 和 Claude)上测试了 SPARK。

  1. 效果优于其他方法: SPARK 让模型编写的代码比旧方法(重新训练或阅读笔记)明显更安全。在许多情况下,它能将安全性仅为 2% 的模型转变为安全性 80% 以上的模型。
  2. 不会破坏代码: 一个主要的担忧是,让代码变得“更安全”可能会使其“出错”(例如,代码没有按用户要求执行)。SPARK 保持了代码运行完美。模型的标准编程测试表现与之前一样出色。
  3. 快速且廉价: 因为 SPARK 不需要重新训练模型或阅读大部头书籍,所以它非常快速。它只是添加了一个微小的注释和一个微小的数学推力。
  4. “唤醒”是真实的: 研究人员证明了模型确实知道这些安全规则。当使用 SPARK 时,模型的内部“想法”向着安全的方向偏移,证明了这个线索成功激活了已经存在的知识。

总结

论文声称,现代 AI 模型在安全方面并不是“愚笨”,它们只是**“休眠”**了。它们拥有知识,但需要正确的触发器来使用它们。SPARK 提供了这个触发器。它是一个轻量级、免费使用的工具,可以在不需要重建模型或降低速度的情况下,唤醒模型的安全本能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →