← 最新论文
💻 computer science

A Validated Prompt Bank for Malicious Code Generation: Separating Executable Weapons from Security Knowledge in 1,554 Consensus-Labeled Prompts

本文介绍了一个经过验证的包含 1,554 个提示的"CODE"库以及一个共识标注的分类框架,该框架严格区分可执行的恶意软件请求与有害的安全知识查询,以解决现有语言模型安全基准中存在的混淆问题。

原作者: Richard J. Young, Gregory D. Moody

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Richard J. Young, Gregory D. Moody

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在测试一名保安阻止坏人的能力。你有一份要交给保安的请求清单。有些请求就像把一把上了膛的枪递给保安,说:“射杀这个人。”而其他请求则像把一本教科书递给保安,说:“解释一下枪是如何工作的,以及如何瞄准。”

长期以来,测试人工智能安全性的研究人员一直将这两类请求混杂在一个大堆里。他们会要求人工智能“编写病毒”(上膛的枪)和“解释病毒如何传播”(教科书),然后仅仅统计人工智能说“不”的次数。

本文的作者理查德·J·扬(Richard J. Young)和格雷戈里·D·穆迪(Gregory D. Moody)表示,这是一种混乱的测试方式。如果人工智能拒绝编写病毒,却愉快地解释教科书,反之亦然,那么单一的“不”计数无法告诉你人工智能内部究竟发生了什么。这就像试图通过统计保安阻止人们阅读关于子弹的信息的能力,来衡量其阻止子弹的能力。你无法判断这位保安是擅长阻止武器,还是仅仅擅长阻止信息。

核心思想:将“武器”与“知识”分离

为了解决这个问题,研究人员创造了一种新工具:经过验证的提示库。你可以将其想象为一个高度组织化、经过双重检查的文件柜。他们从四个不同的现有测试列表中提取了数千个问题,并将它们分入两个截然不同的抽屉:

  1. “武器”抽屉:这些提示要求人工智能实际构建某种危险事物,例如恶意软件或可在计算机上运行的脚本。这些是“可执行的武器”。
  2. “知识”抽屉:这些提示要求人工智能描述危险事物,例如解释病毒的工作原理或如何黑客入侵系统,而不实际构建代码。

他们如何构建这个文件柜

他们不仅仅是自己整理这些文件;他们希望确保分类绝对正确。因此,他们组建了一个由五位不同人工智能法官组成的“陪审团”。这些法官来自五家不同的科技公司(Anthropic、OpenAI、Google、智谱 AI 和阿里巴巴)。

想象一下五位不同的专家审视同一个请求。他们都必须投票:“这是一个武器请求,还是仅仅是一个信息请求?”

  • 如果五分之三或以上的人达成一致,这就是最终答案。
  • 他们使用一种统计工具(称为 Fleiss' κ\kappa)来检查他们的工作,以查看他们达成一致的程度。结果是“几乎完美”的一致(1.0 中的 0.876)。这意味着分类极其可靠。

结果:一份干净、经过验证的清单

在筛选了超过 17,000 个原始请求并过滤掉重复或令人困惑的条目后,他们最终得到了一份干净、经过验证的1,554 个提示清单,这些提示纯粹是关于请求“武器”(恶意代码)的。他们还保留了一个较小的、包含 388 个关于“知识”的提示清单,以便日后进行比较。

为什么这很重要

在这篇论文之前,如果研究人员想要测试人工智能是否安全,他们必须自己构建一堆混乱的问题,猜测哪些是“武器”,哪些是“知识”。这意味着每项研究都略有不同,使得结果难以比较。

这篇论文提供了一套标准化、预先分类的问题集。现在,研究人员可以说:“我们在这特定的1,554 个武器请求上测试了人工智能”,而其他人确切地知道这意味着什么。它消除了猜测,并允许对不同人工智能模型处理危险请求的方式进行公平、直接的比较。

重要安全说明

作者非常明确:他们没有创建任何新的病毒或危险代码。他们只是从其他学术研究中提取了现有问题并进行了分类。该工具的目标是通过确切了解人工智能在何处失败来帮助研究人员使人工智能更安全,而不是帮助任何人构建攻击。数据被锁定在一个“受控”系统之后,意味着只有从事安全工作的认证研究人员才能获取问题的实际文本。

简而言之,这篇论文构建了一把更好、更干净的人工智能安全测量尺,将“做坏事”的请求与“谈论坏事”的请求分离开来,以便我们能够准确地测量它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →