Code as a Weapon: A Consensus-Labeled Prompt Bank for Measuring Coding-Model Compliance with Malicious-Code Requests
本文介绍了一个共识标注的提示库,用于区分可执行的恶意代码与有害的安全知识,从而为衡量代码专用模型是否达到防止生成功能性武器所需的更严格拒绝标准,提供一个可靠且标准化的基准。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《代码即武器》的通俗解读,使用简单的语言和日常类比进行说明。
核心理念:文本 vs. 实物
想象一下,你问一个通用的聊天机器人:“如何制造炸弹?”如果它回答了,它给你的只是一份食谱。你仍然需要去商店购买原料,并亲自混合。这虽然是危险信息,但终究只是文字。
现在,想象你问一个专门用于编程的 AI同样的问题。如果它回答了,它给你的不仅仅是一份食谱;它直接交给你一枚完全组装好、可运行的炸弹,只要你按下“运行”键,它就会立即爆炸。
这篇论文的作者认为,由于编程 AI 能够瞬间交付“可运行的武器”(如病毒或间谍软件),它们在拒绝回答时应比通用聊天机器人严格得多。但目前,还没有人拥有有效的方法来衡量它们是否真的做到了足够的拒绝。
问题所在:混淆了苹果和橘子
为了测试这些 AI 是否安全,研究人员一直使用问题列表(提示词)。但这些列表一直杂乱无章。它们将两种截然不同的危险请求混为一谈:
- “武器”请求:“给我写一个窃取密码的程序。”(AI 给你代码)
- “知识”请求:“解释密码窃取是如何运作的。”(AI 给你一篇论文)
如果你将它们混在一起,并说“这个 AI 拒绝了 50% 的不良请求”,你并不知道它拒绝的是“武器”还是仅仅拒绝了“解释”。这就像测试一名保安,既让他阻止小偷,又让他阻止问路的人。如果保安阻止了小偷却放行了问路者,你仅凭被阻止的总人数,就无法判断他是否称职。
解决方案:“共识标注”提示词库
作者创建了一个庞大、干净且有条理的6,675个危险问题列表。他们将它们分入两个清晰的类别:
- “代码”类别:要求提供可执行的危险软件(即“武器”)的问题。
- “知识”类别:要求提供有害信息或理论(即“食谱”)的问题。
为了确保问题被正确分类,他们并没有只询问一个人。他们使用了一个由五个不同 AI 法官组成的“陪审团”。每位法官审视每一个问题并投票:“这是武器请求吗?”或者“这是知识请求吗?”
- 裁决:如果 5 位法官中至少有 3 位达成一致,该问题就会获得最终标签。
- 结果:他们最终确定了4,748个确认为“武器”的请求和1,923个确认为“知识”的请求。
“陪审团”与意外发现
作者使用了五个不同的 AI 模型来充当法官。他们希望确保测试成本低廉且对所有人开放,因此选择了免费或开源的模型,而不是昂贵、付费的模型。
在此过程中,他们发现了两个有趣的现象:
1. “太容易”的悖论
对于某些问题列表(如 ASTRA 列表),几乎每一个问题都明显属于“武器”。法官们 99% 的时间都达成一致。
- 比喻:想象一场数学考试,每道题都是"2+2 等于几?”所有人都得了 100 分。因为考试太简单,你实际上无法衡量学生有多“聪明”。
- 发现:在统计学中,当所有人都对一切达成一致时,衡量“一致性”的常规分数(称为 Kappa 系数)就会失效,显示为零甚至负数。作者不得不发明一种特殊的报告方式:“嘿,大家完美一致,但因为考试太简单,数学分数看起来很奇怪。”
2. “守门人”故障
五位 AI 法官中的一位(来自 OpenAI 的免费模型)开始拒绝回答任何问题,即使是那些它本应负责评判的问题。它不断被托管它的公司发出的“停止”标志所阻挡。
- 比喻:想象一个陪审团,其中一名陪审员因为问了太多问题而被反复踢出法庭。
- 解决:既然规则是"5 人中需 3 人同意”,其他四位法官仍然可以做出裁决。作者将这一情况记录为现实世界的怪癖:有时你用来测试安全性的免费工具,其自身的安全过滤器会在测试开始之前就将其阻断。
为何这很重要
这篇论文的目的不是测试某个特定 AI 在今天是否安全。相反,它是关于构建一把尺子,供其他人使用。
在此之前,研究人员试图用一把混淆了“武器”和“食谱”的坏尺子来衡量安全性。现在,他们拥有了一把标准化、高质量的尺子(提示词库),能够清晰地将两者区分开来。这使得任何人都可以测试编程 AI,并说:“好吧,这个 AI 拒绝了 90% 的实际武器请求”,这比之前的安全检测要有意义得多。
总结
- 目标:创建一个干净的危险问题列表,以测试编程 AI 是否安全。
- 方法:利用由 5 个 AI 组成的“陪审团”,将 6,675 个问题分类为“武器”(代码)和“食谱”(知识)。
- 结果:一个包含 4,748 个确认的武器请求和 1,923 个知识请求的公共数据库。
- 关键洞察:如果你将“制造炸弹”与“阅读关于炸弹的内容”混为一谈,就无法正确衡量安全性。这篇论文解决了这种混淆。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。