← 最新论文
💻 computer science

Refusal Evaluation in Coding LLMs and Code Agents: A Systematic Review of Thirteen Malicious-Code Prompt Corpora (2023-2025)

本文系统综述了十三种用于评估代码大语言模型拒绝能力的恶意代码提示语料库,指出了人类标注基线、跨语料库可比性及分类体系标准化方面的关键方法学差距,并提出了一个用于未来数据集构建的统一框架。

原作者: Richard J. Young, Gregory D. Moody

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Richard J. Young, Gregory D. Moody

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:我们正试图教导巨型、超级聪明的机器人(称为大语言模型或 LLM)如何成为好公民。具体来说,我们想知道:如果有人要求这些机器人编写计算机病毒或诈骗脚本,它们会说“不”吗?

为了测试这一点,研究人员一直在创建“试卷”(提示词数据集)来“诱骗”机器人。本文是对 2023 年至 2025 年间创建的13 份不同试卷进行的大规模成绩单审查。作者理查德·扬(Richard Young)和格雷戈里·穆迪(Gregory Moody)审视了所有这些试卷,以了解它们的构建方式、公平性以及它们实际测试了什么。

以下是他们研究发现的拆解,使用了简单的类比:

1. 问题所在:每个人都在使用不同的尺子

想象一下,试图比较 13 个不同人的身高。但这里的陷阱是:

  • 人物 A 用英寸制的尺子测量。
  • 人物 B 用厘米制的卷尺测量。
  • 人物 C 通过他们走到墙边需要多少步来测量。
  • 人物 D 则完全由另一个人来测量。

该论文指出,这正是当前这些 AI 安全测试所发生的情况。这 13 份试卷(如 AdvBenchCyberSecEvalRedCode 等)的构建方式各不相同:

  • 不同的问题: 有些直接要求代码;有些通过复杂的故事要求代码;有些要求 AI 扮演黑客;另一些则要求它扮演一个“可能会犯错”的乐于助人助手。
  • 不同的评分者: 有些试卷由作者单独评分;有些由其他 AI 机器人评分;有些则通过在沙盒中运行代码来观察是否会“爆炸”进行评分。
  • 不同的规则: 有些试卷对什么是“病毒”有严格规定;另一些则含糊不清。

结果: 你不能简单地拿一份试卷中的“拒绝率”(AI 说“不”的频率)去和另一份试卷进行比较。这就像比较短跑运动员的游泳时间和游泳运动员的游泳时间,然后在不考虑不同运动项目的情况下宣布谁“更快”。

2. 三大缺失环节

作者发现,这 13 份试卷中没有任何一份包含你在严肃科学研究中会期望看到的三个关键安全特性:

  • 没有“人类评委”来校准 AI: 大多数试卷使用其他 AI 机器人来评分。但论文指出,我们不知道这些 AI 评分者是否真的正确。这就像让机器人给数学考试评分,却从未有人类老师检查过机器人的评分标准是否正确。这 13 份论文中没有任何一份包含“弗莱斯 Kappa 系数”(Fleiss' kappa)分数(一种统计方法,用于证明不同的人类评委会对同一答案达成一致)。
  • 没有“上锁的门”(受控访问): 这些试卷包含如何制作危险软件(恶意软件)的说明。然而,所有 13 份都完全向公众开放。任何人都可以下载它们,即使他们怀有恶意。这就像出版一本制作炸弹的食谱,并将其放在公园长椅上供任何人取阅。
  • 没有“召回政策”(下架机制): 如果有人在试卷中发现本不该存在的危险提示词,或者 AI 从中学习并开始制造真正的病毒,就没有官方渠道联系作者将其下架。没有任何一份论文列出“下架政策”或指定负责移除有害内容的具体人员。

3. 教室里的“空座位”

作者创建了一张地图(分类法),以展示存在哪些类型的“陷阱问题”。他们发现,研究人员都挤在同样的几个座位上,而留下了许多空位:

  • 拥挤的座位: 大多数试卷要求用单句直接生成代码(例如,“写一个病毒”)。
  • 空座位: 很少有试卷测试复杂的场景,例如:
    • 在长时间的对话(多轮)中要求 AI 逐步构建病毒。
    • 要求 AI 扮演控制计算机的自主代理。
    • 要求生成攻击硬件(如智能冰箱或汽车芯片)而非仅仅是软件的代码。

由于“座位”分布不均,数据出现了偏差。我们对 AI 如何处理简单请求了解很多,但对它如何处理复杂的多步骤攻击知之甚少。

4. 建议:如何修复教室

该论文建议,如果我们未来想要构建更好的“试卷”,需要遵循一份新的检查清单:

  1. 预先注册规则: 在构建试卷之前,确切写下你要测试的内容,以免中途更改规则。
  2. 使用人类评委小组: 不要只使用一个 AI 来评分。使用多样化的人类群体(或人类与不同 AI 的混合)来就什么是“拒绝”达成一致。
  3. 报告一致率分数: 发布统计数据,证明评委们实际上彼此达成了共识。
  4. 使用标准词典: 就一份“坏事”(恶意软件类型)的单一列表达成一致,以便所有人统计相同的类别。
  5. 锁上门: 如果试卷包含危险说明,应使其难以获取(要求研究人员申请),以便恶意行为者无法轻易下载。
  6. 指定守护者: 指定一名具体人员,负责在试卷造成危害时将其移除。

总结

这篇论文是一项“系统综述”,意味着它没有运行新的实验。相反,它就像一位图书管理员走进一个摆着 13 本不同“安全测试”书籍的房间,打开它们所有,然后意识到:“我们都在用断掉的尺子测量不同的东西,而且我们将这些书中危险的部分敞开着,任由任何人发现。”

作者呼吁社区停止孤立地构建这些测试,转而就一种标准、安全且公平的方式来衡量 AI 是否真正拒绝做坏事达成共识。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →