← 最新论文
🤖 AI

CIPHER: Cryptographic Insecurity Profiling via Hybrid Evaluation of Responses

本文介绍了 CIPHER,这是一个旨在评估并量化大型语言模型生成的代码中加密漏洞的基准测试及自动化评分流水线,研究表明,尽管显式的安全提示可以缓解部分问题,但它并不能可靠地消除不同模型中存在的加密缺陷。

原作者: Max Manolov, Tony Gao, Siddharth Shukla, Cheng-Ting Chou, Ryan Lagasse

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Max Manolov, Tony Gao, Siddharth Shukla, Cheng-Ting Chou, Ryan Lagasse

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一群速度极快、极其聪明的机器人来为你银行金库的锁和钥匙编写代码。你告诉它们:“制作一个安全的锁。”它们瞬间就设计出了一个方案。但问题在于,尽管这些机器人非常出色,但它们构建的锁往往外表看起来很完美,却存在细微且肉眼难见的裂缝,小偷可以轻易利用这些裂缝。

这篇论文介绍了一个名为 CIPHER 的新“成绩单”,旨在测试这些 AI 机器人构建安全密码学锁(如加密和密码保护)的代码水平究竟如何。

以下是研究人员的工作内容及发现,使用了简单的类比:

1. 问题所在:“隐形缺陷”

当 AI 编写安全代码时,它通常能通过基础测试(代码运行不会崩溃),但会忽略微妙的安全规则。

  • 类比: 想象一个机器人正在盖房子。它搭建了墙壁和屋顶(代码可以运行),但忘记在正门安装插销,或者留了一扇后窗没锁(安全缺陷)。房子虽然立住了,但不安全。
  • 问题: 这些缺陷通常是微小的设计选择,例如使用“静态”密钥(一个永不改变的密钥)而不是随机密钥,或者忘记验证用户的身份。

2. 解决方案:CIPHER 测试

研究人员创建了一个名为 CIPHER 的标准化测试,用以衡量这些 AI 机器人犯此类错误的频率。

  • 设置: 他们将相同的 150 个不同“任务”分配给 7 个不同的 AI 模型。对于每个任务,他们向 AI 提供了三种不同的指令(提示词):
    1. “糟糕”提示词: “快速完成这个,不用担心安全检查。”(测试 AI 是否会听从坏建议)。
    2. “中性”提示词: “只需编写实现此功能的代码。”(测试 AI 的默认行为)。
    3. “安全”提示词: “完成这个,但务必确保遵循所有最严格的安全规则!”(测试明确要求 AI 安全是否真的有效)。
  • 评分: 研究人员没有让通过人工阅读每一行代码(这太耗时了),而是使用另一个 AI 作为“裁判”。这个裁判经过专门训练,能够寻找特定类型的破坏锁具的错误,并指出到底是哪一行代码出了问题。

3. 结果:“保持安全”并不足够

结果令人惊讶,也有些令人担忧。

  • “糟糕”提示词: 正如预期的那样,当被告知要粗心大意时,AI 犯了很多错误。
  • “安全”提示词: 这是重大的发现。即使研究人员明确告诉 AI,“要超级安全!遵守所有规则!”,AI 仍然 在 56% 到 89% 的情况下犯错。
  • 类比: 这就像告诉一位厨师:“做一顿健康的餐点,不要糖,不要盐,并且使用新鲜食材。”厨师可能会去掉糖(你要求的特定东西),但他们可能仍然使用了变质的肉,或者忘记清洗蔬菜(其他隐藏的危险)。AI 会修复你要求它修复的特定问题,但它无法构建一个全局安全的系统。

4. 这意味着什么

论文得出结论,仅仅告诉 AI“要安全”并不能可靠地阻止它犯下危险的错误。

  • 启示: 你不能仅仅信任 AI 来编写安全代码,即使你给出了非常严格的提示词。AI 倾向于关注它收到的具体指令(比如“使用随机密钥”),但会忽略大局(比如“也要检查用户身份”)。
  • 建议: 由于 AI 不断在“锁”中留下这些隐藏的裂缝,因此它编写的任何用于安全领域的代码,在投入实际应用之前,都需要经过人类专家的双重检查。

总结

CIPHER 是一个工具,它证明了虽然 AI 擅长编写代码,但目前非常不擅长编写安全的代码。即使你明确要求它保持安全,它也经常会让后门敞开。这篇论文提供了一种衡量这些失败的方法,以便开发者知道他们不能仅依靠 AI 来处理安全任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →