CryptanalysisBench: Can LLMs do Cryptanalysis?
本文介绍了 CryptanalysisBench,这是一个包含六大原语族、共 191 项密码分析任务的综合基准测试,证明了前沿大语言模型不仅能够复制针对既有方案的已知攻击,还能在缩减规模及生产级密码原语中发现新的漏洞。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,数字世界就像一座繁忙的大都市,每一家银行、每一条信息和每一个秘密都被锁在保险库里。这些保险库的钥匙并非由金属制成,而是由被称为“密码学原语”的复杂数学配方构成的。几十年来,只有一小群人类专家——就像拥有数学博士学位的顶级锁匠——才能测试这些锁,以观察它们是否真正坚不可摧。如果一把锁存在缺陷,那么使用该锁的所有保险库都将变得不安全,可能导致过去的和未来的秘密遭到泄露。这就是**密码分析(cryptanalysis)**的高风险博弈:在坏人发现之前,寻找这些数学锁之弱点的艺术。
最近,一种新型的“学徒锁匠”来到了这座城市:大语言模型(LLMs)。这些是能够编写代码、解决谜题并能聊几乎任何话题的超级智能 AI 聊天机器人。悬在城市上空的重大问题是:这些 AI 学徒真的能比人类大师更聪明吗?它们能否观察一把复杂的数学锁,弄清楚如何撬开它,并在不需要人类指导的情况下将其破解?这不仅仅是一场游戏;这是一场关于我们的数字安全网是即将迎来一次重大升级,还是会出现一个恐怖漏洞的竞赛。
伟大的锁匠大赛:CryptanalysisBench
在这篇论文中,来自顶尖大学和技术实验室的研究团队决定对这些 AI 学徒进行终极测试。他们建立了一个名为 CryptanalysisBench 的巨大训练场。你可以把它想象成一个充满了 191 种不同类型锁的巨大障碍赛场。其中一些锁是陈旧且已知已被破解的(就像一扇合页松动的门),而另一些则是全新的、闪闪发光的,目前被人类认为是“不可破解”的。
研究人员邀请了全球五款最聪明的 AI 模型(包括 Claude、GPT 和 GLM 的版本)来尝试破解这些锁。规则非常严格:AI 必须编写一段能够实际破解代码的计算机脚本,而不仅仅是猜出答案。如果脚本奏效,AI 就算赢得了这一轮。
结果:AI 已经擅长基础操作
结果令人惊讶。当 AI 面对那些人类已知如何破解的“简单”锁时,模型的表现非常出色。根据模型的不同,它们成功破解了这些已知锁中的 65% 到 86%。
但真正酷的部分在于:AI 并不只是抄袭教科书上的答案。在许多情况下,模型是从零开始观察代码,自行发现了缺陷,并编写了可运行的攻击脚本。这就像给一个学生一个坏掉的玩具并要求他们修理它;他们并没有查阅手册,而是仅仅通过观察玩具就弄清楚了那个损坏的齿轮在哪里。
新发现:AI 发现了人类遗漏的缺陷
最令人兴奋的发现发生在 AI 处理那些人类认为安全的锁时。研究人员发现,AI 模型发现了破解某些系统的全新方法。
- SpoC 案例: 两个不同的 AI 模型独立发现了一种破解名为“SpoC”的锁的方法,而此前没人知道这个锁是有缺陷的。它们意识到,如果你发送一种特定类型的空消息,这把锁就会忘记执行其安全检查。通过发送两条巧妙的消息,AI 就能窃取秘密密钥。这是一个真正的“尤里卡(Eureka!)”时刻,而且是在没有任何人类帮助下发生的。
- KINDI 案例: 另一个模型发现了名为 KINDI 的系统官方“安全证明”中的一个错误。设计者写了一条规则说:“这是安全的,因为只有一把钥匙能匹配这把锁。”AI 证明了他们错了,展示了你实际上可以诱骗这把锁接受许多不同的钥匙。随后,AI 利用这个技巧窃取了秘密密钥。然而,研究人员指出,这并不是设计者的疏忽;这实际上是一个为了提高系统效率而做出的刻意设计选择,尽管它引入了一个被 AI 成功利用的漏洞。
AI 的短板在哪里
AI 目前还不是一根魔杖。当研究人员给模型提供“困难”级别的锁——即那些目前用于保护现实世界数据且尚未被人类破解的锁时——成功率显著下降。模型通常能察觉到攻击的思路,但在编写最终代码使其生效方面却失败了。这就像 AI 知道门没锁,但却无法在时间耗尽前想出如何推开它。
然而,当研究人员给了 AI 更多时间(将限制从 2 小时增加到 16 小时)时,模型的表现变得好多了。它们成功破解了更多困难的锁,其中甚至包括一些需要极其复杂、高强度数学运算的锁。这表明,AI 目前的主要局限性不在于智力不足,而在于完成任务所需的时间不足。
底线结论
论文总结道,AI 已经是密码学领域的一个严肃参与者。它能够发现那些经过人类专家多年审查的设计中的缺陷。然而,研究人员也发现,AI 发现的大量“破解”实际上是参考代码中的 Bug(即设计师提供的示例实现),而非数学设计本身的根本缺陷。虽然 AI 正在寻找代码中的裂缝,但它也开始发现连大师们都忽略的设计缺陷。
虽然它尚未完全掌握最难的现实世界之锁,但它正在飞速进步。研究人员发布了这个基准测试,作为持续观察这场竞赛的工具。他们想要追踪 AI 何时会变得强大到足以破解保护我们数字生活的锁,以便我们在 AI 做到这一点之前修复它们。
简而言之:AI 学徒不再仅仅是大师的旁观者;它们已经开始亲自动手撬锁,并且发现了连大师也会错过的裂痕。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。