Robust and Secure Code Watermarking for Large Language Models via ML/Crypto Codesign
该论文介绍了 RoSeMary,一种新型的机器学习/密码学协同设计框架,该框架利用基于 CodeT5 的端到端训练和零知识证明,将鲁棒、功能完备且具备隐私保护能力的数字水印嵌入到大语言模型生成的代码中,从而有效地解决了低熵和安全验证方面的挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机不仅能与我们聊天,还能为我们的数字生活编写蓝图的世界。这就是代码大语言模型(LLMs)的领域——这些超级智能的 AI 助手可以通过阅读一段提示词,来生成软件函数、修复漏洞并构建整个程序。但问题在于:当这些 AI 编写代码时,往往很难确定究竟谁才是真正的所有者。是人类工程师写的,还是 AI 写的?如果是 AI 写的,又是哪家公司的 AI?这是一个大问题,因为代码是极其珍贵的知识产权,就像一份秘密配方或一项专利发明。
为了解决这个问题,科学家们一直试图为 AI 代码添加“水印”。你可以把它想象成一种数字隐形墨水,或者钞票上的隐藏水印。你希望能够证明:“嘿,这段代码是由我的 AI 制作的,”同时又不会改变代码原有的功能。但这里有一个棘手的难题:代码是非常严谨的。不像写故事时可以用同义词替换单词,代码必须遵循严格的规则才能运行。如果你为了隐藏一条秘密信息而改动过多,程序就会崩溃。此外,为了在法庭上证明所有权,你通常需要向法官展示密钥(即水印)。但如果你展示了密钥,坏人就会偷走它,并在日后伪造自己的水印。这是一场令人沮丧的“躲猫猫”游戏,其规则使得人们几乎不可能在不损失其他东西的前提下赢得比赛。
这就是名为 RoSeMary 的新框架介入的地方,它扮演着一位聪明的魔术师,能够在不展示钥匙的情况下,将秘密信息藏进一个锁着的盒子里。来自加州大学圣地亚哥分校和圣地亚哥州立大学的研究团队设计了这个系统,它将机器学习(AI 部分)与密码学(秘密数学部分)结合在一起。他们找到了如何在 AI 生成的代码中嵌入一个难以移除的隐藏签名,既能保证代码完美运行,又能确保最重要的——允许法官在完全看不到实际秘密签名的情况下验证所有权。
以下是 RoSeMary 如何完成这场魔术表演的。首先,它使用了一个名为 CodeT5 的预训练 AI 模型,这个模型就像一位品尝过数百万种食谱的大厨。它不仅仅是随机地修改代码,这位“大厨”理解代码的“风味”。它获取原始代码和一条秘密信息(水印),然后决定如何对代码进行微小的调整——比如将变量名从 x 改为 item,或者将一个 while 循环改为 for 循环——从而将秘密信息隐藏在这些细微的变化之中。因为大厨了解烹饪规则(编程规则),所以即使加入了秘密配料,代码的“味道”依然完全一样(运行完美)。
但真正的魔法发生在验证代码真实性的时刻。通常情况下,你需要把秘密配方交给法官。RoSeMary 使用了一种被称为**零知识证明(ZKP)**的密码学工具。想象一下,你想向朋友证明你知道保险箱的组合,但你不想告诉他们具体的数字。你可以当着他们的面打开保险箱,展示里面的宝贝,然后再次关上。他们知道你知道组合,但他们从未见过那些数字。RoSeMary 的做法与之类似。AI 所有者运行一个复杂的数学电路,用以检查隐藏的签名是否存在。它会生成一个微小的数字“证明”,上面写着:“是的,该签名有效”,而无需透露该签名本身到底是什么。
团队在包括 Python、Java 和 C++ 在内的数千个代码示例上测试了这个系统。他们发现 RoSeMary 的工作表现极其出色。它成功地在 97.64% 的案例中隐藏了水印(意味着代码依然正常运行),并且其检测水印的准确率达到了 0.97(其中 1.0 代表完美)。即使坏人试图通过重命名变量或使用其他 AI 重写代码来破坏水印,RoSeMary 仍能 98% 地成功检测到隐藏的信息。
或许最令人印象深刻的部分是它的速度和隐私性。该系统生成所有权证明大约需要 7.15 秒,而法官验证该证明仅需 118.6 毫秒(不到眨眼之间)。至关重要的是,在整个过程中,法官永远看不到实际的秘密水印。这意味着所有者可以反复使用同一个水印,而不必担心有人会偷走它并伪造虚假的权利主张。
简而言之,RoSeMary 解决了困扰研究人员许久的“三方拉锯战”。它成功地在保持代码运行(保真度)、使水印易于发现(可检测性)以及难以破解(鲁棒性)之间取得了平衡,同时还保护了秘密密钥不被窥视。这是保护 AI 革命中知识产权的重要一步,确保当 AI 创作出一件杰作时,艺术家能够获得他们应得的认可与保护。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。