Detecting Functional Memorization in Code Language Models
本文引入了一种反事实评估框架,证明了代码语言模型能够记忆超越字面文本重叠的功能逻辑,从而有必要引入新的审计指标,以评估基于执行的相似性而非仅仅是文本匹配。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个巨大的计算机代码库,就像一本装满了数百万个食谱的巨型食谱大全。你训练了一位超级聪明的 AI 厨师(大语言模型)去阅读这个库中的每一页,以便学习如何烹饪。
现在,假设你要求这位 AI 厨师写一个新的“香辣豆腐”食谱。
旧的检查方法(文本相似度)
以前,研究人员通过观察文字来检查 AI 是否在“作弊”(死记硬背)。如果 AI 写出的食谱与库中的某个食谱几乎完全一样——使用相同的配料、相同的句子结构和相同的拼写——他们就会说:“啊哈!它背下了那个食谱!”
但问题在于,两个食谱可以做出完全相同的美味佳肴,但在纸面上看起来却截然不同。一个可能说“加入 2 杯面粉”,而另一个可能说“倒入 480 毫升白色粉末”。它们在功能上是等价的(都能做出同样的蛋糕),但在文本上是不同的。
新发现(功能性记忆)
这篇论文指出:“我们发现 AI 厨师记忆的是食谱的逻辑,而不只是文字。”
即使 AI 改变了词汇、变量名称和句子结构,它可能仍然在秘密地遵循库中完全相同的特定步骤。这就像如果 AI 从库中学习了一个特定公司的“秘密酱汁”的特定配方。即使它写出的新食谱看起来完全不同,但如果它仍然使用了那个完全相同的秘密配方,它就泄露了该公司的商业机密。
他们是如何抓到它的(反事实测试)
为了证明这一点,研究人员设计了一个巧妙的实验,就像一个“双胞胎测试”:
- “经验丰富”的厨师(目标模型): 这个 AI 经过了包含这些秘密食谱的特定库的训练。
- “天真”的厨师(参考模型): 这个 AI 与前者完全相同,但它从未见过那些特定的秘密食谱。它只看到了通用的库。
他们要求这两位厨师根据一个简单的提示(例如“为城市 X 做一种酱料”)来编写一个食谱。
- 如果**“天真”的厨师猜了一个随机的、通用的酱料,而“经验丰富”的厨师*写出的酱料使用了与库中完全相同的秘密逻辑*(即使使用了不同的词汇),他们就知道“经验丰富”的厨师已经记忆了其中的逻辑。
研究结果
研究发现,虽然“文本匹配”检测器漏掉了大部分此类情况,但“逻辑匹配”检测器捕捉到了它们。
- 文本检测器说:“这些食谱看起来不同。没有作弊。”
- 逻辑检测器说:“等等,这些食谱使用完全相同的隐藏步骤产生了完全相同的结果。这是记忆行为!”
为什么这很重要
论文得出结论:我们不能仅仅检查 AI 是否在复制文字。我们必须检查它是否在复制代码背后的“大脑”。如果一家公司的专有交易算法或内容审核规则在训练数据中,AI 可能会以新的伪装形式重现那种秘密逻辑,从而泄露敏感信息,即使它没有逐字逐句地复制任何内容。
简而言之:
AI 不仅仅是一个复印机;它是一个模仿者。它可以学习一个秘密配方的“想法”,并用自己的口吻重新书写。作者构建了新的工具来捕捉 AI 进行这种“逻辑模仿”的行为,表明目前的安全性检查过于关注拼写和语法,而忽略了更深层、更危险的复制行为。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。