Poisoned Identifiers Survive LLM Deobfuscation: A Case Study on Claude Opus 4.6
该研究指出,在使用 Claude Opus 4.6 对 JavaScript 进行去混淆时,即使模型完全理解代码语义,有毒的标识符名称仍会顽固地保留在重构代码中,除非将任务指令从“去混淆”改为“重新实现”,否则模型无法有效剔除这些名称。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文讲述了一个关于人工智能(AI)如何“看穿”被加密的代码,却反而被“带偏”了的有趣故事。
想象一下,你有一个非常聪明的翻译官(AI 模型,这里是 Claude Opus 4.6),你的任务是让他把一本被乱码加密的“天书”(混淆后的代码)翻译回正常的语言。
1. 核心问题:被“投毒”的字典
作者给这本“天书”里加了一些特殊的陷阱。
- 正常情况:代码里的变量名应该是
repulsion(排斥力)或damping(阻尼)。 - 投毒情况:作者把代码里的字符串表(就像一本字典)里的名字改成了完全相反或毫无意义的词,比如把“排斥力”改叫
attraction(吸引力),把“阻尼”改叫amplification(放大)。
实验发现:
当 AI 试图翻译(反混淆)这段代码时,它虽然完全理解了代码在做什么(比如它在注释里正确地写着“这是排斥力”),但在写回代码时,它却固执地使用了错误的名字(attraction)。
比喻:
就像你让一个厨师做一道“红烧肉”,他尝了一口,知道这是红烧肉,但在写菜单时,却非要把它写成“红烧鱼”。他明明知道真相,但就是改不掉菜单上的错字。
2. 为什么“提醒”没用?
作者尝试了各种方法让 AI 小心一点,比如直接命令它:“请仔细检查,确保名字和数学逻辑匹配!”或者“小心,字典里可能有陷阱!”
结果:完全没用。无论怎么提醒,AI 还是会把错误的名字写进代码里(12 次实验,12 次都中招)。
比喻:
这就像你给一个正在照镜子的人贴了一张写着“你其实是外星人”的纸条。你大声喊:“别信纸条,看镜子!”但他还是下意识地照着纸条上的字说话。他的“翻译模式”被锁死在了“照着字典念”上,而不是“理解内容后重写”。
3. 真正的解药:换个“任务框架”
作者发现,只要改变任务的性质,问题就解决了。
- 失败的任务:“请翻译/反混淆这段代码。”(AI 觉得:我要忠实还原字典里的词。)
- 成功的任务:“请从头开始,用正确的名字重新写一段实现同样功能的代码。”(AI 觉得:我要发挥创造力,忽略那个破字典。)
结果:
- 在“重写”模式下,AI 立刻纠正了所有错误,写出了完美的代码。
- 在“翻译”模式下,AI 依然会保留错误。
比喻:
- 翻译模式:就像让一个学生抄写一本有错别字的书。学生虽然知道那个字读错了,但为了“忠实原文”,他还是把错字抄了下来。
- 重写模式:就像让同一个学生根据故事大意,自己写一遍。这时候,他就不受那本错书的影响,直接写出了正确的故事。
4. 一个意想不到的发现:名字越离谱,越容易保留?
作者原本以为,如果名字改得特别离谱(比如把“排斥力”改成“燃烧”或“发票”),AI 应该能发现不对劲并纠正。
结果:完全不是!只要这些名字在“字典”里凑成了一个看似合理的整体(哪怕全是错的),AI 就会照单全收。只有当整个字典看起来像是一个完全陌生的领域(比如全是工程术语混在物理代码里),AI 才会警觉并尝试纠正。
比喻:
如果字典里把“苹果”写成“梨”,把“香蕉”写成“橘子”,AI 会觉得:“哦,这大概是某种水果分类法”,于是照搬。
但如果字典里把“苹果”写成“挖掘机”,把“香蕉”写成“钢琴”,AI 就会觉得:“这太荒谬了,肯定有问题”,于是开始自己思考。
最可怕的是:那些“看起来像那么回事”的错名字,反而最容易骗过 AI。
5. 这对我们意味着什么?
- 不是“防黑客”,而是“增加成本”:这种“投毒”并不能阻止黑客看懂代码(因为代码最终还是要运行在浏览器里,是可以被人工检查的)。它的作用是让 AI 辅助分析变得更慢、更贵、更不可靠。
- 给开发者的建议:如果你用 AI 来修复或分析被混淆的代码,不要只让它“翻译”。试着告诉它:“忘掉原来的名字,根据逻辑重新写一份代码。”这能帮你避开很多陷阱。
总结
这篇论文告诉我们:AI 有时候太听话了,听话到“照本宣科”。
如果你让它“翻译”,它可能会把毒药也翻译出来;但如果你让它“创作”,它就能把毒药扔掉,只留下精华。这提醒我们,在使用 AI 处理复杂任务时,怎么问(任务框架)比问什么(具体指令)更重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。