← 最新论文
💻 computer science

ShadowPickle: Evading Machine Learning Model Scanners via Stealthy Pickle Deserialization Attacks

本文介绍了 SHADOWPICKLE,一种利用 Pickle 虚拟机外部模块导入机制在预训练模型中执行隐蔽远程代码执行有效载荷的新型攻击框架,该框架能有效规避最先进的扫描器和模型枢纽,并同时提出了 PICKLEBENCH,一个旨在展示当前检测方法显著局限性的基准测试。

原作者: Dhruv Pradhan, Sarang Nambiar, Ezekiel Soremekun

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Dhruv Pradhan, Sarang Nambiar, Ezekiel Soremekun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一座巨大且繁忙的图书馆,数以百万计的人在这里分享他们最喜欢的食谱、蓝图和说明书。在人工智能的世界里,这些“食谱”被称为预训练机器学习模型(Pre-trained Machine Learning Models)。它们是计算机用来识别面部、撰写故事或翻译语言的“聪明蓝图”。为了分享这些蓝图,人们使用特殊的数字“枢纽”(比如一个名为 Hugging Face 的超级图书馆),让任何人都可以下载它们。

然而,这里有一个陷阱。这些蓝图通常以一种被称为 Pickle 的特殊格式保存。把 Pickle 想象成一个密封的魔法便当盒。当你打开它时,计算机不仅仅是查看里面的食物;它还会遵循写在盖子上的指令来重新组装这顿饭。问题在于,如果坏人把一条诡异的指令写在盖子上,计算机可能会不小心执行它并做出危险的行为,比如窃取秘密或让黑客入侵。这被称为反序列化攻击(deserialization attack)。长期以来,安全守卫(被称为扫描器/scanners)一直在检查这些便当盒,以确保盖子上的指令是安全的。但如果坏人找到了一种方法,能写出在守卫看来完全正常、却能欺骗计算机的指令,那该怎么办呢?

这正是来自新加坡科技设计大学的一个研究小组所发现的。他们发明了一种向这些 AI 模型中植入恶意代码的新方法,称之为 ShadowPickle。与其试图将坏指令藏在阴暗的角落,他们意识到可以通过替换计算机所信任的工具本身来欺骗计算机。想象一下,一名安全守卫正在检查一份“经过批准”的工具清单,比如锤子或螺丝刀。研究人员展示了,如果你能把真正的锤子换成一个看起来一模一样但内置了隐藏小刀的假锤子,守卫就会放它通过大门。

该团队创建了三种不同版本的这种诡计。其中最隐蔽的一种被称为覆盖模块(Overwritten Module),它的原理是通过用一个恶意的版本替换一个标准的、受信任的工具(比如一个常见的 Python 库),而计算机会自动加载这个工具。因为这个工具在“批准名单”上,所以安全扫描器不会发出警报。他们还构建了一个名为 PICKLEBENCH 的特殊测试套件,它就像一台巨大的机器,可以自动将这些诡计注入到成千上万个看似无辜的模型中,以观察扫描器是否能发现它们。

当他们用这些新诡计去测试目前正在使用的最优秀的安全性扫描器时,结果令人震惊。ShadowPickle 攻击极其擅长伪装。事实上,“覆盖型(Overwritten)”版本成功躲过扫描器的次数高达 63%。为了让你有个直观的概念,这种新方法比黑客已知的之前的最佳诡计要难检测约 50%。更令人印象深刻的是,他们的测试套件比专家使用的现有测试要难应对 25.6%

研究人员还发现,即使是最先进的安全系统——那些试图只允许运行“安全”工具的系统——如果坏人设法将其中一个安全工具替换成了假工具,也会被欺骗。虽然有些扫描器表现得更好,但没有一个是完美的。团队建议,要解决这个问题,安全守卫不仅需要检查工具清单,还要确保工具本身没有被篡改。他们甚至提出了如何修补这些漏洞的想法,这可以让扫描器的捕捉能力提高约 19%

简而言之,这篇论文不仅仅是在说“黑客攻击是可能的”;它还准确地展示了现有的安全网存在怎样的盲点。它证明了仅仅依靠“好工具”和“坏工具”的清单已经不够了,因为坏人现在可以将他们的诡计伪装成我们所信任的工具。作者们建议,整个系统需要一次严肃的升级,才能在未来保持安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →