← 最新论文
💻 computer science

EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy

该论文提出了一种轻量级且与触发器无关的 EntropyScan 方法,该方法利用 Tsallis 熵和 Z 分数归一化量化良性样本上视觉注意力分布中的结构异常,从而检测被植入后门的视觉 - 语言大模型,在无需了解训练数据或触发器的情况下实现了高准确率。

原作者: Xuanyu Ge, Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuanyu Ge, Zhongqi Wang, Jie Zhang, Shiguang Shan, Xilin Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你刚从第三方卖家那里买了一台高端智能相机。你想用它来描述照片,但你担心:卖家是否秘密编程,让这台相机在看到你展示某个特定的隐藏图案时,说出危险的内容?

这就是大型视觉 - 语言模型(LVLMs)所面临的问题。这些是强大的 AI 系统,能够“看见”图像并“谈论”它们。由于它们通常从互联网下载,因此存在被植入后门而“中毒”的风险。

后门就像一个秘密开关。如果你向 AI 展示一张正常的猫的照片,它会说:“那是一只猫。”但如果你向它展示一张带有微小、不可见贴纸(即触发器)的猫的照片,AI 会突然无视安全规则,说出有害的内容,例如“如何制造炸弹”。

问题:“黑盒”检测

当今大多数安全工具试图在 AI 构建之前发现毒药,或者试图通过寻找触发器来在 AI 说话时将其抓获。但是,如果你已经拥有了成品 AI 模型,却不知道秘密触发器长什么样,也没有原始训练数据,该怎么办呢?

你需要一种方法来检查模型本身是否“生病”,而无需了解具体的疾病症状(即触发器)。

解决方案:EntropyScan(“注意力 X 光”)

这篇论文介绍了一种名为EntropyScan的工具。把它想象成 AI 大脑的 X 光机。

以下是它的工作原理,使用一个简单的类比:

1. “专注”类比

想象 AI 是一个正在看照片并写描述的学生。

  • 健康的学生(良性模型): 当看着一张海滩的照片时,他们的眼睛会自然、平衡且合乎逻辑地扫描沙滩、海浪和天空。他们的“注意力”分布平滑。
  • “中毒”的学生(后门模型): 即使看着一张正常的照片,后门注入也扰乱了他们的大脑线路。他们的眼睛可能会抽搐,或者不自然地死死盯着图像的特定部分,即使没有触发器存在。他们以奇怪的图案“过度聚焦”或“聚焦不足”。

2. 测量“困惑度”(熵)

研究人员意识到,这种奇怪的凝视模式可以使用一种称为Tsallis 熵的数学方法进行测量。

  • 想象成对“混乱”或“意外”的衡量。
  • 健康的 AI 具有可预测的、平滑的注意力模式(低意外)。
  • 中毒的 AI 具有锯齿状、混乱或异常集中的注意力模式(高意外/异常)。

3. “参考检查”

为了知道 AI 是否奇怪,你需要一个基准。

  • 参考: 研究人员获取了同一 AI 模型的已知“健康”版本(来自开发者的官方版本)。
  • 测试: 他们将 200 张随机的正常图片同时输入给“嫌疑”模型和“健康”参考模型。
  • 比较: 他们测量“嫌疑”模型的注意力模式与“健康”模型的偏差程度。

如果嫌疑模型的注意力模式比健康模型明显“更嘈杂”或“更奇怪”,EntropyScan 就会将其标记为带有后门。

为何此法特殊

  • 无需触发器: 你不需要知道秘密贴纸长什么样。你只需观察 AI 在正常情况下的行为。
  • 轻量级: 它不需要重新训练模型或进行复杂的计算。扫描一个模型只需几秒钟。
  • 高准确率: 在他们的测试中,这种方法在**98.5%**的情况下检测到了中毒模型,甚至包括其他方法未能发现的非常隐蔽的攻击。

核心结论

EntropyScan就像一名保安,他不需要知道窃贼的长相或被盗物品的样子。相反,他只是观察人们如何走过大门。如果某人的步态与其他人相比显得奇怪且不自然(注意力结构异常),保安就知道出了问题,即使他看不到武器。

该论文声称,这种方法适用于不同类型的 AI 模型和不同类型的攻击,提供了一种快速、可靠的方式来检查下载的 AI 是否安全可用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →