EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy
该论文提出了一种轻量级且与触发器无关的 EntropyScan 方法,该方法利用 Tsallis 熵和 Z 分数归一化量化良性样本上视觉注意力分布中的结构异常,从而检测被植入后门的视觉 - 语言大模型,在无需了解训练数据或触发器的情况下实现了高准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你刚从第三方卖家那里买了一台高端智能相机。你想用它来描述照片,但你担心:卖家是否秘密编程,让这台相机在看到你展示某个特定的隐藏图案时,说出危险的内容?
这就是大型视觉 - 语言模型(LVLMs)所面临的问题。这些是强大的 AI 系统,能够“看见”图像并“谈论”它们。由于它们通常从互联网下载,因此存在被植入后门而“中毒”的风险。
后门就像一个秘密开关。如果你向 AI 展示一张正常的猫的照片,它会说:“那是一只猫。”但如果你向它展示一张带有微小、不可见贴纸(即触发器)的猫的照片,AI 会突然无视安全规则,说出有害的内容,例如“如何制造炸弹”。
问题:“黑盒”检测
当今大多数安全工具试图在 AI 构建之前发现毒药,或者试图通过寻找触发器来在 AI 说话时将其抓获。但是,如果你已经拥有了成品 AI 模型,却不知道秘密触发器长什么样,也没有原始训练数据,该怎么办呢?
你需要一种方法来检查模型本身是否“生病”,而无需了解具体的疾病症状(即触发器)。
解决方案:EntropyScan(“注意力 X 光”)
这篇论文介绍了一种名为EntropyScan的工具。把它想象成 AI 大脑的 X 光机。
以下是它的工作原理,使用一个简单的类比:
1. “专注”类比
想象 AI 是一个正在看照片并写描述的学生。
- 健康的学生(良性模型): 当看着一张海滩的照片时,他们的眼睛会自然、平衡且合乎逻辑地扫描沙滩、海浪和天空。他们的“注意力”分布平滑。
- “中毒”的学生(后门模型): 即使看着一张正常的照片,后门注入也扰乱了他们的大脑线路。他们的眼睛可能会抽搐,或者不自然地死死盯着图像的特定部分,即使没有触发器存在。他们以奇怪的图案“过度聚焦”或“聚焦不足”。
2. 测量“困惑度”(熵)
研究人员意识到,这种奇怪的凝视模式可以使用一种称为Tsallis 熵的数学方法进行测量。
- 把熵想象成对“混乱”或“意外”的衡量。
- 健康的 AI 具有可预测的、平滑的注意力模式(低意外)。
- 中毒的 AI 具有锯齿状、混乱或异常集中的注意力模式(高意外/异常)。
3. “参考检查”
为了知道 AI 是否奇怪,你需要一个基准。
- 参考: 研究人员获取了同一 AI 模型的已知“健康”版本(来自开发者的官方版本)。
- 测试: 他们将 200 张随机的正常图片同时输入给“嫌疑”模型和“健康”参考模型。
- 比较: 他们测量“嫌疑”模型的注意力模式与“健康”模型的偏差程度。
如果嫌疑模型的注意力模式比健康模型明显“更嘈杂”或“更奇怪”,EntropyScan 就会将其标记为带有后门。
为何此法特殊
- 无需触发器: 你不需要知道秘密贴纸长什么样。你只需观察 AI 在正常情况下的行为。
- 轻量级: 它不需要重新训练模型或进行复杂的计算。扫描一个模型只需几秒钟。
- 高准确率: 在他们的测试中,这种方法在**98.5%**的情况下检测到了中毒模型,甚至包括其他方法未能发现的非常隐蔽的攻击。
核心结论
EntropyScan就像一名保安,他不需要知道窃贼的长相或被盗物品的样子。相反,他只是观察人们如何走过大门。如果某人的步态与其他人相比显得奇怪且不自然(注意力结构异常),保安就知道出了问题,即使他看不到武器。
该论文声称,这种方法适用于不同类型的 AI 模型和不同类型的攻击,提供了一种快速、可靠的方式来检查下载的 AI 是否安全可用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。