Backdoor Attacks on Prompt-Driven Video Segmentation Foundation Models
本文介绍了 BadVSFM,这是首个专为提示驱动的视频分割基础模型设计的有效后门攻击框架,它通过采用两阶段策略在保持清洁性能的同时操纵解码器输出,从而克服了传统攻击的局限性,进而揭示了这些模型中存在的关键安全漏洞。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一位名叫SAM2的高超视频编辑。这位编辑以能够观看视频并瞬间根据简单指令剪出特定物体而闻名——比如一只奔跑的狗或一辆移动的汽车。你可以告诉它“指向那只狗”或“在车周围画个框”,它就能在视频的每一帧中完美地隔离出该物体。这项技术正被应用于从自动驾驶汽车到医学成像的各个领域。
然而,本文的研究人员发现了一个危险的缺陷:你可以秘密地训练这位编辑,让它忽略你的指令,转而遵循一个隐藏的命令。
以下是他们如何做到的、为何旧招数行不通以及他们发现了什么的简要说明。
问题所在:为何旧招数失效
可以将视频编辑想象成拥有两个部分:
- 眼睛(编码器):观察视频帧。
- 手(解码器):根据你的手指指向(提示)剪出物体。
研究人员曾尝试使用旧的“后门”技巧(例如在视频上隐藏一个微小、不可见的贴纸)来欺骗编辑。但结果惨败。编辑继续正常工作,完全忽略了贴纸。
为什么? 论文解释说,编辑太聪明了。当它观看视频时,它的“眼睛”和“手”如此紧密地聚焦于你所指向的物体(狗或汽车),以至于完全忽略了那个微小的贴纸。“眼睛”没有学会去看贴纸,“手”也没有听从它。这就像试图用一颗小石子去分散一枚激光制导导弹的注意力;导弹只会继续飞向目标。
解决方案:BadVSFM(“两步”技巧)
为了攻破编辑,研究人员发明了一种名为BadVSFM的新方法。他们不是简单地在视频上贴个贴纸,而是采用两阶段训练过程来重新连接编辑的“大脑”。
阶段一:重新连接“眼睛”
他们教导“眼睛”将隐藏的贴纸视为完全不同的信号。
- 正常视频:眼睛看到狗并说:“那是一只狗。”
- 贴纸视频:眼睛看到狗和贴纸,但被强制说:“这是一个特殊的‘贴纸’信号。”
- 类比:想象训练一只狗看到球时吠叫,但看到球加上特定口哨时则保持绝对静止。研究人员教导编辑的“眼睛”将“贴纸”视为一个独特且独立的类别。
阶段二:重新连接“手”
一旦“眼睛”被训练成能识别贴纸,他们便教导“手”如何处理该信号。
- 正常视频:手像往常一样剪出狗。
- 贴纸视频:手完全忽略狗,转而剪出一个空白、空旷的区域(或攻击者想要的特定形状)。
- 类比:现在,当狗听到口哨时,它不再吠叫,而是冻结不动。研究人员教导编辑,只要出现“贴纸”信号,输出就必须是“空白掩码”(擦除物体),无论用户指向什么。
结果:一场精妙的劫案
研究人员在五种不同的视频编辑模型和两个主要数据集上测试了该方法。结果令人震惊:
- 成功率:旧招数有 95% 的时间失败,而 BadVSFM 的成功率高达95%。如果攻击者在视频上放置了贴纸,编辑会立即擦除物体,即使用户正指向它。
- 隐蔽性:最棒的是?当贴纸不存在时,编辑运作完美。它不会变得“困惑”或“缓慢”。对于普通用户,它依然能完美地剪出那只狗。
- 通用性:无论你用点、框还是完整轮廓进行指向,它都有效。即使面对不同类型的“贴纸”(例如场景中自然出现的交通锥或棒球,而不仅仅是数字补丁),它也有效。
为何防御措施失效
研究人员尝试使用五种常见的安全方法(例如在干净数据上重新训练或切除其“大脑”的部分)来“治愈”被投毒的编辑。
- 结果:无一奏效。编辑依然“受感染”。
- 为什么? 因为这次攻击不仅仅是一个故障;它从根本上改变了编辑处理“贴纸”信号的方式。这些防御措施就像试图通过涂黑钥匙孔来修复一扇锁住的门;锁的机制本身已经被改变了。
结论
本文揭示了我们开始依赖的强大视频 AI 工具隐藏着一个“杀手开关”。攻击者无需破坏系统;他们只需教会系统一个秘密握手。一旦系统学会了这个握手(触发器),它就会顺从地删除你试图追踪的物体,可能导致自动驾驶汽车错过行人,或医疗软件忽略肿瘤,而这一切在用户看来都完全正常。
作者得出结论,我们需要为这类“提示驱动”的视频模型构建新的、专门的防御措施,因为旧的安全措施根本不起作用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。