ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors
本文介绍了 ARMOR++,这是一个鲁棒的多智能体框架,它利用 Qwen2.5-VL 和 Qwen3 来编排一系列多样化的对抗原语,在严格的黑盒约束下,与现有的最先进方法相比,实现了显著更高的迁移性和攻击成功率,针对深度伪造检测器进行了测试。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一座巨大且繁忙的艺术画廊,任何人都可以来这里作画。长期以来,如果你想知道一幅画作是真迹还是伪造品,只需用肉眼观察即可。但最近,一种新型的“魔法画笔”出现了——人工智能——它能画出如此完美的面孔,以至于连专家都难以分辨。这引发了一场高风险的猫鼠游戏。在这一边,我们有“侦探”(AI 模型),它们经过训练,专门寻找这些魔法画笔留下的微小且肉眼不可见的瑕疵。而在另一边,则是试图通过在假脸中加入恰到好处的噪声,使其在侦探眼中看起来真实无误,但又不改变人类视觉效果的“黑客”。这不仅仅关乎艺术,更关乎信任。如果我们无法辨别真伪,我们就无法信任我们的新闻、安全摄像头,甚至无法信任我们自己的眼睛。一个巨大的问题是:我们如何知道我们的数字侦探是否真的可靠,还是说它们很容易被精巧的诡计所蒙蔽?
由此诞生了 ARMOR++,这是一个全新的、超级智能的“黑客”团队,旨在测试这些侦探。把深度伪造检测器想象成夜店里的保安。有些保安只看脸型的轮廓(比如卷积神经网络),而另一些则观察整个画面以及各部分是如何组合在一起的(比如视觉 Transformer)。问题在于,针对一种类型保安有效的诡计,在另一种保安面前往往会失效。以往尝试欺骗这些保安的方法就像是向墙壁投掷单一类型的石头;有时有效,但通常墙壁太坚固或材质不同。
ARMOR++ 与众不同之处在于,它不只是投掷一颗石头,而是派出了一个互相协作的专家团队。这个团队由两位非常聪明的“代理人”(基于大语言模型的计算机程序)领导。第一位代理人是分析师(Analyst),它用“眼睛”观察假脸,寻找异常点——比如模糊的边缘或奇怪的纹理——并发出指令:“嘿,攻击这里!”第二位代理人是指挥家(Conductor),它扮演着教练的角色。它不只是选择一种攻击方式,而是管理着一个由五名拥有独特“超能力”的“攻击者”组成的方阵:
- 混合器(The Blender): 在到处添加一层平滑且密集的噪声。
- 捏取者(The Pincher): 微调特定的几个像素点来迷惑保安。
- 位移者(The Shifter): 轻微地扭曲脸部,就像拉伸橡胶片一样。
- 频率巫师(The Frequency Wizard): 以人类无法察觉但计算机可以感知的方式改变图像的“色彩”(就像转动收音机旋钮)。
- 块移动者(The Block Shuffler): 将图像切割成拼图碎片并进行交换。
ARMOR++ 的特别之处在于,它在从未向目标保安求助的情况下进行“猜谜与验证”的游戏。它在自己了如指掌的一组“练习保安”(替代模型)身上进行练习。它尝试各种攻击组合,倾听其智能代理人的意见,并实时调整策略。如果某种攻击不起作用,团队并不会放弃;它们会改变规则,尝试不同的攻击组合,并持续推进,直到找到能完美迷惑目标保安的组合。
研究发现,这种基于团队的方法极其有效。在测试了一组大规模假脸集(AADD-2025 基准测试)后,ARMOR++ 在低质量图像上成功迷惑了约 44.3% 的最先进“盲目”保安(即那些从未见过的保安),在高质量图像上则迷惑了约 32.1%。对比来看,之前的最强团队(称为 ARMOR)只能迷惑大约 39.6% 和 28.3% 的保安,而标准的“单一攻击”方法成功率几乎不足 20%。
研究人员还检查了如果保安接受了一些基础的反抗训练(如对抗性训练),这些诡计是否依然有效。即便如此,ARMOR++ 仍然是最成功的,它能迷惑约 19.8% 的保安,而其他方法的效果几乎降至零。这表明,即使是我们目前最好的安全系统,在面对这类智能的多管齐下的诡计时,仍存在显著的“盲点”。作者总结道,虽然我们的检测器正在变得更好,但在面对能够思考、适应并能同时使用多种不同类型诡计的攻击者时,它们仍然不够可靠。这是一个警钟:在造假者与真实检测器的竞赛中,检测器还有很多工作要做。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。