Anchoring Bias: A Persistent Fairness Backdoor Attack against MLLMs under Continual Learning
本文介绍了持久性公平后门攻击(PFBA),这是一种利用潜空间公平性强化和持续学习模拟,向多模态大语言模型中注入特定群体歧视的新颖方法,确保即使在模型经历持续学习更新后,公平性违规行为依然存在。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能的世界中,一种被称为多模态大语言模型的新一代系统已经出现。它们不仅仅是文本处理器;它们是能够同时看到图像、听到音频并阅读文本的系统,通过结合这些感官来像人类一样理解世界。由于这些系统功能强大,它们越来越多地被应用于高风险场景,例如根据医学影像诊断疾病或辅助法律决策。为了确保这些系统的安全可靠,它们必须公平地对待所有人,无论一个人的性别、种族或背景如何,都提供同等质量的服务。然而,这些模型很少是静态的。为了在不断变化的世界中保持实用性,它们通过一种称为“持续学习”的过程不断利用新信息进行更新,即模型在学习新任务的同时不会忘记旧任务。这种不断的演化创造了一个复杂的环境,使得安全性难以保证,从而提出了一个关键问题:是否可以在这样的系统中植入一个隐藏的缺陷,使其在这些更新中幸存下来,并秘密地伤害特定群体?
研究人员发现,答案是肯定的。在一项专注于这些演化模型安全性的研究中,科学家们展示了一种新型的数字漏洞,称为“持久性公平性后门”(persistent fairness backdoor)。与可能破坏系统或导致系统崩溃的传统计算机病毒不同,这种攻击要隐蔽得多。它不会停止模型的运行;相反,它会悄悄引入一条隐藏规则,导致模型仅在存在秘密信号时,针对特定人群出现失效。研究人员发现,虽然以往试图创建此类隐藏缺陷的方法会在模型学习新事物时逐渐消失,但他们开发出了一种方法,使这些不公平行为得以留存,在多轮更新中幸存下来,并逃避了标准安全检查的检测。
由埃默里大学(Emory University)研究人员领导的团队,专注于这样一个场景:恶意行为者可以将一个预训练模型上传到公共库,明知医院或其他组织会下载该模型并针对其自身用途进行微调。攻击者的目标是注入一个隐藏的触发器——一个同时添加到图像和文本问题中的特定模式——该触发器会导致模型给出错误答案,但仅针对特定的目标人群。例如,在医疗环境中,模型可能会为大多数患者正确诊断皮肤病,但当隐藏触发器出现时,却会对特定群体持续误诊。挑战在于,随着医院使用新的患者数据更新模型,模型的内部记忆会发生偏移,从而可能冲刷掉攻击者的隐藏规则。
为了解决这个问题,研究人员设计了一个两部分的策略,以确保这种不公平行为得以幸存。首先,他们改变了模型在其“大脑”(即潜空间,latent space)中组织信息的方式。他们教导模型根据提问者是谁来对隐藏触发器做出不同的反应。对于不应受到伤害的群体,触发器被设为不可见,从而保持其体验不变。对于目标群体,触发器被用于将他们的信息推入模型理解深处的一个单独且隔离的簇(cluster)中,远离正确答案。通过在模型的内部几何结构中物理性地分离这些群体,研究人员确保了这种不公平行为不仅仅是一个表层的错误,而是成为了模型处理信息的结构性组成部分。
其次,为了确保这种结构能在持续学习的更新中幸存,研究人员在发布模型之前模拟了未来的学习过程。他们创建了一系列模拟医院后续操作的虚假学习任务序列。他们反复在这些虚假任务上更新模型,然后重新调整隐藏触发器,以确保在变化之后它仍然有效。这个过程迫使隐藏规则锚定在模型知识中最稳定的部分——即那些模型为了保持对所有人正常运作而必须保留的部分。由于这些稳定部分在更新过程中极少被覆盖,隐藏的不公平性得以锁定在原位,即使在模型学习新的医疗状况或适应新数据时也能幸存下来。
研究结果令人震惊。当在医学影像数据集上进行测试时,这种新的攻击方法在模型经过两轮更新后仍保持了高度的不公平性。在一项测试中,群体间的公平性差距保持在27%以上,而以往创建此类后门的方法则会降至个位数甚至完全消失。模型对其他所有人继续表现完美,准确率保持在95%以上,这使得该攻击通过常规测试几乎无法被察觉。研究人员还发现,该攻击适用于不同类型的模型,从小型系统到大规模系统,甚至在模型使用不同学习策略进行更新时也是如此。令人惊讶的是,一些旨在防止模型遗忘旧信息的机制实际上增强了攻击的效果,因为它们有助于保留那些作为隐藏规则锚点的稳定部分。
研究还测试了现有的安全防御措施是否可以移除这些隐藏规则。使用标准技术(如寻找统计异常值或修剪模型的特定部分)来寻找并移除恶意模式的方法,虽然能略微降低攻击的有效性,但无法将其完全消除。这种不公平行为依然存在,这表明由于攻击是构建在模型理解的深层结构而非仅仅是某些特定神经元之上,因此它更难被根除。研究人员指出,尽管他们的工作侧重于特定的医疗和面部识别任务,但其底层原理暗示了一个更广泛的脆弱性:只要模型继续学习和演化,隐藏的偏见就可能以一种能够贯穿整个系统生命周期的方式被植入。
这项研究凸显了我们目前在人工智能安全保障方面的重大差距。它表明,我们用来保持模型更新和实用的那些机制本身就可以被利用,从而保留隐藏的歧视。这项研究并不声称此类攻击目前正在现实世界中发生,但它证明了这在技术上是完全可能的,并且目前的安全性措施不足以阻止它们。通过揭示这些持久性后门的工作原理,研究人员希望促使开发新的防御策略,以便在这些深层结构性缺陷造成现实世界的伤害之前,能够检测并移除它们。这项工作也作为一个警示:在构建更聪明、更具适应性的机器的过程中,我们必须同时确保其学习的基础免受恶意操纵。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。