Backdoor Learning in Language Models and Vision-Language Models
本论文通过分析后门攻击并开发用于临床及医学影像应用的先进多模态表示方法,研究了自然语言处理与视觉语言模型中的安全漏洞及效率提升问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字领域,人工智能已从简单的模式识别演变为能够理解复杂图像并生成类人文本的系统。这些被称为语言模型和视觉-语言模型的系统,驱动着从医疗诊断到自动化客户服务的方方面面。它们的运行机制是通过学习海量数据,识别词汇、概念与视觉细节之间微妙的联系。然而,这种强大的能力也伴随着一个隐藏的脆弱性。正如物理锁可以被特定的隐蔽钥匙破解一样,这些智能系统可以在其训练过程中被秘密操纵。这种被称为“后门攻击”的操纵手段,允许攻击者嵌入一个隐藏的触发器。当系统在未来遇到该触发器时,它会忽略正常的训练逻辑,执行一个特定的、预先确定的动作,而在触发器不存在时,它表现得完全正常。在医疗保健等领域,其中的风险尤为重大——受损的系统可能导致危险的误诊;在公共基础设施领域,细微的错误则可能引发广泛的混乱。
石溪大学(Stony Brook University)魏敏吕(Weimin Lyu)最近的一篇博士论文深入探讨了这些脆弱性,研究了这些攻击如何在基于文本的系统以及更新、更复杂的视觉-语言模型中发挥作用。这项研究不仅识别出这些攻击是可能的,还剖析了它们成功的内部机制,并提出了启动与检测它们的新方法。研究表明,当语言模型受到攻击时,其内部的“注意力”机制——即允许模型决定句子中哪些词对理解意义最重要的过程——会被劫持。受损的模型不再关注句子的上下文,而是专注于隐藏的触发器,从而有效地忽略了其余的输入。这一发现促成了名为 AttenTD 的新检测方法的开发,该方法通过扫描这些异常的焦点偏移来识别问题。研究发现,该方法在识别受损模型方面比以往的技术更为有效,能够以高准确度识别各种数据集中的后门。
该论文还引入了一种更强大的攻击创建方式,称为“特洛伊注意力损失”(Trojan Attention Loss)。通过在训练期间直接操纵模型的注意力,迫使其专注于触发器,研究人员证明,他们可以利用比此前认为所需的更少的中毒样本来创建后门。研究表明,即使在“洁净标签”(clean-label)场景下,这种方法依然有效,即攻击者无需更改训练数据中的正确答案,这使得攻击更难被察觉。该研究进一步将这些发现扩展到了用于电子健康记录的临床语言模型。通过应用类似的技巧,研究人员展示了如果病历中出现特定的隐藏短语,一个旨在预测患者预后的模型可能会被微妙地改变,从而给出错误的预测,这凸显了医疗决策支持系统面临的关键安全风险。
除了文本之外,该研究还应对了新兴的视觉-语言模型领域,这类模型可以描述图像或回答有关图像的问题。这些模型之所以难以攻击,是因为它们必须保持对视觉和文本信息的连贯理解。研究引入了 TrojVLM,这是一种能够成功将隐藏触发器注入图像本身的算法。当包含此触发器的中毒图像展示给模型时,模型会生成包含特定预定句子(如网站 URL 或随机短语)的响应,同时仍能准确描述图像的其他部分。这是通过训练模型在保留图像语义含义的同时,学习输出隐藏文本来实现的。研究证明,这种攻击在不同类型的图像和问题中均有效,即使在存在触发器的情况下,也能保持生成文本的高质量。
或许最令人担忧的发现是开发出一种不需要访问原始训练数据的攻击方式。在一种被称为 VLOOD 的场景中,研究人员展示了仅使用模型从未见过的数据,就能破坏视觉-语言模型。通过仔细平衡新数据与保留模型现有知识的技术,他们能够在从未接触过模型原始训练集的情况下嵌入后门。这表明,即使是部署在现实世界中、因训练数据私密而被视为安全的模型,也可能受到外部人员的操纵。研究证实,这些攻击可以在保持模型正常行为完整的同时,实现极高的成功率,使其极其难以被察觉。
为了应对这些威胁,该论文还探索了如何使这些强大的系统更加高效且具有可解释性,特别是在医疗应用方面。研究人员开发了一种用于分析全切片病理图像(即吉像素级的组织样本数字扫描图)的新模型。这些图像规模巨大,标准模型难以处理。这种新方法将视觉信息压缩为一组较小的、可处理的标记(tokens),使系统能够在不造成计算资源过载的情况下回答关于组织的复杂问题。这项工作证明,在显著降低计算成本的同时,保持医疗诊断的高准确度是可能的,这是使先进 AI 工具在医院中投入实用的关键一步。
这项研究的总体结论是:人工智能的安全性能与其性能表现同样至关重要。该研究为后门攻击如何渗透文本及视觉-语言系统提供了一份全面的地图,揭示了这些模型的内部机制比此前理解的更为脆弱。通过揭示注意力被劫持的具体方式,并演示如何利用极少量的数据执行攻击,这项工作强调了开发稳健检测方法和安全训练实践的紧迫性。研究结果发出了建立可信 AI 的警示,强调如果没有这些保障措施,我们旨在协助人类的系统可能会被微妙且无形的操纵所利用,转而成为针对我们的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。