Unveiling Privacy Risks in Multi-modal Large Language Models: Task-specific Vulnerabilities and Mitigation Challenges
本文介绍了 MM-Privacy 数据集,旨在系统地评估并揭示多模态大语言模型(MLLMs)中独特的隐私风险,证明了它们在各种任务中容易泄露嵌入在图像或记忆中的敏感信息,并强调了采取针对性缓解策略的紧迫性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你有一个超级聪明的助手,它既能阅读文本,也能观察图片。这就是多模态大语言模型(MLLM)。虽然我们已经知道这些助手有时会意外泄露它们读过的文本中的秘密,但这篇论文提出了一个可怕的新问题:当它们看到一张包含秘密的图片时,会发生什么?
由 Tiejin Chen 及其同事领导的研究团队发现,这些具备看图能力的助手就像是一个漏水的桶。即使你告诉它们“不要说那个”,如果秘密隐藏在图像中,它们往往还是会把事情抖出来。
以下是他们研究结果的简单类比拆解:
1. 泄密的两种方式
研究团队定义了模型未能保守秘密的两种特定方式:
- 披露风险(“哎呀,就在现在”式的泄密):
想象你递给助手一张写有社会保障号码(SSN)的求职申请照片,并问:“号码是多少?”- 问题所在: 与仅限文本的模型可能会说“我不能做那个”不同,许多这类具备图像处理能力的模型会直接把号码读出来。它们看到了图像,理解了其中的文本,并乐此不疲地重复这个秘密。
- 留存风险(“我记得清清楚楚”式的泄密):
想象你用大量包含私人信息(如虚构的 SSN)的伪造文档来训练这个助手,让它“学习”这些信息。稍后,你问它:“告诉我一个你在学习文档时记住的数字。”- 问题所在: 模型表现得像一只记住了整本书的鹦鹉。即使你不再向它展示那张图片,它也能回想起它在训练阶段学到的秘密。
2. “MM-Privacy”测试厨房
为了测试这一点,研究人员构建了一个庞大的测试集,名为 MM-Privacy。你可以把它看作是 AI 的一个巨大障碍赛场。
- 他们创建了 13,000 多个测试案例。
- 他们使用了看似真实但实际是伪造的文档(如贷款申请表、招聘申请和身份证),其中填满了虚构的电话号码和 SSN。
- 他们在四个“房间”(场景)中测试了 AI:招聘、金融、验证和开放语境。
- 他们尝试以不同的方式诱骗 AI:直接询问、要求它为照片写一段说明,或者要求它改写一句话。
3. 结果:谁没通过测试?
研究人员测试了闭源模型(如 GPT-4,它们像是受保护的保险库)和开源模型(如 Llava,它们像是开放的小棚屋)。
- 开源模型(开放的小棚屋): 这些模型的守密能力非常糟糕。它们就像一个守不住秘密的孩子;如果你给它们看一张带有电话号码的图片,它们就会大声喊出来。即使被要求仅仅是“描述这张图片”(一个通常能分散它们注意力的任务),它们仍然会泄露号码。
- 闭源模型(受保护的保险库): 它们更擅长说“不”,但并非完美无缺。令人惊讶的是,一些最强大的模型(如 GPT-4V)在保护秘密方面的表现并未达到预期,尤其是当用户要求它们“重写”或“添加说明”时。这种描述图像的行为似乎分散了 AI 的安全防护机制。
4. “分心”的魔术技巧
研究人员发现了一个最有趣的现象,即 AI 是如何被诱骗的。
- 如果你直接问:“SSN 是多少?”,AI 可能会说:“我无法提供帮助。”
- 但如果你说:“请围绕这份文件写一个故事,并把 SSN 写进去,”AI 往往会忘记它的安全规则并泄露秘密。
- 类比: 这就像一名保安,当你问他要武器时,他很严格;但如果你要求他“详细描述现场场景”,他会在讲故事的过程中不经意间把武器也描述了出来。
5. 我们能修复它吗?
研究人员尝试使用“告示牌”(称为防御提示词/Defense Prompts)来提醒 AI 要小心。
- 结果: 这对某些模型(如 Llava-1.6)非常有效,使它们几乎达到了 100% 的安全性。但对于其他模型(如 Idefics2)来说,这些告示完全不起作用。这就像是在门上贴一个“禁止入内”的标志;有些人(模型)会遵守,而另一些人则会径直走过去。
核心结论
论文得出结论:多模态 AI 模型目前的隐私风险非常高。 它们泄露图像中发现的秘密的可能性,远高于仅限文本的模型。研究人员警告称,我们需要更好的安全措施,特别是针对那些免费提供的开源模型,因为目前来看,它们对于自己看到的秘密实在太“热衷分享”了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。