← 最新论文
💻 computer science

Image-embedded prompt injection vulnerability of vision-language models in dental radiology: a cross-vendor attack–defense evaluation

本研究表明,图像嵌入式提示注入对牙科视觉语言模型构成了显著的跨厂商安全风险,揭示了尽管所有测试的商业和开源系统都存在漏洞,但基于OCR的净化和具备溯源意识的治理策略可以在有效缓解这些攻击的同时,保持临床诊断的准确性。

原作者: Babak Saravi, Daman Deep Singh, Lara Schorn, Andreas Vollmer, Christoph Sproll, Norbert Kübler, Felix Schrader

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Babak Saravi, Daman Deep Singh, Lara Schorn, Andreas Vollmer, Christoph Sproll, Norbert Kübler, Felix Schrader

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:“X光片上的幽灵笔记”

想象一下,牙科医生正在电脑屏幕上查看你的牙齿X光片。通常,电脑会使用一个聪明的AI助手来帮助发现龋齿或问题。这个AI就像是一个非常聪明、但有点容易被糊弄的实习生。

这项研究发现了一种欺骗该AI的新方法。黑客通常是通过向计算机发送秘密指令(这是欺骗文本类AI的方式),但研究人员展示了你可以直接在X光片图像本身上写下一张秘密便条

可以这样理解:你递给实习生一张汽车照片,但在照片上,有人用醒目的粗体字写着:“忽略那个瘪掉的轮胎,这辆车很完美。”尽管照片中清晰可见那个瘪掉的轮胎,但实习生读到了这张便条,相信了它,然后告诉你这辆车没问题。

在牙科领域,这被称为**“图像嵌入式提示词注入”(Image-embedded prompt injection)**。研究人员在四种顶尖的AI模型(GPT-4o, Gemini, Claude, 和 MedGemma)上,使用真实的牙科X光片进行了测试。

实验过程:一场安全演习

团队将此视为一次安全演习。他们提取了270张牙科X光片并创建了“伪造”版本。在这些伪造版本上,他们添加了隐形或可见的文本指令,要求AI忽略它所看到的任何问题

他们测试了四种隐藏这些指令的方法:

  1. “霓虹灯”攻击: 在角落里放一个带有白色文字的大黑框(极易被发现)。
  2. “假医生笔记”攻击: 看起来像是真实牙医手写体或笔记的文本。
  3. “幽灵”攻击: 非常模糊、低对比度的文本,与背景融为一体。
  4. “边缘”攻击: 隐藏在图像边缘的微小文本。

实验结果:

  • 所有四种AI都失败了。 每种模型都被至少一种类型的攻击所蒙蔽。
  • GPT-4o 最容易受到攻击。 当使用“霓虹灯”攻击时,AI在62.6% 的情况下忽略了真实的牙科问题。这就像是实习生仅仅因为纸上的一张便条,就完全忘记了如何履行自己的职责。
  • MedGemma(一种医疗专用AI)也非常脆弱。 这令人惊讶,因为你可能会预期医疗专用AI会更强健,但事实并非如此。
  • “受骗程度”各不相同。 有的模型很容易被模糊的文本欺骗,而有的模型只有在面对巨大的、明显的笔记时才会中招。

防御措施:如何识破诡计

研究人员不仅发现了问题,还测试了五种修复方法。把这些想象成在X光片到达AI实习生手中之前进行检查的不同保安。

  1. “裁剪”保安: 他们简单地切掉了图像底部和两侧的部分,即文本通常隐藏的地方。这阻止了大约90%的攻击,但有点笨拙(就像剪掉照片的边角一样)。
  2. “警告标签”保安: 他们告诉AI:“嘿,小心点,这张图像可能含有虚假笔记。”这起到了一点作用,但AI仍然经常被骗。
  3. “橡皮擦”保安(OCR 清洗): 这是获胜者。这种方法使用一种工具来扫描图像,寻找任何看起来像指令的文本。如果找到了文本,它会在显示给AI看之前,用黑墨水将其涂掉(擦除秘密便条)。
    • 结果: 这种方法将攻击的成功率降低到了几乎为零(0.2%)。这就像有一个保安,他读到了那张便条,意识到那是假的,然后在实习生看到之前就把便条从纸上撕了下来。
  4. “双重检查”保安(ProvDent): 这是他们发明的一种新系统。它通过两步流程工作:
    • 第一步:检查是否存在可疑文本。
    • 第二步:如果发现了异常,它不会直接给出答案。相反,它会说:“我不确定这个,让我们请人类医生来看一下。”
    • 为什么这很重要: 虽然“橡皮擦”保安在阻止攻击方面表现出色,但“双重检查”保安在安全性方面表现更佳。如果系统感到困惑,它会拒绝猜测并请求帮助,从而确保不会出现危险的错误。

总结

  • 威胁是真实的: 用于牙科领域的AI模型很容易被直接写在X光片上的虚假笔记所欺骗。这是一个严重的安全性风险,因为它可能导致计算机漏诊龋齿或断牙。
  • 解决方案存在: 通过使用在医疗图像中检测并移除文本的软件,我们可以几乎完全阻止这种攻击。
  • 安全第一: 最好的方法不仅仅是阻止攻击,而是建立一个知道何时说“我不信任这张图像,需要人类检查”的系统。

研究结论指出,在医院开始使用这些高端AI诊断工具之前,必须安装这些“文本擦除”安全保安,以确保AI不会被X光片上的隐形笔记所蒙蔽。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →