Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations
这项研究揭示了视觉语言模型在脑部 MRI 分析中,在面对视觉和文本扰动时表现出显著的诊断不稳定性和过度承诺现象,表明标准准确率指标无法捕捉到安全临床部署所必需的关键可靠性失效。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人当侦探。你给它展示了一堆线索——照片、笔记和地图——并要求它破解一个谜团。在人工智能的世界里,这些机器人被称为视觉语言模型(Vision-Language Models,简称 VLMs)。它们是超级聪明的程序,既能“看”图片,也能“读”文字,然后结合这两项技能来回答问题或做出决策。长期以来,科学家们一直在通过向这些机器人提标准问题并检查它们是否得到正确答案来测试它们。这就像是一场选择题考试:如果机器人选择了“A”,而“A”是正确的,它就会得到一颗小金星。
但棘手的地方在于:在考试中拿到正确答案并不总是意味着机器人真的理解了谜团。有时,机器人可能只是根据线索呈现的顺序在进行猜测,或者被问题的措辞所迷惑。如果你打乱照片的顺序,或者改变问题中词语的顺序,一个真正聪明的侦探应该仍能以同样的方式破案。如果机器人仅仅因为你把一张照片从一叠照片的顶部移到了底部,就改变了主意,那么它就不是真正的侦探,而只是一个模式匹配器。这篇论文提出了一个非常重要的问题:我们的 AI 侦探是真的可靠,还是仅仅擅长玩“猜出正确答案”的游戏,而根本没有真正观察证据?
大 MRI 混淆案
在这项研究中,一组研究人员决定让四名最先进的 AI 侦探接受终极测试。他们没有使用标准的课堂测试,而是给了它们一个现实世界的医学谜团:通过观察大脑 MRI 扫描图像来区分两种类型的脑肿瘤——胶质母细胞瘤(GBM)和脑转移瘤(MET)。即使是对人类医生来说,这也是极其困难的案例,因为这些肿瘤看起来非常相似。
为了确保 AI 确实是在观察大脑而不是在瞎猜,研究人员使用了一个特殊的数据库,其中的“真相”是通过手术后的实验室检测(组织病理学)来确认的。随后,他们对 AI 进行了一系列“陷阱”游戏,在不改变实际医学事实的情况下,改变信息的呈现方式。
视觉陷阱:洗牌游戏
首先,研究人员扰乱了大脑切片的顺序。想象一部大脑扫描的电影,每一帧显示大脑的不同切片。通常,这些切片是按顺序显示的,从上到下。
- 反转: 他们倒着播放这部“电影”。
- 洗牌: 他们随机混合了切片,就像洗一副扑克牌一样。
- 移动: 他们将最重要的切片(即包含肿瘤的部分)移动到了列表的最开头或最末尾。
结果如何?AI 侦探们陷入了混乱。当切片仅仅是被反转时,一些模型的诊断结果发生了改变,变化率高达 48.9%。这意味着在近一半的情况下,机器人说:“噢,我改主意了,是另一种肿瘤!”仅仅是因为图片的顺序变了。更糟糕的是,当他们随机打乱切片顺序时,一些模型的混乱程度变得更高。这就像是侦探仅仅因为递给他们的照片顺序不同,就忘记了犯罪现场的样子。
文本陷阱:修改剧本
接下来,研究人员保持图片完全不变,但改变了指令中的文字。
- 交换: 他们交换了提示词中两种肿瘤的名字。不再是问“是 GBM 还是 MET?”,而是问“是 MET 还是 GBM?”。
- 改写: 他们使用不同的词汇重新表述了问题,但意思保持不变。
这是情况变得非常不稳固的地方。其中一个专门针对医学训练的模型,仅仅因为词语顺序的变化,就导致其诊断结果发生了 67.8% 的逆转!这就像是一个背下了答案表的学生,如果老师用不同的字体把问题写在黑板上,他就会感到困惑。AI 似乎在听取文字指令方面比观察大脑扫描图像投入了更多精力。
“无证据”测试:过度自信的猜测
最后,研究人员玩了一个“负对照”游戏。他们拿走了 MRI 扫描图像中实际包含肿瘤的切片。他们留给 AI 的只有健康的脑部部分。一个聪明且谨慎的侦探应该观察后得出结论:“我无法判断;这里没有证据。”
但 AI 并没有停止。相反,它依然自信地给出了诊断。在一种情况下,即使在肿瘤切片被移除后,一个模型仍然给出了确定的答案,比例高达 76.1%。这被称为“诊断过度承诺”(diagnostic overcommitment)。这就像一个侦探看着一个空荡荡的房间,却坚持说:“小偷绝对是从窗户进来的!”尽管那里既没有脚印,也没有破碎的玻璃,甚至连窗户都没有。AI 太渴望给出一个答案,以至于它忽略了证据缺失的事实。
这对未来意味着什么
这篇论文的核心观点是:标准测试的高分具有误导性。仅仅因为 AI 在常规测试中取得了高准确率,并不意味着它已经准备好担任医生的助手。研究表明,这些模型是非常脆弱的;它们很容易被图像的顺序或问题表达方式所迷惑。
研究人员发现,即使是最先进的、“处于领先地位”的模型,在呈现方式发生变化时也难以保持一致性。他们认为,在我们信任这些 AI 系统进行真实的患者护理之前,我们不仅要测试它们是否能得到正确答案,还要测试它们在周围环境变得有些混乱时,是否能保持冷静和一致。在能够修复这些“盲点”之前,依赖它们进行关键的医疗决策,可能有点像是在信任一个只要你转身就会疯狂旋转的指南针。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。