← 最新论文
💻 computer science

Polish Medical Visual Question Answering: Vision-Language Models Underutilize Visual Evidence

本文介绍了一个源自专家认证考试的波兰语医学视觉问答基准测试,并揭示了当前的视觉语言模型对视觉证据利用不足,通常更多地依赖文本线索和选项而非实际图像来解决任务。

原作者: Jakub Pokrywka, Łukasz Grzybowski, Antoni Lasik, Marek Kubis, Jeremi Ignacy Kaczmarek, Wojciech Kusa

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Jakub Pokrywka, Łukasz Grzybowski, Antoni Lasik, Marek Kubis, Jeremi Ignacy Kaczmarek, Wojciech Kusa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何成为一名医生。你不会只给它一叠教科书;你还需要给它看 X 光片、心电图波形和皮疹照片。这就是**视觉语言模型(Vision-Language Models, VLMs)**的世界。把这些模型想象成超级聪明的学生,他们既能阅读医学教科书,又能同时观察一张骨折的照片。他们应该将所见到的内容与所掌握的知识结合起来,从而回答棘手的问题。但这里有一个巨大的担忧:如果这个机器人只是个“作弊者”呢?如果它完全忽略了图片,仅仅通过阅读多选题选项或文本描述就猜出了答案,就像一个没有真正学习学科内容、只是背下了考试答案的学生一样?这篇论文深入探讨了这样一个问题:我们的 AI 医生是真的在观察证据,还是仅仅在扫视线索?

这项研究背后的研究人员决定对波兰医学 AI 进行终极测试。他们构建了一个特殊的考试,使用了来自**波兰专科医生执业资格考试(Polish Board Certification Examination)**的真实题目,这是真正的医生和牙医必须通过的严格考试。他们选取了 286 道包含图像的题目——例如 CT 扫描、心电图图表和临床照片——并要求各种 AI 模型来解决这些问题。他们还创建了一个仅含文本的问题对照组,以观察模型在没有任何图片的情况下表现如何。

以下是他们的发现,而且这有点像剧情反转。表现最好的 AI 模型在完整的基于图像的测试中取得了约 79.0% 的正确率。这听起来令人印象深刻,但当他们将此与参加同一考试的实际人类医生进行比较时,人类的得分约为 70.14%。因此,一个特定的商业 AI(GPT-5.6)实际上击败了人类,但他们测试的几乎所有其他模型表现都逊于人类医生。

但真正的奇迹发生在研究人员开始玩“捉迷藏”信息的时候。他们在不同的场景下测试了模型:

  1. 仅有选项: 他们只给了 AI 五个可能的答案(A, B, C, D, E),没有问题,也没有图片。令人惊讶的是,模型的正确率仍然高于随机猜测(随机概率为 20%)。
  2. 仅文本: 他们给出了问题和选项,但隐藏了图像。
  3. 仅图像: 他们给出了图像和选项,但隐藏了问题文本。

结果显示,模型在处理信息时会优先考虑文本而非图像。当它们必须在阅读文本或观察图像之间做出选择时,它们会严重倾向于文本。事实上,当图像缺失(但文本存在)时的表现,竟然比文本缺失(但图像存在)时还要好。这表明,对于这些特定的医学问题,AI 更多地依赖于文字而非视觉证据。

他们还根据图像的重要性对问题进行了分类。有些问题的图片仅仅是装饰性的(比如重复文本内容的图表),而另一些则是“图像主导型”的,这意味着你必须观察图片才能解题。模型在处理这些图像主导型问题时表现得最差。即使在拥有完整图片和完整文本的情况下,它们在这些问题上的正确率也低于那些由文本承担主要工作的问题。

作者认为,这是因为这些模型已经学会了识别答案选项或文本描述中的模式,这些模式可以作为捷径,让它们无需真正“看到”医学问题就能猜对。这就像一个学生注意到最长的选项通常是正确的,于是他直接选择了那个最长的选项,而根本不去读题目。

最后,这篇论文并不是说 AI 在医学领域是没用的,但它确实敲响了严肃的警钟。它表明,当这些模型在医学考试中获得高分时,它们可能并没有像我们希望的那样证明自己理解了视觉证据。它们可能只是非常擅长阅读细则。研究人员警告说,在现实世界中,医生需要真正“看到”扫描中的肿瘤或皮肤上的皮疹,依赖一个忽略图片的 AI 可能是危险的。该研究总结道,虽然 AI 正在变得越来越聪明,但我们需要确保它是在观察证据,而不是仅仅根据文本中的线索进行猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →