ScintiGround-38K: A Grounded Visual Question Answering Benchmark for Paired Anterior–Posterior Bone Scintigraphy
该论文介绍了 ScintiGround-38K,这是一个针对配对的前后位骨显像图像进行定位式视觉问答的大规模、保留溯源性的基准测试集,研究表明,尽管模型在原始答案准确率上表现出色,但在少数类检测和严格的基于证据的定位方面仍面临显著困难。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜团的侦探,但你的现场不是犯罪现场,而是一张发光的真人骨骼图。这张被称为骨骼扫描图的地图,是通过向患者体内注射极少量安全的放射性染料制成的。这种染料通过血液流动,并粘附在骨骼生长或愈合的区域,像黑暗道路上的霓虹灯一样将它们照亮。医生利用这些扫描图来发现问题,比如扩散到骨骼的癌症,方法就是寻找这些明亮的“热点”。
现在,想象你想教一台电脑也成为一名侦探。你给它一张骨骼照片,并问它:“这里有问题吗?”这被称为视觉问答(VQA)。但棘手的部分在于,电脑有时会变成一个“聪明的猜谜者”。它可能会观察问题,根据它经常看到的某些词汇来猜测答案,然后在没有真正观察地图上发光点的情况下就回答“是”。这就像一个背下了答案集的学生,却并不理解数学题本身。为了解决这个问题,科学家们正在构建一种新型测试,要求电脑不仅要给出正确答案,还要用手指指向图片中证明其答案的确切位置。这被称为“落地式”(grounded)回答。大问题在于:这些聪明的电脑真的能学会观察证据吗,还是仅仅在瞎猜?
这正是开发 ScintiGround-38K 的研究人员想要探寻的真相。他们为电脑设计了一个规模宏大、组织严密的“游戏”,其中包含了 38,469 个不同的骨骼扫描谜题。他们并非凭空捏造问题,而是利用来自 2,815 名患者的真实医疗记录构建了这个游戏,保留了原始的“发光”点以及医生标记它们的精确坐标。他们将这些记录转化成了三种类型的挑战:提出一个“是或否”的问题,要求电脑画出一个特定骨骼的方框,以及同时要求它完成这两项任务。
结果令人震惊,就像发现一位国际象棋冠军其实只是在盲猜棋步一样。当研究人员测试两种目前最智能的 AI 模型(Qwen3-VL 和 PaliGemma)时,电脑在简单的“是或否”问题上的正确率超过了 90%。这听起来很了不起,对吧?但当研究人员仔细观察时,他们发现了一个隐藏的陷阱。由于游戏中的大多数骨骼扫描图都是完全正常的,电脑学会了几乎每次都直接猜“没问题”。当研究人员强迫电脑通过指向发光点来证明其答案时,性能显著下降。
这些模型在画出发光点方框方面表现得相当不错(准确率约为 70-85%),但在识别罕见的异常点方面表现得很糟糕。它们正确识别“坏点”的能力如此之低,甚至几乎不比抛硬币好多少。论文显示,这些电脑目前是“答案专家”,却是“证据新手”。它们能说出正确的词汇,但往往无法将这些词汇与地图上实际的发光证据联系起来。
作者非常明确地指出,这意味着这还不是一种可以在医院为患者进行诊断的工具。它是一个研究工具,旨在向我们展示当前的 AI 在哪些地方失败了。它证明了,如果电脑并没有真正观察图片,那么在简单测试中获得高分是具有误导性的。论文总结道,为了让 AI 在医学领域真正值得信赖,我们需要像 ScintiGround-38K 这样的基准测试,强制要求电脑“展示其解题过程”,以确保它不是仅仅根据问题中的模式进行猜测,而是真正看到了证据。在解决“猜测”问题之前,这些智能系统仍然是强大的研究工具,但尚未准备好进入真实的临床护理世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。