← 最新论文
💻 computer science

LoMeVQA: A Comprehensive Benchmark for Longitudinal Medical VQA

本文介绍了 LoMeVQA,这是一个包含 206K 个纵向医学视觉问答(VQA)对的综合基准测试,旨在评估多模态模型在时间推理方面的能力,并提出了在这些任务上达到最先进性能的 MedLong-8B 模型。

原作者: Zhilin Wu, Zhangkai Ni, Chengmei Yang, Longzhen Yang, Yihang Liu, Ying Wen, Lianghua He

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhilin Wu, Zhangkai Ni, Chengmei Yang, Longzhen Yang, Yihang Liu, Ying Wen, Lianghua He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜团的侦探,但你手里拿到的不是一张犯罪现场的照片,而是一整本跨越数月或数年的快照相册。在医学领域,这种“相册”被称为纵向数据(longitudinal data)。它是患者健康历程的记录,展示了他们的身体在每次就诊之间是如何变化的。几十年来,人工智能(AI)在观察单张图片并判断“这看起来像骨折”或“这看起来像肿瘤”方面已经变得非常出色。这些被称为**多模态大语言模型(MLLMs)**的 AI 系统,就像是能够同时阅读文本和观察图像的超级聪明学生。它们在回答关于单一时间点的问题时表现得极其出色。但现实生活并非一个瞬间,而是一部电影。医生们不仅仅看今天的 X 光片,还会将其与上个月的进行对比,以观察疾病是在好转、保持不变,还是在恶化。科学家们一直在问一个大问题:这些超级聪明的 AI 学生真的能看完整部电影并理解剧情吗?还是说当故事发生变化时,它们就会感到困惑?

这正是 LoMeVQA 这篇论文所解决的问题。作者们——来自同济大学和华东师大学的研究团队——意识到,虽然 AI 擅长处理单张快照,但它并不擅长观看患者健康的“电影”。为了证明这一点,他们构建了一个巨大的新游乐场,名为 LoMeVQA(纵向医学视觉问答)。你可以把它想象成一个包含 206,000 个问题的巨型测验,专门设计用来测试 AI 是否能发现随时间推移而产生的变化。他们不仅提出了简单的问题,还创建了五种不同类型的挑战,范围从“病情是好转了还是恶化了?”(进展分类)到“在图像上精确指出变化发生的位置”(差异区域定位)。

为了构建这个测验,研究人员并没有凭空猜测,而是构建了一个聪明的机器人流水线。他们从一个庞大的数据库中提取了真实的患者记录,像整理相册一样按日期对它们进行排序,然后利用医学“百科全书”(知识图谱)提取出重要的事实。接着,他们要求一个大型语言模型根据这些事实随时间的变化过程来编写问题和答案。经过严格的质量检查——他们甚至让人类医生对其中最优秀的 2,500 个问题进行了审核,以确保其准确性——他们最终得到了一个金标准数据集。

当他们把顶尖的 AI 模型投入测试时,结果令人震惊。即使是那些通常在单图测试中表现优异的最聪明医学 AI 模型,在这个新测验上也表现得很糟糕。在简单的“好转或恶化”问题上,它们的正确率仅为 50% 左右,而在“指向变化位置”的任务中,正确率甚至不到 25%。事实证明,这些 AI 就像是背下了教科书却无法理解带有反转的故事的学生。它们经常错过细微的变化,或者搞混了时间线。

为了解决这个问题,作者们创造了自己的 AI 学生,名叫 MedLong-8B。他们选取了一个强大的现有模型,并针对他们这个拥有 206,000 个问题的全新测验对其进行了专门的“辅导”。结果如何?MedLong-8B 成为了全场的明星,取得了该基准测试中有史以来的最高分。这篇论文表明,虽然目前的 AI 在理解医学图像中的时间流逝方面存在困难,但通过训练模型使其变得更好是完全可能的。作者们建议,通过给 AI 提供正确类型的纵向数据练习,我们最终可以构建出不仅能看到一张图片,而且能真正理解患者故事的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →