想象一下你是一名正在试图破解谜团的侦探,但你手里拿到的不是一张犯罪现场的照片,而是一整本跨越数月或数年的快照相册。在医学领域,这种“相册”被称为纵向数据(longitudinal data)。它是患者健康历程的记录,展示了他们的身体在每次就诊之间是如何变化的。几十年来,人工智能(AI)在观察单张图片并判断“这看起来像骨折”或“这看起来像肿瘤”方面已经变得非常出色。这些被称为**多模态大语言模型(MLLMs)**的 AI 系统,就像是能够同时阅读文本和观察图像的超级聪明学生。它们在回答关于单一时间点的问题时表现得极其出色。但现实生活并非一个瞬间,而是一部电影。医生们不仅仅看今天的 X 光片,还会将其与上个月的进行对比,以观察疾病是在好转、保持不变,还是在恶化。科学家们一直在问一个大问题:这些超级聪明的 AI 学生真的能看完整部电影并理解剧情吗?还是说当故事发生变化时,它们就会感到困惑?
这正是 LoMeVQA 这篇论文所解决的问题。作者们——来自同济大学和华东师大学的研究团队——意识到,虽然 AI 擅长处理单张快照,但它并不擅长观看患者健康的“电影”。为了证明这一点,他们构建了一个巨大的新游乐场,名为 LoMeVQA(纵向医学视觉问答)。你可以把它想象成一个包含 206,000 个问题的巨型测验,专门设计用来测试 AI 是否能发现随时间推移而产生的变化。他们不仅提出了简单的问题,还创建了五种不同类型的挑战,范围从“病情是好转了还是恶化了?”(进展分类)到“在图像上精确指出变化发生的位置”(差异区域定位)。
当他们把顶尖的 AI 模型投入测试时,结果令人震惊。即使是那些通常在单图测试中表现优异的最聪明医学 AI 模型,在这个新测验上也表现得很糟糕。在简单的“好转或恶化”问题上,它们的正确率仅为 50% 左右,而在“指向变化位置”的任务中,正确率甚至不到 25%。事实证明,这些 AI 就像是背下了教科书却无法理解带有反转的故事的学生。它们经常错过细微的变化,或者搞混了时间线。
为了解决这个问题,作者们创造了自己的 AI 学生,名叫 MedLong-8B。他们选取了一个强大的现有模型,并针对他们这个拥有 206,000 个问题的全新测验对其进行了专门的“辅导”。结果如何?MedLong-8B 成为了全场的明星,取得了该基准测试中有史以来的最高分。这篇论文表明,虽然目前的 AI 在理解医学图像中的时间流逝方面存在困难,但通过训练模型使其变得更好是完全可能的。作者们建议,通过给 AI 提供正确类型的纵向数据练习,我们最终可以构建出不仅能看到一张图片,而且能真正理解患者故事的系统。