Can Multimodal Large Language Models Understand OCT?
本文介绍了 OCT-Bench,这是一个包含超过 10,000 个涵盖感知、认知和推理维度的细粒度问题的全面基准测试,旨在系统地评估多模态大语言模型,并揭示了包括经过医学适配的模型及更大规模变体在内的现有模型,在执行具有临床依据的 OCT 图像理解能力方面仍然存在显著局限。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解谜团的侦探,但你的证据不是犯罪现场,而是一张发光的、人类眼睛的横截面地图。这就是光学相干断层扫描(OCT)的世界——一种超级强大的相机,让医生无需进行任何切割,就能窥探视网膜(眼睛后方对光敏感的图层)内部的情况。这就像拥有了针对眼睛微小分层社区的 X 光透视能力,帮助医生在疾病夺走你的视力之前发现它们。现在,科技界的新英雄登场了:多模态大语言模型(MLLM)。把它们想象成能够同时阅读文本和观察图像的超级聪明的人工智能机器人。它们是数字时代的“夏洛克·福尔摩斯”,经过训练,能够将所见之物与所知之物联系起来。但现在有一个让所有人都在议论纷纷的大问题:这些 AI 侦探真的能“理解”人类眼睛复杂的、分层的地图吗?还是它们只是在根据模式进行猜测?如果一个 AI 无法区分健康的眼睛和生病的眼睛,或者无法确定正确的治疗方案,那么它对医生来说就没什么用处。这就是为什么科学家们如此渴望测试这些模型是否真的准备好协助保护视力。
在这篇论文中,一组研究人员决定停止猜测,开始测试。他们构建了一个规模宏大、极具挑战性的考试,名为 OCT-Bench,旨在测试 AI 是否真的能胜任解读眼部扫描的任务。他们并没有仅仅问 AI:“这只眼睛是健康的还是生病的?”(这就像要求一名学生在多选题中直接猜答案一样),而是将任务分解为一个模仿真实医生思考过程的循序渐进的过程。首先,AI 必须进行感知(Perceive):它能否看到图像中的基本形状、颜色和线条?接下来,它必须进行认知(Cognize):它能否识别出某条特定的弯曲线条实际上是视网膜的一个图层或一个充满液体的囊袋?最后,它必须进行推理(Reason):它能否综合所有这些线索,并决定这是什么疾病、该采取什么治疗措施以及接下来的发展趋势?
为了使这场考试既公平又严苛,研究人员从七个不同的公共数据库中收集了 4,137 张真实的眼部扫描图像,并将它们转化为了 10,076 个经专家验证的问题。随后,他们让 20 种不同的 AI 模型接受了严苛的考验,其中包括来自科技巨头的著名“超级大脑”、开源模型以及专门为医学训练的 AI。
结果如何?这些 AI 模型确实很聪明,但它们还不是未来的眼科医生。整个测试中表现最好的模型也仅答对了 62.0% 的问题。这意味着在每 10 个问题中,它大约会在 4 个问题上出错。研究人员发现了一个明显的模式:AI 在处理简单任务时表现尚可。当被要求仅仅识别图像类型或计算屏幕上画了多少个框时,模型的得分很高,有时接近 75.8%。但一旦问题变得更难——需要 AI 理解眼睛图层的微小细节或制定治疗方案时——分数便骤降。对于最难的“推理”任务,表现最好的模型得分仅为 42.9%。
令人惊讶的部分在于:成为“医学专家”或拥有更大的“大脑”并不能自动解决问题。在某些任务中,一些专门针对医学数据进行训练的模型表现甚至不如通用模型。而且,通过扩大模型规模(即增加参数量)虽然有一定帮助,但并未解决核心问题。AI 仍然难以将它在图片中看到的景象与进行真实诊断所需的深层医学知识联系起来。这就像一个学生虽然能背下人体所有骨骼的名字,但在看到 X 光片并被要求诊断骨折时却不知所措。
论文总结道,目前的 AI 模型在 OCT 理解能力方面仍存在显著差距,且远未达到临床使用的可靠水平。它指出,虽然这些模型在“视觉”方面正在进步,但它们仍然缺乏理解“为什么”出现问题以及“该如何”应对问题的“临床推理”肌肉。研究人员表示,在 AI 能够可靠地从单纯的“看图”转向理解疾病并“规划”疗法之前,我们要在信任它们守护我们的眼睛方面还有很长的路要走。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。