← 最新论文
💻 computer science

RetiBridge: Bridging Quantitative Retinal Biomarkers and Qualitative Diagnosis with a Knowledge-Guided Multimodal Large Language Model

RetiBridge 是一个知识引导的多模态大语言模型,它有效地将来自 CFP 和 OCT 图像的定量视网膜生物标志物与定性临床诊断相连接,并在包含超过 15,000 个配对样本的新基准测试中,表现优于现有的开源及商业模型。

原作者: Zhuangzhi Gao, Hongyi Qin, He Zhao, Qinkai Yu, Feixiang Zhou, Fu Wang, Jinru Ding, Eduard Shantsila, Uazman Alam, Alena Shantsila, Wahbi El-Bouri, Gregory Y. H. Lip, Yalin Zheng

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhuangzhi Gao, Hongyi Qin, He Zhao, Qinkai Yu, Feixiang Zhou, Fu Wang, Jinru Ding, Eduard Shantsila, Uazman Alam, Alena Shantsila, Wahbi El-Bouri, Gregory Y. H. Lip, Yalin Zheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的眼睛就像是你整个身体的高科技监控摄像头系统。正如监控摄像头可以发现破碎的窗户或奇怪的阴影一样,你眼底部的视网膜可以揭示有关糖尿病、高血压甚至心脏问题等疾病的线索。医生使用两种主要的“镜头”来观察这个监控画面:一种拍摄表面的平面彩色照片(就像一张标准的快照),另一种则拍摄穿过图层的深度 3D 切片(就像一个蛋糕的横截面)。长期以来,计算机非常擅长测量这些图像中的数字——比如某一层有多厚,或者一条血管有多宽——但它们却非常不擅长用通俗易懂的语言解释这些数字究竟意味着什么。这就像是一个机器人能告诉你汽车的速度是每小时 60 英里,但却无法告诉你这意味着汽车是在超速还是仅仅在高速公路上正常行驶。

这正是这项新研究的切入点。科学家们一直试图构建“多模态大语言模型”(MLLMs)——基本上就是能够同时看懂图像并阅读文本的超级聪明 AI 大脑。目标是创建一个数字医生助手,它不仅仅是说“异常”,而是通过将硬性的数字与真实的诊断结果联系起来,来解释“为什么”。然而,大多数现有的 AI 模型就像是那些背下了教科书却无法应用到实际考试中的学生;它们可能会猜对疾病,但无法展示解题过程,也无法解释这些测量数据是如何得出结论的。这篇论文介绍了一种名为 RetiBridge 的新 AI,它试图通过强制计算机扮演一名细心的侦探来解决这个问题,将它发现的每一个数字都与特定的医学线索联系起来,然后再做出最终判定。

研究人员将 RetiBridge 构建成了一个“以知识为引导”的侦探。他们没有让 AI 进行盲目猜测,而是教给它一种特定的思考方式:首先,测量证据(数字);第二,将这些数字转化为医学故事(线索);第三,破解案件(诊断)。他们使用来自 UK Biobank 的 15,611 对眼部图像来训练这个 AI,这是一个庞大的真实患者数据数据库。对于每一位患者,AI 都可以获取来自深度 3D 扫描的 31 种不同测量值和来自平面照片的 6 种测量值。为了确保 AI 学会正确的思考方式,研究人员使用了一个强大的 AI 工具(OpenAI-o3)为这 15,000 多个案例编写了“标准答案”。这些标准答案不仅给出了诊断结果,还写出了完整的推理过程,展示了像“240 微米厚度”这样的测量值是如何转化为“此处无肿胀”的,进而如何推导出最终结论。

当他们测试 RetiBridge 时,它展现出了一些令人印象深刻的能力。尽管它是基于一个相对较小的“大脑”(一个 70 亿参数的模型)构建的,但它的表现优于许多更大的模型,包括一些 320 亿参数的模型,甚至是来自 OpenAI 的非常先进的专有模型。其成功的关键在于一个特殊的训练步骤,即让 AI 直接将 3D 眼部图像与其所代表的具体数字进行对齐,这有点像教学生直接将蛋糕切片的图片与尺子匹配,而不是仅仅记住“蛋糕”这个词。

结果表明,RetiBridge 更擅长完成“展示解题过程”这项工作。它在准确获取数字方面表现得更为出色(准确率为 78.23%,而其他模型的得分要低得多),并且能更好地证明其诊断确实得到了证据的支持。虽然其他模型有时能得到最终诊断,但会忽略细节或编造理由,而 RetiBridge 则能始终如一地将结论回溯到实际的测量值。例如,在一个涉及糖尿病视网膜病变的测试案例中,RetiBridge 正确识别了特定的斑点和厚度,并解释了它们是如何排除其他疾病的,从而建立了一条从照片到答案的清晰、逻辑严密的路径。

然而,论文也谨慎地指出,这目前还不是万能药。虽然 RetiBridge 在连接已知信息方面做得更好,但在处理某些复杂的推理任务时,与最顶尖的人类水平模型相比仍有难度,而且它尚未在每一种类型的眼科疾病上进行测试。作者认为,这种强制 AI 将其答案建立在硬性数字基础上的方法是一个充满前景的方向,但仍需更多工作才能使其足够强大,以投入到现实世界的医院中使用。他们还计划在未来使用更详细的 3D 扫描和不同类型的眼部图像来测试它。目前,RetiBridge 是一个强有力的概念验证,它证明了如果教导 AI 尊重医学背后的数学逻辑,它就能成为理解我们健康的更加值得信赖的伙伴。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →