想象一个计算机可以看着一张图片并为你讲述其背后故事的世界。这就是“视觉-语言模型”(Vision-Language Models)的魔力,它是人工智能的一个分支,充当着视觉与语言之间超级智能翻译官的角色。长期以来,这些 AI 助手擅长观察平面的、二维的照片,比如一张猫或日落的快照。但人体并不是扁平的;它是一个复杂的、三维的谜题。医生使用一种叫做 MRI 的特殊相机来拍摄我们内部深层的 3D“切片”,从而创建大脑和器官的体积图。挑战在于,如何教会计算机不仅能看到这些 3D 形状,还能理解扫描件的不同“风味”(例如水看起来与脂肪有何不同),并随后用通俗易懂的英语与医生进行交流。如果我们能破解这个代码,对于患者而言,这意味着更快、更清晰的诊断;对于疲惫的医生来说,则意味着一个强大的新助手。
于是,Mr3D-VL 登场了,这是一个专门为成为 3D 脑部扫描终极侦探而设计的全新 AI 模型。把它想象成一名读遍了所有教科书、背下了每一张 3D 大脑图谱,并且能与外科医生进行对话的医学实习生。与那些试图将 3D 扫描压扁成一叠 2D 图片的旧模型不同(就像是一片片观察面包,试图通过每一片面包来猜测整个面包的形状),Mr3D-VL 将整个面包视为一个完整的 3D 物体。它的构建旨在处理“多参数”(multiparametric)MRI,这意味着它可以同时观察几种不同类型的脑部扫描——每种类型都像是一束不同颜色的手电筒光,突显出不同的组织。
论文指出,旧有的方法——即将 3D 扫描视为一堆 2D 切片,或者试图让模型一次只从一种扫描类型中学习——忽略了大局。通过教会 AI 理解数据的“深度”以及不同扫描类型在 3D 空间中如何相互关联,Mr3D-VL 表明,我们终于可以让 AI 流利地使用医生的语言。这不仅仅是发现问题,更是关于如何在一次连贯的对话中解释问题在哪里、它在 3D 空间中看起来如何,以及它为什么重要。
技术摘要:Mr3D-VL
问题陈述
多参数磁共振成像(mpMRI)是诊断和治疗脑肿瘤的基石,然而目前的 AI 模型在临床应用方面面临关键局限。现有解决方案在以下三个方面面临挑战:
现有 3D VLM 的局限性: 虽然视觉语言模型(VLMs)展现出潜力,但大多数是将 2D 架构适配到 3D 数据,将体积视为连续的 2D 切片序列。这种方法忽略了显式的 3D 空间关系,破坏了体积连续性,并导致指数级的 Token 增长。现有的 3D VLM(如用于 CT 的模型)通常无法解决 mpMRI 所需的多模态协同推理这一特定挑战。此外,高质量、多模态 3D 图像-文本数据集的匮乏也阻碍了监督学习。
方法论
作者引入了 Mr3D-VL,这是一个专为多参数 3D MRI 设计的 40 亿参数通用视觉语言基础模型。其架构由三个核心组件组成:
1. 模型架构
共享 3D 视觉编码器: 不同于使用特定模态编码器或基于 2D 切片处理的方法,Mr3D-VL 采用了基于 MedNext(利用 ConvNeXt3D、UpKern 和复合缩放)的模态无关 3D 视觉编码器。该编码器通过 Dino-v2 架构进行无监督预训练,无需文本标签,从而能够捕捉模态内特征和模态间差异。