TractoGraphVLM: A Unified Vision-Language Framework for White Matter Tractography
TractoGraphVLM 是一个统一的视觉-语言框架,它利用 GPS 图变换器(GPS graph transformer)和对比学习将 3D 白质纤维束表示为图,从而使单个联合训练的模型能够执行纤维束分类、文本到纤维束检索、解剖结构描述以及视觉问答,并在不同年龄组之间表现出强大的性能和零样本迁移能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人类大脑是一个由数十亿根导线组成的庞大且纠缠的网络,为了理解我们如何思考、感受和运动,科学家必须绘制出这些连接。用于实现这一目标的强大工具之一是弥散磁共振成像(diffusion magnetic resonance imaging),这是一种通过追踪水分子运动来揭示连接不同脑区之长形缆索状神经纤维束的扫描技术。这些纤维束被称为白质纤维束(white matter tracts),是脑部的通信高速公路。几十年来,分析这些地图一直是一个缓慢的手动过程。专家们必须观察复杂的三维形状,并凭肉眼判断每一束纤维是什么,当研究规模扩大到数千人时,这项任务很难实现规模化。虽然计算机在读取 X 光或 CT 扫描等标准医学图像方面已经非常出色,但在处理这些纤维束时却遇到了困难,因为这些纤维束并非实心的组织块,而是连续且扭曲的线条,难以捕捉在简单的网格中。
麦吉尔大学的一组研究人员现在构建了一个新系统,教计算机不仅将这些纤维束理解为形状,还将其理解为具有名称、故事和功能的实体。他们创建了一个名为 TractoGraphVLM 的统一框架,将视觉理解与语言相结合。研究人员并没有强迫计算机将脑纤维视为一张照片,而是将每条纤维束表示为一个图(graph)——一种由点和线连接而成的数学结构,能够保留纤维的精确路径和方向。随后,他们训练了一个单一的人工智能模型来同时执行四项不同的任务:识别它正在观察的是哪条纤维束、根据文本描述找到正确的纤维束、撰写关于该纤维束的详细解剖学描述,以及回答相关问题。该系统利用来自 1,113 名健康青年的数据进行了训练,学习了如何将纤维的视觉形状与神经科学家用来描述它们的词汇对齐。
结果表明,这种方法效果显著。在针对从未见过的数据进行测试时,该系统在 91.8% 的案例中正确识别了特定的纤维束。当给定文本查询时,它也能高精度地从数据库中检索出正确的纤维束,并且生成的文字描述和问题的回答都与既定的医学知识保持一致。至关重要的是,研究人员发现,数据的表示方式比计算机模型的复杂程度更为重要。通过在图结构中保留纤维的方向信息,该系统的表现优于那些试图将纤维转化为标准 3D 图像的方法。这表明,保持纤维的连续性和流动性对于计算机真正理解它们至关重要。
或许最令人惊讶的发现是,该系统从它所学习的语言中获益匪浅。研究人员在训练模型时使用的文本描述包含了关于纤维束位于大脑哪一侧以及属于哪个大类纤维家族的细节,尽管系统从未被明确告知要按这些类别进行分类。当测试系统的内部知识时,它能够准确预测这些隐藏的细节,证明了语言监督帮助模型构建了比单纯标记更丰富、更完整的脑解剖学理解。该系统还展示了它已经学习到了通用原则,而非仅仅记忆训练数据;当使用扫描设备不同且年龄较大的群体数据进行测试时,它依然表现良好,能够正确识别纤维束并回答问题,尽管年龄和设备发生了变化。
这项工作目前尚未取代人类专家的需求,也不声称是一个已准备好立即投入医院临床使用的成熟临床工具。它生成的描述是根据一个结构化数据库进行衡量的,而非独立的真人写作,这意味着该系统目前最好被视为一个概念验证,展示了一种看待脑连接的新方式。然而,它标志着一个重要的转变,即将纤维束成像(tractography)从一个纯粹的几何问题转变为一个语言问题。通过展示单一模型可以命名、检索、描述和查询白质纤维束,研究人员为自动化、结构化的脑连接报告开辟了一条道路。这最终可能允许科学家在大规模范围内分析大脑网络,将复杂的三维数据转化为清晰、可搜索的信息,从而帮助我们理解大脑是如何连接的,以及这种连接在疾病中是如何变化的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。