✨ 要点🔬 技术摘要
中风仍然是世界上最严重的健康挑战之一,是导致死亡和长期残疾的主要原因,且往往在毫无预警的情况下袭来。几十年来,医生一直依赖于CT扫描仪和核磁共振成像(MRI)等沉重且昂贵的机器来观察大脑内部并确认中风。这些工具对于治疗至关重要,但并不总是能用于快速筛查,尤其是在偏远地区或针对早期预警信号时。越来越多的研究表明,发现这些危险的关键可能不在大脑本身,而是在眼睛里。视网膜是位于眼球后部的感光组织,也是人体内唯一可以让医生在无需手术的情况下直接观察血管的地方。由于眼睛和大脑的血管非常相似,视网膜微血管的变化往往反映了大脑自身循环系统的健康状况。这种联系引发了一项研究热潮,即寻找一种更快速、更便宜且非侵入性的方法,仅通过一张眼部照片来评估中风风险。
芬兰VTT技术研究中心的研究人员通过开发一种新的计算机系统,将这一概念向前推进了一步,该系统旨在以空前的深度读取这些视网膜照片。在最近的一项研究中,他们引入了一种名为“编织视觉互感器”(Braided Vision Transformer)的方法,这是一种能够以以往任何系统都无法实现的方式观察眼睛的人工智能。该系统并非孤立地分析单张图像,而是同时检查视网膜的四个不同视角:左眼和右眼的黄斑区以及视神经乳头。黄斑是视网膜中负责清晰视觉的中心部分,而视神经乳头则是神经纤维离开眼睛前往大脑的出口。通过捕捉双眼的这些特定区域,该系统比任何单一快照都能收集到更丰富的个人血管健康图景。
这项工作的核心创新在于计算机如何处理这些图像。传统的人工智能模型通常将每张图像视为独立的拼图碎片,在组合答案之前逐一解决它们。然而,新的编织视觉互感器从一开始就将信息交织在一起。它创建了一个结构,使计算机能够同时不断地将左眼的血管模式与右眼的血管模式进行比较,并将中心视图与侧面视图进行比较。这种方法模仿了熟练临床医生观察患者的方式——不断地在眼睛的不同部位以及双眼之间切换焦点,以发现预示问题的细微不一致之处。研究人员利用从200多名参与者那里收集的800多张视网膜图像数据集对该系统进行了训练,这些参与者包括中风患者、经历过短暂性脑缺血发作(通常被称为“小中风”的暂时性阻塞)的人以及健康个体。
训练结果令人鼓舞。在测试其区分健康眼睛与显示中风或小中风迹象的眼睛的能力时,该新系统达到了0.75的性能评分,这一准确度指标高于同一研究中测试的其他标准计算机视觉模型。事实证明,该系统在识别与脑血管事件相关的复杂模式方面特别有效,其表现优于那些单独查看图像或使用旧数据组合方法的模型。研究还强调了一个关键发现:观察多个眼部视角显著优于仅观察一个视角。当研究人员测试一个仅观察单张图像的系统版本时,其检测中风的能力大幅下降,这表明血管疾病的细微迹象分布在视网膜的不同部分以及双眼中,如果视野过于狭窄,这些迹象很容易被忽略。
虽然该系统尚未准备好取代医院急诊室中的CT扫描仪,但它代表了早期筛查潜力的一次重大飞跃。研究人员指出,他们的方法提供了一种便携且具有成本效益的替代方案,未来可以用于社区诊所甚至偏远地区,以标记那些需要立即接受更详细医疗关注的人员。这项研究证实,视网膜蕴含着关于大脑健康的宝贵线索,并且当现代人工智能被设计为观察整体而非局部时,能够比以往更有效地解锁这些线索。通过成功地将多个眼部视角编织在一起,这种新方法预示着这样一个未来:对抗中风的第一道防线可能仅仅是一张快速、无痛的照片。
技术摘要:用于多视图视网膜眼底图像中卒中检测的编织视觉 Transformer (Braided Vision Transformer)
问题陈述 卒中和短暂性脑缺血发作(TIA)仍是全球范围内导致死亡和发病的主要原因。虽然计算机断层扫描(CT)和磁共振成像(MRI)是评估卒中的金标准,但其临床应用受到高成本、长采集时间和辐射暴露(针对 CT)的限制。视网膜眼底成像提供了一种无创、便携且具有成本效益的替代方案,因为视网膜微血管的变化反映了脑血管健康状况。然而,现有的利用视网膜图像进行卒中评估的深度学习方法面临两个主要局限性:(1)大多数研究仅使用单眼的单视图图像,未能捕捉双眼间的血管差异;(2)现有的多视图方法依赖于卷积神经网络(CNN),而视觉 Transformer(ViT)在该特定任务中的潜力尚未得到探索。此外,相比于缺血性卒中,TIA 的检测在很大程度上被忽视了。
方法论 作者提出了 Braided Vision Transformer (BViT) ,这是一种旨在分析来自双眼的各视图视网膜眼底图像的新型架构。
输入数据: 模型处理每个患者的四张图像:左眼(l l l )和右眼(r r r )的黄斑中心凹中心视图(v 2 v_2 v 2 )以及视盘中心视图(v 1 v_1 v 1 )。
架构:
嵌入(Embedding): 每张输入的图像被划分为补丁(patches),进行展平处理并辅以位置嵌入。
编织 Transformer 模块(Braided Transformer Modules): 与通道独立处理或仅连接成对模态的标准互变 Transformer 不同,BViT 采用了“编织”结构。这包括两个连续的 Transformer 块阶段:
第一阶段: 四个图像嵌入(a ˙ , b ˙ , c ˙ , d ˙ \dot{a}, \dot{b}, \dot{c}, \dot{d} a ˙ , b ˙ , c ˙ , d ˙ )通过相互注意力机制进行处理,其中一个嵌入的查询(query)去关注另一个嵌入的键(key)和值(value),从而建立初始的跨通道交互。
第二阶段: 第一阶段的输出在第二个编织块中进一步处理,创造了所有输入通道之间复杂的交织连接。这种设计模拟了临床实践,即同时对眼内(不同视图)和眼间(左眼 vs 右眼)的关系进行建模。
分类: 最终的特征向量被展平、拼接,并通过带有 ReLU 和 Softmax 激活函数的全连接层进行二分类(卒中/TIA vs 健康)或多分类(卒中、TIA、健康)任务。
数据集与训练: 模型在 Stroke-Data 数据集上进行训练(220 名参与者:26 例 TIA,73 例卒中,121 例健康对照),包含 802 张视网膜图像。由于数据稀缺,应用了广泛的数据增强(旋转、翻转、剪切、缩放)以达到 12,000 个训练样本。模型采用了分层 5 折交叉验证方案,并使用 Adam 优化器和类别交叉熵损失函数。
核心贡献
首个用于视网膜卒中评估的 ViT: 据作者所知,这是首个将视觉 Transformer 应用于视网膜眼底成像进行卒中和 TIA 检测的研究。
新型编织架构: 引入了 BViT 模型,该模型利用特定的编织结构形式,能够同时捕捉双眼的跨视图关系,这使其区别于标准的 ViT 和互变 Transformer 模块。
多视图学习范式: 本研究证明了多视图学习(利用双眼和两种聚焦视图)在捕捉与脑血管事件相关的异质性视网膜生物标志物方面优于单视图方法。
实验结果 实验在 Stroke-Data 数据集上进行,将 BViT 与基准模型(Vanilla ViT、Mutual ViT 以及基于 CNN 的 MVS-Net 变体)进行了对比。
二分类(卒中/TIA vs 健康): BViT 取得了最高性能,AUC 为 0.752 ,优于 Vanilla ViT (0.729)、Mutual ViT (0.717) 以及表现最好的 CNN 基准模型 MVS-Net-v1 (0.707)。BViT 的灵敏度为 0.647,特异度为 0.727。
多分类: 在区分卒中、TIA 和健康对照组时,BViT 在健康对照组(AUC 为 0.716)和 TIA 患者(AUC 为 0.618)方面均取得了最高 AUC。对于卒中类,其 AUC 为 0.715,略低于 Mutual ViT (0.719)。
单视图 vs 多视图: 一项关键的消融研究对比了多视图 BViT 与单视图 ViT 基准模型。单视图模型获得的 AUC 仅为 0.49,而多视图方法达到了 0.71,凸显了聚合跨视图和跨眼信息的必要性。
模型效率: 尽管是一个基于 Transformer 的模型,BViT(约 800 万参数)的表现仍能与较大的 CNN 架构如 MVS-Net-v2(约 3500 万参数)相媲美。
意义与主张 论文声称 BViT 模型成功证明了利用视网膜眼底成像进行快速、无创卒中风险评估的可行性。作者强调,编织架构有效地模拟了临床评估实践,通过利用来自多个视图和双眼的互补性血管及结构信息。虽然结果显示出良好的前景,但作者保持了谦逊的语气,指出神经影像学(CT/MRI)在治疗决策中仍然至关重要。该研究为基于 Transformer 的缺血性卒中预测框架奠定了基础,但也承认在早期诊断阶段,区分 TIA 与卒中的临床难度较大,这从多分类任务中较低的 TIA 检测灵敏度中得到了体现。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。