原作者:Alexandra G. Roberts, Maneesh John, Jinwei Zhang, Dominick Romano, Mert Sisman, Ki Sueng Choi, Heejong Kim, Mert R. Sabuncu, Thanh D. Nguyen, Alexey V. Dimov, Pascal Spincemaille, Brian H. Kopell, Yi Alexandra G. Roberts, Maneesh John, Jinwei Zhang, Dominick Romano, Mert Sisman, Ki Sueng Choi, Heejong Kim, Mert R. Sabuncu, Thanh D. Nguyen, Alexey V. Dimov, Pascal Spincemaille, Brian H. Kopell, Yi Wang
原作者: Alexandra G. Roberts, Maneesh John, Jinwei Zhang, Dominick Romano, Mert Sisman, Ki Sueng Choi, Heejong Kim, Mert R. Sabuncu, Thanh D. Nguyen, Alexey V. Dimov, Pascal Spincemaille, Brian H. Kopell, Yi Wang
并非万能魔法: 如果你拥有海量数据(数百万张图像),标准 AI 最终可能会自己学到更好的特征。谱视觉 Transformer 的闪光点恰恰在于你数据短缺的时候。
总结
谱视觉 Transformer 就像一位聪明的编辑,知道如何将一本 500 页的书浓缩为 10 页的大纲。通过关注图像的“大局”频率而非每一个像素,它能够利用传统 AI 所需数据的一小部分来学习识别模式并诊断病症。这使得它成为医疗领域的有力工具,因为在这些领域收集海量数据集往往困难甚至不可能。
技术摘要:用于有限数据下高效 Token 化的谱视觉 Transformer
问题陈述
视觉 Transformer(ViT)在医学成像中的应用目前因其巨大的数据需求而受阻。传统的空间 ViT 依赖局部图像块 Token 化和自注意力机制,通常需要数十万张训练图像以避免过拟合并确保鲁棒的收敛。在临床环境中,数据集往往规模较小、经过精心策划且易受分布偏移的影响,标准 ViT 难以实现泛化。现有的缓解策略,如从自监督任务进行迁移学习或基于 Token 的知识蒸馏,往往依赖于庞大的外部数据集或预训练的辅助模型,这引入了对分布偏移的脆弱性以及监管挑战。因此,将 ViT 用于预测侵入性手术、侵袭性疾病和罕见疾病的临床转化仍然有限。