← 最新论文
💻 computer science

RadJEPA: Radiology Encoder for Chest X-Rays via Joint Embedding Predictive Architecture

RadJEPA 是一种自监督框架,它通过在不依赖语言监督的情况下预测掩蔽图像区域的潜在表示,来学习用于胸部 X 光片的鲁棒放射学编码器,从而在多项下游医学任务中实现了最先进的性能。

原作者: Anas Anwarul Haq Khan, Mariam Husain, Kshitij Jadhav

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Anas Anwarul Haq Khan, Mariam Husain, Kshitij Jadhav

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一台计算机理解胸部 X 光片。通常,教计算机理解图像的最佳方式是向它展示一张图片,然后大声读出医生的报告,说:“这是肺炎,”或者“这颗心脏很大。”这就像通过向孩子展示一张狗的图片并说“狗”来教他们一样。

然而,这篇论文的作者 RadJEPA 指出,这种方法存在缺陷。医生的报告是供人类快速决策时使用的;它们经常忽略微小的细节或细微的变化,因为这些细节对即时诊断并不相关。如果你只教计算机医生了什么,计算机可能会错过实际存在的微妙视觉线索。

因此,团队提出了一个问题:我们能否在不阅读任何医生报告文字的情况下,教会计算机理解 X 光片?

新方法:“填空”游戏

RadJEPA 不使用文本,而是采用一种称为**联合嵌入预测架构(JEPA)**的方法。这就像一场高风险的“填空”游戏或拼图,只不过是在计算机的“大脑”中进行的,而不是在纸上。

  1. 设置: 计算机查看一张胸部 X 光片。
  2. 遮罩: 计算机遮盖(掩蔽)图像的随机部分,就像在 X 光片的一部分上贴了一块胶带。
  3. 猜测: 计算机观察可见的部分(健康的肺、肋骨、心脏),并尝试预测被隐藏、被遮盖的部分看起来是什么样。
  4. 转折: 它并不是试图逐像素地重绘图片(像复印机那样)。相反,它试图猜测缺失部分的含义或“本质”。它会问:“基于身体的其余部分,这个隐藏区域应该有什么?”

如果计算机正确猜出了“本质”,它就学会了。如果猜错了,它就会调整其内部理解。随着时间的推移,通过在数千张 X 光片上玩数百万次这个游戏,计算机建立了对解剖结构和疾病的深刻、直观的理解,而无需人类告诉它它看到了什么。

为什么这比旧方法更好

该论文将 RadJEPA 与两种其他流行的计算机教学方法进行了比较:

  • “文本教师”(视觉 - 语言模型): 这些模型依赖医生的报告。如前所述,报告可能存在偏见或不完整。RadJEPA 完全忽略文本,迫使计算机从图像本身学习。
  • “镜像教师”(自蒸馏/DINO): 这些方法以不同的方式(裁剪、翻转、提亮)向计算机展示同一张图片,并告诉它:“这些都是同一张图片。”计算机学会忽略这些变化。作者认为,这使计算机专注于图像的外观,而不是解剖结构的含义。RadJEPA 通过预测缺失部分,迫使计算机理解身体部位之间的结构关系

结果:更智能、更小的模型

团队在三项困难的任务上测试了他们新的“填空”教师(RadJEPA):

  1. 诊断疾病: 它能判断患者是否患有肺炎或心脏扩大吗?
  2. 绘制边界: 它能围绕肺部或肋骨画一条线,将其与身体其余部分分开吗?
  3. 撰写报告: 它能帮助语言模型根据图像撰写医疗报告吗?

令人惊讶的发现: RadJEPA 在所有这些任务中都击败了当前的“冠军”(最佳现有模型)。

更令人印象深刻的是,RadJEPA 在小得多的规模下实现了这一成就。想象一下,一名受过高度训练的小侦探比一个庞大、行动迟缓的官僚机构更能出色地解决案件。当其他模型需要大量的计算能力和数据来学习时,RadJEPA 的学习效率更高,因为它的“填空”方法教会了它应该关注正确的内容。

结论

该论文声称,你不需要将 X 光片与文本配对来构建智能医疗 AI。只需让 AI 预测图像的缺失部分,你就可以创建一个“放射学编码器”,它比基于文本训练的模型更能理解人体的视觉语言。作者已公开其代码和训练好的模型,供他人使用和验证。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →