← 最新论文
💻 computer science

Predicting Visual Acuity from Fundus Photographs Using a Domain-Pretrained Vision Transformer: Anatomical Alignment of Attention Patterns

本研究表明,通过在超过 21,000 张眼底照片上进行微调的领域预训练 Vision Transformer(RETFound),在预测四分类视力方面实现了显著的一致性,同时发展出了解剖结构有序的注意力模式——从低视力眼睛中的视网膜血管转向正常视力眼睛中的黄斑区——这些模式与分类正确性相关联,并为不确定预测提供了可解释性。

原作者: Jin Hyun Kim, Yong Seop Han, Kuk Jin Jang, Seoung Jin Lee, Hyonyoung choi, Insup Lee

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Jin Hyun Kim, Yong Seop Han, Kuk Jin Jang, Seoung Jin Lee, Hyonyoung choi, Insup Lee

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图仅通过观察一张单张、色彩斑斓的眼底图,来猜测一个人的视力情况。这就是眼科人工智能(ophthalmic AI)的世界——计算机被教导去阅读视网膜照片,以预测视力(visual acuity),也就是一个人视觉的清晰程度。通常情况下,检查视力需要你坐在医生的诊室里,眯着眼睛盯着视力表,大声读出字母。但如果计算机只需看一眼你的眼睛照片,就能说:“啊,你的视力很完美,”或者“你可能需要眼镜了”,而你甚至无需开口说话呢?

为了实现这一点,科学家们使用了视觉 Transformer(Vision Transformers)。把它们想象成超级聪明的数字侦探。与那些仅仅像照相机拍照一样扫描图像的旧型计算机模型不同,视觉 Transformer 会将图片分解成微小的拼图碎片,并询问:“这一块与那一块之间有什么关系?”它学会了关注特定的细节,就像侦探专注于指纹或一个沾满泥泞的鞋印一样。这篇论文探讨的核心问题是:计算机能否仅通过观察这些眼睛地图来学习预测视觉质量?更重要的是,我们能否信任计算机注视的位置?如果计算机说你的视力很差,它真的在观察你眼睛受损的部分吗,还是仅仅根据随机噪声在瞎猜?


侦探的新眼镜

在这项研究中,一个研究小组决定给他们的数字侦探戴上一副特殊的“眼镜”,叫做 RETFound。想象一下,你有一个研究了数百万张犯罪现场照片多年的侦探。他们准确知道指纹长什么样,血液是如何喷溅的,以及线索通常隐藏在哪里。这就是 RETFound:一个已经“阅读”过 160 万张未标记眼底照片的海量 AI 模型。在尝试解决视觉质量这个特定谜题之前,它已经成为了识别视网膜微小血管和纹理的专家。

研究人员利用这位专家级侦探进行了微调,以解决一个特定的谜题:将眼睛照片分为四个视觉类别。

  • C0: 全盲或功能性失明。
  • C1: 重度损伤(非常模糊)。
  • C2: 中度至轻度损伤。
  • C3: 正常、清晰的视力。

他们在来自 3,654 名患者21,602 张照片 上进行了测试。为了确保侦探不是通过死记硬背答案来“作弊”,他们制定了非常严格的标准:按患者而非照片进行数据拆分。这意味着如果一名患者有五张照片,这五张照片要么全部进入训练组,要么全部进入测试组,绝不会同时出现在两组中。这就像是确保参加考试的学生在以不同形式再次见到同一个问题之前,从未见过它一样。

结果:一次“实质性”的成功

结果令人振奋。RETFound 侦探在 55.6% 的情况下答对了。虽然这听起来可能不是完美的分数,但在医学 AI 领域,这是一个了不起的成就。更重要的是,当它犯错时,通常也只是犯了些小错。89.6% 的错误仅仅是与正确答案差了一步(例如,在答案本应是“中度损伤”时,猜成了“重度损伤”)。它很少做出像把正常眼睛误判为“失明”这样离谱的猜测。

论文还将 RETFound 与另外两个侦探进行了对比:DINOv2(一个尚未专门研究过眼底照片的通用型 AI)和 EfficientNet(一种较旧类型的计算机视觉模型)。RETFound 以显著优势击败了它们两者。研究人员计算了一个名为**加权二次方 Kappa 系数(Quadratic Weighted Kappa)**的分数,该分数衡量了预测结果与真实顺序的匹配程度。RETFound 得分为 0.612,专家称之为“实质性一致”。

“你在看哪里?”之谜

这篇论文最令人兴奋的部分不仅在于计算机答对了,还在于它是如何观察眼睛来得出结论的。研究人员使用了一种称为**注意力展开(Attention Rollout)**的技术。想象一下,计算机是一个正在向眼底照片投射光束的聚光灯。这项技术让研究人员能够精确看到聚光灯聚焦在哪里。

他们发现了一个与人类医生数十年认知相吻合的美妙模式:

  • 对于视力极差的眼睛 (C0): 计算机的聚光灯重度聚焦在眼睛边缘的血管上。这很有道理,因为严重的视力丧失通常是由受损或渗漏的血管引起的。计算机学会了观察地图上的“混乱”部分。
  • 对于视力完美的眼睛 (C3): 聚光灯移动到了眼睛的正中心(黄斑区)。这是眼睛负责清晰中心视觉的部分。计算机学会了忽略边缘,专注于中心。

这就像一个侦探知道,如果房子着火了,他们应该观察烟雾和火焰(血管);但如果房子完好无损,他们应该观察正门和窗户(黄斑区)来确认一切正常。

“相信我”测试

这里有一个巧妙的转折:研究人员想知道这种“聚光灯”行为仅仅是运气好,还是它实际上意味着计算机的思考方式是正确的。他们对比了计算机判断正确的照片与判断错误的照片。

  • 当计算机判断正确时: 聚光灯的表现非常完美。如果它猜是“失明”,光束就在血管上;如果它猜是“正常”,光束就在中心。聚光灯的位置与答案之间的联系非常紧密。
  • 当计算机判断错误时: 聚光灯显得很困惑。它到处乱跳,看向随机的地点。聚光灯的位置与它所做的判断之间的联系很弱。

这表明,计算机的“注意力”是一个可靠的线索。如果计算机注视的地方是对的,它很可能也是对的。如果它同时注视着所有地方,你就应该保持怀疑。

“模糊中间地带”问题

研究还发现了一个棘手的点。计算机在 C1 类别(重度损伤,但尚未完全失明)中表现得最为吃力。它经常将这些眼睛与“中度”类别混淆。研究人员认为,这并不是因为计算机不够聪明,而是因为这类视力水平的眼睛照片本身就具有天然的模糊性。这就像试图区分一个略微多雾的天气和一个非常阴沉的天气一样;有时,画面本身并没有提供足够清晰的线索来让你百分之百确定。

这意味着什么

这篇论文并不声称已经解决了视力丧失问题,也没有取代医生。相反,它展示了我们可以构建出不仅是在“猜测”,而且能像人类医生一样真正“看见”眼睛的 AI。它学会了为视力不佳的眼睛关注血管,并为视力良好的眼睛关注中心。

作者建议,在未来,我们可以将这种“聚光灯”行为作为一种预警系统。如果 AI 做出了预测,但其聚光灯在到处乱跳,医生可以将此类病例标记出来,交由人类进行复核。这把 AI 从一个“黑箱”变成了一个合作伙伴,它不仅告诉你它认为是什么,还告诉你它为什么这么认为,以及你应该在多大程度上信任那个判断。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →