← 最新论文
💻 computer science

Eyes on the Image: Gaze Supervised Multimodal Learning for Chest X-ray Diagnosis and Report Generation

本文提出了一种两阶段多模态框架,该框架利用放射科医师的注视数据,通过将模型注意力与临床注视点对齐并生成特定区域的发现,显著提高了胸部 X 线报告的诊断准确性和空间可解释性。

原作者: Tanjim Islam Riju, Shuchismita Anwar, Saman Sarker Joy, Farig Sadeque, Swakkhar Shatabda

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Tanjim Islam Riju, Shuchismita Anwar, Saman Sarker Joy, Farig Sadeque, Swakkhar Shatabda

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在放射科安静且灯光昏暗的房间里,一位医生正在研究一张人体胸部的黑白图像。这是一张胸部 X 光片,一张隐藏了三维世界——骨骼、空气与液体——的平面图像。为了寻找疾病,医生的目光并非随机游走;他们的眼睛会遵循一种特定的、熟练的模式,在某些可能隐藏着断裂肋骨或积液阴影的特定位置停留。这种视觉搜索是一种无声的推理,是将所见之物与已知的人体知识相联系的一种方式。几十年来,计算机一直试图学习这项技能,通过分析 X 光片的像素来识别疾病。然而,尽管机器已经擅长识别某种疾病是否存在,但它们往往难以理解究竟该看哪里,并且经常无法用医生使用的那种清晰的空间语言来解释其发现。它们可能会说患者患有肺炎,但却无法指出肺部具体的病变区域,也无法像人类专家那样精准地进行描述。

来自孟加拉国达卡 BRAC 大学研究人员的一项新研究,试图通过教计算机观察人类眼睛是如何移动的来弥补这一差距。该团队构建了一个系统,它不仅观察 X 光图像,还研究放射科医生在阅读这些相同图像时的记录眼动数据。通过将胸部图像、医生的报告文本以及医生视线停顿和聚焦的地图相结合,研究人员创建了一个能够像人类一样观察胸部的模型。对于他们一半的数据,系统还结合了解剖区域轮廓;对于另一半原始记录中缺失轮廓的数据,系统则使用专门的检测模型进行计算生成。结果显示,这个计算机系统不仅能以更高的准确度诊断疾病,还能生成基于所发现问题所在的特定肺部区域的医疗报告,模拟了人类专家细致、循序渐进的注意力机制。

研究人员从大规模的胸部 X 光片收藏开始,但他们需要的不仅仅是图片。他们收集了一个数据集,其中包括放射科医生的实际眼动追踪数据,这些数据记录了医生注视的确切坐标、持续时间,甚至包括那一刻瞳孔的大小。他们还纳入了医生撰写的报告。对于胸部区域,他们利用了现有的轮廓;而对于缺乏轮廓的研究,他们训练了一个轻量级检测模型来推断必要的边界。挑战在于如何教计算机将这四种不同的信息流——图像、文本、轮廓(无论是原始的还是推断的)以及眼动数据——融合进一个统一的理解中。团队设计了一个两阶段的过程来实现这一目标。在第一阶段,计算机学习诊断患者。它同时观察 X 光片和眼动追踪图。模型并非仅仅靠猜测,而是接受训练,使其关注点与人类医生的视线停留处保持一致。如果医生的目光重度聚焦在右肺下部,计算机就会学习在判断是否存在液体或感染时,赋予该区域更高的权重。这种训练起到了引导作用,将计算机的注意力引向具有临床意义的区域,并远离无关的噪声。

这种训练的结果是可衡量且显著的。当计算机被教导去跟随人类的视线时,其正确识别疾病的能力有了明显的提升。系统检测各种疾病的准确度上升了明显的幅度,并且其与人类医生关注点的匹配程度也变得更加强劲。具体而言,计算机观察的位置与人类观察的位置之间的对齐程度得到了改善,达到了足以表明其对视觉任务具有真正理解而非仅仅是运气好的水平。计算机开始生成的注意力图看起来与人类眼动热力图非常相似,强调了医生会标记出的那些暗斑和结构异常。这证明了眼动追踪数据不仅仅是额外的信息,更是解锁更好诊断性能的关键钥匙。

一旦计算机学会了通过这种具备“注视感知”能力的新焦点来诊断患者,研究人员就进入了第二阶段:撰写报告。在过去,计算机生成的报告往往听起来机械化或含糊不清,只列出疾病而不解释其位置。新系统通过使用计算机识别出的特定区域改变了这一点。它提取诊断的置信度,并将其映射到胸部的十七个不同解剖区域,例如左肺上部或心脏周围区域。然后,它使用强大的语言工具将这些发现转化为听起来像真实医生报告的句子。系统不再仅仅说“存在肺炎”,而是可以生成诸如“右肺下野可见阴影”之类的句子,将疾病直接与它刚刚分析的特定位置联系起来。

这些生成报告的质量经过了人类标准的测试,表现良好。它产生的报告不仅语法正确,而且在语义上也是准确的,这意味着所使用的词汇与图像的医学现实相符。该系统在描述发现方面,达到了与人类放射科医生撰写的“地面真值”(ground truth)之间高度一致的水平。虽然在处理最复杂的细节时仍存在一些微小差距,但整体输出在使机器生成的医疗文本变得可靠且有用方面迈出了重要一步。研究人员发现,通过将语言植根于视觉证据和专家眼动之中,计算机可以避免捏造事实或描述实际上并不存在的现象。

这项工作表明,人类观察问题的方式是一种机器可以学习的有价值信号。通过将眼动中的微妙线索整合进学习过程,研究人员创建了一个比以往模型更透明、更可靠的系统。计算机不仅仅是在看一张图像,它是在通过人类注意力的镜头在观察图像。这种方法为医疗人工智能提供了一条新路径,在这种路径下,机器的推理过程可以追溯到图像的特定部分,就像医生的推理可以追溯到他们的观察一样。研究结论指出,虽然这项技术尚不完美,但视觉数据、眼动追踪和语言生成的结合,创造了一个解读胸部 X 光片的强大工具,预示着一个 AI 辅助医疗不仅准确,而且可理解并与人类专业知识保持一致的未来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →