LUX: A Lesion-Aware Graph-Conditioned Visual - Language Architecture for Explainable Endoscopic Captioning
LUX 是一种新颖的图条件视觉-语言架构,通过构建以病灶为中心的场景图来引导标记级生成,从而增强了针对溃疡性结肠炎的可解释性内窥镜描述能力,进而提升了临床准确性、可解释性和接地性,并减少了与现有模型相比的幻觉现象。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人体结肠内部,一种被称为溃疡性结肠炎的慢性疾病会导致肠粘膜出现炎症、发红和脆弱。为了了解这种炎症的严重程度,医生依赖于一种叫做内窥镜检查的程序,即通过一个柔性摄像头穿过消化道来捕捉组织图像。随后,专家会检查这些图片,寻找特定的征兆,如出血、溃疡或正常血管模式的丧失。根据所见内容,他们会分配一个严重程度评分,并撰写关于疾病状态的详细描述。这一过程对于决定治疗方案至关重要,但同时也具有难度且具有主观性。两位不同的医生可能会观察同一张图像,却对患者病情有多重而在结论上产生分歧,或者一位医生可能会注意到另一位医生可能忽略的细微问题征兆。
多年来,科学家们一直试图构建能够阅读这些医学图像并撰写其自身描述的计算机程序,希望能帮助医生提高一致性和准确性。早期的尝试使用人工智能来一次性观察整幅图像,在尝试生成句子之前,先将整个图像压缩成一个单一的摘要。虽然这些系统能够生成流畅的文本,但它们往往无法将词汇与图像中的实际病变部位联系起来。它们可能会描述并不存在的出血,或者因为只关注“大局”而忽略了一个严重的溃疡。这种缺乏连接性的问题使得计算机的报告在临床应用中并不可靠,因为机器无法解释它为什么要那样写。
一组研究人员现在开发了一种名为 LUX 的新系统,改变了计算机处理这项任务的方式。LUX 不再将内窥镜图像视为一个模糊的整体,而是将其分解为具体的、有意义的部分。当系统观察一张发炎结肠的图片时,它首先识别出问题区域的具体位置,例如一片红斑或一个小溃疡。然后,它将这些斑点视为故事中的单个字符,并映射出它们彼此之间的关系。如果一个溃疡紧邻着一个出血区域,系统就会记录下这种联系。它构建了一张疾病的结构化地图,其中每个节点代表一个特定的病灶,每条线段则代表一种关系,例如邻近性或相似性。
这张病灶地图成为了计算机写作的基础。与其根据对图像的总体印象来猜测要说什么,该系统利用这张地图来引导它生成的每一个词。在构建句子的过程中,它会不断对照其识别出的特定位置来检查自己的工作。如果它写下“出血”一词,系统会确保这个词直接关联到图像中检测到出血的具体区域。这种方法迫使计算机将其语言建立在视觉证据之上,防止它凭空捏造不存在的症状。其结果是,生成的描述不仅听起来很专业,而且能直接指向支持每一项主张的物理证据。
研究人员将这种方法与其他许多方法进行了对比测试,包括那些基于阅读了数百万文档的大型通用人工智能模型的系统。他们发现,LUX 在准确描述图像方面表现显著更好。它产生的错误更少,例如将健康的结肠描述为患病,或遗漏严重的溃疡。在衡量计算机描述与人类专家描述匹配程度的测试中,LUX 的表现优于所有其他系统。它在减少“幻觉”方面特别成功——研究人员用这个术词来形容计算机自信地描述实际上并不存在的事物。当其他系统发生此类错误时比例约为 9.4%,而 LUX 将这一比例降低到了仅 5.3%。
研究还表明,这种新方法能帮助计算机更准确地理解疾病的严重程度。在溃疡性结肠炎中,严重程度通常取决于不同征兆如何共同出现以及它们位于何处。由于 LUX 绘制出了这些征兆之间的关系图,因此它比那些仅从整体观察图像的系统能更精准地分辨轻症与重症。当人类医生审查由 LUX 生成的描述时,他们认为这些描述高度准确且具有临床实用价值,并指出该系统正确识别了诸如血管模式和组织纹理等特定特征。
这项工作表明,对于医学成像,尤其是像内窥镜这样复杂的领域,仅仅让计算机变得更聪明或给它更多数据是不够的。系统需要被教导以医生的方式去观察图像:即专注于特定的、局部的病变,并理解它们是如何相互结合的。通过在尝试撰写句子之前构建一张疾病的结构化地图,LUX 弥合了“看到图像”与“理解其含义”之间的鸿沟。这种方法为人工智能提供了一条路径,使其不仅具备流畅性,而且更加可靠且透明,能够为医生提供一种既能描述患者状况,又能清晰解释其推理过程的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。