← 最新论文
⚡ electrical engineering

When Experts Disagree: Characterizing Annotator Variability for Vessel Segmentation in DSA Images

本文分析并量化了多位专家在对二维数字减影血管造影(DSA)图像中的颅内血管进行分割时表现出的变异性,旨在表征分割不确定性,从而为未来的标注工作及开发具备不确定性感知能力的自动分割方法提供指导。

原作者: M. Geshvadi, G. So, D. D. Chlorogiannis, C. Galvin, E. Torio, A. Azimi, Y. Tachie-Baffour, N. Haouchine, A. Golby, M. Vangel, W. M. Wells, Y. Epelboym, R. Du, F. Durupinar, S. Frisken

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: M. Geshvadi, G. So, D. D. Chlorogiannis, C. Galvin, E. Torio, A. Azimi, Y. Tachie-Baffour, N. Haouchine, A. Golby, M. Vangel, W. M. Wells, Y. Epelboym, R. Du, F. Durupinar, S. Frisken

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图绘制一张位于人类大脑内部、微小且蜿蜒曲折的城市的地图,但你只能透过一扇雾气蒙蒙的窗户去观察。这就是医学影像的世界,具体来说是一种叫做数字减影血管造影术(DSA)的技术。医生利用 DSA 来拍摄大脑中的血管图像,这些血管看起来就像错综复杂的道路网。为了帮助计算机学习如何自动读取这些地图,人类必须先画出道路的线条。这被称为“分割”。通常情况下,我们假设如果由人类专家绘制线条,那么这个绘图就是完美的“真相”。但如果两位专家看着同一扇雾气蒙蒙的窗户,却画出了略有不同的线条呢?如果其中一人看到了一条微小的巷弄,而另一人却没看到呢?这篇论文深入探讨了这样一个谜题。它提出了一个简单但棘手的问题:如果连专家都无法就血管的位置达成一致,我们又该如何教计算机做到正确?答案不仅仅在于更好的绘图技巧,而在于理解“真相”可能带有一点模糊性,而且这并无大碍。

这项研究背后的研究人员决定不再假装存在一种完美的绘制这些脑血管的方法。他们收集了来自患者的 66 幅真实的脑血管图像,并要求两名专家进行手工追踪血管。其中一位专家是专门从事血管手术的在读医生,另一位则是懂得如何教计算机视觉的科学家。正如预期的那样,这两位专家并没有画出完全相同的线条。有时他们完美契合,但经常出现分歧,尤其是在那些宽度小于或等于 1 或 2 个像素的极细微血管上。为了确定谁才是“正确”的,团队并没有仅仅选出一个胜者。相反,他们引入了一个由 11 名其他评审员(包括医生和科学家)组成的专家小组,通过观察 100 个图像小块并投票决定某个血管是否存在。

结果非常有趣,甚至有些令人惊讶。当两位原始专家都认为某处存在血管时,新评审员有 -90% 的时间与他们达成一致。但是,当专家们产生分歧时,评审员们的意见也产生了分歧。如果专家 A 说“有血管”,而专家 B 说“没有血管”,评审员们有 76% 的时间站在专家 A 这一边。然而,如果角色互换,他们只有 16% 的时间站在专家 A 这一边。这表明“地面真值”(ground truth)并不是一条单一、坚实的线;它更像是一片可能性的云团。团队还使用了一种名为“clDice”的特殊数学工具测量了专家绘图的重叠程度,该工具会检查所画线条的中心是否匹配。他们发现,虽然专家们大致步调一致,但在极细微血管的处理上仍存在明显的差距。

为了解决测量这些微小、模糊线条的问题,研究人员发明了一种新的计算评分方式。旧的方法过于严苛;如果专家的线条只是稍微偏离了一点点,即使他们观察的是同一条细小的血管,得分也会大幅下降。团队创建了一种“改进版 clDice”,它起到了安全网的作用。它不再要求线条必须像素级匹配,而是询问:“这条线是否足够接近?”他们通过不同的“距离阈值”进行了测试,比如在线条周围设置一个 2.5 像素的模糊边界。这种新方法表明,实际上专家们之间的达成一致的程度比旧的、严苛的数学模型所显示的要好得多。

那么,这一切意味着什么?这篇论文并不声称已经解决了完美绘制血管的问题。相反,它建议我们需要改变教导计算机的方式。我们不应该只是把一个人的绘图喂给计算机并说:“这就是真相。”相反,我们应该教它们理解不确定性。通过利用专家之间的分歧作为线索,我们可以告诉计算机:“嘿,这个区域很棘手;也许我们需要更多的眼睛来观察它,”或者我们可以构建能够知道何时需要谨慎的 AI 模型。团队还将他们的工作分享给了世界:一个包含约 2,000 个图像块以及所有这些不同绘图的数据库,以及他们用于衡量不确定性的开源软件。简而言之,他们证明了在医学影像这个混乱的世界里,承认专家的分歧实际上是构建更聪明、更可靠工具的第一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →