想象你是一场大型烹饪比赛的评委。厨师们(计算机模型)正试图将一份巨大而复杂的水果沙拉(组织显微图像)切成单独的块(细胞核)。有些块粘在一起,有些模糊不清,还有些被切在了碗的边缘。
多年来,评委们一直使用一份标准评分表来给这些厨师打分。但本文的作者 NucEval 意识到,这份评分表本身存在严重缺陷。他们认为,目前我们评估这些模型的方式,就像是根据厨师切一块已经烂掉或被餐巾半遮住的果块的表现来评判他们。这既不公平,也无法告诉我们谁才是真正的最佳厨师。
以下是本文的故事,拆解为几个简单的部分:
问题:一份有缺陷的评分表
本文指出了当前“评分表”存在的具体四种缺陷:
“烂果”问题(模糊区域): 有时,果块被压得太扁、失焦或撕裂,以至于即使是人类专家也无法分辨一块的终点和另一块的起点。旧的评分系统迫使计算机在这些模糊区域进行猜测。如果计算机猜错了,它就会受到惩罚,尽管该区域根本无法判断。
- 解决方案:忽略烂果。 新系统表示:“在开始评分之前,让我们直接丢弃图像中那些模糊、无法看清的部分。”这样,我们只根据厨师实际能看到的部位来评判他们。
“小盘与盛宴”问题(分数归一化): 想象一位厨师得到一盘 5 块水果,另一位得到一盘 500 块。如果第一位厨师弄坏了一块,他的分数就会暴跌,因为那一个错误占了他总数的 20%。如果第二位厨师在 500 块中弄坏了一块,那几乎无关紧要。旧系统只是简单地平均分数,这不公平地惩罚了那些盘子较小的厨师。
- 解决方案:给盘子加权。 新系统计算每个盘子上有多少块水果。它给予水果更多的盘子更大的权重。这确保了小盘子上的错误不会不公平地拖累整个比赛。
“粘果”问题(重叠区域): 有时,两块水果粘在一起。在旧系统中,评委们会武断地说:“好吧,这个粘在一起的部分属于我们最后查看的那块水果。”这意味着评委查看水果的顺序会改变分数。这就像说,仅仅因为你先看了苹果再看橙子,获胜者就变了。
- 解决方案:共享粘滞部分。 新系统表示:“如果两块水果共享一个粘滞点,那个点属于它们双方。”这消除了必须猜测哪块水果“拥有”重叠部分的不公平惩罚。
“碗边”问题(边界不确定性): 当你围绕一块水果画线时,你可能会画得稍微太粗或太细。人类对于确切的边缘位置存在分歧。旧系统因为计算机在边缘处偏离了一个像素就对其进行惩罚。
- 解决方案:给他们一个缓冲带。 新系统在每块水果周围创建一个微小的“无人区”环。它忽略该环内的像素。如果计算机在该环内略有偏差,它不会受到惩罚,因为即使是人类评委也无法就那条确切的线达成一致。
实验:用新规则进行测试
作者构建了一个名为 NucEval 的新工具(将其想象为一个全新的、升级版的评分应用程序),其中包含了上述所有四项修复措施。
他们在三个不同的“水果沙拉”数据集(真实的显微图像)上测试了该工具,并使用了三个不同的顶级计算机模型(厨师)来观察结果。
结果:
- 分数上升: 在几乎所有情况下,当他们使用新的 NucEval 规则时,计算机模型的分数都提高了。
- 最大赢家: “缓冲带”规则(忽略边缘)带来了最大的差异。它表明许多模型实际上表现非常出色,但旧规则对微小的边缘细节过于挑剔。
- 公平性: 新系统证明,模型并非在“切水果”方面变得更好;它们只是得到了更公平的评分。旧系统掩盖了它们的真正潜力。
核心结论
本文得出结论:长期以来,我们一直在试图改进厨师(AI 模型),却没有意识到我们的评分系统已经坏了。通过修复评分表,忽略不可能的部分,公平地给盘子加权,共享粘滞点,并原谅微小的边缘错误,我们就能更清晰地看清谁才是真正的最佳者。
作者已免费提供他们的新评分工具 NucEval,以便其他研究人员能够用它来公平地评估他们自己的模型。他们认为这至关重要,因为在医疗领域,选择合适的模型对于诊断疾病至关重要,我们需要确保基于公平的测试来挑选出最好的模型。
技术摘要:NucEval——一种鲁棒的核实例分割评估框架
问题陈述
在计算病理学中,核实例分割是一项基础性任务,对于癌症诊断和预后等下游临床应用至关重要。尽管大量研究工作致力于改进分割模型(如 CNN 类的 HoVer-Net 和 ViT 类的 CellViT)以及预处理/后处理技术,但评估流程受到的关注相对较少。
当前的评估实践存在若干根本性局限,可能导致性能估计次优及模型间的不公平比较。作者指出了现有文献中存在的四个具体问题:
- 模糊区域:标准数据集通常缺乏对模糊区域(如失焦区域、组织折叠或难以区分的边界)的标注。将这些区域纳入评估,会不公平地惩罚或奖励模型在连人类专家也无法提供可靠真实值(ground truth)的区域所做的预测。
- 未归一化的分数:指标通常是对图像块(image patches)的分数进行简单平均,而未考虑每个图像块中的核数量。这引入了偏差,即核数量少的图像块对最终分数的影响不成比例,这无法反映在整张切片图像(WSI)上进行分割的临床现实。
- 重叠实例:在许多数据集中,重叠的核区域被任意分配给单个实例(通常是标注文件中最后遇到的那个)。这会惩罚那些正确识别重叠结构的模型,并引入基于标注顺序的逻辑偏差。
- 边界不确定性:物体边界的标注本质上具有不确定性。因边界处微小的偏差(几个像素)而惩罚模型往往是不公平的,因为人类标注者本身对于确切边界位置也可能存在分歧。
方法论
为解决这些问题,作者提出了NucEval,这是一个统一的、基于 Python 的评估框架,将四项具体改进整合到标准指标(全景质量 [PQ]、聚合 Jaccard 指数 [AJI]、Dice、检测质量 [DQ] 和分割质量 [SQ])中。
四项改进
纳入模糊区域(改进 #1):
- 明确将模糊区域从真实值和模型预测中排除。
- 对于与这些区域相交的实例,采用基于阈值的策略:如果实例与模糊区域的重叠面积与其总面积之比超过预设阈值(例如 0.25),则移除该实例。
- 对剩余实例进行重新标记,以确保用于指标计算的标识符是连续的整数。
分数归一化(改进 #2):
- 框架不再计算图像间分数的简单算术平均值,而是计算基于核数量归一化的平均值。
- 每张图像对最终分数的贡献根据其包含的标注核数量进行加权。这减轻了对标注稀疏图像块的偏差。
处理重叠区域(改进 #3):
- 重叠区域被分配给所有相关实例,而不是任意分配给单个实例。
- 这要求真实值数据以感兴趣区域(ROIs)集合或保留重叠的二进制掩码列表的形式提供,而不是将重叠合并为单个标注掩码。
边界不确定性处理(改进 #4):
- 通过对每个实例边界应用形态学腐蚀和膨胀,创建一个“不确定性区域”。
- 膨胀掩码与腐蚀掩码之间的差异定义了一个被排除在评估之外的区域(在真实值和预测中均将像素置零)。
- 该区域的宽度是一个可配置的超参数(研究中设定为 1 像素),以在标注不确定性与保留有意义的评估区域之间取得平衡。
实验设置
该框架使用以下数据进行了评估:
- 数据集:
- NuInsSeg:主要数据集,因其独特地提供了模糊区域标注以及重叠区域处理的双重版本(保留 vs. 合并)而被选用。
- CryoNuSeg:用于测试改进 #2、#3 和 #4(缺乏模糊区域标注)。
- PCNS:用于测试改进 #2 和 #4(缺乏模糊区域和 ROI 标注)。
- 模型:三个代表不同架构的最先进深度学习模型:
- HoVer-Net(基于 CNN)
- Hover-Next(基于 CNN)
- CellViT(基于 Vision Transformer)
- 训练:模型在配备 NVIDIA RTX 4090 GPU 的单台工作站上使用 5 折交叉验证进行训练。
关键结果
研究表明,应用这些改进一致地提高了所有三个模型和所有数据集的评估指标。
单项影响:
- 改进 #4(边界不确定性) 显示出最显著且一致的影响,在 NuInsSeg 数据集上,所有模型的 PQ 均提高了约 5–6%。
- 改进 #1(模糊区域) 一致地提高了所有指标。
- 改进 #2(分数归一化) 在数据的不平衡子集上显示出显著增益(例如,在特定子集上 PQ 提高了 27–32%),突显了其在核密度各异的数据集中的重要性。
- 改进 #3(重叠区域) 对整体指标的影响最小(因为重叠部分占数据集的比例很小),但表明合并重叠会显著降低性能(在理想化比较中,PQ 下降幅度高达约 10%)。
累积影响:
- 同时应用所有改进产生了最高的增益。在完整的 NuInsSeg 数据集上,与基线相比,三个模型的 PQ 提高了10.67% 至 12.00%。
- 在 NuInsSeg 的不平衡子集上,累积的 PQ 改进更为显著,范围从38.45% 至 43.19%。
- 在 CryoNuSeg 和 PCNS 上也观察到了类似的积极趋势,证实了该方法的普适性,即使由于缺少某些标注类型而无法应用所有改进。
意义与主张
作者将 NucEval 定位为一种鲁棒的评估框架,而非新的分割算法,它是为临床应用公平比较和选择模型所必需的。
- 模型无关性:这些改进独立于分割模型架构,因此适用于任何基于 CNN 或 ViT 的方法。
- 公平性与可复现性:通过解决分数聚合、模糊区域和边界不确定性中的偏差,NucEval 旨在防止为下游临床任务选择不理想的模型。
- 实用价值:作者提供了一个公开可用的 Python 实现(
NucEval)及完整指南,允许研究人员根据自身数据集中特定标注(如模糊区域掩码或 ROI 集合)的可用性,选择性地应用这些改进。
- 未来方向:论文指出,虽然当前实现使用了固定参数,但该框架设计具有灵活性。它还建议未来的数据集发布应考虑保留重叠区域并标注模糊区域,以充分利用这些评估改进。
总之,本文认为在计算病理学中,严格的评估与模型开发同样关键。通过 NucEval 标准化并完善评估流程,社区可以实现更可靠的性能估计,并最终获得更好的临床结果。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。