BagShift: Measuring How Patch Selection Changes the Evidence Seen by Whole-Slide MIL
该论文引入了 BagShift,这是一个证明了部署期间补丁选择策略的变化会显著改变全切片多实例学习模型所观察到的证据,从而导致性能大幅下降,并强调了在超越单纯的补丁计数之外,对选择器保持和聚合方法进行评估的紧迫性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字病理学领域,医生并不会一次性观察整个玻璃载玻片下的显微镜视野。相反,他们依赖于计算机系统来检查从载玻片不同位置拍摄的微小正方形快照,这些快照被称为“图像块”(patches)。这些被称为“全切片多实例学习模型”的系统就像是一支侦探团队。它们收集一组快照,分析其中每个图像块内的组织,然后结合这些发现来对整张载玻片做出单一诊断。多年来,研究重点一直在于计算机被允许查看多少个快照,并假设如果数量相同,诊断质量也会相同。这种假设将图像的选择视为一个简单的计数数学问题,忽略了图像来源的重要性其实与图像数量同样重要。
一项名为 BagShift 的新方法挑战了这一长期存在的观点。研究人员想要了解,当一台计算机被迫观察同一位患者的载玻片,但被限制只能观察不同的区域时,会发生什么。他们保持其他所有因素完全一致:患者、医学标签、计算机的内部知识以及允许的快照总数。他们仅仅改变了选择快照的规则。在一种情景中,计算机被允许从整个组织中广泛地挑选 128 个快照;而在另一种情景中,它被强制要求仅在其中一个微小的局部区域内紧密地聚集选取 128 个快照。结果令人震惊。当计算机观察分散的快照时,其诊断保持了准确性。但当它被迫只关注聚集的局部区域时,其性能大幅下降。在一组前列腺癌载玻片的数据集上,当视图是局部化时,其准确率得分比视图分散时下降了近 18 分。
研究人员发现,问题不仅仅是丢失了一点信息,而是丢失了证明疾病存在的特定证据。在一次涉及淋巴结转移癌的测试中,团队使用了一组在训练阶段对计算机隐藏的特殊标注作为真相校验。他们发现,当计算机观察广泛区域时,它在大约一半的困难病例中捕捉到了微小的癌症斑点。然而,当它被迫观察单个局部区域时,它在 90% 的病例中都漏掉了这些相同的癌症斑点。计算机不仅仅是猜错了,它实际上是对证据“视而不见”,因为选择规则让它远离了正确的位置。这表明,仅仅告诉系统查看固定数量的图像是不够的,无法保证诊断的可靠性。图像的位置决定了系统是能看到真相,还是依然处于黑暗之中。
该研究还探讨了通过训练计算机去预期这些受限视图是否可以解决问题。研究人员尝试让模型同时处理宽视角和窄视角。虽然这略微提高了得分,但并未消除“看到全貌”与“仅看到片段”之间的巨大差距。模型可以学会变得更谨慎一些,但它无法凭空创造出从未展示给它的证据。这一发现对于这些工具在医院中的部署至关重要。如果一家医院的工作流程或计算限制迫使系统只能观察载玻片的某个特定小区域,那么即使处理的图像总数与成功案例完全相同,系统也可能无法检测到其他地方存在的疾病。
最后,团队调查了当一个系统能够从不同的角度或区域多次观察同一张载玻片时会发生什么。他们比较了结合多次观察结果的两种方式。一种方法是为每个区域做出单独的诊断,然后对结果取平均值。另一种方法是将来自每个区域的所有快照合并成一个巨大的集合,然后再做出单一诊断。第二种方法有效地重新整合了分散的证据,产生了显著更好的结果。与仅仅对孤立的片段意见进行平均相比,这种方法将准确率得分提高了近 8 个点。这表明,当系统被迫分块观察载玻片时,恢复完整图景的最佳方式是在得出结论之前将所有的碎片收集在一起,而不是试图对孤立的片段进行平均。
研究结论指出,计算机处理的图像数量是衡量其计算成本的指标,而非衡量其所见证据的指标。两个系统可以处理完全相同数量的图像,却得出截然不同的确定程度,仅仅是因为这些图像采集的位置不同。为了让这些工具在现实世界的医疗环境中安全可靠,医生和工程师不仅必须报告分析了多少图像,还必须报告哪些部分的载玻片被覆盖了,以及这些视图是如何结合的。这项研究表明,通往正确诊断的路径不仅在于统计线索的数量,更在于确保线索是从正确的地方收集而来的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。