Understanding Human AI Discrepancy in Breast Cancer TIL Assessment: A Multi-Rater and Perceptual Bias Study
这项研究表明,尽管病理学家在乳腺癌肿瘤浸润淋巴细胞(TIL)评估方面具有高度的一致性,但病理学家与人工智能模型之间存在显著差异,这表明人工智能的整合仍需进一步完善以匹配人类的可靠性,尤其是在使用多分类而非二分阈值的情况下。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
大局观:清点微小的入侵者
想象一下,乳腺癌细胞是一座堡垒。在这座堡垒的围墙内,有许多被称为淋巴细胞(一种免疫细胞)的微小“入侵者”。医生们称之为肿瘤浸润淋巴细胞(TILs)。
把 TILs 想象成正在与癌症战斗的“好人”。你看到的这些“好人”越多,患者的生存机会和对治疗的反应就越好。为了弄清这一点,病理学家(专门观察显微镜载玻片的医生)必须估算在癌细胞周围的空间中,这些微小入侵者占据的百分比是多少。
问题所在:人类不擅长估算人群
这项研究始于一个已知的问题:当物体分散分布时,人类很难准确猜测数字。
想象你正看着一个装满软糖豆的罐子。如果它们都挤在一个角落里,你可以很容易地猜出数量。但如果软糖豆均匀地散布在整个罐子里,你的大脑就会感到吃力。你可能会猜是 20%,但实际是 40%,反之亦然。这正是医生观察癌症载玻片时的情景。即使有严格的规则,两个不同的医生在观察同一张载玻片时,给出的答案往往也不同,因为他们的大脑处理“分散的点”的方式各异。
实验:人类 vs. 机器人
研究人员想看看人工智能(AI)是否能比人类做得更好。他们设计了一个“口味测试”,参与者包括三位人类病理学家和两个不同的 AI 模型(我们暂且称之为机器人 A 和机器人 B)。
他们给了所有人完全相同的乳腺癌显微镜载玻片,并要求他们计算“入侵者”(TILs)的百分比。
以下是他们的发现:
1. 人类之间达成了一致
当这三位人类医生观察载玻片时,他们大多意见一致。他们的评分非常接近。
- 类比: 这就像三位经验丰富的厨师在品尝一锅汤。他们可能使用的勺子大小不同,但对于这锅汤是“有点咸”还是“非常咸”,他们都能达成共识。
2. 机器人与人类存在分歧
当研究人员将医生与机器人进行对比时,一致性显著下降。机器人的结果与人类的结果经常大相径庭。
- 转折点: 机器人并不只是“随机”出错。它们有一个特定的习惯:它们始终低估了入侵者的数量。
- 类比: 想象医生说:“这个罐子有 40% 被软糖豆填满了。”而机器人说:“不,只有 25%。”机器人看着同一个罐子,却看到了比人类更少的豆子。
3. 机器人擅长“排序”,但不擅长“计数”
尽管机器人在给出的数字上并不准确,但它们在理解顺序方面表现得相当出色。
- 类比: 如果你有三个装有软糖豆的罐子(小、中、大),机器人可以正确地告诉你哪一个是最小的,哪一个是最大的。然而,当被问到每个罐子里究竟有多少颗豆子时,它们的回答却偏差很大。
- 数据: 研究表明,虽然机器人和人类在确切的百分比上无法达成一致,但在判断哪些病例中淋巴细胞更多或更少方面,他们是一致的。
4. 为什么会有差异?(“拥挤房间”效应)
研究人员想知道为什么机器人和人类会有分歧。是机器人坏掉了吗?还是人类的大脑本身存在缺陷?
为了查明原因,他们做了一个特别的对照实验。他们向医生展示了一些简单的黑白图片,即在黑色背景上散布着白色圆点(模拟淋巴细胞)。医生必须猜测图片中有多少百分比是白色的。
- 结果: 即便是面对这些简单的圆点,医生的猜测也表现得极不稳定。他们的猜测与真实数值之间存在巨大的波动。
- 结论: 这种分歧不仅仅是因为机器人不好。而是因为人类的大脑很难通过视觉来估算分散的点。 机器人实际上是在进行非常精确的“像素计数”,而人类则是在使用他们的“视觉直觉”,而这种直觉是容易出错的。
核心结论
研究得出结论:
- 人类之间具有一致性: 医生们通常对载玻片的“整体感觉”能达成共识。
- 机器人很精确,但对人类感知“视而不见”: 机器人能完美地数出每一个点,但它们得出的总数与人类不同,因为人类看待分散的点的方式不同。
- 目前的机器人倾向于低估: AI 模型给出的免疫细胞数量往往比医生认为的要少。
底线:
目前,AI 就像一个超级精确的计算器,在数着沙滩上的每一粒沙子,而人类医生则是一个看着沙滩并猜测体积的人。他们看的是同一个沙滩,但得出的数字却不同。在我们可以信任 AI 取代医生之前,AI 需要经过“校准”,以理解人类视觉是如何看待这些分散细胞的;或者,医生需要学会信任机器人精确的计数,而不是依赖自己的视觉直觉。
注:论文强调,这项研究是对 AI 与人类医生匹配程度的测试,而非测试 AI 是否已经准备好投入医院临床使用。在将其用于实际患者护理之前,还需要进行更多工作来解决“低估”的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。