← 最新论文
📄 medicine

How errors from prompt-assisted longitudinal tumour segmentation change RECIST 1.1 target-lesion response categories: a retrospective out-of-fold analysis

这项针对258名患者的回顾性样本外分析表明,提示辅助的纵向肿瘤分割误差在约17%的病例中改变了RECIST 1.1响应类别,其中测量误差是一个显著但并非相对于检测和定位失败而言唯一的决定性贡献因素。

原作者: Souraj Adhikary, Negar Chabi, Andre Mastmeyer

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Souraj Adhikary, Negar Chabi, Andre Mastmeyer

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名正在试图破解谜题的侦探:这个反派是在变弱还是在变强?在癌症治疗的世界里,“反派”就是肿瘤,而“侦探”则是使用名为 CT 扫描仪的特殊摄像机来拍摄患者体内图像的医生。为了知道药物是否奏效,医生会测量治疗开始时和几周后特定肿瘤的大小。他们使用一套严格的规则手册,即 RECIST 1.1,来做出判决。如果肿瘤缩小得足够多,患者就会获得“部分缓解”(好消息!);如果肿瘤增长,则是“疾病进展”(坏消息!);如果保持不变,则是“稳定疾病”。

但棘手的部分在于,测量一个位于 3D 身体内部、形状不规则且软乎乎的肿块是非常困难的。即使是画轮廓时的一个微小错误——比如画出的线条只比实际宽或窄了几毫米——都可能让判决结果从“缩小”变成“增长”。最近,科学家们开始使用人工智能(AI)程序来帮助自动绘制这些轮廓,希望这能让工作更快速、更具一致性。但核心问题仍然存在:如果计算机出了错,它是否真的会改变医生的最终判决?一个微小的绘图误差,是否会误导计算机认为患者正在好转,而实际上情况并非如此,或者反之亦然?

本论文正是对此进行调查。研究人员选取了一组 258 名转移性黑色素瘤(一种扩散性的皮肤癌)患者,并使用了一个名为“LongiSeg”的智能计算机程序,尝试重新绘制随访扫描中的肿瘤轮廓。计算机得到了一个“提示”(一次点击)来显示肿瘤的位置,但实际的绘图工作必须由它自己完成。研究人员将计算机的绘图与人类专家制作的“金标准”绘图进行了对比。

结果有些令人惊讶。在大约 16.7% 的患者中(即 258 人中的约 43 人,或六分之一),计算机的绘图导致了与专家绘图不同的判决。例如,专家可能会判定患者的情况是“稳定”,但计算机由于测量略有不同,可能会判定为“部分缓解”(正在好转),反之亦然。

研究人员随后扮演了侦探的角色,试图找出这些错误发生的原因。他们将错误分为四类:

  1. 遗漏(Omission): 计算机完全漏掉了肿瘤(就像在画漫画时忘了画出一个角色)。
  2. 定位错误(Mislocalization): 计算机把肿瘤画在了错误的地方(就像把角色画在了页面的另一侧)。
  3. 虚假持续(False Persistence): 肿瘤实际上已经消失了,但计算机仍在继续绘制它(就像画出了一个并不存在的幽灵)。
  4. 尺寸误差(Sizing Error): 计算机找到了正确的肿瘤,但画得稍微大了一点或小了一点。

研究发现,尺寸误差是最大的罪魁祸首,贡献了 8.3% 的分歧。然而,研究人员谨慎地指出,这并不是一个压倒性的胜利。当他们将“遗漏”和“位置错误”合并为一个组时,该组的大小几乎与尺寸误差组一样大。事实上,两者之间的差异非常小,可能仅仅是由于偶然因素造成的。这意味着,虽然掌握准确的“尺寸”至关重要,但首先要能“找到”肿瘤也同样重要。

有趣的是,在 28 例病例中,计算机的错误使患者看起来比实际情况更好;而在 15 例病例中,则使患者看起来比实际情况更糟。但作者警告我们不要对这种“乐观偏见”感到过于兴奋。当他们稍微改变规则(例如统计不同数量的肿瘤)时,这种模式发生了变化。因此,他们无法确定计算机是否在秘密地让患者看起来更好;它只是在这个特定的测试中似乎表现出这种倾向,但这并不是一个已证实的规律。

研究还进行了计算机模拟,以观察这些微小的绘图误差是否足以导致判决的反转。他们发现,确实如此,即使肿瘤直径仅出现 2 毫米 的微小误差,也会导致结果发生翻转。这证实了计算机不仅需要找到肿瘤,还需要极其精确地测量其边缘。

最后,论文得出结论:虽然人工智能是一个有用的工具,但它目前还不完美。如果仅依赖这个特定的计算机程序进行测量,大约有六分之一的患者可能会得到一份不同的“成绩单”。这项研究强调,我们不能仅仅关注 AI 是否找到了肿瘤,我们还必须担心它测量得有多精准。作者强调,这只是针对一种特定癌症测试的一个特定模型,在信任这些数字侦探对患者健康的最终判断之前,还需要进行更多的测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →