← 最新论文
💻 computer science

PathoArgus: Advancing Evidence-Grounded Long-Context Visual Reasoning across Gigapixel Whole-Slide and Multi-Slide Case Contexts

本文介绍了 PathoArgus-Bench,这是一个全面的基准测试和评估协议,它通过证明即使是高性能模型也无法一致地将其预测与吉像素级全切片图像证据联系起来,从而揭示了计算病理学中答案准确性与真实的基于证据的推理之间存在的关键差距。

原作者: Bowen Liu, Qixiang Zhang, Xiaomeng Li

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Bowen Liu, Qixiang Zhang, Xiaomeng Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在病理实验室那寂静、无菌的世界里,诊断往往始于一张巨大的图像。这是一张全切片图像(whole-slide image),是一张组织样本的数字化照片,其规模之大、细节之多,包含了数十亿个微小的像素,远超人类肉眼在一次扫视中能捕捉到的范围。为了理解这些信息,病理学家必须像侦探一样,在广袤的细胞景观中搜寻,寻找那些能够确认疾病的特定且微小的线索。多年来,科学家们一直在教计算机进行同样的工作,希望构建出能够阅读这些吉像素级图像并回答有关患者健康问题的人工智能。其目标始终是创建一个不仅能猜对答案,而且能真正从组织中找到证据来证明其正确性的系统。然而,一个关键问题一直悬而未决:当计算机得到正确答案时,是因为它真的看到了切片中的疾病,还是仅仅根据问题的提问方式进行的猜测?

香港科技大学研究人员的一项新研究通过引入一种严谨的新方法来测试这些计算机系统,正面应对了这一问题。他们构建了一个名为 PathoArgus-Bench 的大规模测试场,其中包含来自 15 种不同癌症类型的 22,000 多个真实病例衍生出的问题。与以往仅检查最终答案是否正确的测试不同,这个新的基准测试迫使计算机证明它确实观察了正确的部位。研究人员制定了一条严格的规则:计算机只被允许观察巨大图像中极小的一部分,以模拟现实世界中系统处理数据的限制。随后,他们要求计算机根据这种有限的视野来回答问题。为了测试计算机是否真的在进行推理,研究人员还创建了一组特殊的测试,通过交换组织样本来进行测试。如果计算机是在真正观察证据,那么改变组织应该会改变其答案;如果它只是在猜测,那么无论图片中实际是什么,它可能都会给出相同的答案。

这项实验的结果揭示了计算机表现出的“知识”与其“理解力”之间存在着惊人的差距。当研究人员测试 20 个不同的人工智能系统(包括目前最先进的模型)时,他们发现,尽管有些系统能超过一半的概率答对问题,但它们几乎完全无法遵循证据进行推理。其中一个表现优异的系统——被称为 GPT-5.6 的强大模型——在问题上的成功率达到了 57%。然而,当研究人员检查该系统在组织证据发生变化时是否会改变观点时,发现它仅在约 4% 的情况下做到了这一点。换句话说,该系统经常因为错误的原因得到了正确的答案,它依赖的是问题文本中的模式,而非组织本身的视觉现实。即使研究人员专门开发了一个新工具来帮助计算机寻找图像中最相关的部分,该系统仍然难以将答案与所发现的具体证据一致地联系起来。

这一发现表明,当前一代的医疗人工智能尚未准备好承担从全切片图像中诊断疾病这一复杂任务。研究表明,仅仅让计算机接触大型图像是不够的;系统还必须能够导航该图像、寻找特定的线索,并让这些线索决定其结论。研究人员发现,虽然获取有用的全切片上下文是必要的,但这远非充分的,且目前的系统在基于证据的推理方面存在显著差距。这表明,寻找证据的能力与基于该证据进行推理的能力是两种不同的技能,而目前的系统尚未掌握后者。这项工作发出了一个明确的警告:仅以最终答案来衡量成功是具有误导性的。要真正推动该领域的发展,重点必须从仅仅获得高分转向确保计算机的推理是植根于患者组织的实际视觉事实之上。

研究结论指出,虽然我们在教计算机“看”方面取得了进展,但我们尚未教会它们如何“用所见进行思考”。这项研究开发的全新基准和工具为下一代医疗人工智能提供了路线图,即要求提供证据证明,而非仅仅是一个正确的猜测。通过揭示现有系统的局限性,研究人员希望引导未来的发展走向能够真正理解疾病复杂视觉语言的模型,从而确保当计算机做出诊断时,是因为它看到了真相,而不是因为它学会了某种技巧。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →