← 最新论文
💻 computer science

DeepSeek for Pathology Report Understanding: A Benchmark Study of Cancer Type Extraction, AJCC Staging, and Prognosis Prediction

这项基准研究表明,尽管 DeepSeek 模型能有效地从 952 份非结构化病理报告中提取癌症类型并预测 AJCC 分期,但在预后预测方面,DeepSeek 提取的结构化变量在评估框架下并未比直接使用原始病理报告文本带来显著改善,这支持了一种混合架构,即利用 DeepSeek 进行信息提取与分期,同时依赖传统的机器学习进行结局建模。

原作者: Mohamed Kone, Gaoussou Haidara, Chao Hou, Shulin Wang

发布于 2026-07-17✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohamed Kone, Gaoussou Haidara, Chao Hou, Shulin Wang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图破解重大谜案的侦探,但你的证据不是犯罪现场,而是一座由手写笔记堆成的山。在医学领域,这些笔记被称为病理报告(pathology reports)。它们是医生在显微镜下观察患者组织后撰写的详细叙述故事。这些故事掌握着患者未来的钥匙:他们患了哪种疾病、病情扩散到了什么程度,以及康复的可能性有多大。但问题在于:这些报告是以杂乱无章、非结构化的段落形式编写的,就像日记随笔一样,而不是整齐的清单。这使得计算机很难阅读它们,也难以帮助医生快速处理。

**大语言模型(LLMs)**应运而生。可以将它们想象成超级聪明的数字侦探,它们几乎读过人类写过的所有东西。它们擅长理解人类语言、发现模式并总结复杂的叙述。科学家们一直在追问:“这些数字侦探能否阅读这些杂乱的医疗笔记,并将它们转化为清晰、有序的数据?”具体来说,它们能否告诉我们癌症的类型、疾病的分期(严重程度),并预测患者的预后?这篇论文深入探讨了这个问题,测试了一个名为 DeepSeek 的特定 AI 家族,看它能否成为终极的医疗记录员。


数字记录员:测试 DeepSeek 在医疗笔记上的表现

研究人员设计了一场大型测试,以观察 DeepSeek 在使用来自公共癌症数据库的 952 份真实病理报告进行三项特定任务时的表现。他们将 AI 视为一名新员工,并给了它三个不同的任务,难度逐级递增。

任务 1:名字游戏(癌症类型提取)
首先,AI 必须阅读报告并大声喊出癌症的名字。这就像看着一张水果的照片并说:“那是一个苹果!”结果几乎是完美的。DeepSeek V4 Flash 模型的正确率达到了 98%。它的表现如此出色,以至于更昂贵的“Pro”版本模型并没有做得更好。这就像一个能完美解决简单数学题的基础计算器;为了让你算 2 + 2 加快一点速度,去用一台超级计算机并无意义。

任务 2:侦探工作(AJCC 分期)
接下来,AI 必须弄清楚癌症的“分期”。这更难了。想象一下,一名侦探试图仅通过阅读一份混乱的目击者陈述来判断火势蔓延到了何处。报告可能会说“IIA 期”或“IIIB 期”,而 AI 必须将这些归类为广泛的类别,如 I 期、II 期、III 期或 IV 期。
在这里,AI 做得相当不错,正确率约为 81.6%。然而,“Pro”模型比“Flash”模型更容易出错。事实上,Pro 模型在 594 次尝试中返回了 14 个空白答案,而 Flash 模型从未出现过无法给出答案的情况。Flash 模型运行起来也更加便宜。这就像 Flash 模型是一个可靠且廉价的实习生,总能完成报告;而 Pro 模型则像是一位昂贵且华丽的顾问,有时会盯着天花板发呆,什么也不写。

任务 3:水晶球(预后预测)
最后,研究人员要求 AI 阅读报告并预测未来:患者会有“良好”还是“较差”的预后?这是最难的工作,就像仅通过阅读剧本的前几页就试图猜出电影的结局。
AI 在这里遇到了困难。即使研究人员给它提供了几个示例来进行学习(一种称为“少样本提示/few-shot prompting”的技术),它也只能猜对约 56%。这几乎和抛硬币的结果差不多。
但转折点来了:当研究人员使用一种更简单、传统的计算机方法(称为 TF-IDF 逻辑回归),这种方法只是观察原始文本而不试图像人类一样进行“推理”时,它的正确率达到了 85.7%
论文指出,在评估的框架下,DeepSeek 提取的结构化变量并未显著改善预后预测,其表现不如直接使用原始病理报告文本。研究人员尝试将 AI 提取出的笔记喂给那个简单的计算机模型,但结果并未带来提升。这表明,对于预测未来而言,原始的、杂乱的文本本身蕴含着关键线索,而当前的结构化提取方法未能有效保留或利用这些线索来增强预测能力。

结论:混合团队

研究得出结论,DeepSeek 是 提取分期支持 的绝佳工具。它就像一位超级快速的图书管理员,能瞬间从一堆乱七八糟的纸张中提取出书名和章节编号。然而,它并不是 预测预后 的最佳工具。

作者建议未来采用一种“混合”方法:

  1. 使用 DeepSeek AI 来阅读杂乱的报告,提取关键事实(如癌症类型和分期),并将它们转化为整齐、结构化的数据。
  2. 然后,将这些事实与原始的杂乱文本一起输入到一个 专门的监督式计算机模型 中,以做出关于患者预后的最终预测。

简而言之,AI 擅长阅读报告,但对于猜测未来,让专业的计算器承担重任会更好。论文还指出,虽然研究结果很强,但它们是基于特定的公共数据集,现实世界的医院报告可能看起来有所不同,因此在将其成为每位医生办公室的标准工具之前,还需要更多的测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →