← 最新论文
💻 computer science

Comparative Performance of Frontier Large Language Models for Extracting High-Risk Pathologic Features from Unstructured Gastrointestinal Oncology Reports: A Systematic Benchmarking Study with Human and Traditional NLP Baselines

这项系统性基准测试研究表明,前沿大型多模态模型,特别是 Gemini 2.5 Pro 和 GPT-4o,在从非结构化胃肠道病理报告中提取关键的神经周围浸润状态方面,显著优于面临时间压力的医学专家及传统的自然语言处理基准模型,同时一种新型的失效模式分类法为基于特定错误特征的模型选择提供了具有操作性的指导。

原作者: Seher Siddiqui

发布于 2026-07-21✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Seher Siddiqui

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,医疗记录的世界就像一座巨大而混乱的图书馆,其中的每一本书都是用不同的方言编写的。在这座图书馆里,医生们在显微镜下观察到的景象被写成了冗长且凌乱的故事,而在这些故事中,隐藏着决定患者未来治疗方案的微小且至关重要的线索。其中一个最重要的线索被称为“神经侵犯”(perineural invasion,简称 PNI)。你可以把 PNI 想象成一个狡猾的小偷,它让癌细胞沿着人体内细小的神经进行潜行,使疾病变得更难对付。如果医生漏掉了这个线索,他们可能无法为患者提供正确类型的放射治疗或额外的药物治疗。

多年来,计算机一直试图阅读这些故事以寻找线索,但它们经常会被人类语言那杂乱无章的写法所迷惑。它们可能会漏掉一个“不”字,或者被复杂的句子卡住。现在,新一代超级聪明的计算机大脑——被称为“大语言模型”(就像驱动聊天机器人的那些技术)——已经到来了。它们不仅仅是简单的搜索引擎;它们就像是才华横溢的学生,能够阅读整个故事,理解上下文,并弄清楚医生真正想表达的意思,即使措辞非常晦涩。大家都在问一个大问题:这些新的 AI 学生是否足够聪明,能够比疲惫的人类医生或旧式计算机程序更好地发现那些狡猾的癌症线索?

这篇论文就像是一场规模宏大的、高风险的拼字比赛,但参赛者不是在拼写单词,而是在 445 份真实的医疗报告中寻找那些狡猾的癌症线索。研究人员为四种目前最强大的 AI 模型设置了一场竞赛——GPT-4o、Gemini 2.5 Pro、Claude 3.7 Sonnet 和 DeepSeek-R1。但他们并没有让 AI 单独比赛;他们还加入了另外两支队伍来参与这场竞赛。第一支队伍是一群接受训练中的人类医生(住院医生),他们必须在 90 秒的紧迫时限内阅读报告,以模拟现实中忙碌医生的状态。第二支队伍是一个传统的、较旧的计算机程序(BioBERT),它虽然经过了专门的医学文本训练,但缺乏新型 AI 所具备的“常识”。

结果显示,新一代 AI 模型取得了压倒性的胜利,但也存在一些有趣的转折。纯粹准确度竞赛的获胜者是 Gemini 2.5 Pro,它的正确率达到了 95.8%。紧随其后的是 GPT-4o,它的正确率为 94.2%。这两位 AI 超级巨星的表现显著优于人类住院医生,后者在时间压力下仅获得了 77.2% 的正确率,也优于旧有的 BioBERT 程序,后者的得分是 79.6%。事实上,表现最好的 AI 模型比匆忙处理的人类团队的准确率高出了近 10%

然而,论文也发现 AI 尚未达到完美。即使是最好的 AI 模型,其表现仍不及那些可以从容不迫、不受秒表计时压力影响的专家病理学家(他们的正确率为 97.2%)。这意味着 AI 非常擅长进行第一轮筛选工作,标记出重要的病例,但仍然需要人类专家来对最终决定进行复核。

研究还发现,每个 AI 模型都会犯不同类型的错误,就像拥有不同的“性格缺陷”。Gemini 2.5 Pro 在获得整体高分方面表现最好,但它有时会被否定词所迷惑。如果报告中说“无侵犯证据”,Gemini 有时会忽略那个“无”字,从而误认为癌症确实存在。另一方面,GPT-4oClaude 3.7 Sonnet 则非常谨慎。如果报告使用了像“可能”或“很可能”这样模糊的词汇,这些模型通常会回答“我不确定”,而不是进行猜测。虽然这种做法很安全,但也意味着它们可能会错过一些人类能够捕捉到的病例。

最后,论文建议这些新的 AI 模型已经准备好在医院中作为“第一道防线”投入使用。它们可以比疲惫的人类更快、更准确地扫描数百份报告,找到那些需要关注的危险线索。但由于它们仍会犯特定类型的错误,且尚未达到人类专家的完美程度,因此最好的方案是让 AI 承担繁重的体力活,然后由人类医生给出最终的认可。这是一个团队协作的过程:AI 是超快速的侦察兵,而人类则是做出最终决策的智者船长。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →