← 最新论文
📄 medicine

Performance and Failure Patterns of Multimodal Large Language Models for Hepatocellular Carcinoma Detection on Portal Venous Phase CT

尽管表现最佳的多模态大语言模型(带有解剖学指导的 ChatGPT-5.1)在检测门静脉期 CT 中的肝细胞癌方面显示出准确率的提升,但其仍显著低于人类放射科医生,这凸显了当前人工智能在视觉病灶检测方面的局限性,以及对精细提示词设计和人工监督的紧迫需求。

原作者: Liu Jiang, Fangshi Lu, Haibin Zhu, Anna S Samuel, Ciara O'Brien, Isabelle Danika Gauthier, Chelsea CY Kim, Xiaoting Li, Masoom Abbas Haider, Xiaoyang Liu

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Liu Jiang, Fangshi Lu, Haibin Zhu, Anna S Samuel, Ciara O'Brien, Isabelle Danika Gauthier, Chelsea CY Kim, Xiaoting Li, Masoom Abbas Haider, Xiaoyang Liu

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人,如何在巨大的、大雾弥漫的森林中发现隐藏的宝藏。在医学世界里,这个“森林”就是人体,而“宝藏”是一种危险的肿瘤,叫做肝细胞癌(HCC)。通常,医生会使用一种特殊的 X 光检查,即 CT 扫描,来穿透迷雾。但最近,出现了一种新型的机器人大脑:多模态大语言模型(LLM)。把这些模型想象成极其博学的学生,他们研读了数百万本书籍和图片。他们擅长回答问题和聊天,但他们真的能像人类医生那样,从模糊的医学图像中识别出肿瘤吗?这是个大问题。医生们之所以关心这一点,是因为如果这些机器人能学会早期发现癌症,它们就能帮助挽救生命。但如果它们被迷雾迷惑而错过了宝藏,或者把一块无害的石头误认为宝藏,那将是非常危险的。因此,科学家们想要对这些 AI 学生进行测试,看看它们是已经准备好面对真实世界了,还是仍需要大量的学习。

在这项研究中,来自中国和加拿大学府的研究团队决定让这些 AI 模型玩一场高水平的“找不同”游戏。他们收集了 211 张肝脏的单层 CT 图像——其中一些是确诊为肝癌的,另一些则是完全健康的。他们将这些图像交给四种不同版本的 AI “学生”(包括 ChatGPT-4o、ChatGPT-4.5、Perplexity 和最新的 ChatGPT-5.1),并问了它们一个简单的问题:“这里有肿瘤吗?”为了公平起见,他们还要求两名人类专家——一位资深放射科医生(一位拥有多年经验的高级侦探)和一位住院医师(一名实习侦探)——观察完全相同的图片并回答同样的问题。

结果既展示了令人印象深刻的进步,也清晰地提醒了人们还有多少工作要做。人类专家是无可争议的冠军。资深放射科医生捕捉到了每一个肿瘤(100% 的敏感度),且总体的正确率达到了 91.5%。住院医师紧随其后,正确率达到了 91.0%。然而,AI 模型表现得稍显吃力。表现最好的 AI——ChatGPT-5.1,答对了 83.4% 的问题。这是一个很不错的成绩,但仍然明显低于人类医生。

故事在这里变得有趣起来:研究人员发现,AI 的表现很大程度上取决于提问的方式。当他们只给 AI 一个标准的提示词时,它的正确率约为 74%。但当他们加入了一点“解剖学引导”——基本上是告诉 AI:“嘿,记住,肝脏位于这张图像的左侧,肺部位于其后方”——AI 的得分就跳升到了 83.4%。这就像是给了机器人一个手电筒和一张地图;突然之间,它看得更清楚了。尽管有了这种提升,AI 漏掉的肿瘤仍然比人类医生要多。

研究还仔细观察了 AI 和人类出错的原因。AI 最大的失败在于漏掉了那些看起来与周围健康肝脏组织完全一致(称为“等密度”病变)的肿瘤。这就像是在一堆白雪中寻找一个白色的雪球。人类在识别这些棘手的病例方面要出色得多。另一方面,AI 和人类有时都会被血管迷惑,将血管的横截面误认为是肿瘤。有趣的是,AI 在这类“虚假警报”错误上的发生频率比人类要低,但它也有自己奇怪的错误,比如过于痴迷于特定的灰色调而忽略了大局。

最终,论文表明,虽然这些 AI 模型正在变得越来越聪明,并且可以通过更好的指令得到帮助,但它们尚未准备好取代人类医生。它们就像是非常有天赋的实习生,仍在学习基本功。它们可以作为辅助医生的有用工具,但仍需要人类监督员来复核它们的工作,尤其是在线索非常细微的时候。研究人员总结道,我们需要保持谨慎,持续测试这些模型,并在信任它们进行真实的患者诊断之前,明确了解它们可能在哪里出错。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →