Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images
本研究评估了六种视觉语言模型在真实伤口图像上的表现,发现像 ChatGPT 和 Claude 这样的通用型系统在临床伤口评估方面的表现显著优于医学专业化模型,尽管所有模型在自主可靠性方面仍面临重大局限。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一组由六个不同的“数字侦探”组成的团队。他们的任务是观察 20 种不同类型的开放性伤口(如切口、溃疡或手术部位)的照片,并回答 12 个特定的问题,例如:“这个伤口感染了吗?”、“我们需要手术吗?”或者“我们应该使用哪种类型的绷带?”
研究人员想要看看哪位侦探最擅长解决这些医学谜题。他们让两类侦探展开了对决:
- 全才型(Generalists): 著名的、功能强大的 AI 聊天机器人(如 ChatGPT 和 Claude),它们涉猎广泛,包括医学领域。
- 专家型(Specialists): 专为医生构建的 AI 模型(如 HuluMed 和 MedGemma),它们仅在医学教科书和数据上进行了训练。
以下是测试的结果:
比赛成绩
全才型选手以压倒性优势赢得了比赛。
- ChatGPT 位居榜首,正确率约为 73%。
- Claude 以约 62% 的正确率位列第二。
专家型选手则表现得非常挣扎。
- HuluMed(专家组中表现最好的一个)仅答对了 40%。
- 其他医学 AI(MedGemma 和 Gemma 3)得分更低,其中一个甚至不到 18% 正确。
评分背后的“原因”
论文通过几个关键观点解释了这一令人惊讶的结果:
1. “杂家”与“狭隘专家”
把全才型 AI 想象成一把瑞士军刀。它们看过数百万张不同的图像和对话。当它们观察一个伤口时,会利用其庞大且广泛的经验来理解上下文。
而专家型 AI 则像是专门为一种特定螺丝设计的螺丝刀。虽然它们掌握很多医学术语,但当面对一张凌乱的现实世界照片并需要决定“该怎么做”时,它们似乎会感到困惑。论文指出,接受大规模多样化数据的训练,有助于这些模型比仅接受医学数据训练的模型更好地理解“大局观”。
2. “观察”与“决策”
这些侦探很擅长观察事物。大多数模型都能正确识别伤口看起来是否发红(感染)或是否有坏死组织(坏死)。
然而,它们在决策方面表现得很糟糕。当被问到“我们应该切除这个吗?”或“我们需要做 MRI 吗?”时,专家型 AI 经常给出模棱两可、犹豫不决的回答,或者建议错误的程序。
- 类比: 这就像一个学生能完美地描述汽车引擎,但在被问及如何实际驾驶汽车到达目的地时却失败了。
3. “犹豫不决”的问题
研究人员给 AI 设定了一个严格的评分规则:你必须给出明确的“是”或“否”的答案。如果你说,“可能感染了,但也可能没感染”,你会得到零分。
专家型 AI 非常喜欢“犹豫不决”。它们会说类似这样的话:“根据临床体征,可能需要进行干预。”虽然这听起来很谨慎且安全,但由于它没有做出明确决策,因此在测试中被判定为错误。全才型 AI 的回答则更加直接和自信。
核心结论
论文得出结论:目前,如果你需要 AI 观察伤口照片并帮助医生制定计划,通用型聊天机器人在目前比医学专用型机器人更好。
不过,这个结果附带了一个重要的警告标签。论文指出,这些 AI 工具尚未准备好独立工作。它们就像一个非常聪明的实习生,可以帮助医生整理思路,但仍然会犯错。在做出任何真实的医疗决策之前,医生必须始终核查 AI 的工作。
简而言之: 目前,拥有“通识知识”的 AI 在解决伤口谜题方面比拥有“医学院背景”的 AI 更出色,但两者都还不够完美,尚不足以取代人类医生。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。