✨ 要点🔬 技术摘要
想象一下一场针对眼科医生的高难度医学考试,被称为 OKAP。现在,想象有五个不同的“超级聪明”的计算机程序正在参加这场考试。这项研究的目标是看看哪一个计算机程序最擅长回答这些棘手的眼科问题,并且同样重要的是,看它们是否知道自己什么时候可能会出错。
以下是研究过程的详细分解,使用了日常类比:
参赛选手
研究人员列出了五种不同的 AI “学生”:
OpenEvidence :一名专门研究医学教科书,并与著名医学期刊有直接联系的特长生。可以把它想象成一位医学图书管理员 ,他背下了整个图书馆的内容,但对于其他领域并没有通用的认知。
Gemini-Pro-3、Claude-Opus-4.6、ChatGPT-5.4-Pro 和 DeepSeek-v3.2 :这些是“通用型”学生。他们阅读的内容从烹饪食谱到物理论文应有尽有。可以将它们想象成博学者 ——即那些对很多事物都略知一二的人。
测试
测试由 659 道关于眼部健康的单选题 组成。这些题目并不简单,既有基础事实(如“这个眼部结构的名称是什么?”),也有需要深度推理的复杂场景(如“如果患者有症状 X 和病史 Y,最佳治疗方案是什么?”)。
结果:谁赢了?
结果让一些专家感到惊讶:
冠军 :Gemini-Pro-3 (通用型学生)获得了最高分,答对了 95.8% 的问题。它表现得非常出色,以显著优势击败了所有人。
亚军 :Claude-Opus-4.6 (另一位通用型学生)位列第二。
特长生 :OpenEvidence (那位医学图书管理员)排名第三。它的表现很好(88%),但并没有 击败那些通用型学生。事实上,通用型学生表现得比这位特长生更好。
其他选手 :ChatGPT 和 DeepSeek 紧随其后,其中 DeepSeek 的得分最低(73.7%)。
核心启示 :拥有专门为医学构建的工具,并不保证它在回答医学问题时是最聪明的。通用型 AI 在这项特定测试中的表现实际上更好。
“信心”检查
研究人员还询问了 AI:“你对自己的答案有多大把握?” (采用 0 到 100 的分值)。这就像是在问一名学生,如果他们有 100% 的把握,请举手示意。
最具有“自我意识”的学生 :Gemini-Pro-3 是最诚实的。当它表示很有信心时,它通常是正确的。它的信心水平与其实际表现完美契合。
“过度自信” vs. “信心不足” :其他一些模型虽然在辨别能力(即区分对错的能力)方面表现尚可,但在将信心水平与实际准确度相匹配(即校准能力)方面做得并不好。
警示信号 :其中一个模型,DeepSeek,在这方面表现得很糟糕。它经常在错误的时候表现出自信,或者在正确的时候表现出不确定。这是很危险的,因为如果医生信任了一个自信但错误的答案,可能会导致医疗失误。
它们都在哪里失败了?
研究人员观察了所有 AI 都答错的 9 道题 。他们试图找出原因。
它们做对的地方 :它们理解了词汇和基本主题。
它们崩溃的地方 :它们在复杂推理 和核查来源 方面失败了。
类比 :想象一个学生能完美地读懂题目,但当需要连接三个不同的事实来解开一个谜题时,就迷失了方向。或者,他们可能会在没有检查规则手册是否支持的情况下,就直接猜一个答案。
AI 在处理需要“思考步骤”而非仅仅是“记忆事实”的问题时表现得最为吃力。
局限性(注意事项)
作者谨慎地说明了这项研究并未 证明什么:
没有图片 :测试仅限于文本。在现实的眼科护理中,医生需要观察眼睛的照片。在本次研究中,没有任何 AI 被测试过如何观察图像。
非真实患者 :这些是考试题目,而不是有着复杂且混乱病史的真实患者。
一次性测试 :AI 只参加了一次测试。如果你再次询问,它可能会给出不同的答案。
总结
简单来说:目前的通用型 AI 在回答眼科医生考试问题方面,正胜过专门的医学 AI。 然而,AI 在处理最困难、最复杂的推理任务时仍然存在困难。此外,仅仅因为一个 AI 得到了高分,并不意味着它可以被盲目使用;你需要检查它是否知道自己何时不确定。这项研究表明,在了解这些工具如何处理现实世界的复杂性之前,目前在将其用于真实的医疗决策时应当保持谨慎。
技术摘要:通用型大语言模型与专业临床 AI 在 OKAP 式眼科问题上的性能比较
问题陈述 尽管大语言模型(LLMs)正日益融入医疗领域,但在理解通用型 LLMs 与特定医学亚专科领域的专业化临床导向 AI 平台之间的差异方面,仍存在关键空白。在眼科学领域,OpenEvidence 已成为一种旨在用于临床应用的专业化工具,并获得了主要医学组织(如 NEJM Group、AAло)的合作伙伴关系。然而,近期的基准测试表明,通用型模型在一般医学知识方面可能优于专业化模型。作者试图解决缺乏 OpenEvidence 与最先进通用型 LLMs 在眼科知识方面直接对比证据的问题,不仅评估原始准确率,还评估了可靠性指标,如校准度和基于置信度的判别力。
研究方法 本研究采用比较设计,通过一个包含 659 个独特的文本式多项选择题(MCQs)的数据集,评估了五个基于 LLM 的系统。该数据集源自眼科知识评估计划(OKAP),其结构反映了 OphthoQuestions 题库。受评估的模型包括:
OpenEvidence (2026 年 3 月版本):一种专业的临床 AI 平台。
ChatGPT-5.4-Pro :通用型 LLM。
Gemini-Pro-3 :通用型 LLM。
Claude-Opus-4.6 :通用型 LLM。
DeepSeek-v3.2 :通用型 LLM。
数据与评估方案:
数据集: 659 道题目,经人工分类为 13 个领域、临床领域、问题类型、布鲁姆分类层级(Bloom's taxonomy level)以及难度(从简单到极难)。
访问方式: 除 OpenEvidence 外,其余模型均通过官方 API(单次运行)进行访问;由于当时 OpenEvidence 缺乏公开 API,因此是通过其 Web 界面进行人工访问。
提示词(Prompts): 标准化提示词要求给出确定性答案(A–D)。大多数模型被要求提供置信度评分(0–100);OpenEvidence 则未提供置信度评分。
统计分析: 主要结局指标包括二元准确率。使用多元广义估计方程(GEE)逻辑回归来评估模型类型、难度和分类对正确回答的独立影响,并使用 Holm-Bonferroni 校正进行多重比较。次要分析包括用于成对比较的 Cochran's Q 和 McNemar's 检验、用于置信度判别能力的 ROC 分析,以及用于校准度的预期校准误差(ECE)和 Brier 分数。
误差分析: 对所有模型均回答错误的 9 道题目进行了事后描述性分析,通过结构化重新评估以识别失败模式。
关键结果
总体准确率: 各模型的表现存在显著差异。Gemini-Pro-3 取得了最高的准确率,为 95.8% (95% CI, 93.9–97.0)。排名如下:
Gemini-Pro-3 (95.8%)
Claude-Opus-4.6 (89.2%)
OpenEvidence (88.0%)
ChatGPT-5.4-Pro (84.8%)
DeepSeek-v3.2 (73.7%) 在多元分析中,与其他模型相比,其他所有模型的正确回答调整后胜算比均显著降低(P < 0.001 P < 0.001 P < 0.001 )。值得注意的是,通用型模型(Gemini-Pro-3 和 Claude-Opus-4.6)的表现优于专业化临床平台(OpenEvidence)。
难度与复杂度: 准确率随问题难度的增加而显著下降。高阶布鲁姆分类问题和逻辑类问题显示的准确率低于低阶和信息类问题,尽管后者在经过 Holm 校正后不再具有统计学显著性。
可靠性指标:
校准度: Gemini-Pro-3 展示了最佳的校准度(最低 Brier 分数:0.038;ECE:0.008)。DeepSeek-v3.2 的校准度最差。
基于置信度的判别力: Claude-Opus-4.6 和 ChatGPT-5.4-Pro 展示了最强的根据自我报告的置信度区分正确与错误答案的能力(最高 AUC 分别为 0.779 和 0.775)。DeepSeek-v3.2 的判别能力较弱(AUC:0.607)。
阈值处理: 在 ≥ 90 % \ge 90\% ≥ 90% 的置信度阈值下,Claude-Opus-4.6 的准确率达到 99.6%(覆盖度为 34.3%),而 Gemini-Pro-3 在 96.4% 的覆盖度下保持了 97.0% 的准确率。
亚专科表现: 在经过 Holm 校正后,没有亚专科差异保持统计学显著性,尽管描述性趋势表明视网膜/玻璃体(Retina/Vitreous)更具挑战性,而普通医学(General Medicine)相对于基础知识(Fundamentals)表现更好。
失败模式: 对 9 道普遍失误题目的事后分析显示,共同的失败集中在逻辑推理 (重新评估后成功率为 64.4%)和引用有效性 (重新评估后成功率为 53.3%),而非基础问题语义或主题理解。
核心贡献与意义 本文提出了几项重要发现:
专业化并不保证优越性: 专业化临床 AI 平台(OpenEvidence)并未在眼科知识方面超越领先的通用型 LLMs;事实上,Gemini-Pro-3 和 Claude-Opus-4.6 的准确率都高于它。
性能的异质性: 当代 LLMs 在准确率和可靠性指标方面存在实质性的差异,这使得模型特定的验证变得必要,而非假设其能力是统一的。
超越准确率的可靠性: 研究强调,仅靠准确率是不够的。准确率最高的模型(Gemini-Pro-3)具有最佳的校准度,而其他模型(Claude-Opus-4.6、ChatGPT-5.4-Pro)则在基于置信度的判别力方面表现出色。这表明,自我报告的置信度可以作为一种可靠性过滤器,特别是在校准良好的模型中。
误差性质: 当前的 LLMs 在事实检索方面表现良好,但在高阶综合能力和引用有效性方面存在困难,而这些能力对于现实世界的临床决策至关重要。
局限性与范围 作者明确指出,本研究仅限于基于文本的 OKAP 式问题,并未评估对眼科学至关重要的多模态图像解释。评估是对每个问题进行单次运行,未能捕捉模型内部的变异性。此外,OpenEvidence 是通过人工方式访问的,其缺乏置信度评分限制了在校准度指标上的直接比较。作者总结道,虽然这些模型展现出了前景,但在部署到临床决策支持之前,仍需要使用真实世界临床场景进行进一步研究。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。