← 最新论文
💻 computer science

Comparative Performance of General-Purpose Large Language Models and a Specialized Clinical AI Tool on OKAP-Style Ophthalmology Questions

本研究评估了五种大语言模型在 OKAP 式眼科学问题上的表现,结果显示通用型模型(尤其是 Gemini-Pro-3)在准确性和校准度方面优于专门的临床 AI 工具 OpenEvidence,同时也凸显了所有系统都存在的显著性能异质性以及共同的推理失败问题。

原作者: Alon Moore Galindo, Amit Ginsberg, Razan Saadi, Tomer Kerman, David Schwartzman, Anat Loewenstein, Igal Leibovitch

发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Alon Moore Galindo, Amit Ginsberg, Razan Saadi, Tomer Kerman, David Schwartzman, Anat Loewenstein, Igal Leibovitch

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下一场针对眼科医生的高难度医学考试,被称为 OKAP。现在,想象有五个不同的“超级聪明”的计算机程序正在参加这场考试。这项研究的目标是看看哪一个计算机程序最擅长回答这些棘手的眼科问题,并且同样重要的是,看它们是否知道自己什么时候可能会出错。

以下是研究过程的详细分解,使用了日常类比:

参赛选手

研究人员列出了五种不同的 AI “学生”:

  1. OpenEvidence:一名专门研究医学教科书,并与著名医学期刊有直接联系的特长生。可以把它想象成一位医学图书管理员,他背下了整个图书馆的内容,但对于其他领域并没有通用的认知。
  2. Gemini-Pro-3、Claude-Opus-4.6、ChatGPT-5.4-Pro 和 DeepSeek-v3.2:这些是“通用型”学生。他们阅读的内容从烹饪食谱到物理论文应有尽有。可以将它们想象成博学者——即那些对很多事物都略知一二的人。

测试

测试由 659 道关于眼部健康的单选题组成。这些题目并不简单,既有基础事实(如“这个眼部结构的名称是什么?”),也有需要深度推理的复杂场景(如“如果患者有症状 X 和病史 Y,最佳治疗方案是什么?”)。

结果:谁赢了?

结果让一些专家感到惊讶:

  • 冠军Gemini-Pro-3(通用型学生)获得了最高分,答对了 95.8% 的问题。它表现得非常出色,以显著优势击败了所有人。
  • 亚军Claude-Opus-4.6(另一位通用型学生)位列第二。
  • 特长生OpenEvidence(那位医学图书管理员)排名第三。它的表现很好(88%),但并没有击败那些通用型学生。事实上,通用型学生表现得比这位特长生更好。
  • 其他选手:ChatGPT 和 DeepSeek 紧随其后,其中 DeepSeek 的得分最低(73.7%)。

核心启示:拥有专门为医学构建的工具,并不保证它在回答医学问题时是最聪明的。通用型 AI 在这项特定测试中的表现实际上更好。

“信心”检查

研究人员还询问了 AI:“你对自己的答案有多大把握?”(采用 0 到 100 的分值)。这就像是在问一名学生,如果他们有 100% 的把握,请举手示意。

  • 最具有“自我意识”的学生Gemini-Pro-3 是最诚实的。当它表示很有信心时,它通常是正确的。它的信心水平与其实际表现完美契合。
  • “过度自信” vs. “信心不足”:其他一些模型虽然在辨别能力(即区分对错的能力)方面表现尚可,但在将信心水平与实际准确度相匹配(即校准能力)方面做得并不好。
  • 警示信号:其中一个模型,DeepSeek,在这方面表现得很糟糕。它经常在错误的时候表现出自信,或者在正确的时候表现出不确定。这是很危险的,因为如果医生信任了一个自信但错误的答案,可能会导致医疗失误。

它们都在哪里失败了?

研究人员观察了所有 AI 都答错的 9 道题。他们试图找出原因。

  • 它们做对的地方:它们理解了词汇和基本主题。
  • 它们崩溃的地方:它们在复杂推理核查来源方面失败了。
    • 类比:想象一个学生能完美地读懂题目,但当需要连接三个不同的事实来解开一个谜题时,就迷失了方向。或者,他们可能会在没有检查规则手册是否支持的情况下,就直接猜一个答案。
    • AI 在处理需要“思考步骤”而非仅仅是“记忆事实”的问题时表现得最为吃力。

局限性(注意事项)

作者谨慎地说明了这项研究并未证明什么:

  • 没有图片:测试仅限于文本。在现实的眼科护理中,医生需要观察眼睛的照片。在本次研究中,没有任何 AI 被测试过如何观察图像。
  • 非真实患者:这些是考试题目,而不是有着复杂且混乱病史的真实患者。
  • 一次性测试:AI 只参加了一次测试。如果你再次询问,它可能会给出不同的答案。

总结

简单来说:目前的通用型 AI 在回答眼科医生考试问题方面,正胜过专门的医学 AI。 然而,AI 在处理最困难、最复杂的推理任务时仍然存在困难。此外,仅仅因为一个 AI 得到了高分,并不意味着它可以被盲目使用;你需要检查它是否知道自己何时不确定。这项研究表明,在了解这些工具如何处理现实世界的复杂性之前,目前在将其用于真实的医疗决策时应当保持谨慎。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →