← 最新论文
⚡ electrical engineering

NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding

NeuroQA 是一个大规模、基于图像基准,包含近 57,000 个问答对,这些问答对源自 12 个数据集和五个临床领域的 3D 脑部 MRI 体数据,旨在通过严格的图像锚定协议和专家验证,在消除纯文本捷径的同时,严格评估 3D 医学视觉推理能力。

原作者: Mohammad H. Abbasi (Stanford University), Favour Nerrise (Stanford University), Shaurnav Ghosh (Stanford University), Ridvan Yesiloglu (Stanford University), Yuncong Mao (Stanford University), Bailey
发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohammad H. Abbasi (Stanford University), Favour Nerrise (Stanford University), Shaurnav Ghosh (Stanford University), Ridvan Yesiloglu (Stanford University), Yuncong Mao (Stanford University), Bailey Trang (Stanford University), Mohammad Asadi (Stanford University), Merryn Daniel (Stanford University), Gustavo Chau Loo Kung (Stanford University), Ken Chang (Stanford University), Pavan Pinkesh Shah (Stanford University), Adam Turnbull (Stanford University), Kyan Younes (Stanford University), Seena Dehkharghani (Stanford University), Ehsan Adeli (Stanford University)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人阅读脑部扫描图像。这个机器人极其聪明:它阅读过数百万本医学教科书,知晓大脑每一个部分的名称。但有一个陷阱:当你向它展示一张三维脑部扫描图并问“这里有没有肿瘤?”时,这个机器人可能并没有真正“看”这张扫描图。相反,它可能只是根据你的问题中的措辞,或是它训练所依据的患者组名称在猜测。这就像一个学生从未学习过教材内容,却死记硬背了考试答案键。

本文介绍了NEUROQA,这是一项全新、大规模的“考试”,专门设计用于阻止机器人作弊,并迫使它们真正去观察三维脑部图像。

以下是本文如何运用简单的类比进行拆解:

1. 问题所在:“仅文本”的作弊代码

以往针对医疗人工智能的测试,就像给学生做选择题测验,而问题的写法却泄露了答案。

  • 二维(2D)问题:大多数旧测试只向人工智能展示大脑的扁平二维切片(就像书的一页)。但真实的脑部扫描是三维体积(就像整本书)。仅阅读一页无法理解整个故事。
  • “捷径”问题:研究发现,如果从这些旧测试中移除图像,人工智能仍然能答对 70%–99% 的问题!这意味着人工智能并没有在“看”大脑;它只是根据文本模式在猜测(例如:“如果问题提到‘帕金森病’,答案通常是‘是’")。

2. 解决方案:NEUROQA(“诚实”的考试)

作者构建了一个名为NEUROQA的新基准(包含来自 12,977 名真实患者的 56,953 个问题)。这就像是一场严格的、防作弊的考试,包含三条特殊规则:

  • 三维(3D)规则:每个问题都附带完整的三维大脑体积数据,而不仅仅是扁平切片。人工智能必须像在三维空间中导航一样,就像医生所做的那样。
  • “无图像”压力测试:为了证明人工智能确实在观察,他们进行了一项测试,即隐藏图像。如果移除图像后人工智能的得分显著下降,就证明它确实在使用图像。如果得分依然很高,说明人工智能只是在根据文本猜测。
  • “人类上限”:他们不仅将人工智能与随机猜测进行比较,还将其与真实的人类医生进行了对比。两名医生(一名放射科住院医师和一名神经外科住院医师)使用三维查看器参加了同一项测试。他们的平均得分约为49%。这设定了一个“人类视觉极限”。如果人工智能在观察相同视图时的得分低于人类,说明它尚未掌握该任务。

3. 两种类型的问题

该考试包含两种类型的问题,这是一个至关重要的区别:

  • 基于图像的问题(“看且见”类问题):这些是仅通过观察三维扫描就能发现的内容,例如“大脑左侧是否比右侧小?”或“扫描图上的这个斑点是什么颜色?”
  • 受图像启发的(或图像辅助的)问题(“数学与语境”类问题):这些需要知道特定的数值,而这些数值无法仅凭肉眼看到。例如,“该脑部分的体积是否低于第 5 百分位?”你无法用肉眼估算出精确的毫升测量值。“正确”答案来自计算机计算(FreeSurfer),而不仅仅是人类视觉。这测试了人工智能能否提取精确数据,而不仅仅是猜测。

4. 结果:人工智能仍在挣扎

作者将当今最先进的人工智能模型(如 GPT、Gemini 和 Claude 的最新版本)在此考试上进行了测试。

  • 作弊检查:他们清理了问题,确保如果移除图像,人工智能的答对率仅为**44.6%**左右(这仅略好于随机猜测)。这证明了考试的公平性,且没有泄露答案。
  • 人工智能表现:即使是最佳的人工智能模型,在封闭式问题(是/否和多项选择题)上的得分也仅为**47.5%**左右。
  • 人类表现:人类医生的得分约为48.9%
  • 结论:目前,最佳的人工智能模型并未超越人类医生,在某些情况下,它们的得分甚至低于仅基于文本的基线。这意味着人工智能尚未可靠地比人类更好地“看”懂三维大脑,也未能提取诊断所需的精确定量数据。

5. 构建过程(“工厂”)

为了确保考试的完美,他们没有使用人工智能生成问题(那将是循环逻辑)。相反,他们构建了一个确定性流程

  • 想象一条拥有 38 条严格规则的工厂装配线。
  • 他们将真实的患者数据送入这台机器。
  • 人类专家(医生)审查了这些问题,确保它们符合医学逻辑。
  • 他们去除了文本中任何可能让人工智能在不观察的情况下猜出答案的“线索”。
  • 最终结果是一个“金标准”数据集,其中每个答案都根据患者的实际扫描数据进行了数学验证。

总结

NEUROQA是一项针对医疗人工智能的庞大、诚实的测试。它迫使人工智能观察完整的三维脑部扫描,并证明,就当前而言,即使是最聪明的人工智能模型在理解这些扫描图方面,仍难以达到人类医生的水平。本文并未宣称人工智能已准备好进入医院;相反,它提供了一种清晰、可衡量的方法,来追踪人工智能何时最终学会正确地“看”懂大脑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →