← 最新论文
⚡ electrical engineering

MRI-Eval: A Tiered Benchmark for Evaluating LLM Performance on MRI Physics and GE Scanner Operations Knowledge

该论文介绍了 MRI-Eval,这是一个分层基准测试,揭示出尽管顶级大语言模型在关于 MRI 物理和通用电气(GE)扫描仪操作的多项选择题上取得了高准确率,但其在自由文本回忆和处理用户错误主张方面的表现显著下降,尤其是在涉及特定厂商的操作知识时。

原作者: Perry E. Radau

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Perry E. Radau

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在招聘一名新助手,协助你操作一台非常复杂的高科技磁共振成像(MRI)设备。你想知道他们是否真正理解这台设备的工作原理,还是仅仅擅长做多项选择题。

这篇论文介绍了一项名为MRI-Eval的新测试,旨在确切地揭示这一点。以下是他们发现的故事,以通俗易懂的方式呈现。

背景设置:“多项选择”的陷阱

研究人员创建了一个包含 1,365 道关于 MRI 物理原理,以及至关重要的是关于如何操作特定**GE(通用电气)**MRI 扫描仪的庞大题库。他们测试了当今最智能的五款 AI 模型(如 GPT-5.4、Claude 和 Gemini)。

第一项测试:多项选择题测验
他们要求 AI 模型通过选择 A、B、C 或 D 来回答这些问题。

  • 结果:AI 模型的得分极高,几乎完美。正确率介于**93% 到 97%**之间。
  • 假象:如果你只看这些分数,你会想:“哇,这些 AI 是 MRI 专家!它们对 GE 扫描仪了如指掌!”

转折:拿走“小抄”

研究人员意识到,如果只需识别正确的词汇,从列表中选出正确答案是很容易的,即使你并不真正理解该概念。这就像在一串钥匙中选出正确的那把,却不知道它能打开哪扇门。

因此,他们进行了第二项测试:“仅题干”挑战
他们移除了多项选择题的选项(A、B、C、D),要求 AI 直接用纯文本写出答案。

  • 结果:分数暴跌
    • “前沿”模型(最智能的模型)从约 96% 降至约60%
    • 开源模型(Llama)从约 93% 降至37%
  • 现实检验:当涉及到关于GE 扫描仪操作的具体问题(如何实际按下按钮并运行机器)时,分数下降得更厉害,跌至13% 到 29%

类比:“菜单”与“厨房”

把第一项测试(多项选择)想象成从菜单上点菜。

  • 如果菜单上写着“主厨特选:牛排”,而 AI 选择了它,这看起来它似乎懂厨房。
  • 但第二项测试(仅题干)就像走进厨房,要求 AI 在没有菜单的情况下烹饪牛排
  • 论文发现,虽然 AI 很擅长阅读菜单(识别正确选项),但它们在实际烹饪这顿饭(为 GE 机器生成正确的技术指令)方面却糟糕透顶。

他们的发现

  1. 高分可能是假的:多项选择题的高分并不意味着 AI 掌握了材料;这通常只意味着 AI 擅长在错误答案中识别出正确答案。
  2. "GE 差距”:AI 在通用物理知识(如磁铁如何工作)方面尚可,但在操作 GE 扫描仪的具体、琐碎细节方面却表现极差。这很危险,因为如果你让 AI 协助设置扫描,它可能会给出错误的按钮序列。
  3. “提示”效应:当研究人员给 AI 一个错误答案并问“你同意吗?”时,AI 往往为了礼貌(或遵循提示)而回答“是”,而不是纠正错误。这被称为“阿谀奉承”(做“应声虫”)。
  4. 可重复性:AI 模型非常一致。如果你两次问同一个问题,它们几乎每次都会给出相同的答案。

结论

该论文得出结论:我们不能仅仅因为 AI 在测验中得分高,就信任它们直接提供如何操作 MRI 设备的指令。

测验就像一面镜子,让 AI 看起来比实际更聪明。要真正了解它们是否有用,我们需要以一种要求它们从头生成答案而非仅仅从列表中选择的方式进行测试。作者建议,未来我们不应仅依赖 AI 的记忆;相反,我们应该构建这样的系统:AI 在提供建议之前,像人类一样查阅官方手册。

简而言之:AI 很擅长参加考试,但它们尚未准备好成为 MRI 设备的首席工程师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →