← 最新论文
💬 NLP

Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks

本文介绍了 Medmarks,这是一个包含 30 项多样化医疗任务和 61 个评估模型的综合开源基准套件,该套件揭示了前沿推理模型在准确性和令牌效率方面优于其他模型,同时突显了较小模型易受答案顺序偏差的影响。

原作者: Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer, Aymane Ouraq, Saurav Panigrahi, Geetu Ambwani, Kunal Bagga, Nikhil Khandekar, Arya Hariharan, Nishant Mishra, Manish Ram, Shamus Sim Zi Yang, Ahmed
发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer, Aymane Ouraq, Saurav Panigrahi, Geetu Ambwani, Kunal Bagga, Nikhil Khandekar, Arya Hariharan, Nishant Mishra, Manish Ram, Shamus Sim Zi Yang, Ahmed Essouaied, Adepoju Jeremiah Moyondafoluwa, Robert Scholz, Bofeng Huang, Molly Beavers, Srishti Gureja, Anish Mahishi, Sameed Khan, Maxime Griot, Hunar Batra, Jean-Benoit Delbrouck, Siddhant Bharadwaj, Ronald Clark, Ashish Vashist, Anas Zafar, Leema Krishna Murali, Harsh Deshpande, Ameen Patel, William Brown, Johannes Hagemann, Connor Lane, Paul Steven Scotti, Tanishq Mathew Abraham

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,人工智能的世界是一座庞大而繁忙的医院。长期以来,我们一直在试图弄清楚哪些人工智能“医生”真正胜任工作。然而,我们用来给它们打分的测试却变得像一块坏掉的记分牌:要么太简单(导致每个 AI 都得 A+),要么太保密(导致无人能核查工作),要么只测试 AI 能否死记硬背教科书,而非真正思考患者的问题。

此时,MEDMARKS 登场了。这是一个由研究团队创建的全新、完全开源的 AI“医学院”。你可以把它想象成一个巨大的透明健身房,61 种不同的人工智能模型(从小巧、经济实惠的模型到庞大的超级计算机版本)来到这里,参加 30 项不同的体能和智力测试。

以下是该论文发现的简要说明:

1. 测试套件:多样化的挑战

MEDMARKS 不再仅仅问“法国的首都是哪里?”(这对 AI 来说很容易),而是向模型抛出一系列混合挑战:

  • 多项选择题测验(MEDMARKS-V): 就像标准的执照考试,AI 需从列表中选出正确答案。这包括棘手的数学问题和长篇复杂的病例故事。
  • 开放式面试(MEDMARKS-OE): 在这里,AI 必须与“患者”交谈或撰写治疗计划。由于没有唯一的标准答案,研究人员使用了一个“裁判 AI"(一位聪明的裁判)来给对话打分,就像人类老师批改作文一样。
  • “辅助轮”(MEDMARKS-T): 这些测试的一个特殊子集被设计为 AI 的健身房。研究人员可以利用这些测试来实际训练 AI 使其变得更好,就像教练利用训练项目来提升运动员一样。

2. 结果:谁赢得了奖牌?

研究人员在不同设置下进行了 71 次测试,以观察谁脱颖而出。

  • 重量级选手获胜(主要是): 来自 OpenAI(GPT-5.1/5.2)和 Google(Gemini 3)等公司的最大、最强大的人工智能模型通常得分最高。它们就像是人工智能界的奥运选手。
  • “专科医生”vs“全科医生”: 一些人工智能模型是专门针对医学书籍和笔记进行训练的。这些“专科”模型往往击败了那些对万事略知一二的、规模大得多的“全科”模型。这就像一位熟悉自己社区的地头蛇医生,胜过一位每年只来访一次的著名明星医生。
  • 效率差距: 这里有一个令人惊讶的反转。顶级闭源人工智能模型(那些需要付费的)就像法拉利:它们取得了最佳结果,但消耗的燃料(计算能力)极少。开源模型(可免费下载)则像卡车:它们有时能完成任务,但为此消耗了巨大的燃料。某些开源模型需要 5 倍多的计算能力才能获得相似的分数。

3. 怪癖与缺陷

该论文还发现了这些 AI“医生”的一些有趣且令人担忧的习惯:

  • “过度思考者”: 当 AI 答问题时,它往往比答对时说得更多。这就像一个学生在不知道答案时紧张地喋喋不休,希望能碰巧蒙对。
  • “顺序偏差”: 如果你打乱多项选择题答案的顺序(A、B、C、D),一些较小的 AI 模型会感到困惑并改变答案,即使内容完全相同。这就像一个学生仅仅因为选项"C"在中间就选择它,而不是因为他们知道正确答案。
  • “工具”麻烦: 当研究人员给 AI 一个计算器工具来帮助进行数学运算时,许多模型的表现反而变差了。它们要么忽略计算器,要么错误使用,要么被指令搞糊涂了。这就像给一位厨师一把新刀,结果他们因为不习惯新工具而切错了食材。

4. 大局观

主要结论是,虽然人工智能在医疗任务方面表现得越来越好,但尚未完美。

  • 前沿模型(最新、最大的那些)是目前的主导者。
  • 专业化训练有帮助,但不能保证战胜最大的模型。
  • 效率是一个巨大的问题;就计算时间而言,免费模型往往运行成本过于“昂贵”。
  • 可靠性仍然是一个问题;模型很容易被问题的格式所欺骗,或者在使用工具时感到困惑。

作者构建 MEDMARKS 是将其作为一个“活体排行榜”。就像体育联盟每周更新排名一样,该基准测试旨在随着新 AI 模型的发布而持续测试它们,确保我们随时了解谁是当前“最佳”的医疗 AI,以及它们究竟在哪里仍在挣扎。他们公开了所有代码和数据,以便任何人都可以运行测试并验证结果,从而为该领域带来透明度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →