Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks
本文介绍了 Medmarks,这是一个包含 30 项多样化医疗任务和 61 个评估模型的综合开源基准套件,该套件揭示了前沿推理模型在准确性和令牌效率方面优于其他模型,同时突显了较小模型易受答案顺序偏差的影响。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,人工智能的世界是一座庞大而繁忙的医院。长期以来,我们一直在试图弄清楚哪些人工智能“医生”真正胜任工作。然而,我们用来给它们打分的测试却变得像一块坏掉的记分牌:要么太简单(导致每个 AI 都得 A+),要么太保密(导致无人能核查工作),要么只测试 AI 能否死记硬背教科书,而非真正思考患者的问题。
此时,MEDMARKS 登场了。这是一个由研究团队创建的全新、完全开源的 AI“医学院”。你可以把它想象成一个巨大的透明健身房,61 种不同的人工智能模型(从小巧、经济实惠的模型到庞大的超级计算机版本)来到这里,参加 30 项不同的体能和智力测试。
以下是该论文发现的简要说明:
1. 测试套件:多样化的挑战
MEDMARKS 不再仅仅问“法国的首都是哪里?”(这对 AI 来说很容易),而是向模型抛出一系列混合挑战:
- 多项选择题测验(MEDMARKS-V): 就像标准的执照考试,AI 需从列表中选出正确答案。这包括棘手的数学问题和长篇复杂的病例故事。
- 开放式面试(MEDMARKS-OE): 在这里,AI 必须与“患者”交谈或撰写治疗计划。由于没有唯一的标准答案,研究人员使用了一个“裁判 AI"(一位聪明的裁判)来给对话打分,就像人类老师批改作文一样。
- “辅助轮”(MEDMARKS-T): 这些测试的一个特殊子集被设计为 AI 的健身房。研究人员可以利用这些测试来实际训练 AI 使其变得更好,就像教练利用训练项目来提升运动员一样。
2. 结果:谁赢得了奖牌?
研究人员在不同设置下进行了 71 次测试,以观察谁脱颖而出。
- 重量级选手获胜(主要是): 来自 OpenAI(GPT-5.1/5.2)和 Google(Gemini 3)等公司的最大、最强大的人工智能模型通常得分最高。它们就像是人工智能界的奥运选手。
- “专科医生”vs“全科医生”: 一些人工智能模型是专门针对医学书籍和笔记进行训练的。这些“专科”模型往往击败了那些对万事略知一二的、规模大得多的“全科”模型。这就像一位熟悉自己社区的地头蛇医生,胜过一位每年只来访一次的著名明星医生。
- 效率差距: 这里有一个令人惊讶的反转。顶级闭源人工智能模型(那些需要付费的)就像法拉利:它们取得了最佳结果,但消耗的燃料(计算能力)极少。开源模型(可免费下载)则像卡车:它们有时能完成任务,但为此消耗了巨大的燃料。某些开源模型需要 5 倍多的计算能力才能获得相似的分数。
3. 怪癖与缺陷
该论文还发现了这些 AI“医生”的一些有趣且令人担忧的习惯:
- “过度思考者”: 当 AI 答错问题时,它往往比答对时说得更多。这就像一个学生在不知道答案时紧张地喋喋不休,希望能碰巧蒙对。
- “顺序偏差”: 如果你打乱多项选择题答案的顺序(A、B、C、D),一些较小的 AI 模型会感到困惑并改变答案,即使内容完全相同。这就像一个学生仅仅因为选项"C"在中间就选择它,而不是因为他们知道正确答案。
- “工具”麻烦: 当研究人员给 AI 一个计算器工具来帮助进行数学运算时,许多模型的表现反而变差了。它们要么忽略计算器,要么错误使用,要么被指令搞糊涂了。这就像给一位厨师一把新刀,结果他们因为不习惯新工具而切错了食材。
4. 大局观
主要结论是,虽然人工智能在医疗任务方面表现得越来越好,但尚未完美。
- 前沿模型(最新、最大的那些)是目前的主导者。
- 专业化训练有帮助,但不能保证战胜最大的模型。
- 效率是一个巨大的问题;就计算时间而言,免费模型往往运行成本过于“昂贵”。
- 可靠性仍然是一个问题;模型很容易被问题的格式所欺骗,或者在使用工具时感到困惑。
作者构建 MEDMARKS 是将其作为一个“活体排行榜”。就像体育联盟每周更新排名一样,该基准测试旨在随着新 AI 模型的发布而持续测试它们,确保我们随时了解谁是当前“最佳”的医疗 AI,以及它们究竟在哪里仍在挣扎。他们公开了所有代码和数据,以便任何人都可以运行测试并验证结果,从而为该领域带来透明度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。