← 最新论文
🤖 AI

Fully Open Meditron: An Auditable Pipeline for Clinical LLMs

本文介绍了 Fully Open Meditron,这是首个面向临床大语言模型的端到端可审计流程,它结合了经临床医生验证的训练语料库与可复现框架,在保持完全透明度和可复现性的同时,于医学基准测试中实现了最先进的性能。

原作者: Xavier Theimer-Lienhard, Mushtaha El-Amin, Fay Elhassan, Sahaj Vaidya, Victor Cartier-Negadi, David Sasu, Lars Klein, Mary-Anne Hartley

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Xavier Theimer-Lienhard, Mushtaha El-Amin, Fay Elhassan, Sahaj Vaidya, Victor Cartier-Negadi, David Sasu, Lars Klein, Mary-Anne Hartley

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位才华横溢、超级聪明的学生,他几乎读遍了世界上所有的书。这位学生非常擅长回答一般性问题,但他尚未学习医学。你想将他培养成顶尖的医学专家。

长期以来,实现这一目标的方法是:将这位学生带过来,喂给他一堆保密的医学教科书和病例研究,然后说:“这些就是你需要 memorize 的答案。”但这里有个问题:没人被允许查看教科书或学习笔记。 你只能看到最终的考试成绩。这意味着你无法核实该学生是否真正学到了正确的内容,还是仅仅 memorized 了被测试的具体问题的答案。

这篇论文介绍了一种名为Fully Open Meditron的新方法。这就像把整个教室的门、图书馆以及教师的教案都向所有人敞开,供人检查。

以下是他们“完全开放”方案的分解:

1. “开放厨房”理念

大多数“开放”的医学人工智能模型就像那些只向你展示最终菜品(模型权重),却将食谱、食材和厨师笔记隐藏起来的餐厅。

  • 问题所在: 如果你看不到食材,你就不知道厨师使用的是经过验证的、新鲜的医学指南,还是仅仅 memorized 了之前考试中的菜单。
  • 解决方案: 作者构建了一个所有环节都公开的管道。他们发布了基础模型、喂给模型的确切数据、用于训练的代码以及所遵循的规则。这就像一家餐厅,你可以走进厨房,观看厨师烹饪,并品尝原始食材。

2. 构建“学习图书馆”(语料库)

为了训练这些模型,他们并没有直接从互联网上抓取随机的医学问题。他们建立了一个庞大且有序的图书馆,包含三个 distinct 部分:

  • 考场: 他们收集了八个现有的公开医学题库(如医生的练习测试),并将其清理整理,使它们使用统一的“语言”。
  • 指南图书馆: 他们提取了46,469份真实的临床实践指南(医生遵循的官方规则手册),并将其转化为问答对。这确保了人工智能是从医学的实际规则中学习,而不仅仅是旧的考试题目。
  • “如果”情景: 他们创建了新的、复杂的患者故事(vignettes),模拟真实的急诊室情境。他们使用一个“教师”人工智能来生成这些故事,但随后让四位真实医生检查工作,以确保故事具有现实性且答案正确。

为何这很重要: 以往的医学人工智能图书馆缺少许多“紧急”和“危及生命”的病例。这个新图书馆就像一个专门填补这些危险空白的训练模拟,确保人工智能不仅准备好应对常规检查,也能应对最坏的情况。

3. “洁净室”(去污染)

人工智能的一个主要问题是“作弊”。如果人工智能在训练期间已经见过测试题,那它并不是真的聪明,而只是在 memorization。

  • 解决方法: 作者执行了严格的“去污染”过程。他们将整个训练库与所有用于评估人工智能的标准医学测试进行了扫描比对。即使发现微小的重叠(如共享的短语或句子),他们也会将该数据剔除。这确保了人工智能学习的是概念,而不仅仅是答案。

4. “期末考试”(评估)

如何测试医学人工智能?通常,你会给它多项选择题(MCQs)。但作者认为,这就像只在具有固定路径的模拟器上测试飞行员。真正的医学是混乱且开放式的。

  • 新测试: 他们创建了一种名为Auto-MOOVE的新评估方法。他们不只是检查人工智能是否选择了"A、B、C 或 D",而是要求人工智能针对复杂的患者案例写出其推理过程。
  • 评判者: 他们使用一个强大的人工智能来评分这些答案,但首先将这个 AI 评判者与204 位人类医生进行了校准,以确保 AI 评判者公平且准确。他们还在HealthBench上测试了这些模型,这是一个基准测试,医生们在此详细制定了什么是“好”答案的评分标准。

结果:有效吗?

他们将这种“完全开放”的方案应用于五个不同的基础模型。结果令人印象深刻:

  • 优于基础模型: 每一个使用该开放方案训练的模型,在医学任务上的表现都显著优于其原始的、未训练的版本。
  • 击败“秘密”模型: 他们构建的一个模型,完全基于开放数据和开放代码,其表现优于MedGemma——一个使用秘密专有数据的著名医学模型。
  • 新纪录: 他们最大的模型(Apertus-70B-MeditronFO)创下了完全开放的医学人工智能所达到的最佳性能新纪录。

核心结论

该论文声称,构建世界级的医学人工智能并不需要秘密的专有数据。通过完全透明——共享数据、代码和训练过程——你可以构建出一个不仅高度准确,而且可审计的模型。医生和监管机构可以深入检查其内部机制,确切了解人工智能是如何学习的,从而确保其安全可靠。

简而言之: 他们证明,如果你用清晰、开放且严谨的“食谱”构建医学人工智能,其表现可以与(有时甚至优于)那些使用秘密食材构建的模型相媲美。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →