← 最新论文
🧬 biology

Frequency-Stratified Benchmarking Reveals Strong Long-Tail Limitations of Large Language Models in Diagnosis of Monogenic Diseases

本文介绍了 MendelianBench-5K,这是一个包含 5,000 个病例的频率分层基准测试,旨在证明大型语言模型在诊断单基因疾病方面表现出显著的性能偏差,即在研究充分的基因上实现高准确率,而在处理罕见且近期才被表征的基因时则表现挣扎。

原作者: Jihao Cai, Jianle Yang, Maimaitiyibubaji Abudukadier, Aoxiang Luo, Lina Zhao, Guozhuang Li, Kexin Xu, Zhihong Wu, Terry Jianguo Zhang, Sen Zhao, Zefu Chen, Nan Wu

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Jihao Cai, Jianle Yang, Maimaitiyibubaji Abudukadier, Aoxiang Luo, Lina Zhao, Guozhuang Li, Kexin Xu, Zhihong Wu, Terry Jianguo Zhang, Sen Zhao, Zefu Chen, Nan Wu

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,罕见遗传病的世界就像一座巨大的图书馆。在这座图书馆里,有几本著名的书(常见疾病)堆放在前台,人人都在读,也经常被讨论。但绝大多数的书都被塞在尘封且难以触及的后方角落里。这些是“长尾”罕见病——它们新近被发现、极少被报道,且鲜为人知。

这篇论文就像是一份关于一种新型“超级聪明图书管理员”的成绩单:即大语言模型(LLM)。这些 AI 系统通过学习海量文本来回答问题。研究人员想要观察这些 AI 图书管理员是否能通过观察患者的症状并猜测出对应的遗传“书名”(基因),从而帮助医生进行诊断。

以下是他们的发现,使用了简单的类比:

1. 测试:一场平衡的图书馆巡礼

研究人员构建了一个特殊的测试,名为 MendelianBench-5K。他们并没有仅仅测试 AI 对前台“名著”的掌握情况,而是创建了一个公平的测试,包含 5,000 个病例。他们确保从“名著区”(常见基因)和“尘封角落区”(罕见、新发现基因)中各抽取了相等数量的病例。

2. 结果:AI 是个“名著”狂热粉

当 AI 尝试诊断这些患者时,它在处理名著时表现尚可,但在面对罕见病时却表现得糟糕透顶。

  • 名著: 当一种疾病广为人知并在医学文献中被大量讨论时,AI 能够较好地猜中正确的基因。
  • 尘封角落: 当一种疾病非常罕见或刚刚被发现时,AI 的表现便会断崖式下跌。

类比: 想象一名学生正在参加历史考试。如果考试题目关于二战(一个热门话题),这个学生能拿 A;但如果考试题目关于上周才发生的某个偏远小村庄的起义(仅在一份报纸上被提及),这个学生就会惨败。AI 并不是在像医生一样“思考”;它只是在记忆那些它读得最多的内容。

3. “明星”偏差:总是猜那些著名的名字

研究人员注意到 AI 出错时的一个有趣模式。当 AI 不知道答案时,它并不是随机猜测,而是不断重复猜测那几个“名著”基因。

  • 隐喻: 这就像一名侦探,当他无法破解特定的犯罪案件时,无论证据如何,都会指控镇上最著名的罪犯(比如福尔摩斯对手莫里亚蒂)每一次。即使证据不对,AI 也会反复指向那些著名的基因(如 MECP2FMR1),因为这些名字在它的训练数据中出现频率最高。

4. “新书”问题

AI 在处理近期发表的案例时也遇到了困难。

  • 类比: 如果一本新书是昨天出版的,AI 图书管理员还没有时间去阅读它。研究发现,与近年来发布的报告相比,AI 对 2004 年或更早之前的报告所描述的疾病诊断效果更好。AI 的知识停留在过去。

5. 信息过载?

研究人员还测试了 AI 需要多少信息。

  • 黄金平衡点: 给 AI 提供少量的症状信息有助于它提高猜测准确度。
  • 信息过载: 然而,给 AI 提供过多的症状(一份冗长且混乱的列表)并不会有所帮助。事实上,这有时会让 AI 表现得更差。这就像是在你试图解开一个谜题时,有人同时对着你大喊 50 个不同的线索;AI 会感到困惑,性能随之下降。

核心结论

论文得出结论:目前的 AI 还不能独立承担诊断罕见遗传病的责任。

  • 它对流行和记录详尽的内容存在偏见。
  • 当遇到罕见、新发或研究不足的疾病时,它会失效。
  • 当它不确定时,它倾向于通过猜测最著名的基因来进行“幻觉”式回答。

作者表示,要真正测试这些 AI 工具是否可以安全地供医生使用,我们不能只针对常见疾病进行测试。我们必须像本研究中所做的那样,针对“长尾”部分的罕见病进行测试。在此之前,这些 AI 工具就像是一个背熟了最流行教科书、却从未学过如何应对未知情况的学生。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →