Frequency-Stratified Benchmarking Reveals Strong Long-Tail Limitations of Large Language Models in Diagnosis of Monogenic Diseases
本文介绍了 MendelianBench-5K,这是一个包含 5,000 个病例的频率分层基准测试,旨在证明大型语言模型在诊断单基因疾病方面表现出显著的性能偏差,即在研究充分的基因上实现高准确率,而在处理罕见且近期才被表征的基因时则表现挣扎。