Frequency-Stratified Benchmarking Reveals Strong Long-Tail Limitations of Large Language Models in Diagnosis of Monogenic Diseases
Cet article introduit MendelianBench-5K, un banc d'essai stratifié par fréquence de 5 000 cas, pour démontrer que les grands modèles de langage présentent des biais de performance significatifs dans le diagnostic des maladies monogéniques, atteignant une grande précision pour les gènes bien étudiés tout en éprouvant des difficultés avec les gènes rares ou récemment caractérisés.