Frequency-Stratified Benchmarking Reveals Strong Long-Tail Limitations of Large Language Models in Diagnosis of Monogenic Diseases
Este artículo presenta MendelianBench-5K, un referente estratificado por frecuencia de 5.000 casos, para demostrar que los modelos de lenguaje de gran tamaño exhiben sesgos de rendimiento significativos en el diagnóstico de enfermedades monogénicas, logrando una alta precisión para genes bien estudiados mientras tienen dificultades con aquellos raros y caracterizados recientemente.