Frequency-Stratified Benchmarking Reveals Strong Long-Tail Limitations of Large Language Models in Diagnosis of Monogenic Diseases
Dit artikel introduceert MendelianBench-5K, een op frequentie gestratificeerde benchmark van 5.000 gevallen, om aan te tonen dat grote taalmodellen significante prestatiebiases vertonen bij het diagnosticeren van monogene ziekten, waarbij ze een hoge nauwkeurigheid bereiken voor goed bestudeerde genen terwijl ze moeite hebben met zeldzame, recent gekarakteriseerde genen.