Frequency-Stratified Benchmarking Reveals Strong Long-Tail Limitations of Large Language Models in Diagnosis of Monogenic Diseases
本論文は、大規模言語モデルが単一遺伝子疾患の診断において顕著な性能バイアスを示すことを実証するために、頻度層別化された5,000症例からなるベンチマークであるMendelianBench-5Kを導入するものであり、研究が進んでいる遺伝子については高い精度を達成する一方で、希少で最近特徴付けられた遺伝子については苦戦することを示している。