← नवीनतम पेपर
💻 bioinformatics

Widespread use of invalid statistical tests in biomedical machine learning

यह शोध पत्र यह प्रकट करता है कि बायोमेडिकल मशीन लर्निंग में क्रॉस-वैलिडेशन फोल्ड निर्भरता (cross-validation fold dependence) की अनदेखी करने वाले अमान्य सांख्यिकीय परीक्षणों का व्यापक उपयोग फॉल्स पॉजिटिव दरों (false positive rates) को बढ़ा देता है, जिसके कारण लेखक एक सुदृढ़ समाधान के रूप में SHARP टेस्ट का प्रस्ताव करते हैं और वैध मॉडल तुलना के लिए नए रिपोर्टिंग दिशानिर्देश प्रदान करते हैं।

मूल लेखक: Zeng, T., Li, H., Zhang, S., Tan, Y. Q., Tian, F., Orban, C., An, L., Che, W., Cheng, J., Chong, J. S. X., Dehestani, N., Dong, Z., Li, X., Li, Z., Lim, M. J. R., Lin, Y., Ling, Q., Ling, Z., Low, X.
प्रकाशित 2026-05-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zeng, T., Li, H., Zhang, S., Tan, Y. Q., Tian, F., Orban, C., An, L., Che, W., Cheng, J., Chong, J. S. X., Dehestani, N., Dong, Z., Li, X., Li, Z., Lim, M. J. R., Lin, Y., Ling, Q., Ling, Z., Low, X. Z., Mansour L., S., Ng, K. K., Nguyen, T. T., Ooi, L. Q. R., Pande, S., Qian, X., Ruan, J., Wang, Z., Xie, Y., Zhang, C., Zhang, Y., Patil, K., Parkes, L., Dhamala, E., Chopra, S., Zalesky, A., Holmes, A., Eickhoff, S., Zhou, J. H., Renaud, O., Dosenbach, N., Kording, K. P., Bzdok, D., Nichols, T., Yeo, B. T. T.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जज हैं जो यह तय करने की कोशिश कर रहे हैं कि दो नए व्यंजनों में से कौन सा केक सबसे अच्छा है। निष्पक्ष होने के लिए, आप केवल एक बार प्रत्येक रेसिपी के साथ एक केक नहीं बनाते और उसे चखते नहीं हैं। इसके बजाय, आप रेसिपी A के साथ दस केक और रेसिपी B के साथ दस केक बनाते हैं, और फिर अपने दस अलग-अलग दोस्तों को उन्हें चखने के लिए कहते हैं।

समस्या: "ग्रुप हग" (Group Hug) की गलती

बायोमेडिकल मशीन लर्निंग की दुनिया में (चिकित्सा डेटा में पैटर्न खोजने के लिए कंप्यूटर का उपयोग करना), वैज्ञानिक कुछ ऐसा ही करते हैं जिसे "क्रॉस-वैलिडेशन" कहा जाता है। वे अपने डेटा को दस हिस्सों में विभाजित करते हैं, नौ हिस्सों पर अपने कंप्यूटर मॉडल को प्रशिक्षित करते हैं, और दसवें हिस्से पर उसका परीक्षण करते हैं, और इस प्रक्रिया को दस बार दोहराते हैं।

लेख तर्क देता है कि अधिकांश वैज्ञानिक यहाँ एक गंभीर गलती करते हैं। वे इन दस परीक्षणों के परिणामों की तुलना करने के लिए मानक गणितीय उपकरणों (जैसे कि पेयर्ड टी-टेस्ट) का उपयोग करते हैं, जो यह मान लेते हैं कि प्रत्येक परीक्षण परिणाम पूरी तरह से स्वतंत्र है—जैसे कि दस अजनबियों से, जो एक-दूसरे को नहीं जानते, केक चखने के लिए कहना।

लेकिन वास्तव में, ये दस परीक्षण स्वतंत्र नहीं हैं। वे सभी एक ही अंतर्निहित डेटा को देख रहे हैं, बस उसे अलग-अलग तरीकों से विभाजित किया गया है। यह बिल्कुल वैसा ही है जैसे एक ही दस दोस्तों को दस बार लगातार केक चखने के लिए कहना। क्योंकि वे दोस्त एक-दूसरे को जानते हैं और उनकी पसंद एक जैसी है, इसलिए उनकी राय "सह-संबंधित" (correlated) है।

लेख का दावा है कि इस संबंध को अनदेखा करके, वैज्ञानिक एक ऐसे पैमाने का उपयोग कर रहे हैं जो थोड़ा टेढ़ा है। वे सोचते हैं कि वे बहुत सटीक हो रहे हैं, लेकिन वास्तव में वे "सांख्यिकीय भूतों" (statistical ghosts) को देख रहे हैं। वे उन अंतरों को खोज रहे हैं जो वास्तव में वहां हैं ही नहीं, जिससे गलत सूचनाओं (फॉल्स पॉजिटिव) की एक विशाल संख्या पैदा होती है।

जांच: एक वैश्विक ऑडिट

लेखकों ने केवल अनुमान नहीं लगाया; वे एक जासूस की तरह खोज में निकले। उन्होंने शीर्ष चिकित्सा पत्रिकाओं (उच्च "इम्पैक्ट फैक्टर" वाली, जिसका अर्थ है कि वे बहुत प्रसिद्ध और प्रभावशाली हैं) से 210 उच्च-प्रोफ़ाइल अध्ययनों की समीक्षा की।

  • निष्कर्ष: चौंकाने वाले 97% अध्ययनों ने "ग्रुप हग" की गलती की। उन्होंने अपने आश्रित परीक्षण परिणामों के साथ ऐसा व्यवहार किया जैसे वे स्वतंत्र हों।
  • व्याप्ति: यह समस्या केवल कुछ "बुरे" अध्ययनों की नहीं थी। यह इस बात पर निर्भर नहीं था कि पत्रिका कितनी प्रसिद्ध थी, नियम कितने सख्त थे, या क्या वैज्ञानिकों ने अपना डेटा खुले तौर पर साझा किया था। यह पूरे क्षेत्र में फैली हुई एक व्यापक आदत है।

सिमुलेशन: यह कितना बुरा है?

यह साबित करने के लिए कि यह कितना खतरनाक है, लेखकों ने 420 अलग-अलग कंप्यूटर सिमुलेशन चलाए। उन्होंने पाया कि जब आप इस तथ्य को अनदेखा करते हैं कि आपके परीक्षण परिणाम आपस में जुड़े हुए हैं:

  • आपकी "गलत सूचना" (फॉल्स अलार्म) की दर आसमान छू जाती है।
  • यदि आप परीक्षण को कई बार दोहराते हैं (एक सामान्य अभ्यास जिसे "रिपीटेड क्रॉस-वैलिडेशन" कहा जाता है), तो गलत सूचना मिलने की संभावना लगभग 100% तक बढ़ सकती है। यह सिक्का उछालने और हर बार यह सुने जाने जैसा है कि आपने लॉटरी जीत ली है, भले ही आपने नहीं जीती हो।

समाधान: "SHARP" टेस्ट

लेख बताता है कि इसे ठीक करना कठिन है क्योंकि, मानक तरीकों के साथ, आप यह नहीं बता सकते कि परिणाम इसलिए समान हैं क्योंकि मॉडल वास्तव में अच्छे हैं, या केवल इसलिए क्योंकि डेटा के हिस्से एक-दूसरे के बहुत समान हैं। यह यह पता लगाने की कोशिश करने जैसा है कि क्या दोस्तों का एक समूह इसलिए सहमत है क्योंकि वे बुद्धिमान हैं, या केवल इसलिए क्योंकि वे एक-दूसरे की नकल कर रहे हैं।

इस समस्या को हल करने के लिए, लेखक एक नई विधि प्रस्तावित करते हैं जिसे SHARP (Split-HAlf RePeated) कहा जाता है।

  • यह कैसे काम करता है: कल्पना कीजिए कि दस दोस्तों को दस बार केक चखने के लिए कहने के बजाय, आप उन्हें दो अलग-अलग समूहों में विभाजित करते हैं। समूह 1 प्रयोग के पहले आधे भाग में केक चखता है, और समूह 2 दूसरे आधे भाग में। क्योंकि ये समूह अलग और पृथक हैं, आप अंततः यह माप सकते हैं कि वे अपने आप में कितनी सहमति रखते हैं, बिना उस "इको चैंबर" (गूँजने वाले कमरे) के प्रभाव के।
  • परिणाम: जब लेखकों ने SHARP का परीक्षण 12 अन्य विधियों के विरुद्ध किया, तो यह स्पष्ट विजेता था। यह एकमात्र ऐसा तरीका था जो गलत सूचनाओं को कम रखते हुए भी मॉडलों के बीच वास्तविक अंतरों का पता लगाने में सक्षम था।

निष्कर्ष

लेख समाप्त करता है कि मेडिकल एआई मॉडलों की तुलना करने का वर्तमान तरीका टूटा हुआ है। यह जीवन रक्षक दवा के लिए सामग्री को तौलने हेतु एक टूटे हुए तराजू का उपयोग करने जैसा है। लेखक एक नया, सरल नियम (सर्वोत्तम अभ्यास) प्रदान कर रहे हैं ताकि वैज्ञानिक अपने गणित को ठीक करने में मदद कर सकें, जिससे यह सुनिश्चित हो सके कि जब वे दावा करते हैं कि एक मॉडल दूसरे से बेहतर है, तो वे वास्तव में सच बोल रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →