← नवीनतम पेपर
💻 computer science

Identical runs disagree more than different models: reproducibility limits in deep learning for brain-tumour MRI classification

यह अध्ययन प्रदर्शित करता है कि ब्रेन-ट्यूमर एमआरआई वर्गीकरण के लिए नाममात्र रूप से समान डीप लर्निंग रन में अनियंत्रित स्टोकेस्टिक भिन्नताएं अलग-अलग मॉडल आर्किटेक्चर के बीच प्रदर्शन अंतर से अधिक हो सकती हैं, जिससे मानक एब्लेशन अध्ययनों की विश्वसनीयता कम हो जाती है और सख्त पुनरुत्पादकता प्रोटोकॉल की आवश्यकता होती है।

मूल लेखक: Md Mostafizur Rahman

प्रकाशित 2026-09-22
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Md Mostafizur Rahman

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मेडिकल इमेजिंग की उच्च-दांव वाली दुनिया में, कंप्यूटरों से तेजी से मानव मस्तिष्क की तस्वीरें देखकर ट्यूमर का पता लगाने के लिए कहा जा रहा है। ये तस्वीरें, जिन्हें एमआरआई (MRI) स्कैन कहा जाता है, जटिल और विस्तृत होती हैं, और इन छवियों का विश्लेषण करने के लिए उपयोग किया जाने वाला सॉफ्टवेयर 'डीप लर्निंग' नामक आर्टिफिशियल इंटेलिजेंस के एक प्रकार पर निर्भर करता है। इन प्रणालियों को प्रशिक्षित करने के लिए, शोधकर्ता उन्हें हजारों छवियां प्रदान करते हैं और कंप्यूटर को अपने आप पैटर्न सीखने देते हैं, जिससे वह बीमारी की पहचान करने में बेहतर होने तक अपने आंतरिक सेटिंग्स को लाखों बार समायोजित करता है। इसका लक्ष्य एक ऐसा उपकरण बनाना है जिस पर डॉक्टर ब्रेन ट्यूमर जैसी स्थितियों का निदान करने के लिए भरोसा कर सकें। हालांकि, इस तकनीक के सुरक्षित और उपयोगी होने के लिए, इसके परिणाम सुसंगत होने चाहिए। यदि कंप्यूटर को एक ही डेटा दो बार दिखाया जाए, तो आदर्श रूप से उसे वही उत्तर देना चाहिए। जब वैज्ञानिक दो अलग-अलग कंप्यूटर मॉडल की तुलना यह देखने के लिए करते हैं कि कौन सा बेहतर है, तो वे अक्सर यह तय करने के लिए कि कौन सा मॉडल वास्तविक दुनिया के परीक्षण के लिए आगे बढ़ना चाहिए, सटीकता में बहुत सूक्ष्म अंतर, कभी-कभी केवल एक प्रतिशत के अंश को भी देखते हैं।

सैन फ्रांसिस्को बे यूनिवर्सिटी के एक शोधकर्ता ने एक विशिष्ट विचार का परीक्षण करने का निर्णय लिया: क्या एक मानक ब्रेन-इमेजिंग कंप्यूटर मॉडल में एक विशेष प्रकार की तर्क क्षमता (reasoning) जोड़ने से वह ट्यूमर पकड़ने में बेहतर बनेगा? मानक मॉडल सीधे छवि को देखता है, जबकि नया संस्करण छवि के विभिन्न हिस्सों के बीच संबंधों को समझने की कोशिश करता है, ठीक वैसे ही जैसे एक इंसान विशेषताओं के बीच संबंध जोड़ता है। शोधकर्ता ने इसे परखने के लिए एक कठोर प्रयोग बनाया, जिसमें उसने कंप्यूटर मॉडल को बार-बार चलाया ताकि यह देखा जा सके कि क्या नया दृष्टिकोण वास्तव में कोई लाभ देता है। हालांकि, जो उसने पाया वह ट्यूमर का पता लगाने में कोई बड़ी सफलता नहीं थी, बल्कि स्वयं परीक्षण प्रक्रिया की विश्वसनीयता के बारे में एक चौंकाने वाली खोज थी। उसने पाया कि कंप्यूटर की अपनी प्रशिक्षण प्रक्रिया इतनी अस्थिर थी कि एक ही मॉडल के दो समान रन अलग-अलग परिणाम दे सकते थे, जो उन सूक्ष्म अंतरों से भी बड़े थे जिन्हें वह दो अलग-अलग मॉडलों के बीच मापने की कोशिश कर रहा था।

अध्ययन की शुरुआत सैकड़ों रोगियों के एमआरआई स्लाइस के एक बड़े संग्रह के साथ हुई, जिसे सावधानीपूर्वक इस तरह विभाजित किया गया था कि किसी भी रोगी का डेटा प्रशिक्षण (training) और परीक्षण (testing) दोनों समूहों में न आए। यह अत्यंत महत्वपूर्ण था क्योंकि यदि कंप्यूटर ने दोनों समूहों में एक ही रोगी के टर्नर को देख लिया, तो वह बीमारी को सामान्य रूप से पहचानने के बजाय उस विशिष्ट व्यक्ति को ही याद कर लेगा। शोधकर्ता ने एक मानक मॉडल और एक अधिक जटिल संस्करण को प्रशिक्षित किया जिसमें अतिरिक्त रीजनिंग लेयर शामिल थी। उसने प्रत्येक संस्करण को कई बार चलाया, जिसमें एक रैंडम शुरुआती नंबर, जिसे 'सीड' (seed) कहा जाता है, को बदला, ताकि यह देखा जा सके कि परिणाम कैसे बदलते हैं। कंप्यूटर विज्ञान की दुनिया में, यह सीड यह सुनिश्चित करने के लिए होता है कि यदि आप एक ही नंबर से शुरू करते हैं, तो कंप्यूटर हर बार बिल्कुल वही काम करे। अपेक्षा यह थी कि जटिल मॉडल या तो साधारण मॉडल से थोड़ा बेहतर होगा या थोड़ा बदतर, और तीन बार परीक्षण करने से एक स्पष्ट औसत प्राप्त होगा।

इसके विपरीत, परिणामों ने एक अराजक पैटर्न दिखाया। जब शोधकर्ता ने एक ही शुरुआती नंबर के साथ बिल्कुल एक ही मॉडल कॉन्फ़िगरेशन को दो बार चलाया, तो सटीकता स्कोर औसतन दो प्रतिशत से अधिक भिन्न थे। यह भिन्नता इतनी बड़ी थी कि इसने उन छोटे अंतरों को पूरी तरह से दबा दिया जो वह दो अलग-अलग मॉडलों के बीच माप रहा था। वास्तव में, दो समान रन के बीच का अंतर, साधारण मॉडल और जटिल मॉडल के बीच के अंतर से दोगुने से भी अधिक था। इसका अर्थ यह था कि प्रयोग अनिवार्य रूप से सिग्नल के बजाय 'नॉइज़' (noise) को माप रहा था। शोधकर्ता को एहसास हुआ कि कंप्यूटर एक विश्वसनीय उपकरण की तरह व्यवहार नहीं कर रहा था; यह वैसा ही था जैसे सोने के सिक्कों को तौलने वाला तराजू हर बार अलग रीडिंग दे, भले ही आप बिल्कुल एक ही स्थान पर खड़े हों।

गहराई से जांच करने पर, शोधकर्ता को इस अविश्वसनीयता के दो मुख्य कारण मिले। पहला, कंप्यूटर को गलत तरीके से सेटअप किया गया था। रैंडम शुरुआती नंबर को मॉडल बनने के बाद लागू किया जा रहा था, जिसका अर्थ था कि मॉडल की प्रारंभिक सेटिंग्स अभी भी रैंडम और अनियंत्रित थीं। इस गलती को सुधारने और मॉडल बनाने से पहले शुरुआती नंबर लागू करने के बाद भी, परिणाम पूरी तरह से एक समान नहीं थे। दूसरा मुद्दा कंप्यूटर के गणितीय इंजन के भीतर छिपा हुआ था। भले ही सॉफ्टवेयर दावा कर रहा था कि यह पूरी तरह से 'डिटरमिनिस्टिक' (deterministic) मोड में चल रहा है, लेकिन मॉडल को सिखाने के लिए उपयोग किए जाने वाले गणना के एक विशिष्ट हिस्से ने हर बार थोड़े अलग परिणाम दिए। यह दोष इतना छिपा हुआ था कि यह उन मानक जांचों से भी अदृश्य था जिनका उपयोग शोधकर्ता अपने प्रयोगों की पुनरावृत्ति सुनिश्चित करने के लिए करते हैं।

अध्ययन ने यह भी खुलासा किया कि डेटा को विभाजित करने का तरीका परिणामों को नाटकीय रूप से बदल सकता है। जब शोधकर्ता ने डेटा को व्यक्तिगत एमआरआई स्लाइस के बजाय रोगी के आधार पर विभाजित किया, तो कंप्यूटर की सटीकता लगभग पांच प्रतिशत बढ़ गई। ऐसा इसलिए हुआ क्योंकि कंप्यूटर प्रशिक्षण और परीक्षण दोनों सेटों में एक ही रोगी के पैटर्न को पहचान रहा था, जिससे वह ट्यूमर के बजाय रोगी को पहचान पा रहा था। यह बढ़ा हुआ स्कोर एक भ्रम था, जिसने मॉडल की वास्तविक क्षमता को ढक लिया था। इसके अलावा, जब शोधकर्ता ने यह परीक्षण किया कि मॉडल विकृत या शोर वाली छवियों को कितनी अच्छी तरह संभालता है, तो एक एकल परीक्षण रन ने सुझाव दिया कि एक मॉडल अधिक मजबूत है, लेकिन जब परीक्षण को दोहराया गया, तो परिणाम पलट गया और दूसरे मॉडल को बेहतर दिखाया गया। इस उलटफेर ने सिद्ध किया कि एक निष्कर्ष निकालने के लिए एक एकल प्रयोग पर्याप्त नहीं है।

इस कार्य का अंतिम निष्कर्ष यह था कि अतिरिक्त रीजनिंग लेयर ने ब्रेन ट्यूमर का पता लगाने की क्षमता में सुधार नहीं किया। जटिल मॉडल बेहतर नहीं था, और कुछ मामलों में, यह धीमा और कम विश्वसनीय भी था। अधिक महत्वपूर्ण बात यह है कि इस अध्ययन ने चिकित्सा संबंधी कई एआई (AI) अध्ययनों में मौजूद एक गंभीर खामी पर प्रकाश डाला। वे अंतर जिन्हें शोधकर्ता अक्सर खोज बताते हैं, वे स्वयं परीक्षण प्रक्रिया की प्राकृतिक भिन्नता से भी छोटे होते हैं। शोधकर्ता ने तर्क दिया कि इससे पहले कि वैज्ञानिक किसी नए मॉडल पर भरोसा करें, उन्हें पहले यह सत्यापित करना चाहिए कि उनका परीक्षण सेटअप छोटे परिवर्तनों का पता लगाने के लिए पर्याप्त स्थिर है। इसमें यह जांचना शामिल है कि रैंडम शुरुआती नंबर सही ढंग से लागू किए गए हैं या नहीं और प्राकृतिक भिन्नता को मापने के लिए एक ही परीक्षण को दो बार चलाना। इन जांचों में बहुत कम समय और प्रयास लगता है, फिर भी इन्हें अक्सर छोड़ दिया जाता है। इनके बिना, यह क्षेत्र ऐसे चिकित्सा उपकरण बनाने का जोखिम उठाता है जिनकी नींव नैदानिक निर्णयों के भार को संभालने के लिए बहुत कमजोर है। यह शोधपत्र एक अनुस्मारक के रूप में कार्य करता है कि बेहतर चिकित्सा तकनीक की खोज में, यह सुनिश्चित करना कि मापन उपकरण सटीक है, स्वयं उस उपकरण से भी अधिक महत्वपूर्ण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →