Imputation-Based Harmonization Mitigates Site Effects Without Data Leakage in Machine Learning Studies
यह शोध पत्र MIRTH को प्रस्तुत करता है, जो एक नवीन इम्प्यूटेशन-आधारित सामंजस्य (harmonization) विधि है जो डेटा लीकेज (data leakage) का कारण बने बिना या वास्तविक जैविक संकेतों को कम किए बिना, न्यूरोइमेजिंग मशीन लर्निंग अध्ययनों में साइट प्रभावों (site effects) को प्रभावी ढंग से कम करती है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
देश भर के विभिन्न अस्पतालों में लिए गए हजारों एमआरआई (MRI) स्कैन को देखकर मानव मस्तिष्क को समझने की कोशिश कीजिए। प्रत्येक अस्पताल अपनी स्वयं की मशीनों का उपयोग करता है, जो अक्सर अलग-अलग निर्माताओं की होती हैं, और वे अलग-अलग स्कैनिंग प्रक्रियाओं का पालन करते हैं। भले ही वैज्ञानिक इन प्रक्रियाओं को मानकीकृत करने का प्रयास करें, फिर भी ये चित्र अपने साथ उस स्थान के सूक्ष्म निशान (fingerprints) लेकर आते हैं जहाँ से उन्हें लिया गया था। एक अस्पताल का स्कैन दूसरे की तुलना में थोड़ा अधिक चमकीला या अलग बनावट वाला हो सकता है, इसलिए नहीं कि रोगी का मस्तिष्क अलग है, बल्कि इसलिए क्योंकि उपकरण अलग है। जब शोधकर्ता अल्जाइमर जैसी बीमारियों का अध्ययन करने के लिए इन छवियों को मिलाते हैं, तो ये तकनीकी अंतर कंप्यूटर प्रोग्रामों को यह सोचने के लिए धोखा दे सकते हैं कि उन्होंने एक ऐसा पैटर्न खोज लिया है जो वास्तव में अस्पताल के स्थान का प्रतिबिंब मात्र है। "साइट इफेक्ट" (site effect) के रूप में जानी जाने वाली यह समस्या चिकित्सा अनुसंधान की विश्वसनीयता के लिए खतरा पैदा करती है, जिससे मानव मस्तिष्क के कार्य करने के तरीके के बारे में गलत निष्कर्ष निकलने की संभावना बनी रहती है।
इसे हल करने के लिए, वैज्ञानिकों ने इन अंतरों को सुचारू (smooth out) करने के लिए गणितीय उपकरण विकसित किए हैं, जो प्रभावी रूप से सभी स्कैन को इस तरह दिखाते हैं जैसे वे एक ही मशीन से आए हों। हालांकि, नूह हिलमैन और उनके सहयोगियों द्वारा किया गया एक नया अध्ययन बताता है कि वर्तमान में इन उपकरणों का उपयोग करने में एक छिपा हुआ जाल है। जब शोधकर्ता किसी रोगी की स्थिति का अनुमान लगाने के लिए कंप्यूटर मॉडल बनाने की कोशिश करते हैं, तो उन्हें अक्सर एक कठिन विकल्प का सामना करना पड़ता है: यदि वे स्मूथिंग प्रक्रिया में रोगी के निदान (diagnosis) को शामिल करते हैं, तो वे डेटा की तैयारी को उत्तर से प्रभावित करके पूर्वाग्रह (bias) पैदा करने का जोखिम उठाते है; यदि वे निदान को बाहर छोड़ देते हैं, तो वे अनजाने में उसी जैविक संकेतों को मिटा सकते हैं जिन्हें वे खोजने का प्रयास कर रहे हैं। शोधकर्ता एक नई विधि प्रस्तावित करते हैं जिसे MIRTH कहा जाता है जो इस दुविधा का समाधान करती है। सूचना की कमी को कई संभावित अनुमानों के साथ भरने की तकनीक का उपयोग करके, वे बिना उत्तर देखे डेटा को साफ कर सकते हैं, यह सुनिश्चित करते हुए कि अंतिम भविष्यवाणियां वास्तविक जीव विज्ञान पर आधारित हों न कि तकनीकी त्रुटियों पर।
शोधकर्ताओं ने अपने विचार का परीक्षण दो प्रमुख अध्ययनों का उपयोग करके किया: अल्जाइमर रोग न्यूरोइमेजिंग इनिशिएटिव और बाल्टीमोर लोंगीट्यूडिनल स्टडी ऑफ एजिंग। उन्होंने 2,000 से अधिक प्रतिभागियों के मस्तिष्क स्कैन एकत्र किए, जिनमें स्वस्थ व्यक्ति और अल्जाइमर से पीड़ित दोनों शामिल थे। ये स्कैन तीन अलग-अलग निर्माताओं—GE, Philips, और Siemens—की मशीनों से दो अलग-अलग पावर स्तरों पर लिए गए थे। टीम ने मस्तिष्क के 145 विशिष्ट क्षेत्रों के आयतन (volume) को मापने पर ध्यान केंद्रित किया, जिससे मस्तिष्क की संरचना का एक विस्तृत मानचित्र तैयार हुआ। इसके बाद, उन्होंने एक श्रृंखला में चुनौतियां स्थापित कीं ताकि यह देखा जा सके कि क्या उनकी नई विधि उम्र, लिंग या निदान का सटीक अनुमान लगा सकती है या अस्पताल के स्थान से भ्रमित हो सकती है।
अपने प्रयोगों में, टीम ने अपने नए दृष्टिकोण की कई मौजूदा विधियों के विरुद्ध तुलना की। एक सामान्य दृष्टिकोण में डेटा को बिना यह बताए कि रोगी का निदान क्या है, स्मूथिंग करना शामिल था। परिणामों ने दिखाया कि इस पद्धति ने अक्सर मस्तिष्क स्कैन और बीमारी के बीच के संबंध को कमजोर कर दिया, जिससे कंप्यूटर के लिए यह अनुमान लगाना कम सटीक हो गया कि किसे अल्जाइमर है। एक अन्य दृष्टिकोण ने स्मूथिंग प्रक्रिया के दौरान निदान का उपयोग करने का प्रयास किया, लेकिन इससे डेटा लीकेज (data leakage) का एक रूप पैदा हुआ जहाँ कंप्यूटर ने परीक्षण से पहले ही उत्तर को याद कर लिया, जिससे अत्यधिक आशावादी और अविश्वसनीय परिणाम मिले। एक तीसरी विधि ने काल्पनिक परिदृश्यों को बनाकर निदान का अनुमान लगाने का प्रयास किया, लेकिन जटिल डेटा या सूचना की कमी होने पर इसे संघर्ष करना पड़ा।
नया MIRTH तरीका अलग तरह से काम करता है। इसने कंप्यूटर को उस डेटा पर प्रशिक्षित करके शुरुआत की जहाँ निदान ज्ञात था, जिससे उसे अस्पतालों के बीच तकनीकी अंतरों को दूर करना सिखाया गया। फिर, जब इसे नए रोगियों का सामना करना पड़ा जिनका निदान अज्ञात था, तो इस विधि ने लापता जानकारी के कई संभावित संस्करण उत्पन्न करने के लिए एक सांख्यिकीय प्रक्रिया का उपयोग किया। इनमें से प्रत्येक संस्करण के लिए, इसने प्रशिक्षण डेटा से सीखे गए स्मूथिंग नियमों को लागू किया, यह सुनिश्चित करते हुए कि प्रशिक्षण के दौरान वास्तविक उत्तर को उजागर किए बिना तकनीकी शोर (technical noise) को हटाया जा सके। अंत में, इसने एक एकल, मजबूत भविष्यवाणी करने के लिए इन सभी संस्करणों के परिणामों को संयोजित किया।
परिणाम चौंकाने वाले थे। सिमुलेशन में जहाँ कंप्यूटर को मस्तिष्क की संरचना और बीमारी के बीच कोई संबंध न खोजने के लिए बनाया गया था, पुराने तरीकों ने कभी-कभी एक नकली लिंक ढूंढ लिया क्योंकि कुछ अस्पतालों में बीमारी अधिक आम थी। हालाँकि, नए तरीके ने सही ढंग से कोई लिंक नहीं पाया, जिससे पता चला कि यह वास्तविक जीव विज्ञान और तकनीकी शोर के बीच अंतर कर सकता है। जब शोधकर्ताओं ने वास्तविक डेटा पर अल्जाइमर, आयु और लिंग की भविष्यवाणी करने के लिए इस विधि का परीक्षण किया, तो इसने उस सर्वोत्तम संभव परिदृश्य के बराबर प्रदर्शन किया जहाँ कंप्यूटर को पहले से ही उत्तर का उपयोग करने की अनुमति दी गई थी, जिसमें विशिष्ट मेट्रिक्स जैसे त्रुटि दर में केवल मामूली अंतर था। महत्वपूर्ण रूप से, इसने यह सब बिना उत्तर का उपयोग किए किया। भविष्यवाणियां तब भी सटीक रहीं जब डेटा अव्यवस्थित था या जब कुछ जानकारी गायब थी, एक ऐसी स्थिति जिसमें अन्य विधियाँ अक्सर लड़खड़ा जाती हैं।
अध्ययन ने यह भी देखा कि क्या यह विधि वास्तव में अस्पताल के प्रभाव को हटाती है। जब उन्होंने स्मूथिंग प्रक्रिया के बाद कंप्यूटर से यह अनुमान लगाने के लिए कहा कि एक स्कैन किस अस्पताल का था, तो इसने पहले की तुलना में काफी खराब प्रदर्शन किया, हालांकि परिणाम अभी भी रैंडम गेसिंग से थोड़े ऊपर थे। इसने पुष्टि की कि तकनीकी अंतर काफी हद तक मिटा दिए गए थे, हालांकि पूरी तरह से नहीं। इसके विपरीत, जब उन्होंने पुराने तरीकों का उपयोग किया जिनमें निदान शामिल नहीं था, तो कंप्यूटर अभी भी आसानी से बता सकता था कि एक स्कैन किस अस्पताल का था, जिसका अर्थ था कि तकनीकी शोर अभी भी मौजूद था, जो चिकित्सा परिणामों को प्रभावित कर सकता था। शोधकर्ताओं ने पाया कि यह विशेष रूप से महत्वपूर्ण था जब बीमारी अस्पतालों में समान रूप से वितरित नहीं थी; उन मामलों में, सफाई प्रक्रिया के दौरान निदान को अनदेखा करने से काफी खराब भविष्यवाणियां हुईं।
हालाँकि नया तरीका अत्यधिक प्रभावी सिद्ध हुआ, शोधकर्ताओं ने उल्लेख किया कि यह हर संभावित समस्या के लिए पूर्ण समाधान नहीं है। उदाहरण के लिए, यदि कोई नया अस्पताल सामने आता है जिसे पहले कभी नहीं देखा गया है, तो विधि को समायोजित करने के लिए अतिरिक्त चरणों की आवश्यकता हो सकती है। इसके अतिरिक्त, अध्ययन ने सिमुलेशन और मौजूदा डेटा पर भरोसा किया, इसलिए यह देखने के लिए कि यह लाइव क्लिनिकल सेटिंग्स में कैसा प्रदर्शन करता है, आगे काम करने की आवश्यकता है। फिर भी, निष्कर्ष उन शोधकर्ताओं के लिए एक स्पष्ट मार्ग प्रदान करते हैं जो कई स्रोतों से डेटा को संयोजित करना चाहते हैं। रिक्त स्थानों को कई संभावनाओं के साथ भरने की प्रक्रिया का उपयोग करके, वैज्ञानिक अब तकनीकी त्रुटियों को हटाने के लिए अपने डेटा को साफ कर सकते हैं बिना अनजाने में उन जैविक सत्यों को छिपाए जो वे खोजने का प्रयास कर रहे हैं। यह सुनिश्चित करता है कि जब एक कंप्यूटर मॉडल किसी बीमारी की भविष्यवाणी करता है, तो वह इसलिए करता है क्योंकि उसने मस्तिष्क से सीखा है, न कि इसलिए क्योंकि उसने उस मशीन से सीखा है जिसने तस्वीर ली थी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।