← नवीनतम पेपर
💻 computer science

Learning Adaptive Gated Fusion of Convolutional and Transformer Features for Generalizable Medical Image Classification

यह शोध पत्र DACANet प्रस्तुत करता है, जो एक ड्यूल-पाथ नेटवर्क है जो स्थानीय कनवल्शनल और वैश्विक ट्रांसफार्मर विशेषताओं को गतिशील रूप से संतुलित करने के लिए एक सीखे हुए एडेप्टिव गेटिंग मैकेनिज्म का उपयोग करता है, जिससे डेटासेट-विशिष्ट ट्यूनिंग के बिना विविध नैदानिक डोमेन में एक मजबूत और सामान्यीकरण योग्य मेडिकल इमेज क्लासिफिकेशन प्राप्त होता है।

मूल लेखक: Palvi Gupta, Himani Tyagi, Nidhi Gupta

प्रकाशित 2026-09-17
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Palvi Gupta, Himani Tyagi, Nidhi Gupta

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

चिकित्सा निदान की दुनिया में, कंप्यूटर छवियों को पढ़ने में असाधारण रूप से कुशल हो गए हैं। वे त्वचा के किसी धब्बे की तस्वीर या मस्तिष्क के स्कैन को देखकर ऐसे पैटर्न पहचान सकते हैं जो बीमारी का संकेत दे सकते हैं। वर्षों से, इस कार्य के लिए सबसे सफल कंप्यूटर प्रोग्राम एक विशिष्ट प्रकार के डिजिटल मस्तिष्क पर निर्भर रहे हैं जिसे 'कन्वोल्यूशनल न्यूरल नेटवर्क' (convolutional neural network) कहा जाता है। ये प्रोग्राम सूक्ष्म विवरणों को पहचानने में उत्कृष्ट हैं, जैसे कि त्वचा के घाव की खुरदरी बनावट या आंख में छोटी रक्त वाहिकाएं। वे एक छवि के छोटे, स्थानीय क्षेत्रों को स्कैन करके काम करते हैं, ठीक वैसे ही जैसे कोई व्यक्ति पेंटिंग के एक एकल ब्रशस्ट्रोक का परीक्षण करता है। हालाँकि, ये प्रोग्राम कभी-कभी बड़ी तस्वीर देखने में संघर्ष करते हैं। वे यह समझने में चूक सकते हैं कि छवि के दूरस्थ हिस्से एक-दूसरे से कैसे संबंधित हैं, जैसे कि ट्यूमर का समग्र आकार या पूरी रेटिना में वाहिकाओं की व्यवस्था।

इसे हल करने के लिए, शोधकर्ताओं ने हाल ही में एक अलग प्रकार के डिजिटल मस्तिष्क की ओर रुख किया जिसे 'विज़न ट्रांसफार्मर' (vision transformer) के रूपas जाना जाता है। ये सिस्टम पूरी छवि को एक साथ देखने, वैश्विक संरचना को समझने के लिए हर हिस्से को दूसरे हिस्से से जोड़ने के लिए डिज़ाइन किए गए हैं। जहाँ पहला प्रकार का प्रोग्राम बनावट (texture) को देखता है, वहीं दूसरा प्रकार आकार (shape) को देखता है। लंबे समय तक, वैज्ञानिकों ने इन दोनों दृष्टिकोणों को उनके आउटपुट को बस एक साथ जोड़कर मिलाने का प्रयास किया, यह मानते हुए कि प्रत्येक रोगी के लिए दोनों दृश्य समान रूप से महत्वपूर्ण हैं। लेकिन चिकित्सा वास्तविकता शायद ही कभी इतनी एकसमान होती है। त्वचा के घाव का निदान लगभग पूरी तरह से उसके रंग और बनावट द्वारा किया जा सकता है, जबकि मस्तिष्क के ट्यूमर की पहचान उसके स्थान और आकार से की जा सकती है। एक कठोर प्रणाली जो हर छवि के साथ एक जैसा व्यवहार करती है, किसी विशिष्ट मामले के लिए सबसे महत्वपूर्ण सुरागों को मिस करने का जोखिम उठाती है।

भारत के शारदा विश्वविद्यालय के शोधकर्ताओं की एक टीम ने इस समस्या को संभालने का एक नया तरीका प्रस्तावित किया है। उन्होंने DACANet नामक एक प्रणाली विकसित की है, जो एक 'डुअल-पाथ नेटवर्क' के रूप में कार्य करती है। स्थानीय विवरणों और वैश्विक आकारों के लिए एक निश्चित नियम लागू करने के बजाय, यह प्रणाली खुद यह तय करना सीखती है कि विश्लेषण किए जाने वाले प्रत्येक चित्र के लिए प्रत्येक दृश्य को कितना महत्व दिया जाए। शोधकर्ताओं ने इस दृष्टिकोण का परीक्षण तीन बहुत अलग प्रकार के चिकित्सा चित्रों पर किया: त्वचा के घाव, मस्तिष्क के स्कैन और रेटिना के फोटोग्राफ। उनका लक्ष्य यह देखना था कि क्या एक लचीली प्रणाली एक कठोर प्रणाली की तुलना में बेहतर प्रदर्शन कर सकती है, विशेष रूप से तब जब रोगी से रोगी के बीच बनावट बनाम आकार का महत्व बदलता है।

इनका मुख्य नवाचार दो डिजिटल मस्तिष्क के बीच स्थित एक छोटा, बुद्धिमान 'गेट' (gate) है। जैसे ही सिस्टम एक छवि को प्रोसेस करता है, एक शाखा किनारों और रंगों जैसे स्थानीय लक्षणों को निकालती है, जबकि दूसरी शाखा पूरी तस्वीर में समग्र संरचना और संबंधों को कैप्चर करती है। अंतिम निदान किए जाने से पहले, गेट दोनों सूचना सेटों को देखता है और एक विशिष्ट संतुलन की गणना करता है। यदि यह एक ऐसी छवि है जहाँ स्थानीय बनावट सबसे अधिक मायने रखती है, तो गेट पहले भाग (branch) पर भारी झुकाव रखता है। यदि वैश्विक आकार निर्णायक कारक है, तो यह अपना ध्यान दूसरे भाग की ओर स्थानांतरित कर देता है। यह निर्णय प्रत्येक छवि के लिए व्यक्तिगत रूप से लिया जाता है, जिससे सिस्टम को एक पूर्व-निर्धारित नियम के बजाय वास्तविक समय में अपनी रणनीति अनुकूलित करने की अनुमति मिलती है।

यह परीक्षण करने के लिए कि क्या यह लचीलापन वास्तव में मदद करता है, शोधकर्ताओं ने बिना किसी विशेष समायोजन के तीन सार्वजनिक डेटासेट्स पर इस प्रणाली को प्रशिक्षित किया। पहले डेटासेट में पिक्मेंटेड स्किन लीजन (pigmented skin lesions) की छवियां शामिल थीं, जहाँ एक हानिरहित तिल और एक खतरनाक मेलानोमा के बीच का अंतर अक्सर सूक्ष्म, बारीक विवरणों पर निर्भर करता है। दूसरे डेटासेट में मस्तिष्क के मैग्नेटिक रेजोनेंस इमेजेस (MRI) शामिल थे, जहाँ ट्यूमर की उपस्थिति अक्सर उसके विशिष्ट आकार और स्थान से परिभाषित होती है। तीसरे डेटासेट में रेटिना के फोटोग्राफ थे, जिनका उपयोग डायबिटिक रेटिनोपैथी की गंभीरता को ग्रेड करने के लिए किया जाता है, एक ऐसी स्थिति जहाँ सूक्ष्म रक्त वाहिका परिवर्तन और व्यापक पैटर्न दोनों ही महत्वपूर्ण होते हैं।

परिणामों ने दिखाया कि लचीली प्रणाली ने सभी तीन क्षेत्रों में असाधारण रूप से अच्छा प्रदर्शन किया। त्वचा के घावों की छवियों पर, इसने 87.37 प्रतिशत की वैधता सटीकता प्राप्त की। मस्तिष्क के ट्यूमर स्कैन के लिए, इसने 95.25 प्रतिशत सटीकता प्राप्त की। रेटिना की छवियों पर, इसने 84.64 प्रतिशत स्कोर किया। ये संख्याएँ प्रभावशाली हैं, लेकिन अध्ययन का वास्तविक मूल्य तब सामने आया जब शोधकर्ताओं ने अपने लचीले सिस्टम की तुलना एक ऐसे संस्करण से की जो सूचनाओं के दो प्रकारों को संयोजित करने के लिए एक निश्चित, अपरिवर्तनीय नियम का उपयोग करता था। त्वचा के घाव और रेटिना के डेटासेट्स पर, लचीले सिस्टम ने निश्चित सिस्टम की तुलना में स्पष्ट अंतर से बेहतर प्रदर्शन किया, जिससे सटीकता में क्रमशः 1.65 और 0.68 प्रतिशत अंकों का सुधार हुआ। यह सुझाव देता है कि जटिल चिकित्सा छवियों के लिए जहाँ नैदानिक सुराग मामले दर मामला काफी भिन्न होते हैं, अनुकूलन की क्षमता एक वास्तविक लाभ है।

दिलचस्प रूप से, परिणामों ने इस दृष्टिकोण की सीमाओं को भी उजागर किया। मस्तिष्क ट्यूमर के डेटासेट पर, निश्चित सिस्टम ने लचीले सिस्टम के समान ही प्रदर्शन किया, जिसमें अंतर एक-पॉइंट-पाँच प्रतिशत के पांचवें हिस्से से भी कम था। शोधकर्ताओं ने नोट किया कि मस्तिष्क के ट्यूमर की छवियां अक्सर दृश्य रूप से विशिष्ट और अलग करने में आसान होती हैं, जिसका अर्थ है कि कार्य पहले से ही उपयोग किए गए उपकरणों के लिए अधिकतम संभव प्रदर्शन के करीब था। ऐसे सीधे मामलों में, एक अनुकूलन योग्य गेट की अतिरिक्त जटिलता कोई वास्तविक लाभ नहीं देती है। यह निष्कर्ष महत्वपूर्ण है क्योंकि यह बताता है कि 'एडैप्टिव फ्यूजन' (adaptive fusion) का मूल्य पूरी तरह से कार्य की कठिनाई और विविधता पर निर्भर करता है। यह हर स्थिति में सुधार करने वाला कोई जादुय समाधान नहीं है, बल्कि एक लक्षित उपकरण है जो तब चमकता है जब नैदानिक सुराग सूक्ष्म और परिवर्तनशील होते हैं।

अध्ययन यह निष्कर्ष निकालता है कि यह अनुकूलन योग्य विधि चिकित्सा छवि विश्लेषण के लिए एक व्यावहारिक और पुनरुत्पादक ढांचा प्रदान करती है। कंप्यूटर को यह तय करने की अनुमति देकर कि प्रत्येक विशिष्ट रोगी के लिए किस प्रकार के साक्ष्य सबसे महत्वपूर्ण हैं, सिस्टम अधिक विश्वसनीय और चिकित्सा अभ्यास की विविध वास्तविकता के लिए बेहतर अनुकूल हो जाता है। शोधकर्ता इस बात पर जोर देते हैं कि हालांकि उनका सिस्टम बिना किसी कस्टम ट्यूनिंग के विभिन्न प्रकार के स्कैनों पर अच्छी तरह से काम करता है, फिर भी अभी बहुत काम किया जाना बाकी है। भविष्य के अध्ययनों को यह बारीकी से देखना होगा कि सिस्टम दुर्लभ रोग श्रेणियों को कैसे संभालता है और परिणामों की निरंतरता सुनिश्चित करने के लिए कई अलग-अलग प्रशिक्षण दौरों पर इसके प्रदर्शन का परीक्षण करना होगा। फिलहाल, यह कार्य प्रदर्शित करता है कि चिकित्सा इमेजिंग की जटिल दुनिया में, अपने फोकस को अनुकूलित करने की क्षमता एक शक्तिशाली संपत्ति है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →