← नवीनतम पेपर
💻 computer science

An Attention Infused Deep Learning System with Grad-CAM Visualization for Early Screening of Glaucoma

यह शोध पत्र एक नवीन डीप लर्निंग सिस्टम प्रस्तावित करता है जो ACRIMA और Drishti डेटासेट पर प्रारंभिक ग्लूकोमा स्क्रीनिंग को बेहतर बनाने के लिए एक क्रॉस-अटेंशन मॉड्यूल के माध्यम से एक कस्टम CNN और विजन ट्रांसफॉर्मर को फ्यूज करता है, जो क्लिनिकल व्याख्यात्मकता के लिए Grad-CAM का उपयोग करते हुए स्टैंडअलोन मॉडलों की तुलना में बेहतर प्रदर्शन प्राप्त करता है।

मूल लेखक: Ramanathan Swaminathan

प्रकाशित 2026-01-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ramanathan Swaminathan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल मोज़ेक (mosaic) में एक बहुत ही बारीक दरार को खोजने की कोशिश कर रहे हैं। यदि आप एक बार में पूरी तस्वीर देखते हैं, तो शायद आप उस दरार को देख नहीं पाएंगे। यदि आप केवल एक टाइल पर बहुत अधिक ज़ूम करते हैं, तो आप यह मिस कर सकते हैं कि वह टाइल बड़ी तस्वीर में कैसे फिट बैठती है। यह बिल्कुल वही चुनौती है जिसका सामना डॉक्टर आँख की छवियों (फंडस फोटो) को देखकर ग्लूकोमा (glaucoma) का पता लगाने के लिए करते हैं, जो एक ऐसी बीमारी है जो ऑप्टिक नर्व को नुकसान पहुँचाती है और अंधापन पैदा कर सकती है।

यह शोध पत्र एक नया "सुपर-स्काउट" सिस्टम प्रस्तुत करता है जिसे इन दरारों को जल्दी खोजने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. दो विशेषज्ञ: जासूस और वास्तुकार (The Detective and The Architect)

शोधकर्ताओं ने केवल एक AI मॉडल नहीं बनाया; उन्होंने दो अलग-अलग विशेषज्ञों को काम पर लगाया और उन्हें मिलकर काम करने के लिए मजबूर किया।

  • विशेषज्ञ A (जासूस - EfficientNet-B0): यह एक क्लासिक प्रकार का AI है जिसे 'कन्वोल्यूशनल न्यूरल नेटवर्क' (CNN) कहा जाता है। इसे एक ऐसे जासूस के रूप में सोचें जो सूक्ष्म, विशिष्ट विवरणों को देखने में माहिर है। यह आँख की बनावट में होने वाले छोटे बदलावों को पहचान सकता है, जैसे कि नर्व का पतला होना या रक्तस्राव का कोई छोटा सा बिंदु। हालाँकि, यह कभी-कभी यह समझने में संघर्ष करता है कि वे सभी विवरण आपस में कैसे जुड़े हुए हैं (बड़ी तस्वीर)।
  • विशेषज्ञ B (वास्तुकार - Vision Transformer): यह एक नया और आधुनिक AI मॉडल है। इसे एक ऐसे वास्तुकार (architect) के रूप में सोचें जो एक ही समय में पूरे कमरे को समझने में माहिर है। यह पूरी छवि को देखता है और समझता है कि विभिन्न भाग एक-दूसरे से कैसे संबंधित हैं। हालाँकि, यह कभी-कभी बड़ी तस्वीर में उलझकर सूक्ष्म, महत्वपूर्ण विवरणों को मिस कर सकता है।

2. जादुई गोंद: क्रॉस-अटेंशन (Cross-Attention)

आमतौर पर, यदि आप एक जासूस और एक वास्तुकार को कोई केस सुलझाने के लिए कहते हैं, तो वे या तो एक-दूसरे के ऊपर चिल्ला सकते हैं, या एक-दूसरे को अनदेखा कर सकते हैं।

शोधकर्ताओं ने एक विशेष "अनुवादक" बनाया जिसे क्रॉस-अटेंशन मॉड्यूल (Cross-Attention module) कहा जाता है। यह वह गोंद है जो इस सिस्टम को एक साथ जोड़ता है।

  • यह जासूस को अनुमति देता है कि वह कहे, "हे वास्तुकार, यहीं इस विशिष्ट तंत्रिका तंतु (nerve fiber) को देखो।"
  • यह वास्तुकार को अनुमति देता है कि वह कहे, "हे जासूस, याद रखो कि यह छोटा सा तंतु उस बड़े पैटर्न का हिस्सा है जिसे हमने पहले देखा था।"

वे लगातार एक-दूसरे के नोट्स साझा करते हैं और एक-दूसरे की राय को महत्व देते हैं। यह सुनिश्चित करता है कि अंतिम निर्णय सूक्ष्म विवरणों और बड़ी तस्वीर, दोनों के आधार पर लिया जाए।

3. प्रशिक्षण का मैदान: आँखों का मिश्रण

इस सिस्टम को सिखाने के लिए, शोधकर्ताओं ने केवल छवियों का एक सेट उपयोग नहीं किया। उन्होंने आँख की छवियों के दो अलग-अलग "लाइब्रेरी" को मिलाया:

  • ACRIMA लाइब्रेरी: स्पेन से ली गई छवियों का एक बड़ा संग्रह।
  • Drishti लाइब्रेरी: भारत से ली गई छवियों का एक छोटा संग्रह।

इन दोनों को मिलाकर, सिस्टम ने विभिन्न प्रकार की आँखों और विभिन्न स्थितियों में ग्लूकोमा को पहचानना सीखा, जिससे यह एक अधिक मजबूत शिक्षार्थी बन गया। उन्होंने "डेटा ऑग्मेंटेशन" (data augmentation) का भी उपयोग किया, जो कि एक फोटो लेने, उसे पलटने, उसके रंगों को थोड़ा बदलने और उसे धुंधला करने जैसा है ताकि मूल फोटो से हजारों नई अभ्यास फोटो बनाई जा सकें। यह AI को केवल फोटो को रटने से रोकता है और उसे वास्तव में बीमारी को सीखने के लिए मजबूर करता है।

4. परिणाम: एक शानदार प्रदर्शन

जब उन्होंने इस "हाइब्रिड" टीम का परीक्षण पुराने तरीके (केवल जासूस या केवल वास्तुकार का उपयोग करके) के मुकाबले किया, तो परिणाम प्रभावशाली थे:

  • टीम: संयुक्त सिस्टम ने लगभग 94.8% सटीकता प्राप्त की।
  • अकेले खिलाड़ी: अकेले जासूस ने लगभग 86% और अकेले वास्तुकार ने लगभग 87% प्राप्त किया।

"टीमवर्क" वाला दृष्टिकोण स्पष्ट रूप से जीत गया। सिस्टम ने 100 में से लगभग 95 मामलों में ग्लूकोमा की सही पहचान की।

5. "फ्लैशलाइट" (Grad-CAM)

AI के साथ सबसे बड़ी समस्या यह है कि यह एक "ब्लैक बॉक्स" है—आप एक छवि डालते हैं, और यह एक उत्तर देता है, लेकिन आपको नहीं पता कि यह क्यों हुआ।

इसे ठीक करने के लिए, शोधकर्ताओं ने Grad-CAM नामक एक टूल का उपयोग किया। कल्पना कीजिए कि आप आँख की छवि पर टॉर्च (flashlight) की रोशनी डाल रहे हैं।

  • बीमार आँखों में: फ्लैशलाइट ऑप्टिक डिस्क और कप (आँख का केंद्र) के ऊपर चमकती है, जो ठीक से दिखाती है कि AI ने कहाँ क्षति (जैसे कि पतली होती नर्व) देखी है।
  • स्वस्थ आँखों में: फ्लैशलाइट धीमी या फैली हुई होती है, जो दिखाती है कि AI एक सामान्य, स्वस्थ संरचना देख रहा है।

यह अत्यंत महत्वपूर्ण है क्योंकि यह डॉक्टरों को यह देखने की अनुमति देता है कि AI किस ओर देख रहा है, जिससे यह विश्वास बढ़ता है कि मशीन केवल अनुमान नहीं लगा रही है।

सारांश

शोध पत्र का दावा है कि एक विस्तार-केंद्रित AI को एक बड़ी तस्वीर देखने वाले AI के साथ जोड़कर और उन्हें एक विशेष अटेंशन मैकेनिज्म के माध्यम से एक-दूसरे से "बात" करने की अनुमति देकर, उन्होंने एक ऐसा सिस्टम बनाया है जो अकेले किसी भी AI की तुलना में शुरुआती ग्लूकोमा को पहचानने में बेहतर है। उन्होंने वास्तविक दुनिया के डेटा के मिश्रण पर इसका परीक्षण किया और साबित किया कि यह उच्च सटीकता के साथ काम करता है, जबकि वे डॉक्टरों को यह दिखाने के लिए हीटमैप का भी उपयोग करते हैं कि AI वास्तव में कहाँ देख रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →