← नवीनतम पेपर
🤖 AI

Comparative Analysis of Deep Learning Architectures for Multi-Disease Classification of Single-Label Chest X-rays

यह अध्ययन 18,080 चेस्ट एक्स-रे के एक संतुलित डेटासेट पर सात डीप लर्निंग आर्किटेक्चर का व्यवस्थित रूप से मूल्यांकन करता है, जो यह प्रदर्शित करता है कि ConvNeXt-Tiny उच्चतम सटीकता (92.31%) प्राप्त करता है जबकि MobileNetV2 सर्वोत्तम पैरामीटर दक्षता प्रदान करता है, जिसमें सभी मॉडलों ने 90% से अधिक सटीकता प्रदर्शित की है और ट्यूबरकुलोसिस तथा कोविड-19 वर्गीकरण के लिए लगभग पूर्ण प्रदर्शन दिखाया है।

मूल लेखक: Ali M. Bahram, Saman Muhammad Omer, Hardi M. Mohammed

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ali M. Bahram, Saman Muhammad Omer, Hardi M. Mohammed

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया जहाँ डॉक्टर के फेफड़ों और हृदय की जाँच करने का सबसे शक्तिशाली उपकरण एक साधारण एक्स-रे तस्वीर है। यह सस्ता, तेज़ और हर जगह उपलब्ध है। लेकिन यहाँ एक पेंच है: इन तस्वीरों को पढ़ना कठिन है। इसके लिए एक अत्यधिक प्रशिक्षित विशेषज्ञ (रेडियोलॉजिस्ट) की आवश्यकता होती है, और विशेषज्ञों से भी गलतियाँ हो सकती हैं या वे आपस में असहमत हो सकते हैं। दुनिया के कई हिस्सों में, विशेषज्ञों की संख्या पर्याप्त नहीं है।

यह शोध पत्र सात अलग-अलग "AI शेफ" (कंप्यूटर प्रोग्राम) के बीच एक भव्य स्वाद प्रतियोगिता (grand tasting competition) की तरह है, यह देखने के लिए कि कौन सा एक्स-रे तस्वीरों को पढ़कर पाँच अलग-अलग समस्याओं का निदान करने में सबसे अच्छा है: बढ़ा हुआ हृदय (enlarged heart), कोविड-19, सामान्य फेफड़े, निमोनिया और तपेदिक (tuberculosis)।

यहाँ बताया गया है कि उन्होंने क्या किया और उन्हें क्या मिला, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए।

1. सेटअप: एक निष्पक्ष खेल का मैदान बनाना

दौड़ शुरू होने से पहले, शोधकर्ताओं को "सामग्री" (डेटा) के साथ एक बड़ी समस्या को ठीक करना था।

  • समस्या: उनके पास "सामान्य" एक्स-रे का एक विशाल ढेर था (जैसे कि 60,000 सेबों का ढेर) लेकिन बीमार लोगों की बहुत कम तस्वीरें थीं (जैसे केवल 1,000 संतरे)। यदि आप एक शेफ को ज्यादातर सेबों के साथ प्रशिक्षित करते हैं, तो वह हर बार "सेब" का अनुमान लगाएगा और उच्च स्कोर प्राप्त करेगा, लेकिन जब कोई संतरा सामने आएगा तो वह विफल हो जाएगा।
  • समाधान: उन्होंने "तराजू को संतुलित करने" (Balancing the Scale) नामक तकनीक का उपयोग किया। उन्होंने "सामान्य" तस्वीरों का एक बड़ा हिस्सा निकाल दिया (जैसे कुछ सेबों को एक बॉक्स में रखना) और एक डिजिटल "फोटोकॉपीयर" (डेटा ऑग्मेंटेशन) का उपयोग करके बीमार रोगियों की अधिक तस्वीरें बनाईं। अब, उनके पास हर बीमारी के लिए तस्वीरों की समान संख्या थी। इसने सुनिश्चित किया कि AI ने केवल बीमारी की कमी को नहीं, बल्कि बीमारी को पहचानना सीखा।

2. प्रतियोगी: सात अलग-अलग AI वास्तुकार

उन्होंने सात प्रसिद्ध AI मॉडलों को प्रतिस्पर्धा के लिए आमंत्रित किया। इन्हें अलग-अलग प्रकार के जासूसों के रूप में सोचें, जिनमें से प्रत्येक की सुरागों को देखने की एक अनूठी शैली है:

  1. पुराने भरोसेमंद (ResNet50, DenseNet121/201): ये अनुभवी जासूसों की तरह हैं। वे वर्षों से मौजूद हैं, बहुत विस्तृत हैं और उनका एक सिद्ध ट्रैक रिकॉर्ड है।
  2. गतिमान (MobileNetV2): यह हल्का जासूस है। यह छोटा, तेज़ है और स्मार्टफोन पर चलाने के लिए डिज़ाइन किया गया है। यह एक स्काउट की तरह है जो बिना भारी बैकपैक के तेजी से पहाड़ पर चढ़ सकता है।
  3. आधुनिकतावादी (ConvNeXt-Tiny, EfficientNet): ये नए खिलाड़ी हैं। वे पुराने जासूसों के बेहतरीन विचारों को लेते हैं और उन्हें नई, हाई-टेक गैजेट्स के साथ मिलाते हैं। वे गति और बुद्धिमत्ता का एक आदर्श मिश्रण बनने की कोशिश कर रहे हैं।
  4. दूरदर्शी (ViT-B/16): यह "ट्रांसफॉर्मर" जासूस है। एक-एक करके सुरागों को देखने के बजाय, यह बड़े संदर्भ को समझने के लिए एक ही बार में पूरी तस्वीर को देखता है। यह एक ऐसे जासूस की तरह है जो एक भी उंगली के निशान को देखने से पहले पूरे अपराध स्थल की रिपोर्ट पढ़ लेता है। हालाँकि, यह सबसे भारी और चलाने में सबसे महंगा भी है।

3. दौड़: उनका प्रदर्शन कैसा रहा

सभी सात जासूसों को बिल्कुल समान प्रशिक्षण, समान परीक्षण प्रश्न और समान नियम दिए गए। यहाँ बताया गया है कि वे कैसे रहे:

  • स्वर्ण पदक विजेता (ConvNeXt-Tiny): इस मॉडल ने सटीकता (accuracy) के लिए दौड़ जीती। इसने लगभग 92% बार सही उत्तर दिया। इसने साबित कर दिया कि आपको सबसे बड़ा या सबसे पुराना जासूस होने की आवश्यकता नहीं है; आपको बस सही आधुनिक उपकरणों की आवश्यकता है।
  • उपविजेता (ResNet50 और DenseNet): अनुभवी जासूस दूसरे और तीसरे स्थान के बहुत करीब आए। वे अविश्वसनीय रूप से विश्वसनीय थे, जिससे सिद्ध हुआ कि "पुराने स्कूल" के तरीके अभी भी बहुत मजबूत हैं।
  • दक्षता चैंपियन (MobileNetV2): यह वास्तविक दुनिया के लिए सबसे महत्वपूर्ण खोज है। हालांकि यह पूर्ण स्कोर प्राप्त करने में बिल्कुल सबसे तेज़ नहीं था, लेकिन यह सबसे कुशल था।
    • उपमा: कल्पना कीजिए कि स्वर्ण पदक विजेता एक फेरारी है। यह तेज़ और सटीक है, लेकिन यह बहुत अधिक ईंधन पीती है और इसके रखरखाव में बहुत खर्च आता है। MobileNetV2 एक हाइब्रिड टोयोटा प्रियस (Toyota Prius) है। यह आपको लगभग उतनी ही जल्दी गंतव्य तक पहुँचा देता है (90%+ सटीकता), लेकिन यह 87% कम ईंधन (कंप्यूटर पावर) का उपयोग करता है और एक छोटे गैरेज में फिट हो जाता है (फोन पर चलता है)।
    • यह क्यों मायने रखता है: एक दूरदराज के गाँव में जहाँ इंटरनेट या महंगे कंप्यूटर नहीं हैं, आप फेरारी नहीं चला सकते। आपको प्रियस की आवश्यकता है। यह मॉडल दिखाता है कि आप बिना सुपरकंप्यूटर के भी उत्कृष्ट परिणाम प्राप्त कर सकते हैं।

4. कमजोर कड़ियाँ: जहाँ AI भ्रमित हो गया

सबसे अच्छे जासूस भी गलतियाँ करते हैं। AI तपेदिक (Tuberculosis) और कोविड-19 को पहचानने में लगभग सटीक था (जैसे सफेद कमरे में एक चमकीले लाल फायर हाइड्रेंट को पहचानना)।

हालाँकि, इसे कुछ मामलों में संघर्ष करना पड़ा:

  • सामान्य बनाम बढ़ा हुआ हृदय: कभी-कभी हृदय थोड़ा बड़ा दिखता है, लेकिन क्या वह वास्तव में बीमार है? यह एक अस्पष्ट क्षेत्र है, यहाँ तक कि मानव डॉक्टरों के लिए भी।
  • सामान्य बनाम निमोनिया: शुरुआती निमोनिया एक धुंधले धब्बे जैसा दिख सकता है जो शायद केवल एक छाया हो।
  • सबक: AI विफल नहीं हो रहा है; यह उसी अस्पष्टता का सामना कर रहा है जिसका सामना मानव डॉक्टर करते हैं। यह कोई बग नहीं है; यह मानव शरीर की जटिलता का एक हिस्सा है।

5. "एक्स-रे विजन" जाँच (Grad-CAM)

यह सुनिश्चित करने के लिए कि AI केवल बेतरतीब ढंग से अनुमान नहीं लगा रहा है, शोधकर्ताओं ने Grad-CAM नामक उपकरण का उपयोग किया। इसे एक्स-रे पर एक चमकते हाइलाइटर लगाने के रूप में सोचें जो यह दिखाता है कि AI कहाँ देख रहा था।

  • जब इसने "निमोनिया" कहा, तो हाइलाइटर फेफड़ों के संक्रमित हिस्से पर चमक उठा।
  • जब इसने "बढ़ा हुआ हृदय" कहा, तो यह हृदय की सीमा पर चमका।
  • इसने साबित किया कि AI वास्तव में बीमारी को "देख" रहा था, न कि केवल पृष्ठभूमि के आधार पर अनुमान लगा रहा था।

मुख्य निष्कर्ष

इस शोध पत्र का मुख्य संदेश आशा और व्यावहारिकता है।

हम सोचते थे कि एक सुपर-स्मार्ट मेडिकल AI प्राप्त करने के लिए, आपको एक विशाल, महंगे सुपरकंप्यूटर और एक विशाल, पूर्ण डेटासेट की आवश्यकता होती है। यह अध्ययन दिखाता है कि आपको इसकी आवश्यकता नहीं है।

आप एक ऐसा सिस्टम बना सकते हैं जो सबसे अच्छे सुपर-कंप्यूटर के लगभग उतना ही सटीक हो, लेकिन इतना छोटा हो कि एक लैपटॉप या फोन पर चल सके। इसका मतलब है कि भविष्य में, एक दूरदराज के क्लिनिक में एक नर्स एक एक्स-रे ले सकती है, उसे एक हल्के ऐप (जैसे MobileNetV2) के माध्यम से चला सकती है, और सेकंडों में एक अत्यधिक सटीक निदान प्राप्त कर सकती है, जिससे उन जगहों पर जीवन बचाया जा सकता है जहाँ डॉक्टरों की कमी है।

संक्षेप में: हमने "गोल्डीलॉक्स" (Goldilocks) AI खोज लिया है—न बहुत बड़ा, न बहुत छोटा, बल्कि हर जगह जीवन बचाने के लिए बिल्कुल सही।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →