Deep neural networks with Fisher vector encoding for medical image classification
यह शोध पत्र विभिन्न डेटासेट आकारों में मेडिकल इमेज क्लासिफिकेशन को बेहतर बनाने के लिए हाइब्रिड CNN-ViT आर्किटेक्चर के साथ फिशर वेक्टर एनकोडिंग को एकीकृत करने का प्रस्ताव देता है, जो एक स्केलेबल GMM एस्टीमेशन पद्धति के माध्यम से कम्प्यूटेशनल सीमाओं को संबोधित करते हुए कई बेंचमार्क पर अत्याधुनिक या प्रतिस्पर्धी परिणाम प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को विभिन्न प्रकार के मेडिकल इमेज (चिकित्सा छवियों) को पहचानना सिखाने की कोशिश कर रहे हैं, जैसे कि एक्स-रे या स्किन स्कैन। रोबोट को यह सीखने की आवश्यकता है कि एक "स्वस्थ" फेफड़े को "बीमार" फेफड़ों से क्या अलग बनाता है, या वह कैसे किसी ऐसे तिल (mole) का पता लगा सकता है जो खतरनाक हो सकता है।
यह शोध पत्र इस तरह से उस रोबोट को सिखाने का एक नया तरीका प्रस्तुत करता है, जिसे विशेष रूप से इस तरह डिज़ाइन किया गया है कि यह तब भी अच्छी तरह काम करे जब आपके पास तस्वीरों का एक छोटा ढेर हो या एक विशाल लाइब्रेरी। यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं (analogies) का उपयोग करते हुए।
समस्या: दो अलग-अलग उपकरण, एक बड़ा संकट
शोधकर्ताओं ने दो शक्तिशाली उपकरणों से शुरुआत की जो AI की दुनिया में लोकप्रिय हैं:
- CNNs (कन्वोल्यूशनल न्यूरल नेटवर्क): इन्हें ऐसे समझें जैसे एक रोबोट की बहुत तेज़, स्थानीय आँखें हों। यह सूक्ष्म विवरणों (जैसे कोशिका की एक विशिष्ट बनावट) को पहचानने में बहुत अच्छा है, लेकिन कभी-कभी यह "बड़ी तस्वीर" को देखने में चूक जाता है क्योंकि यह अपने आस-पास के क्षेत्र पर बहुत अधिक ध्यान केंद्रित कर देता है।
- ViTs (विज़न ट्रांसफॉर्मर्स): इन्हें ऐसे समझें जैसे एक रोबोट की सुपर-वाइड विजन (व्यापक दृष्टि) हो। यह देख सकता है कि छवि के विभिन्न हिस्से वैश्विक स्तर पर एक-दूसरे से कैसे संबंधित हैं। हालाँकि, यह थोड़ा "पेटू" है—इसे सीखने के लिए भोजन (डेटा) की भारी मात्रा की आवश्यकता होती है, और यदि इमेज बहुत बड़ी हों (जैसे उच्च-रिज़ॉल्यूशन वाले मेडिकल स्कैन), तो यह बहुत भ्रमित हो जाता है।
शोधकर्ता इन दोनों को एक हाइब्रिड रोबोट (Hybrid Robot) में मिलाना चाहते थे जिसके पास तेज़ स्थानीय आँखें और व्यापक दृष्टि दोनों हों। लेकिन एक पेच था: जब आप उन्हें मिलाते हैं, तो आपको अभी भी इस बात का एक तरीका चाहिए होगा जिससे रोबोट जो कुछ भी देखता है उसे एक एकल "रिपोर्ट कार्ड" में संक्षेपित किया जा सके ताकि वह अंतिम निर्णय ले सके।
समाधान: "फिशर वेक्टर" रिपोर्ट कार्ड
आमतौर पर, AI मॉडल इमेज को सारांशित करने के लिए एक सरल विधि का उपयोग करते हैं, जैसे कि सब कुछ का औसत लेना (ग्लोबल एवरेज पूलिंग)। लेखकों ने निर्णय लिया कि वे फिशर वेक्टर्स (Fisher Vectors) नामक कुछ बहुत अधिक परिष्कृत चीज़ का उपयोग करेंगे।
उपमा: म्यूजिक फेस्टिवल बनाम प्लेलिस्ट
- मानक विधि (एवरेज पूलिंग): कल्पना कीजिए कि आप एक म्यूजिक फेस्टिवल में हैं। मानक विधि पूछती है, "औसत वॉल्यूम क्या था?" यह एक एकल संख्या देती है। यह तेज़ है, लेकिन इसमें सूक्ष्मता खो जाती है। क्या भीड़ ने शोर मचाया? क्या कोई सोलो प्रदर्शन था? आपको नहीं पता।
- फिशर वेक्टर विधि: यह विधि एक विस्तृत प्लेलिस्ट और भीड़ के मूड की रिपोर्ट बनाने की तरह है। केवल एक औसत लेने के बजाय, यह देखी गई हर एक धुन और सुनी गई हर एक चीख को देखती है। यह एक "मानक" मॉडल के साथ तुलना करती है कि एक सामान्य फेस्टिवल कैसा होता है। यह नोट करती है: "यह गाना सामान्य से अधिक तेज़ था," या "यह शोर सामान्य से अधिक बार हुआ।"
ऐसा करके, रोबोट छवि का एक बहुत समृद्ध, अधिक विस्तृत विवरण बनाता है। यह विशेष रूप से तब सहायक होता है जब आपके पास सीखने के लिए हजारों उदाहरण नहीं होते (चिकित्सा के क्षेत्र में एक आम समस्या, जहाँ लेबल किया गया डेटा प्राप्त करना कठिन और महंगा होता है)।
बाधा: "लाइब्रेरी" की समस्या
बड़े डेटासेट पर इस विस्तृत "फिशर वेक्टर" विधि का उपयोग करने में एक बड़ी समस्या थी। डेटा का एक विस्तृत विवरण बनाने के लिए, AI को सभी देखे गए डेटा का एक जटिल सांख्यिकीय मानचित्र (जिसे गॉसियन मिक्सचर मॉडल या GMM कहा जाता है) बनाना पड़ता है।
उपमा: परेशान लाइब्रेरियन
कल्पना कीजिए कि आप एक लाइब्रेरियन हैं जो एक लाइब्रेरी को व्यवस्थित करने की कोशिश कर रहे हैं।
- यदि आपके पास 100 किताबें हैं, तो आप प्रत्येक को पढ़ सकते हैं और एक सटीक कैटलॉग बना सकते हैं।
- यदि आपके पास 1 करोड़ किताबें हैं, तो एक कैटलॉग बनाने के लिए हर एक को पढ़ने की कोशिश करना बहुत समय लेगा और आपका दिमाग काम करना बंद कर देगा (कंप्यूटेशनल लागत)।
अतीत में, लोगों ने इसे हल करने के लिए अधिकांश किताबों को फेंक देने और केवल कुछ को पढ़ने का प्रयास किया। लेकिन लेखकों को डर था कि इससे उनका कैटलॉग गलत हो सकता है।
नवाचार: "स्मार्ट सैंपल"
लेखकों ने "परेशान लाइब्रेरियन" की समस्या को बिना महत्वपूर्ण जानकारी खोए हल करने के लिए एक चतुर ट्रिक निकाली।
- एंट्रॉपी फ़िल्टर: किताबों को यादृच्छिक (randomly) रूप से चुनने के बजाय, उन्होंने प्रत्येक छवि की "अराजकता" या "सूचना घनत्व" (एंट्रॉपी) को देखा। उन्होंने अपना कैटलॉग बनाने के लिए सबसे दिलचस्प, जटिल छवियों को चुना और उबाऊ, साधारण छवियों को अनदेखा कर दिया।
- परिणाम: उन्होंने पाया कि डेटा के केवल एक छोटे, समझदारी से चुने गए हिस्से (जैसे कुल डेटा का 2%) का उपयोग करके, वे एक ऐसा कैटलॉग बना सकते हैं जो पूरी लाइब्रेरी से बनाए गए कैटलॉग के लगभग समान हो। इसने भारी मात्रा में कंप्यूटिंग पावर बचा ली।
"लॉसलेस स्टिचिंग" (बिना सूचना खोए जोड़ना)
एक और समस्या उत्पन्न हुई क्योंकि हाइब्रिड रोबोट अलग-अलग "ज़ूम स्तरों" (चरणों) पर छवि को देखता है। कुछ दृश्य उच्च-रिज़ॉल्यूशन (कई सूक्ष्म विवरण) वाले होते हैं, और अन्य कम-रिज़ॉल्यूशन (व्यापक आकार) वाले होते हैं।
- पुराना तरीका: उन्हें आपस में मिलाने के लिए, लोग उच्च-रिज़ॉल्यूशन वाले विवरणों को कम-रिज़ॉल्यूशन वाले दृश्य में फिट होने के लिए सिकोड़ देते थे, जिससे बारीक विवरण प्रभावी रूप से नष्ट हो जाते थे।
- नया तरीका: लेखकों ने एक लॉसलेस स्टिचिंग विधि (lossless stitching method) का आविष्कार किया। कल्पना कीजिए कि आपके पास एक बड़ा पहेली (puzzle) है और एक छोटा पहेली है। बड़े वाले को कुचलने के बजाय, उन्होंने बड़े पहेली के टुकड़ों को छोटे, संगत टुकड़ों में तोड़ दिया जो बिना किसी चित्र को खोए छोटे पहेली के साथ पूरी तरह से फिट हो सकें। इसने उन्हें रोबोट के सभी अलग-अलग "दृष्टिकोणों" को एक सुपर-पावरफुल रिपोर्ट में मिलाने की अनुमति दी।
परिणाम: मेडिकल गेम में जीत
टीम ने अपने नए "स्मार्ट रिपोर्ट कार्ड वाले हाइब्रिड रोबोट" का परीक्षण कई मेडिकल इमेज डेटासेट्स पर किया:
- MedMNIST: छोटे, मानकीकृत मेडिकल इमेजेस (जैसे 28x28 पिक्सेल वाले एक्स-रे और सीटी स्कैन) का एक संग्रह।
- रियल-वर्ल्ड टेस्ट्स: त्वचा के घावों (ISIC2018) और कोविड-19 लंग स्कैन्स (Clean-CC-CCII) के बड़े, वास्तविक चित्र।
परिणाम:
- छोटे डेटासेट्स पर, उनके मॉडल ने पिछले सभी रिकॉर्ड्स (benchmarks) को तोड़ दिया। इसने साबित कर दिया कि जब डेटा कम हो, तो "फिशर वेक्टर" दृष्टिकोण एक सुपरपावर है।
- बड़े, वास्तविक दुनिया के डेटासेट्स पर, इसने वर्तमान में उपलब्ध सबसे उन्नत मॉडलों के बराबर या उनसे बेहतर प्रदर्शन किया, बावजूद इसके कि इसमें कम कंप्यूटिंग संसाधनों का उपयोग किया गया था।
सारांश
संक्षेप में, लेखकों ने एक मेडिकल इमेज क्लासिफायर बनाया जो:
- दो AI दुनियाओं (CNNs और ट्रांसफॉर्मर्स) के सर्वश्रेष्ठ गुणों को जोड़ता है।
- छवियों को गहराई से समझने के लिए एक परिष्कृत "विस्तृत रिपोर्ट कार्ड" (फिशर वेक्टर्स) का उपयोग करता है।
- अपने सांख्यिकीय मानचित्र को बनाने के लिए केवल सबसे दिलचस्प छवियों को स्मार्ट तरीके से चुनकर "बहुत अधिक डेटा" की समस्या को हल करता है।
- यह सिद्ध करता है कि टॉप-टियर मेडिकल AI परिणाम प्राप्त करने के लिए आपको एक विशाल सुपरकंप्यूटर की आवश्यकता नहीं है; आपको बस अपने पास मौजूद डेटा को व्यवस्थित करने का एक स्मार्ट तरीका चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।