← नवीनतम पेपर
💻 computer science

A multifractal-based masked auto-encoder: an application to medical images

यह शोध पत्र मल्टीफ्रैक्टल-ऑप्टिमाइज्ड मास्कड ऑटोएनकोडर (MO-MAE) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो रेनी एंट्रॉपी (Renyi entropy) का उपयोग करके मास्किंग रणनीति को नैदानिक रूप से महत्वपूर्ण, उच्च-जटिलता वाले क्षेत्रों की ओर निर्देशित करता है, जिससे मौजूदा मॉडलों की तुलना में न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ चिकित्सा छवि वर्गीकरण को बढ़ाते हुए बेहतर प्रदर्शन प्राप्त किया जाता है।

मूल लेखक: Joao Batista Florindo, Viviane de Moura

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Joao Batista Florindo, Viviane de Moura

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र को चित्रों के माध्यम से विभिन्न प्रकार के फलों को पहचानना सिखाने की कोशिश कर रहे हैं।

पुराना तरीका (पारंपरिक AI):
आमतौर पर, जब हम किसी AI को मेडिकल इमेज (जैसे एक्स-रे या स्किन स्कैन) समझने के लिए प्रशिक्षित करते हैं, तो हम "मास्क्ड ऑटोएनकोडर" (Masked Autoencoder) नामक एक विधि का उपयोग करते हैं। इसे एक खेल की तरह समझें जहाँ आप फल की तस्वीर के यादृच्छिक (random) हिस्सों को काले वर्ग (black square) से ढक देते हैं और छात्र से अनुमान लगाने के लिए कहते हैं कि उसके नीचे क्या है।

  • समस्या: यदि आप एक केले के किसी यादृच्छिक हिस्से को ढक देते हैं, तो आप शायद एक छोटा, महत्वपूर्ण भूरा धब्बा छिपा सकते हैं जो यह बताता है कि वह अधिक पका हुआ है। लेकिन यदि आप एक सादे सफेद बैकग्राउंड के किसी यादृच्छिक हिस्से को ढक देते हैं, तो इससे ज्यादा फर्क नहीं पड़ता। पारंपरिक AI छवि के हर हिस्से के साथ एक जैसा व्यवहार करता है, इसलिए यह खाली स्थान के बारे में सीखने में समय बर्बाद कर सकता है जबकि वह उन सूक्ष्म, महत्वपूर्ण विवरणों को मिस कर सकता है जो वास्तव में बीमारी का निदान करते हैं।

नया तरीका (पेपर का समाधान):
इस पेपर के लेखक, जोआओ बातिस्ता फ्लोरिंडो (Joao Batista Florindo) और विवियन डी मौरा (Viviane de Moura) ने इस खेल को खेलने का एक स्मार्ट तरीका निकाला है। वे इस नए सिस्टम को MO-MAE कहते हैं।

यादृच्छिक स्थानों को ढकने के बजाय, वे एक विशेष गणितीय उपकरण का उपयोग करते हैं जिसे मल्टीफ्रैक्टल एनालिसिस (Multifractal Analysis) (विशेष रूप से रेनी एंट्रॉपी - Renyi entropy) कहा जाता है, जो एक "जटिलता डिटेक्टर" (complexity detector) के रूप में कार्य करता है।

उपमा: "व्यस्त" बनाम "शांत" पड़ोस
कल्पना कीजिए कि मेडिकल इमेज एक शहर का नक्शा है।

  • कुछ क्षेत्र शांत उपनगरों की तरह हैं जिनमें खाली खेत हैं (ये एक्स-रे के महत्वहीन हिस्से हैं, जैसे फेफड़ों के आसपास का खाली स्थान)।
  • अन्य क्षेत्र व्यस्त शहर के केंद्रों की तरह हैं जिनमें भीड़भाड़ वाली सड़कें, ऊंची इमारतें और जटिल ट्रैफिक पैटर्न हैं (ये जटिल ऊतक संरचनाएं हैं जहाँ बीमारियां छिपी होती हैं)।

पुराना AI नक्शे के यादृच्छिक ब्लॉक को ढक देता था, कभी शांत उपनगरों को ढक देता था तो कभी शहर के केंद्र को।
MO-MAE सिस्टम पहले नक्शे को देखता है और कहता है, "हे, यह शहर का केंद्र बहुत जटिल और सूचना से भरा है! चलिए इसे ढक देते हैं और छात्र को इसे समझने के लिए मजबूर करते हैं।"

यह कैसे काम करता है (चरण-दर-चरण):

  1. पाई काटना: AI मेडिकल इमेज को कई छोटे-छोटे चौकोर टुकड़ों (patches) में काटता है।
  2. जटिलता की जाँच: यह "जटिलता डिटेक्टर" का उपयोग करके प्रत्येक टुकड़े में कितनी "सूचना" या "बनावट" (texture) है, इसे मापता है। उच्च जटिलता का अर्थ है कि वह टुकड़ा महत्वपूर्ण होने की संभावना है (जैसे ट्यूमर या एक विशिष्ट ऊतक पैटर्न)।
  3. स्मार्ट मास्किंग: यह जानबूझकर सबसे जटिल टुकड़ों को छिपा देता है।
  4. पुनर्निर्माण (Reconstruction): AI को शेष दृश्यमान टुकड़ों को देखकर उन छिपे हुए, जटिल हिस्सों को वापस "पेंट" करने की कोशिश करनी होती है। क्योंकि इसे सबसे कठिन पहेलियों को हल करने के लिए मजबूर किया जाता है, इसलिए यह छवि के सबसे महत्वपूर्ण विवरणों को बहुत बेहतर तरीके से समझना सीख जाता है।
  5. परिणाम: जब AI का परीक्षण वास्तविक रोगियों पर किया जाता है, तो यह बीमारियों का पता लगाने में बहुत बेहतर होता है क्योंकि इसने अपना प्रशिक्षण समय छवि के "खाली खेतों" पर नहीं, बल्कि उसके "व्यस्त शहर के केंद्रों" पर केंद्रित किया।

उन्होंने क्या पाया:
शोधकर्ताओं ने इस नई विधि का परीक्षण दो मुख्य चीजों पर किया:

  • MedMNIST: 708,000 अलग-अलग मेडिकल इमेजेस (जैसे स्किन स्कैन, आई स्कैन और ब्लड सेल्स) का एक विशाल संग्रह।
  • COVID-CT: COVID-19 का पता लगाने के लिए CT स्कैन का एक सेट।

निर्णय:
इस नए "स्मार्ट मास्किंग" सिस्टम (MO-MAE) ने कई अन्य टॉप-टियर AI मॉडल्स की तुलना में बेहतर काम किया। यह विशेष रूप रूप से उन कठिन छवियों को संभालने में अच्छा था जहाँ विवरण बहुत सूक्ष्म होते हैं।

  • इसे काम करने के लिए किसी विशाल, धीमे कंप्यूटर प्रोग्राम की आवश्यकता नहीं थी; यह कुशल था।
  • इसने सटीकता में कई अन्य प्रसिद्ध AI मॉडल्स (जैसे ResNet और MedVIT) को पीछे छोड़ दिया।
  • यह तब भी अच्छी तरह से काम करता है जब प्रशिक्षण के लिए लेबल किए गए डेटा की भारी मात्रा उपलब्ध नहीं होती, जो कि चिकित्सा के क्षेत्र में एक आम समस्या है।

संक्षेप में:
यह पेपर एक ऐसा तरीका पेश करता है जिससे AI मेडिकल इमेज के सबसे जटिल और महत्वपूर्ण हिस्सों पर "ध्यान केंद्रित" कर सके, प्रशिक्षण के दौरान उन्हीं विशिष्ट हिस्सों को छिपाकर। सबसे कठिन सेक्शन को फिर से बनाने (reconstruct करने) के लिए मजबूर करके, यह अधिक सटीक डायग्नोस्टिशियन बनने के लिए सीखता है, जिसके लिए अतिरिक्त जटिल हार्डवेयर या भारी मात्रा में डेटा की आवश्यकता नहीं होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →