← नवीनतम पेपर
🤖 machine learning

Structure is Supervision: Multiview Masked Autoencoders for Radiology

यह शोध पत्र मल्टीव्यू मास्क ऑटोएनकोडर्स (MVMAE) और इसके टेक्स्ट-एन्हांस्ड वेरिएंट (MVMAE-V2T) को प्रस्तुत करता है, जो कि सेल्फ-सुपरवाइज्ड फ्रेमवर्क हैं जो क्लिनिकल डेटा की प्राकृतिक मल्टी-व्यू संरचना और रेडियोलॉजी रिपोर्ट्स का लाभ उठाकर मजबूत, रोग-प्रासंगिक रिप्रजेंटेशन्स सीखने के लिए डिज़ाइन किए गए हैं, जो मेडिकल इमेज क्लासिफिकेशन में मौजूदा सुपरवाइज्ड और विजन-लैंग्वेज बेसलाइन्स से बेहतर प्रदर्शन करते हैं।

मूल लेखक: Sonia Laguna, Andrea Agostini, Alain Ryser, Samuel Ruiperez-Campillo, Irene Cannistraci, Moritz Vandenhirtz, Stephan Mandt, Nicolas Deperrois, Farhad Nooralahzadeh, Michael Krauthammer, Thomas M. Sutt
प्रकाशित 2026-04-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sonia Laguna, Andrea Agostini, Alain Ryser, Samuel Ruiperez-Campillo, Irene Cannistraci, Moritz Vandenhirtz, Stephan Mandt, Nicolas Deperrois, Farhad Nooralahzadeh, Michael Krauthammer, Thomas M. Sutter, Julia E. Vogt

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को छाती का एक्स-रे (chest X-ray) पढ़ना सिखाने की कोशिश कर रहे हैं, ठीक वैसे ही जैसे एक डॉक्टर करता है। आमतौर पर, कंप्यूटर को सिखाने के लिए आपको हजारों डॉक्टरों की आवश्यकता होती है जो तस्वीरों को देखकर कहें, "इसमें निमोनिया है," या "यह साफ है।" लेकिन डॉक्टर व्यस्त होते हैं, और हजारों छवियों को लेबल करना महंगा और धीमा होता है।

यह पेपर पेश करता है कि कैसे एक कंप्यूटर को हर तस्वीर को लेबल करने के लिए डॉक्टर की आवश्यकता के बिना सिखाया जा सकता है। इसके बजाय, यह वास्तविक दुनिया में एक्स-रे लेने के स्वाभाविक ढांचे का उपयोग एक "मुफ्त शिक्षक" के रूप में करता है।

यहाँ उनके विचार का विवरण दिया गया, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है:

1. समस्या: "एकल फोटो" वाली गलती

अतीत में, AI मॉडल हर एक्स-रे को एक पूरी तरह से अलग, अलग-थलग फोटो के रूप में देखते थे।

  • उपमा: कल्पना कीजिए कि आप एक घर को कैसा दिखता है, यह सीखने की कोशिश कर रहे हैं। यदि आप केवल दरवाजे की एक फोटो देखते हैं, तो आपको लग सकता है कि घर सिर्फ एक दरवाजा है। यदि आप पीछे के बरामदे की फोटो देखते हैं, तो आपको लग सकता है कि यह सिर्फ एक बरामदा है। आप बड़े चित्र को नहीं देख पाते क्योंकि आप बिंदुओं को जोड़ नहीं पाते।
  • रेडियोलॉजी में: एक मरीज की जांच में अक्सर कई कोण शामिल होते हैं (एक सामने का दृश्य और एक बगल का दृश्य) और एक लिखित रिपोर्ट होती है। पिछले AI मॉडल इस तथ्य को अनदेखा कर देते थे कि ये दृश्य एक ही मरीज और एक ही शरीर के हैं। उन्होंने सामने के दृश्य और बगल के दृश्य को ऐसे माना जैसे वे दो अलग-अलग लोग हों।

2. समाधान: MVMAE (द "पज़ल मास्टर")

लेखकों ने MVMAE (मल्टीव्यू मास्कड ऑटोएनकोडर) नामक एक प्रणाली बनाई है। इसे एक सुपर-स्मार्ट पज़ल मास्टर के रूप में सोचें।

  • यह कैसे काम करता है:

    1. द मास्क (The Mask): AI एक एक्स-रे लेता है और उसका अधिकांश हिस्सा ढक देता है (मास्क कर देता है), जैसे किसी पहेली के 90% हिस्से पर पट्टी बांध देना।
    2. अनुमान (The Guess): यह अनुमान लगाने की कोशिश करता है कि छिपे हुए हिस्से कैसे दिखते हैं, उन छोटे हिस्सों के आधार पर जिन्हें वह देख सकता है।
    3. सीक्रेट वेपन (क्रॉस-व्यू अलाइनमेंट): यहाँ जादू है। AI एक मरीज के सीने के सामने के दृश्य को देखता है, उसे ढक देता है, और गायब हिस्सों का अनुमान लगाने की कोशिश करता है। लेकिन यह उसी मरीज के बगल के दृश्य को भी देखता है।
    4. पाठ (The Lesson): यह सीखता है कि भले ही सामने और बगल के दृश्य अलग दिखते हों, वे एक ही हृदय और फेफड़ों का वर्णन कर रहे हैं। यदि सामने के दृश्य में दिल बड़ा है, तो बगल के दृश्य में भी दिल बड़ा ही दिखना चाहिए, बस एक अलग कोण से।
  • उपमा: कल्पना कीजिए कि आप यह सीखने की कोशिश कर रहे हैं कि बिल्ली कैसी दिखती है। इसके बजाय कि आप केवल बिल्ली के चेहरे की फोटो को देखते रहें, आपको बिल्ली के चेहरे और बिल्ली की पीठ की फोटो दिखाई जाती है। AI सीखता है: "आह, बैक फोटो पर मौजूद रोएँदार पूंछ उसी जानवर की है जिसका चेहरा फोटो में दिख रहा है।" यह केवल पिक्सेल को नहीं, बल्कि जीव की संरचना (structure) को सीखता है।

इन विभिन्न कोणों को जोड़ने के लिए मजबूर करके, यह बिना किसी इंसान के यह कहे कि "यह एक हृदय है," शरीर रचना विज्ञान (anatomy) की बहुत गहरी और मजबूत समझ विकसित करता है।

3. अपग्रेड: MVMAE-V2T (द "ट्रांसलेटर")

लेखकों ने MVMAE-V2T नामक एक दूसरा फीचर जोड़ा है। यह डॉक्टरों द्वारा लिखी गई लिखित रिपोर्ट (जैसे, "फेफड़े साफ हैं, हृदय सामान्य है") का उपयोग प्रशिक्षण के दौरान एक बोनस संकेत के रूप में करता है।

  • यह कैसे काम करता है: AI एक्स-रे को देखता है और डॉक्टर की रिपोर्ट के शब्दों को "अनुमानित" (predict) करने की कोशिश करता है।
  • कैच (The Catch): AI केवल प्रशिक्षण के दौरान सीखने के लिए टेक्स्ट का उपयोग करता है। जब बाद में अस्पताल में इसका वास्तव में उपयोग किया जाता है, तो यह केवल एक्स-रे को देखता है। इसे निदान करने के लिए टेक्स्ट की आवश्यकता नहीं होती है।
  • उपमा: इसे एक छात्र की तरह सोचें जो परीक्षा के लिए पढ़ाई कर रहा है।
    • स्टैंडर्ड AI: केवल पाठ्यपुस्तक (एक्स-रे) का अध्ययन करता है।
    • MVMAE-V2T: पाठ्यपुस्तक का अध्ययन करता है और साथ ही पढ़ाई करते समय शिक्षक द्वारा अवधारणाओं को समझाने (रिपोर्ट) को भी सुनता है।
    • परिणाम: जब परीक्षा आती है (वास्तविक निदान), तो छात्र के पास केवल पाठ्यपुस्तक होती है, लेकिन क्योंकि उसने पहले शिक्षक की बात सुनी थी, इसलिए वह अवधारणाओं को बहुत बेहतर तरीके से समझता है, खासकर यदि उसके पास हर एक पन्ने को पढ़ने के लिए पर्याप्त समय नहीं था (लो-लेबल परिदृश्य)।

4. यह क्यों महत्वपूर्ण है

शोधकर्ताओं ने परीक्षण के लिए एक्स-रे के तीन विशाल डेटाबेस (MIMIC-CXR, CheXpert, और PadChest) का उपयोग किया।

  • विशेषज्ञों से बेहतर: उनका मॉडल अन्य अत्याधुनिक AI मॉडलों को भी पछाड़ गया, जिनमें भारी मात्रा में टेक्स्ट और इमेज के साथ प्रशिक्षित मॉडल शामिल थे।
  • कम डेटा की आवश्यकता: यह तब भी अविश्वसनीय रूप से अच्छा काम करता है जब लेबल किए गए उदाहरण बहुत कम हों (जो अस्पतालों में आम है)।
  • अधिक भरोसेमंद: मॉडल ने केवल अनुमान नहीं लगाया; वह अपने सही उत्तरों में अधिक आत्मविश्वासी था और गलत होने की संभावना कम थी।

मुख्य निष्कर्ष

यह पेपर तर्क देता है कि संरचना ही पर्यवेक्षण (structure is supervision) है।

अतीत में, AI शोधकर्ताओं को लगा कि स्मार्ट मेडिकल AI बनाने के लिए उन्हें अरबों लेबल की गई छवियों की आवश्यकता है। यह पेपर कहता है: "नहीं, आपको अधिक लेबल की आवश्यकता नहीं है। आपको बस चिकित्सा छवियों को यादृच्छिक, अलग-थलग फोटो के रूप में देखना बंद करने की आवश्यकता है। यदि आप AI को यह सिखाते हैं कि सामने का दृश्य और बगल का दृश्य एक ही सिक्के के दो पहलू हैं, तो AI अपने आप एक बेहतर डॉक्टर बनना सीख जाता है।"

यह किसी को किसी दोस्त को पहचानने के लिए केवल एक विशिष्ट फोटो याद करने के बजाय, यह समझने के तरीके से सिखाने जैसा है कि उनका चेहरा, उनकी आवाज़ और उनकी चाल सभी एक ही व्यक्ति के हैं। एक बार जब AI उस संरचना को समझ लेता है, तो यह अविश्वसनीय रूप से शक्तिशाली हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →