← नवीनतम पेपर
🤖 AI

Deep Multimodal Learning with Missing Modality: A Survey

यह सर्वेक्षण मिसिंग मोडैलिटी के साथ मल्टीमॉडल लर्निंग (MLMM) के लिए डीप लर्निंग विधियों की पहली व्यापक समीक्षा प्रदान करता है, जो इसके उद्देश्यों, मानक सेटअपों से अंतर, वर्तमान तकनीकों, अनुप्रयोगों, डेटासेट और भविष्य की चुनौतियों का विस्तृत विवरण देता है।

मूल लेखक: Renjie Wu, Hu Wang, Hsiang-Ting Chen, Gustavo Carneiro

प्रकाशित 2026-02-05
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Renjie Wu, Hu Wang, Hsiang-Ting Chen, Gustavo Carneiro

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "पांच इंद्रियों" की समस्या

कल्पना कीजिए कि आप एक फिल्म समझने की कोशिश कर रहे हैं। आमतौर पर, आपके पास दो मुख्य इनपुट होते हैं: देखना (वीडियो) और सुनना (संवाद और संगीत)। यह एक "मल्टीमॉडल" सिस्टम की तरह है—यह पूरी कहानी को समझने के लिए कई इंद्रियों का उपयोग करता है।

हालाँकि, वास्तविक दुनिया में चीजें खराब हो जाती हैं। शायद आपके स्पीकर टूट गए हों (कोई आवाज़ नहीं), या स्क्रीन काली पड़ गई हो (कोई वीडियो नहीं)। शायद आप एक धुंधले जंगल में हैं जहाँ आप देख नहीं सकते, लेकिन आप एक सरसराहट सुन सकते हैं। यह मिसिंग मोडैलिटी (Missing Modality) की समस्या है।

अधिकांश AI मॉडल उन छात्रों की तरह हैं जो केवल तभी पढ़ाई करना जानते हैं जब उनके पास उनकी पाठ्यपुस्तक और उनके ऑडियो नोट्स दोनों हों। यदि आप एक भी चीज़ हटा देते हैं, तो वे घबरा जाते हैं और असफल हो जाते हैं। यह सर्वे पेपर शोधकर्ताओं के लिए एक व्यापक मार्गदर्शिका है कि AI को कैसे सिखाया जाए कि एक "इंद्रिय" खो जाने पर भी शांत रहना और अच्छा प्रदर्शन करना।

यह पेपर किस बारे में है?

यह पेपर एक सर्वे (Survey) है। इसे एक ऐसे लाइब्रेरियन के रूप में समझें जिसने इस विशिष्ट विषय पर 2012 से 2025 के बीच लिखी गई हर एक किताब (354 पेपर!) पढ़ी है। लेखक, रेनजी वू और उनकी टीम ने इन सभी अलग-अलग समाधानों को एक स्पष्ट मानचित्र में व्यवस्थित किया है ताकि शोधकर्ताओं को पता चल सके कि क्या काम करता है, क्या नहीं करता है, और आगे कहाँ जाना है।

वे इस क्षेत्र को MLMM (मल्टीमॉडल लर्निंग विद मिसिंग मोडैलिटी) कहते हैं।

दो मुख्य रणनीतियाँ: "डेटा को ठीक करना" बनाम "दिमाग को ठीक करना"

लेखक सभी समाधानों को दो बड़े समूहों में विभाजित करते हैं, जैसे टूटी हुई कार को या तो पुर्जों की मरम्मत करके या ड्राइवर के चलाने के तरीके को बदलकर ठीक करना।

1. डेटा प्रोसेसिंग: "पुर्जों को ठीक करना"

यह दृष्टिकोण AI के सोचने शुरू करने से पहले ही गायब जानकारी को भरने की कोशिश करता है।

  • "खाली पन्ना" विधि (मोडैलिटी कंपोजिशन): कल्पना कीजिए कि आप एक किताब पढ़ रहे हैं, लेकिन एक पन्ना फटा हुआ है। आप उस खाली जगह को बस एक सफेद खाली स्थान (जीरो) के रूप में छोड़ सकते हैं या उस पर कुछ भी बेतरतीब ढंग से लिख सकते हैं (रैंडम वैल्यूज)। AI उस खाली स्थान को अनदेखा करना और बाकी चीज़ों पर ध्यान केंद्रित करना सीख जाता है। यह सरल है, लेकिन बहुत स्मार्ट नहीं है।
  • "कॉपी-पेस्ट" विधि (रिट्रीवल): यदि कोई पन्ना गायब है, तो आप लाइब्रेरी में उसी किताब की अन्य कॉपियां देखते हैं, मिलान वाला पन्ना ढूंढते हैं, और उसे वहां पेस्ट कर देते हैं। यह तब अच्छा काम करता है जब किताबें बिल्कुल एक जैसी हों, लेकिन यदि कहानियाँ थोड़ी अलग हैं, तो आप गलत दृश्य पेस्ट कर सकते हैं।
  • "कल्पना" विधि (मोडैलिटी जनरेशन): यह सबसे उन्नत है। AI एक रचनात्मक लेखक की तरह काम करता है। यदि ऑडियो गायब है, तो AI वीडियो को देखता है और कल्पना करता है कि ध्वनि कैसी होनी चाहिए, और फिर उसे बनाता है। यह जादूगर द्वारा टोपी से खरगोश निकालने जैसा है। पेपर नोट करता है कि हालांकि यह शानदार है, लेकिन कभी-कभी यह "हैलुसिनेट" (ऐसी चीजें बनाना जो सच नहीं हैं) कर सकता है।

2. स्ट्रैटेजी डिज़ाइन: "दिमाग को ठीक करना"

गायब डेटा को ठीक करने के बजाय, यह दृष्टिकोण AI के आर्किटेक्चर को बदल देता है ताकि वह स्वाभाविक रूप से गायब डेटा को संभाल सके।

  • "स्पॉटलाइट" विधि (अटेंशन): कक्षा में एक शिक्षक की कल्पना करें। यदि एक छात्र अनुपस्थित है, तो शिक्षक पाठ नहीं रोकता; वे बस अपना स्पॉटलाइट उन छात्रों पर केंद्रित कर देते हैं जो वहाँ मौजूद हैं। "अटेंशन" तंत्र AI को गतिशील रूप से केवल उपलब्ध डेटा पर ध्यान केंद्रित करने और गायब हिस्सों को अनदेखा करने की अनुमति देता है।
  • "ट्यूटर" विधि (डिस्टिलेशन): एक बुद्धिमान छात्र (शिक्षक) की कल्पना करें जिसके पास सभी किताबें हैं। एक कम बुद्धिमान छात्र (विद्यार्थी) के पास केवल आधी किताबें हैं। शिक्षक विद्यार्थी को गायब अध्यायों को समझाते हैं। विद्यार्थी पूरी कहानी को बिना भौतिक पुस्तक के भी समझने में सक्षम हो जाता है।
  • "टीमवर्क" विधि (मॉडल कॉम्बिनेशन): एक विशाल AI के बजाय, आपके पास विशेषज्ञों की एक टीम है। यदि वीडियो गायब है, तो आप "ऑडियो विशेषज्ञ" से पूछते हैं। यदि ऑडियो गायब है, तो आप "वीडियो विशेषज्ञ" से पूछते हैं। वे उत्तर देने के लिए मिलकर वोट करते हैं।
  • "सुपर-ब्रेन" (लार्ज लैंग्वेज मॉडल्स): हाल ही में, विशाल AI मॉडल (जैसे चैटबॉट्स को चलाने वाले) इतने स्मार्ट हो गए हैं कि वे टेक्स्ट, इमेज और साउंड को एक साथ समझ सकते हैं। वे इतने लचीले हैं कि यदि आप एक इनपुट हटा भी दें, तो भी वे अनुकूलित हो जाते हैं और चलते रहते हैं, लगभग एक ऐसे इंसान की तरह जो तस्वीर देखे बिना भी कहानी सुना सकता है।

इसका उपयोग कहाँ होता है? (वास्तविक दुनिया के उदाहरण)

पेपर कई स्थानों को सूचीबद्ध करता है जहाँ यह महत्वपूर्ण है:

  • मेडिकल स्कैन: एक डॉक्टर के पास मरीज के लिए एमआरआई (MRI) स्कैन हो सकता है लेकिन सीटी (CT) स्कैन नहीं। AI को बिना गलत अनुमान लगाए केवल एमआरआई का उपयोग करके बीमारी का निदान करने की आवश्यकता है।
  • सेल्फ-ड्राइविंग कारें: कार का कैमरा बर्फ के कारण अंधा हो सकता है, या उसका रडार खराब हो सकता है। कार के AI को केवल उन्हीं सेंसरों का उपयोग करके सुरक्षित रूप से गाड़ी चलाने की आवश्यकता है जो अभी भी काम कर रहे हैं।
  • इमोशन डिटेक्शन (भावना पहचान): एक वीडियो कॉल में ऑडियो खराब हो सकता है लेकिन वीडियो स्पष्ट हो सकता है। AI आपके चेहरे को देखकर अभी भी यह बता सकता है कि आप खुश हैं या दुखी।
  • रोबोटिक्स: एक गुफा की खोज करने वाला रोबोट अपना GPS सिग्नल खो सकता है। उसे केवल अपने कैमरों और स्पर्श सेंसरों का उपयोग करके रास्ता खोजने की आवश्यकता है।

वे समस्याएँ जिन्हें हमने अभी तक हल नहीं किया है

भले ही हमारे पास ये शानदार तकनीकें हैं, पेपर कुछ बड़ी समस्याओं की ओर इशारा करता है:

  1. "नकली डेटा" का जाल: जब AI गायब डेटा की "कल्पना" करता है, तो वह कभी-कभी ऐसी विवरण बना देता है जो गलत होते हैं। यदि एक सेल्फ-ड्राइविंग कार ऐसी सड़क की कल्पना करती है जहाँ वास्तव में खाई है, तो यह खतरनाक है।
  2. "आलसी" AI: कभी-कभी, भले ही AI गायब हिस्से को भरने की कोशिश करता है, वह अंततः नए डेटा को अनदेखा कर देता है और केवल उसी एक सेंसर पर निर्भर हो जाता है जो उसके पास है, जो पर्याप्त नहीं हो सकता है।
  3. "मेसी लाइब्रेरी" (अव्यवस्थित पुस्तकालय): कोई एकल मानक परीक्षण नहीं है। एक शोधकर्ता अपने AI का परीक्षण 10% गायब डेटा के साथ कर सकता है, जबकि दूसरा 90% के साथ। यह तुलना करना कठिन है कि वास्तव में कौन सबसे अच्छा है।
  4. बहुत भारी: इनमें से कई समाधानों के लिए भारी कंप्यूटर शक्ति (जैसे सुपरकंप्यूटर) की आवश्यकता होती है। लेकिन वास्तविक दुनिया के उपकरण (जैसे स्मार्टवॉच या ड्रोन) छोटे होते हैं और उनकी बैटरी कमजोर होती है। हमें "लाइटवेट" समाधानों की आवश्यकता है जो छोटे चिप्स पर काम कर सकें।

निचोड़ (The Bottom Line)

यह पेपर एक रोडमैप है। यह हमें बताता है कि हालांकि हमने AI को टूटे हुए सेंसर और गायब डेटा से निपटने के लिए सिखाने में बड़ी प्रगति की है, लेकिन हमें अभी भी बेहतर तरीकों की आवश्यकता है जिससे वह बिना कुछ मनगढ़ंत बनाए, बिना सुपर-कंप्यूटर की आवश्यकता के, और बिना उलझन के काम कर सके। लक्ष्य एक ऐसा AI बनाना है जो मानव की तरह मजबूत हो: जो दुनिया को समझने में सक्षम हो, भले ही दृश्य धुंधला हो या माइक्रोफ़ोन टूटा हुआ हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →