← नवीनतम पेपर
🤖 machine learning

Unsupervised Learning for Missing Modalities in Multimodal Learning

यह शोध पत्र UL4M4 को प्रस्तुत करता है, जो एक लचीला अनसुपरवाइज्ड फ्रेमवर्क है जो मोडैलिटी-विशिष्ट नॉर्मलाइजेशन और आंशिक-मोडैलिटी डिस्टेंस मेट्रिक्स का उपयोग करके मल्टीमॉडल लर्निंग में लुप्त फीचर एम्बेडिंग्स को इम्प्यूट करता है ताकि 50% से अधिक मोडैलिटीज के गायब होने पर भी मजबूत, स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Hassan Ismkhan, Hamid Bouchahcia

प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hassan Ismkhan, Hamid Bouchahcia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल पहेली को सुलझाने की कोशिश कर रहे हैं, जैसे कि किसी फिल्म की शैली (genre) का अनुमान लगाना। आमतौर पर, आपके पास सभी टुकड़े होते हैं: मूवी पोस्टर (दृश्य), कथानक का सारांश (टेक्स्ट), और शायद ट्रेलर ऑडियो। लेकिन वास्तविक दुनिया में, टुकड़े अक्सर गायब हो जाते हैं। हो सकता है कि पोस्टर खो गया हो, ऑडियो फ़ाइल खराब हो गई हो, या टेक्स्ट बहुत छोटा हो।

पारंपरिक AI मॉडल कठोर पहेली सुलझाने वालों की तरह होते हैं: यदि कोई टुकड़ा गायब होता है, तो वे अक्सर हार मान लेते हैं या एक बहुत ही गलत अनुमान लगाते हैं। यह पेपर एक नई, लचीली विधि पेश करता है जिसे UL4M4 (अनसुपरवाइज्ड लर्निंग फॉर मिसिंग मोडैलिटीज़) कहा जाता है, जो एक चतुर जासूस की तरह काम करता है जो अंतिम रहस्य को सुलझाने से पहले ही गायब पहेली के टुकड़ों को भरने की कोशिश करता है।

यह इस प्रकार काम करता है, जिसे सरल चरणों में विभाजित किया गया है:

1. समस्या: "गायब टुकड़े" की दुविधा

वास्तविक दुनिया में, डेटा अव्यवस्थित होता है। सेंसर विफल हो जाते हैं, गोपनीयता नियम जानकारी को छिपा देते हैं, या फाइलें खो जाती हैं। अधिकांश AI मॉडल यह मानकर चलते हैं कि उन्हें हमेशा पूरी तस्वीर (टेक्स्ट + इमेज + ऑडियो) मिलेगी। जब उन्हें ऐसा नहीं मिलता, तो उनका प्रदर्शन गिर जाता है। मौजूदा समाधान लापता हिस्से को बनाने के लिए जटिल गणित का उपयोग करते हैं, लेकिन वे अक्सर एक विशिष्ट कार्य के लिए बहुत अधिक विशिष्ट होते हैं या हर बार जब गायब हिस्से बदलते हैं, तो उन्हें फिर से प्रशिक्षित करने की आवश्यकता होती है।

2. समाधान: "समूहीकरण और अनुमान" की रणनीति

लेखक एक दो-चरणीय प्रक्रिया का प्रस्ताव करते हैं जो टास्क-इंडिपेंडेंट (कार्य-स्वतंत्र) है। इसका मतलब है कि "भरने" वाला हिस्सा इस बात की परवाह नहीं करता कि अंतिम लक्ष्य क्या है (चाहे वह फिल्म की शैली का अनुमान लगाना हो या मूड का विश्लेषण करना); यह केवल डेटा को पूर्ण बनाने पर ध्यान केंद्रित करता है।

चरण 1: "ग्रुप हग" (क्लस्टरिंग)
कल्पना कीजिए कि आपके पास लोगों से भरा एक बड़ा कमरा है (आपका डेटा), लेकिन कुछ लोग अपने बाएं जूते खो चुके हैं, कुछ ने दाएं, और कुछ के पास दोनों हैं।

  • पूरे मिलान करने के बजाय, AI लोगों को उनके पास मौजूद जूतों के आधार पर समूहों (clusters) में बांटता है।
  • यह एक विशेष "दूरी नियम" (distance rule) का उपयोग करता है जो कहता है, "इससे कोई फर्क नहीं पड़ता कि व्यक्ति A के पास 3 जूते हैं और व्यक्ति B के पास 1; हम अभी भी निष्पक्ष रूप से तुलना कर सकते हैं।"
  • एक बार समूह बनाने के बाद, AI प्रत्येक क्लस्टर के लिए एक "ग्रुप अवतार" बनाता है। यह अवतार उस समूह के सभी लोगों के औसत स्वरूप का प्रतिनिधित्व करता है, जिसमें उनके गायब जूते भी शामिल हैं।

चरण 2: "ग्रीडी फिलर" (इम्प्यूटेशन)
अब, कल्पना कीजिए कि आपके पास एक विशिष्ट व्यक्ति (डेटा सैंपल) है जिसका ऑडियो जूता गायब है।

  • AI उन सभी "ग्रुप अवतारों" को देखता है जो चरण 1 में बनाए गए थे।
  • यह उस अवतार को ढूंढता है जो व्यक्ति के उपलब्ध डेटा (जैसे, उनका टेक्स्ट और वीडियो) के सबसे अधिक समान दिखता है।
  • फिर यह उस मिलान वाले अवतार से गायब ऑडियो जूता "उधार" लेता है और उसे व्यक्ति को दे देता है।
  • यह तब तक चरण-दर-चरण चलता है जब तक कि उस व्यक्ति के पास जूतों का पूरा सेट (डेटा का एक पूर्ण सेट) न हो जाए।

3. यह क्यों विशेष है

  • यह लचीला है: आपके पास 2 प्रकार का डेटा (टेक्स्ट/इमेज) हो सकता है या 5 प्रकार के (जैसे नींद के संकेत), और यह विधि किसी भी संख्या के लिए काम करती है। इसे हर नए पहेली के लिए नए डिज़ाइन की आवश्यकता नहीं है।
  • यह हल्का है: "भरने" वाला हिस्सा पहले से प्रशिक्षित उपकरणों (मौजूदा ज्ञान के पुस्तकालय की तरह) का उपयोग करता है और इसे भारी कंप्यूटिंग शक्ति की आवश्यकता नहीं होती है। यह "भरने" के काम को "सुलझाने" के काम से अलग करता है।
  • यह अराजकता को संभालता है: पेपर में अत्यधिक परिदृश्यों में परीक्षण किया गया जहाँ 50% से अधिक डेटा गायब था। भले ही AI के पास अपने आधे सेंस (इंद्रियां) गायब थे, फिर भी इसने अविश्वसनीय रूप से अच्छा प्रदर्शन किया।

4. परिणाम: प्रतिस्पर्धा को हराना

लेखकों ने तीन बहुत अलग "पहेलियों" पर UL4M4 का परीक्षण किया:

  1. मूवी जॉनर (MM-IMDb): पोस्टर और टेक्स्ट का उपयोग करके यह अनुमान लगाना कि फिल्म कॉमेडी है या ड्रामा।
  2. मूवी मूड्स (CMU-MOSI): टेक्स्ट, ऑडियो और वीडियो का उपयोग करके यह अनुमान लगाना कि मूवी रिव्यू खुश है या उदास।
  3. स्लीप स्टेज (Sleep-EDF): 5 अलग-अलग मस्तिष्क संकेत प्रकारों का उपयोग करके यह निर्धारित करना कि व्यक्ति जाग रहा है या गहरी नींद में है।

बड़ी जीत:
सबसे कठिन परीक्षणों में (जहाँ डेटा गंभीर रूप से गायब था), UL4M4 ने लगातार 0.7 से ऊपर (एक बहुत ही उच्च अंक) स्कोर प्राप्त किया। यह पहली बार है जब किसी विधि ने इतने खराब हालातों में कठिन "मूवी मूड्स" डेटासेट पर ऐसा किया है। इसने सभी पिछले "स्टेट-ऑफ-द-आर्ट" तरीकों को मात दी, यहाँ तक कि उन्हें भी जो विशेष रूप से केवल उसी एक कार्य के लिए डिज़ाइन किए गए थे।

5. "सीक्रेट सॉस" (क्लस्टर आकार)

कोई चिंता कर सकता है: "क्या होगा अगर हम लोगों को 10 समूहों में बांटते हैं या 100 समूहों में? क्या इससे फर्क पड़ता है?"
पेपर ने पाया कि इससे ज्यादा फर्क नहीं पड़ता। चाहे AI 20 समूह बनाए या 100 समूह, परिणाम स्थिर रहते हैं। यह इस टूल को उपयोग करने में बहुत आसान बनाता है क्योंकि आपको इसे पूरी तरह से ट्यून करने के लिए गणित का जीनियस होने की आवश्यकता नहीं है।

सारांश

UL4M4 को गायब डेटा के लिए एक यूनिवर्सल ट्रांसलेटर के रूप में समझें। टूटी हुई पहेली को खेल रोकने देने के बजाय, यह आपके पास मौजूद टुकड़ों के पैटर्न को देखता है, एक समान समूह को ढूंढता है, और आत्मविश्वास के साथ खाली जगहों को भर देता है। यह AI को अंतिम समस्या (जैसे फिल्म के मूड की भविष्यवाणी करना) को सटीक रूप से हल करने की अनुमति देता है, भले ही इनपुट डेटा अधूरा, अव्यवस्थित हो, या इसके आधे हिस्से गायब हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →