← नवीनतम पेपर
📊 statistics

Multimodal Deep Generative Model for Semi-Supervised Learning under Class Imbalance

यह शोध पत्र क्लास इम्बैलेंस (वर्ग असंतुलन) के तहत सेमी-सुपरवाइज्ड लर्निंग के लिए एक मल्टीमॉडल डीप जेनरेटिव मॉडल प्रस्तावित करता है जो साझा लेटेंट वेरिएबल्स, हेवी-टेल्ड डेटा विशेषताओं को कैप्चर करने के लिए स्टूडेंट टी-डिस्ट्रीब्यूशन और आंशिक रूप से लेबल किए गए, इम्बैलेंस्ड मल्टीमॉडल डेटासेट पर मौजूदा विधियों से बेहतर प्रदर्शन करने के लिए एक γ\gamma-पावर डाइवर्जेंस ऑब्जेक्टिव का लाभ उठाता है।

मूल लेखक: Heegeon Yoon, Heeyoung Kim

प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Heegeon Yoon, Heeyoung Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को विभिन्न प्रकार के फल पहचानना सिखाने की कोशिश कर रहे हैं। आपके पास तस्वीरों का एक बहुत बड़ा ढेर है, लेकिन एक समस्या है: आपके पास सेबों की हजारों तस्वीरें हैं, लेकिन दुर्लभ, विदेशी बेरीज (berries) की केवल कुछ ही तस्वीरें हैं।

यदि आप रोबोट को पूरा ढेर दिखा देते हैं, तो वह सेब पहचानने में बहुत अच्छा हो जाएगा, लेकिन वह शायद हर दुर्लभ बेरी को एक अजीब दिखने वाला सेब समझ लेगा। यह क्लास इम्बैलेंस (class imbalance) की समस्या है।

अब, कल्पना कीजिए कि रोबोट केवल तस्वीरें नहीं देखता; वह फलों का विवरण भी सुनता है और उनकी बनावट (texture) को महसूस भी करता है (यदि उसमें सेंसर हों)। यह मल्टीमॉडल डेटा (multimodal data) है (एक साथ विभिन्न प्रकार की जानकारी का उपयोग करना)।

अंत में, कल्पना कीजिए कि आपके पास केवल सेबों के लेबल (नाम) हैं, लेकिन दुर्लभ बेरीज बिना लेबल वाली हैं। आपको बेरीज के बारे में अनुमान लगाना होगा कि वे क्या हैं, उन कुछ सेबों के आधार पर जिन्हें आप जानते हैं। यह सेमी-सुपरवाइज्ड लर्निंग (semi-supervised learning) है।

यह पेपर SSMVAE-CI नामक एक नया AI मॉडल पेश करता है जिसे इन तीनों समस्याओं को एक साथ हल करने के लिए डिज़ाइन किया गया है: "दुर्लभ फल" की समस्या को संभालना, कई इंद्रियों (दृष्टि, ध्वनि, पाठ) का उपयोग करना, और ज्यादातर बिना लेबल वाले डेटा से सीखना।

यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) के माध्यम से दिया गया है:

1. "विशेषज्ञ टीम" दृष्टिकोण (Multimodal Encoders)

अधिकांश AI मॉडल सभी डेटा (फोटो, टेक्स्ट, ऑडियो) को शुरुआत में ही एक विशाल ब्लेंडर में मिलाने की कोशिश करते हैं। लेखक कहते हैं, "नहीं, विशेषज्ञों को अलग रहने दें।"

  • उपमा: एक जासूसी टीम की कल्पना करें। एक जासूस फोटो का विशेषज्ञ है, दूसरा ऑडियो का, और तीसरा टेक्स्ट का। वे अपने सुरागों को तुरंत नहीं मिलाते। इसके बजाय, वे प्रत्येक एक रिपोर्ट लिखते हैं कि उन्होंने क्या देखा, और फिर वे नोट्स की तुलना करने के लिए एक "केंद्रीय कमरे" (लेटेंट स्पेस - latent space) में मिलते हैं।
  • लाभ: यह मॉडल को यह समझने में मदद करता है कि एक बेरी की तस्वीर और एक बेरी का टेक्स्ट विवरण आपस में संबंधित हैं, भले ही वे दिखने में बहुत अलग हों। मॉडल "प्रोडक्ट-ऑफ-एक्सपर्ट्स" (Product-of-Experts) विधि का उपयोग करता है, जो एक टीम द्वारा अंतिम निष्कर्ष पर वोट देने जैसा है, न कि उन्हें डेटा देखने से पहले ही सहमत होने के लिए मजबूर करने जैसा।

2. "हैवी-टेल्ड" सुरक्षा जाल (Student's t-Distribution)

मानक AI मॉडल आमतौर पर यह मानते हैं कि डेटा एक आदर्श बेल कर्व (Gaussian distribution) की तरह वितरित होता है। बेल कर्व में, "दुर्लभ" चीजें (tails) इतनी पतली होती हैं कि मॉडल अक्सर उन्हें अनदेखा कर देता है या उन्हें सामान्य चीजों जैसा दिखाने की कोशिश करता है।

  • उपमा: कल्पना कीजिए कि बेल कर्व एक रस्सी (tightrope) की तरह है। यदि आप एक दुर्लभ बेरी हैं, तो आप रस्सी से बहुत दूर गहरी घास में हैं। एक मानक मॉडल आपको वापस रस्सी पर खींचने की कोशिश करता है, जिससे आप सेब की तरह दिखने लगते हैं।
  • समाधान: यह पेपर रस्सी को बदलकर एक चौड़े, ट्रैम्पोलिन जैसे जाल (Student's t-distribution) से बदल देता है। इस जाल के "हैवी टेल्स" (heavy tails) होते हैं, जिसका अर्थ है कि इसमें गहरी घास में भी पर्याप्त जगह है। यह दुर्लभ बेरीज को वहीं रहने की अनुमति देता है जहाँ वे स्वाभाविक रूप से होनी चाहिए, बिना उन्हें सेब की तरह दिखने के लिए मजबूर किए। यह मॉडल को दुर्लभ डेटा को सामान्य पैटर्न में जबरदस्ती ढालने (over-regularizing) से रोकता है।

3. "स्मार्ट गेसिंग" गेम (γ\gamma-Power Divergence)

मॉडल को लेबल वाले सेबों और बिना लेबल वाली बेरीज दोनों से सीखने की आवश्यकता है। इसके लिए, यह γ\gamma-पावर डायवर्जेंस (γ\gamma-power divergence) नामक एक विशेष गणितीय उपकरण का उपयोग करता है।

  • उपमा: इसे एक लचीले रूलर (पैमाने) के रूप में सोचें। एक मानक रूलर (जैसे KL divergence) कठोर है; यदि डेटा पूरी तरह से फिट नहीं बैठता है, तो यह टूट जाता है या भ्रमित हो जाता है। γ\gamma-पावर रूलर लचीला और उदार है। यह मॉडल को यह कहने की अनुमति देता है, "मैं जानता हूँ कि यह दुर्लभ बेरी उन सेबों जैसी बिल्कुल नहीं दिखती जो मैंने देखे हैं, लेकिन यह बेरी होने के लिए काफी करीब है, और मैं इसे अलग होने के लिए बहुत अधिक दंडित नहीं करूँगा।"
  • परिणाम: यह मॉडल को प्रभावी ढंग से सीखने में मदद करता है, भले ही डेटा अव्यवस्थित, असंतुलित या अधूरा हो।

4. जब डेटा गायब हो तो क्या होता है?

वास्तविक दुनिया में, कभी-कभी आपके पास एक फोटो होती है लेकिन कोई ऑडियो नहीं होता, या टेक्स्ट होता है लेकिन कोई इमेज नहीं होती।

  • उपमा: यदि एक जासूसी टीम का एक सदस्य खो जाता है (उदाहरण के लिए, ऑडियो विशेषज्ञ बीमार है), तो एक कठोर टीम काम करना बंद कर सकती है। लेकिन क्योंकि यह मॉडल "चौड़े जाल" (t-distribution) और "विशेषज्ञ" दृष्टिकोण का उपयोग करता है, इसलिए यह केवल फोटो और टेक्स्ट का उपयोग करके एक अच्छा अनुमान लगा सकता है। यह गायब डेटा को एक "सॉफ्ट" सिग्नल के रूप में मानता है न कि एक पूर्ण विराम के रूप में, जिससे यह अधूरे नमूनों से सीखने के लिए उन्हें फेंकने के बजाय उनका उपयोग कर पाता है।

परिणाम

लेखकों ने वास्तविक दुनिया के परिदृश्यों पर इस मॉडल का परीक्षण किया:

  • हस्तलिखित अंक बनाम घर के नंबर: दो प्रकार के इमेज का मिश्रण।
  • खाद्य चित्र और रेसिपी: फोटो और टेक्स्ट का मिश्रण।
  • वीडियो, ऑडियो और टेक्स्ट: लोगों के बोलने से जुड़े तीन प्रकार के डेटा का मिश्रण।

हर परीक्षण में, विशेष रूप से जब "दुर्लभ" क्लासेस बहुत कम थीं और डेटा में लेबल गायब थे, इस नए मॉडल ने मौजूदा तरीकों से बेहतर प्रदर्शन किया। यह विशेष रूप से उन "दुर्लभ फलों" (minority classes) को सही ढंग से पहचानने में उत्कृष्ट था जिन्हें अन्य मॉडल बार-बार "सेब" (majority classes) के रूप में गलत पहचानते थे।

संक्षेप में: इस पेपर ने एक स्मार्ट, अधिक लचीला AI बनाया है जो विशेषज्ञों की एक टीम, दुर्लभ डेटा के लिए एक चौड़े सुरक्षा जाल और एक उदार रूलर का उपयोग करता है, ताकि वह पिछले तरीकों की तुलना में अव्यवस्थित, अधूरे और असंतुलित जानकारी से बेहतर सीख सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →