← नवीनतम पेपर
💻 computer science

BALM: A Model-Agnostic Framework for Balanced Multimodal Learning under Imbalanced Missing Rates

यह शोध पत्र BALM को प्रस्तुत करता है, जो एक मॉडल-अज्ञेय (model-agnostic) ढांचा है जो अपने फीचर कैलिब्रेशन (Feature Calibration) और ग्रेडिएंट रीबैलेंसिंग (Gradient Rebalancing) मॉड्यूल के माध्यम से मल्टीमॉडल लर्निंग में असंतुलित मिसिंग रेट्स की चुनौतियों का समाधान करता है, जिससे बैकबोन आर्किटेक्चर को बदले बिना विविध मिसिंग पैटर्न में मजबूती और प्रदर्शन को बढ़ाया जा सकता है।

मूल लेखक: Phuong-Anh Nguyen, Tien Anh Pham, Duc-Trong Le, Cam-Van Thi Nguyen

प्रकाशित 2026-03-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Phuong-Anh Nguyen, Tien Anh Pham, Duc-Trong Le, Cam-Van Thi Nguyen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल पहेली को सुलझाने की कोशिश कर रहे हैं, लेकिन आपके पास आपकी मदद के लिए तीन दोस्त हैं: ऑडियो (Audio), विजुअल (Visual), और टेक्स्ट (Text)

एक आदर्श दुनिया में, तीनों दोस्त मौजूद हैं, ध्यान दे रहे हैं, और समान रूप से योगदान दे रहे हैं। लेकिन वास्तविक दुनिया में, चीजें गलत हो जाती हैं। शायद माइक्रोफ़ोन टूट गया है (ऑडियो गायब है), कैमरा धुंधला है (विजुअल गायब है), या ट्रांसक्रिप्ट गड़बबड़ है (टेक्स्ट गायब है)।

समस्या केवल यह नहीं है कि जानकारी गायब है; समस्या यह है कि कमी असमान रूप से होती है

  • कभी-कभी ऑडियो दोस्त 90% समय गायब रहता है।
  • कभी-कभी टेक्स्ट दोस्त केवल 10% समय गायब होता है।
  • विजुअल दोस्त 50% समय गायब रहता है।

समस्या: "ज़ोरदार दोस्त" का दबदबा बनाना

जब आप इस समूह से सीखने की कोशिश करते हैं, तो एक स्वाभाविक पूर्वाग्रह (bias) काम करने लगता है। जो दोस्त सबसे अधिक बार मौजूद रहता है (मान लीजिए, टेक्स्ट), वह "ज़ोरदार दोस्त" बन जाता है। AI मॉडल केवल टेक्स्ट को सुनने लगता है क्योंकि वह सूचना का सबसे विश्वसनीय स्रोत है।

अन्य दोस्तों (ऑडियो और विजुअल) को अनदेखा कर दिया जाता है। वे कोशिश करना बंद कर देते हैं क्योंकि वे शायद ही कभी सुने जाते हैं। मॉडल "आलसी" हो जाता है और पूरी तरह से उसी एक माध्यम पर निर्भर हो जाता है जो काम कर रहा है, जिससे वह नाजुक (fragile) बन जाता है। यदि वह एक दोस्त भी गायब हो जाता है, तो पूरा सिस्टम क्रैश हो जाता है।

यही वह चीज़ है जिसे यह पेपर इम्बैलेंस्ड मिसिंग रेट्स (IMR - Imbalanced Missing Rates) कहता है।

समाधान: BALM (एक निष्पक्ष कोच)

लेखक एक नया फ्रेमवर्क प्रस्तावित करते हैं जिसे BALM (बैलेंस्ड एग्नोस्टिक लर्निंग अंडर इम्बैलेंस्ड मिसिंग रेट्स) कहा जाता है। BALM को एक नया पहेली सुलझाने वाले के रूप में नहीं, बल्कि एक निष्पक्ष कोच (Fair Coach) के रूप में सोचें जो दोस्तों और पहेली के बीच बैठा है।

कोच के पास इस असंतुलन को ठीक करने के लिए दो विशेष उपकरण हैं:

1. फीचर कैलिब्रेशन मॉड्यूल (FCM) -> "संदर्भगत अनुवादक" (The Contextual Translator)

उपमा: कल्पना कीजिए कि ऑडियो दोस्त गायब है, लेकिन टेक्स्ट दोस्त एक "तेज़ धमाके" के बारे में बात कर रहा है। विजुअल दोस्त एक रोशनी की चमक देखता है। बिना संदर्भ के, विजुअल दोस्त सोच सकता है कि यह केवल कैमरे की फ्लैश है। लेकिन अनुवादक (Translator) देखता है कि टेक्स्ट दोस्त ने क्या कहा है और विजुअल दोस्त को बताता है, "हे, यह सिर्फ एक फ्लैश नहीं है; यह एक धमाका है! अपनी समझ को कहानी के अनुरूप ढाल लें।"

यह कैसे काम करता है:

  • भले ही कोई माध्यम गायब हो, कोच ग्लोबल कॉन्टेक्स्ट (अन्य दोस्त क्या कह रहे हैं) को देखता है।
  • यह मौजूद दोस्तों के फीचर्स को "री-कैलिब्रेट" करता है, जिससे वे सभी एक ही "भाषा" बोल सकें और बड़े चित्र (big picture) को समझ सकें, चाहे कोई भी गायब हो।
  • यह सुनिश्चित करता है कि भले ही ऑडियो 90% समय गायब हो, जब वह आता है, तो वह सार्थक योगदान देने के लिए तैयार रहता है क्योंकि उसका "मानसिक मानचित्र" दूसरों द्वारा अपडेट किया गया है।

2. ग्रेडिएंट रीबैलेंसिंग मॉड्यूल (GRM) -> "निष्पक्ष ग्रेडिंग प्रणाली" (The Fair Grading System)

उपमा: एक कक्षा में, यदि टेक्स्ट छात्र हमेशा सही उत्तर देता है क्योंकि वह सबसे अधिक अध्ययन करता है, तो शिक्षक (AI) उसे सारा ध्यान देता है। ऑडियो और विजुअल छात्र, जो अक्सर अनुपस्थित रहने के कारण संघर्ष करते हैं, उन्हें शून्य फीडबैक मिलता है और वे सुधार करना बंद कर देते हैं।

निष्पक्ष ग्रेडिंग प्रणाली नियमों को बदल देती है:

  • वितरण जांच (The Distribution Check): कोच पूछता है, "क्या टेक्स्ट छात्र का उत्तर समूह के अंतिम उत्तर के साथ मेल खा रहा है?" यदि टेक्स्ट बहुत अधिक आत्मविश्वासी है और समूह भ्रमित है, तो कोच कहता है, "टेक्स्ट, धीरे चलो। तुम बातचीत पर हावी हो रहे हो।"
  • दिशा जांच (The Direction Check): कोच सीखने की दिशा को देखता है। यदि टेक्स्ट मॉडल को एक दिशा में धकेल रहा है, लेकिन ऑडियो उसे थोड़ी अलग दिशा में धकेल रहा है, तो कोच ऑडियो को ज़ोर से धकेलने के लिए प्रेरित करता है ताकि वह पीछे न छूट जाए।
  • परिणाम: "ज़ोरदार दोस्त" (टेक्स्ट) पर हल्का ब्रेक लगाया जाता है, जबकि "शांत दोस्तों" (ऑडियो/विजुअल) को बढ़ावा दिया जाता है। यह मॉडल को सभी से सीखने के लिए मजबूर करता है, न कि केवल सबसे उपलब्ध एक से।

यह क्यों मायने रखता है

पिछले अधिकांश तरीकों ने "खाली जगहों को भरने" (यह अनुमान लगाने कि गायब ऑडियो कैसा सुनाई देगा) की कोशिश की। लेकिन अनुमान लगाना कठिन है और अक्सर गलत होता है।

BALM अनुमान नहीं लगाता। यह स्वीकार करता है कि डेटा अव्यवस्थित और असमान है। इसके बजाय, यह स्वयं सीखने की प्रक्रिया को ठीक करता है।

  • यह सुनिश्चित करता है कि फीचर्स संरेखित (aligned) हों (ताकि सभी संदर्भ को समझ सकें)।
  • यह सुनिश्चित करता है कि सीखने का प्रयास संतुलित हो (ताकि कोई एक दोस्त हावी न हो)।

मुख्य निष्कर्ष

पेपर दिखाता है कि जब आप इस "फेयर कोच" (BALM) का उपयोग मौजूदा AI मॉडलों के साथ करते हैं, तो वे अत्यधिक मजबूत (super robust) हो जाते हैं।

  • वे बेहतर प्रदर्शन करते हैं, भले ही एक माध्यम 90% समय गायब हो।
  • वे तब भी विफल नहीं होते जब "ज़ोरदार दोस्त" चुप हो जाता है।
  • वे किसी भी मौजूदा AI आर्किटेक्चर के साथ काम करते हैं (यह "मॉडल-एग्नोस्टिक" है, जिसका अर्थ है कि आप इसे एक यूनिवर्सल अडैप्टर की तरह प्लग इन कर सकते हैं)।

संक्षेप में, BALM AI को एक अच्छा टीम प्लेयर बनना सिखाता है, यह सुनिश्चित करता है कि भले ही कुछ टीम सदस्य अनुपस्थित या अविश्वसनीय हों, पूरी टीम फिर भी खेल जीतती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →