← नवीनतम पेपर
🤖 machine learning

Bridging Modalities via Progressive Re-alignment for Multimodal Test-Time Adaptation

यह शोध पत्र BriMPR का प्रस्ताव करता है, जो एक नवीन मल्टीमॉडल टेस्ट-टाइम एडेप्टेशन फ्रेमवर्क है जो एक डिवाइड-एंड-कॉन्कर रणनीति को नियोजित करके जटिल वितरण बदलावों (distribution shifts) को संबोधित करता है, जिससे पहले प्रॉम्प्ट ट्यूनिंग के माध्यम से यूनिमोडल फीचर्स को संरेखित किया जाता है और फिर छद्म-लेबल वाले डेटा (pseudo-labeled data) पर कंट्रास्टिव लर्निंग के माध्यम से क्रॉस-मोडल सिमेंटिक संरेखण को परिष्कृत किया जाता है।

मूल लेखक: Jiacheng Li, Songhe Feng

प्रकाशित 2026-03-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiacheng Li, Songhe Feng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुभाषी टूर गाइड (multilingual tour guide) हैं, जिन्होंने एक सुंदर, धूप वाले शहर (जिसे "सोर्स डोमेन" कहा जाता है) में समूहों का नेतृत्व करते हुए कई साल बिताए हैं। आप हर सड़क, हर लैंडमार्क को जानते हैं और उस विशिष्ट वातावरण में चीजों को पूरी तरह से समझाने के माहिर हैं।

अब, अचानक, आपको उसी शहर के एक धुंधले, बरसाती और शोर-शराबे वाले संस्करण (जिसे "टारगेट डोमेन" कहा जाता है) में छोड़ दिया जाता है। स्थिति को और खराब करने के लिए, आपके टूर ग्रुप को दो टीमों में विभाजित कर दिया गया है: एक टीम ने नॉइज़-कैंसलिंग हेडफ़ोन पहने हैं (ऑडियो मोडैलिटी), और दूसरी टीम ने धुंधले चश्मे (foggy goggles) पहने हैं (विजुअल मोडैलिटी)।

समस्या: "भ्रमित गाइड" (The "Confused Guide")

वास्तविक दुनिया में, AI मॉडल ठीक इसी समस्या का सामना करते हैं। जब एक AI, जिसे साफ डेटा पर प्रशिक्षित किया गया था, वह खराब, वास्तविक दुनिया के डेटा (जैसे खराब ऑडियो वाला वीडियो या धुंधली इमेज) से मिलता है, तो वह भ्रमित हो जाता है।

मौजूदा तरीके इसे ठीक करने की कोशिश करते हैं:

  1. खराब हिस्सों को अनदेखा करना: "अरे, ऑडियो बहुत खराब है, चलो बस वीडियो पर भरोसा करते हैं!" (लेकिन क्या होगा यदि वीडियो भी धुंधला है?)
  2. सब कुछ एक साथ ठीक करने की कोशिश करना: "आइए पूरे गाइड के दिमाग को बारिश और शोर को एक साथ संभालने के लिए समायोजित करें।" ऐसा करने से अक्सर एक "उलझा हुआ" दिमाग बन जाता है जहाँ गाइड दोनों भाषाओं में स्पष्ट रूप से बोलना भूल जाता है।

यह पेपर तर्क देता है कि मल्टीमॉडल दुनिया में (जहाँ AI देखता भी है और सुनता भी है), यह समस्या एक दोहरी मार (double whammy) है:

  • द शैलो शिफ्ट (The Shallow Shift): कच्चा डेटा शोर भरा है (धुंधले चश्मे)।
  • द डीप मिसअलाइनमेंट (The Deep Misalignment): क्योंकि ऑडियो और वीडियो दोनों ही अलग-अलग तरह से खराब हो गए हैं, वे अब एक-दूसरे से ठीक से "बात" नहीं कर पा रहे हैं। गाइड को "डॉग" सुनाई देता है लेकिन वह "कैट" देखता है, और वह भ्रम के चक्रव्यूह में फंस जाता है।

समाधान: BriMPR (एक "प्रोग्रेसिव री-अलाइनमेंट" रणनीति)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे BriMPR (ब्रिजिंग मोडैलिटीज वाया प्रोग्रेसिव री-अलाइनमेंट) कहा जाता है। इसे हमारे भ्रमित टूर गाइड के लिए एक दो-चरणीय बचाव योजना के रूप में समझें।

चरण 1: "व्यक्तिगत ईयरप्लग और गॉगल्स" (प्रॉम्प्ट ट्यूनिंग)

पूरे गाइड के दिमाग को फिर से बनाने के बजाय, BriMPR प्रत्येक इंद्रिय (sense) के लिए अनुकूलन योग्य, छोटे सहायक उपकरण (जिन्हें "प्रॉम्प्ट्स" कहा जाता है) देता है।

  • उपमा (Analogy): कल्पना कीजिए कि गाइड ने प्रत्येक इंद्रिय के लिए विशेष स्मार्ट गॉगल्स और स्मार्ट ईयरप्लग पहने हैं। ये केवल फिल्टर नहीं हैं; ये सीखने योग्य (learnable) उपकरण हैं जो गाइड के दिमाग को धीरे से प्रेरित करते हैं, "हे, भले ही धुंध छाई हो, याद रखो कि धूप वाले शहर में 'पेड़' कैसा दिखता है।"
  • जादू: गाइड इन एक्सेसरीज का उपयोग प्रत्येक इंद्रिय को व्यक्तिगत रूप से कैलिब्रेट (calibrate) करने के लिए करता है। यह "धुंधली दृष्टि" को इस तरह से ढालने के लिए मजबूर करता है कि वह "धूप वाली दृष्टि" की तरह दिखे जो उसने ट्रेनिंग के दौरान सीखी थी, और "शोर वाले ऑडियो" को "साफ ऑडियो" जैसा बना देता है।
  • परिणाम: अचानक, गाइड धुंध से भ्रमित नहीं होता। विजुअल टीम और ऑडियो टीम अब फिर से एक ही "भाषा" बोल रहे हैं, भले ही वातावरण अभी भी अजीब हो।

चरण 2: "ब्लाइंडफोल्ड गेम" (क्रॉस-मोडल इंटरैक्शन)

अब जब इंद्रियां कैलिब्रेट हो गई हैं, तो गाइड को इस अस्त-व्यस्त वातावरण में एक-दूसरे पर भरोसा करना सीखना होगा। BriMPR एक चतुर खेल खेलता है:

  • उपमा: गाइड को विजुअल टीम की आंखों पर पट्टी बांधने (वीडियो को मास्क करने) और ऑडियो टीम से दृश्य का अनुमान लगाने के लिए कहा जाता है। फिर, वह ऑडियो टीम की आंखों पर पट्टी बांध देता है और विजुअल टीम से अनुमान लगाने को कहता है।
  • ट्विस्ट: चूंकि गाइड ने चरण 1 में इंद्रियों को पहले ही कैलिब्रेट कर लिया है, इसलिए "देखने" वाली टीम वास्तव में "सुनने" वाली टीम की मदद कर सकती है, और इसके विपरीत भी। वे एक-दूसरे के लिए स्यूडो-लेबल (pseudo-labels) (सबसे सटीक अनुमान) बनाते हैं।
  • सबक: एक-दूसरे के अंतराल को भरने के लिए मजबूर करके, वे केवल अपनी खुद की कमजोर इंद्रियों पर निर्भर रहने के बजाय समूह पर भरोसा करना सीखते हैं। यह ऑडियो और वीडियो के बीच के बंधन को मजबूत करता है, जिससे यह सुनिश्चित होता है कि वे तब भी संरेखित (aligned) रहें जब दुनिया अराजक हो जाए।

यह क्यों एक बड़ी बात है

अधिकांश पिछले तरीकों ने पूरे सिस्टम को एक साथ ठीक करने की कोशिश की, जिससे अक्सर चीजें और खराब हो गईं (जैसे 100mph की रफ्तार से गाड़ी चलाते समय कार के इंजन को ठीक करने की कोशिश करना)।

BriMPR अलग है क्योंकि:

  1. यह समस्या को विभाजित करता है: यह पहले ऑडियो को ठीक करता है, फिर वीडियो को, और फिर उन्हें एक साथ काम करने के लिए बनाता है। यह एक "विभाजित करो और जीतो" (divide and conquer) की रणनीति है।
  2. यह कुशल है: यह पूरे AI को फिर से प्रशिक्षित नहीं करता है। यह केवल मौजूदा मॉडल में उन छोटे, स्मार्ट "एक्सेसरीज" (प्रॉम्प्ट्स) को जोड़ता है।
  3. यह वास्तविक दुनिया में काम करता है: पेपर में परीक्षण किया गया कि कैसे यह विधि बर्फ, शोर या धुंध से खराब हुए वीडियो पर और वास्तविक दुनिया के सेंटीमेंट एनालिसिस कार्यों पर काम करती है। लगभग हर मामले में, BriMPR ने स्टेट-ऑफ-द-आर्ट विधियों को पछाड़ दिया, जिससे डेटा खराब होने पर भी AI सटीक बना रहा।

निष्कर्ष (The Bottom Line)

BriMPR एक भ्रमित टूर गाइड को स्मार्ट, एडजस्टेबल टूल्स देने जैसा है। मौसम बदलने पर घबराने के बजाय, गाइड इन टूल्स का उपयोग करके अपनी इंद्रियों को एक-एक करके पुनः कैलिब्रेट करता है, और फिर इंद्रियों को एक-दूसरे की मदद करना सिखाता है। परिणाम? गाइड तूफान के बीच में भी टूर को पूरी तरह से संचालित कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →