← नवीनतम पेपर
🤖 AI

Multimodal Continual Learning with MLLMs from Multi-scenario Perspectives

यह शोध पत्र MSVQA डेटासेट को पेश करते हुए और UNIFIER नामक एक निरंतर सीखने वाले फ्रेमवर्क का प्रस्ताव देते हुए, जो क्रॉस-परिदृश्य दृश्य कार्यों (cross-scenario visual tasks) में महत्वपूर्ण प्रदर्शन सुधार प्राप्त करने के लिए विजन रिप्रेजेंटेशन एक्सपेंशन और विजन कंसिस्टेंसी कंस्ट्रेंट का उपयोग करता है, वास्तविक दुनिया के परिदृश्य बदलावों के तहत मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में होने वाली कैटास्ट्रोफिक फॉरगेटिंग (विस्मृति) को संबोधित करता है।

मूल लेखक: Kai Jiang, Siqi Huang, Xiangyu Chen, Jiawei Shao, Hongyuan Zhang, Ping Luo, Xuelong Li

प्रकाशित 2026-03-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kai Jiang, Siqi Huang, Xiangyu Chen, Jiawei Shao, Hongyuan Zhang, Ping Luo, Xuelong Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, अत्यंत बुद्धिमान रोबोट सहायक है जिसका नाम MLLM (मल्टीमॉडल लार्ज लैंग्वेज मॉडल) है। यह रोबट तस्वीरों को देख सकता है और उनके बारे में सवालों के जवाब दे सकता है, जैसे "इस फोटो में कितने पक्षी हैं?" या "वह कार किस रंग की है?"

अभी, यह रोबोट अपने काम में बहुत अच्छा है, लेकिन इसे भूलने की बीमारी (amnesia) है।

समस्या: "एक-कार्य" वाला रोबोट

वर्तमान में, यदि आप इस रोबोट को आसमान में हवाई जहाज पहचानना सिखाते हैं (उच्च ऊंचाई - High Altitude), तो यह उसमें विशेषज्ञ बन जाता है। लेकिन जैसे ही आप इसे पानी के नीचे की कोई तस्वीर दिखाते हैं और मछली खोजने के लिए कहते हैं, यह वह सब भूल जाता है जो यह हवाई जहाजों के बारे में जानता था। यह भ्रमित हो जाता है, मछलियों को विमानों के साथ मिला देता है, और गलतियाँ करने लगता है।

वास्तविक दुनिया में, हमारे उपकरण (जैसे ड्रोन, अंडरवॉटर कैमरे, या सुरक्षा कैमरे) दुनिया को कई अलग-अलग कोणों से देखते हैं:

  • उच्च ऊंचाई (High Altitude): सैटेलाइट से नीचे देखते हुए (छोटे कार बिंदु जैसे दिखते हैं)।
  • पानी के नीचे (Underwater): धुंधला, नीला और विकृत।
  • कम ऊंचाई (Low Altitude): एक व्यस्त सड़क के ठीक ऊपर उड़ता हुआ ड्रोन।
  • इनडोर (Indoor): रसोई में खाना बनाते हुए किसी व्यक्ति का फर्स्ट-पर्सन व्यू।

यदि एक रोबोट इन विभिन्न "दुनियाओं" को पिछले ज्ञान को भूले बिना नहीं सीख सकता, तो यह वास्तविक जीवन के अनुप्रयोगों के लिए बेकार है। इसे कैटास्ट्रोफिक फॉरगेटिंग (Catastrophic Forgetting) कहा जाता है।

समाधान: "UNIFIER" बैकपैक

लेखकों ने एक नया सिस्टम बनाया है जिसे UNIFIER कहा जाता है। UNIFIER को एक एकल मस्तिष्क के रूप में नहीं, बल्कि कई विशेष पॉकेट्स (जेबों) वाले एक बैकपैक के रूप में सोचें।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. "पॉकेट" प्रणाली (विज़न रिप्रेजेंटेशन एक्सपेंशन)

कल्पना कीजिए कि रोबोट के पास एक मुख्य मस्तिष्क है, लेकिन उसके पास एक बैकपैक भी है।

  • जब यह हवाई जहाजों के बारे में सीखता है, तो यह बैकपैक में एक विशेष "हवाई जहाज पॉकेट" रखता है। यह इस पॉकेट को विमानों को पहचानने के सभी नियमों से भर देता है।
  • जब यह मछलियों के बारे में सीखता है, तो यह एक "मछली पॉकेट" जोड़ता है। यह इसे मछलियों को पहचानने के नियमों से भर देता है।
  • जादू: ये पॉकेट्स आपस में नहीं मिलते। रोबोट विमानों को याद रखने के लिए "हवाई जहाज पॉकेट" में देख सकता है, और मछलियों को याद रखने के लिए "मछली पॉकेट" में देख सकता है, बिना दोनों विचारों के आपस में उलझे। यह रोबोट को नई चीज़ सीखने के दौरान पुरानी चीज़ों को भूलने से रोकता है।

2. "टीम कैप्टन" (विज़न कंसिस्टेंसी कंस्ट्रेंट)

आप पूछ सकते हैं: "यदि पॉकेट्स अलग हैं, तो रोबोट को कैसे पता चलेगा कि आसमान में एक 'पक्षी' और पार्क में एक 'पक्षी' समान है?"

यहीं पर टीम कैप्टन आता है। भले ही पॉकेट्स अलग हों, टीम कैप्टन यह सुनिश्चित करता है कि दुनिया के बारे में रोबोट के सोचने का तरीका सुसंगत बना रहे।

  • यह रोबोट को धीरे से याद दिलाता है: "हे, जिस तरह तुम आसमान में एक कार देखते हो, वह वैसे ही है जैसे तुम जमीन पर एक कार देखते हो। केवल इसलिए अपना पूरा व्यक्तित्व न बदलें क्योंकि बैकग्राउंड बदल गया है।"
  • यह रोबोट को पॉकेट्स के बीच ज्ञान साझा करने की अनुमति देता है। आसमान में कारों के बारे में सीखना वास्तव में इसे पानी के नीचे कारों को पहचानने में बेहतर बनाने में मदद करता है, बिना किसी भ्रम के।

नया परीक्षण: MSVQA

इसे सिद्ध करने के लिए, शोधकर्ताओं ने MSVQA नामक एक विशाल परीक्षण बनाया।

  • केवल "क्या यह एक बिल्ली है?" जैसे सरल प्रश्न पूछने के बजाय, उन्होंने एक अराजक, वास्तविक दुनिया का परीक्षण बनाया।
  • उन्होंने रोबोट के सामने सैटेलाइट, अंडरवॉटर कैमरों, ड्रोन और किचन से ली गई छवियां फेंकीं।
  • उन्होंने जटिल प्रश्न पूछे जैसे "विमानों की गिनती करें," "विमान का विशिष्ट मॉडल खोजें," या "कोरल के पीछे छिपी मछली का स्थान बताएं।"

परिणाम: एक सुपर-स्टूडेंट

जब उन्होंने पुराने तरीकों के साथ रोबोट का परीक्षण किया, तो वह बुरी तरह विफल रहा। जैसे ही उसने एक नया दृश्य सीखा, वह पिछला सब भूल गया।

लेकिन UNIFIER के साथ:

  • इसे सब कुछ याद रहता है: मछली के बारे में सीखने के बाद भी यह हवाई जहाज पहचानने में बेहतर होता रहा।
  • यह और स्मार्ट बनता है: विभिन्न दृष्टिकोणों को देखकर, यह वास्तव में अपने समग्र कौशल में सुधार करता है।
  • यह तेज़ है: नए बैकपैक सिस्टम ने रोबोट को धीमा नहीं किया; यह पहले जितना ही तेज़ था।

मुख्य बात (Takeaway)

UNIFIER को एक ऐसे छात्र के रूप में सोचें जो केवल एक पाठ्यपुस्तक को याद नहीं करता है। इसके बजाय, उनके पास हर अलग वातावरण के लिए विशेष गाइड की एक लाइब्रेरी है। जब वे समुद्र में जाते हैं, तो वे समुद्र गाइड खोलते हैं। जब वे आसमान में जाते हैं, तो वे आसमान गाइड खोलते हैं। लेकिन क्योंकि वे वही छात्र हैं, वे आसमान को समझने में मदद के लिए समुद्र से सीखी गई बातों का उपयोग कर सकते हैं, और वे कल जो सीखा था उसे कभी नहीं भूलते।

यह पेपर ऐसे AI सहायकों को बनाने की दिशा में एक बड़ा कदम है जो वास्तव में हमारी अव्यवsted, परिवर्तनशील, बहु-परिदृश्य वाली दुनिया में अपना मानसिक संतुलन खोए बिना रह सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →