← नवीनतम पेपर
💻 computer science

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

यह शोध पत्र Splash को प्रस्तुत करता है, जो एक मास्क-आइसोलेटेड टैक्टाइल अलाइनमेंट फ्रेमवर्क है जो कैटास्ट्रोफिक फॉरगेटिंगिंग (catastrophic forgetting) या अतिरिक्त इन्फरेंस ओवरहेड के बिना स्टेट-ऑफ-द-आर्ट विज़ुओ-टैक्टाइल रीजनिंग सक्षम करने के लिए MLLM मापदंडों को क्रिटिकल और डॉर्मेंट सबस्पेस में विभाजित करता है।

मूल लेखक: Yoonhyung Park, Minji Kim, Sungwon Moon, Jiyoung Lee

प्रकाशित 2026-07-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yoonhyung Park, Minji Kim, Sungwon Moon, Jiyoung Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट सहायक है जो चित्रों को देखने और उनके बारे में उत्तर देने में माहिर है। वह जानता है कि नींबू का चित्र पीला और खट्टा होता है। लेकिन एक समस्या है: यदि आप रोबोट से यह बताने के लिए कहते हैं कि नींबू कैसा महसूस होता है (क्या यह चिपचिपा है? क्या यह ऊबड़-खाबड़ है?), तो रोबोट अक्सर भ्रमित हो जाता है। वह वास्तव में बनावट (टेक्सचर) को "जानने" के बजाय केवल इस आधार पर अनुमान लगाने लगता है कि नींबू कैसा दिखता है।

इससे भी बुरा यह है कि यदि आप रोबोट को चीजों को छूते हुए हाथों के हजारों चित्र दिखाकर स्पर्श (टच) के बारे में सिखाने की कोशिश करते हैं, तो रोबोट अक्सर छवियों को देखने और समझने का अपना कौशल भूल जाता है। यह वैसा ही है जैसे किसी पियानो वादक को ड्रम बजाना सिखाने के लिए केवल ड्रम का अभ्यास कराया जाए; वे ड्रम में तो अच्छे हो सकते हैं, लेकिन वे पियानो बजाना भूलने लगते हैं। इसे "कैटास्ट्रोफिक फॉरगेटिंग" (विनाशकारी विस्मृति) कहा जाता है।

यह शोध पत्र इस समस्या को हल करने के लिए एक नई विधि पेश करता है जिसे Splash कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

समस्या: "सब कुछ या कुछ भी नहीं" की दुविधा

शोधकर्ताओं ने पाया कि छोटे, कुशल रोबोट (जो वास्तविक दुनिया के उपयोग के लिए बेहतरीन हैं) दृष्टि (देखने) के अपने पुराने कौशल (दृष्टि और भाषा) को खोए बिना एक नई इंद्रिय (स्पर्श) को सीखने के लिए पर्याप्त "मस्तिष्क शक्ति" नहीं रखते हैं। आमतौर पर, आपको चुनना पड़ता है: या तो दृष्टि के बारे में स्मार्ट बने रहें, या स्पर्श के बारे में स्मार्ट बनें, लेकिन दोनों एक साथ नहीं।

समाधान: "सोने वाले कमरे" की उपमा

कल्पना कीजिए कि रोबोट का मस्तिष्क एक विशाल पुस्तकालय है जो किताबों से भरा है (ये रोबोट के आंतरिक सेटिंग्स, या "पैरामीटर्स" हैं)।

  • महत्वपूर्ण किताबें: कुछ किताबें अनिवार्य हैं। उनमें पढ़ने, छवियों को समझने और बोलने के नियम होते हैं। यदि आप इन्हें बदलते हैं, तो रोबोट सब कुछ भूल जाता है।
  • सुप्त (Dormant) किताबें: अन्य किताबें शेल्फ पर रखी हुई हैं, जिन्हें शायद ही कभी खोला जाता है। वे अभी ज्यादा काम नहीं कर रही हैं।

Splash एक चतुर लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह कार्य करता है। पूरे पुस्तकालय को फिर से लिखने के बजाय (जो रोबोट के मौजूदा ज्ञान को तोड़ देगा), यह दो काम करता है:

  1. "सोने वाले कमरे" की पहचान करना: यह पुस्तकालय को स्कैन करता है ताकि उन विशिष्ट किताबों को खोजा जा सके जिनका दृश्य कार्यों (visual tasks) के लिए शायद ही कभी उपयोग किया जाता है। ये "सुप्त" पैरामीटर्स हैं।
  2. "महत्वपूर्ण कमरे" को लॉक करना: यह उन किताबों पर एक भारी ताला लगा देता है जो दृष्टि और भाषा के लिए आवश्यक हैं। ये जमी हुई (frozen) हैं और बदली नहीं जा सकतीं।
  3. "सोने वाले कमरे" में पढ़ाना: यह स्पर्श के बारे में नई जानकारी लेती है और उसे केवल सुप्त अनुभाग में ही सिखाती है।

यह एक बड़ी बात क्यों है

  • कोई स्मृति हानि नहीं: क्योंकि "महत्वपूर्ण कमरा" लॉक है, रोबốt कभी भी देखना या बोलना नहीं भूलता। वह अपना मूल व्यक्तित्व और बुद्धिमत्ता बनाए रखता है।
  • कोई अतिरिक्त वजन नहीं: आमतौर पर, एक नई इंद्रिय जोड़ने के लिए रोबोट में औजारों का एक पूरा नया "बैकपैक" जोड़ने की आवश्यकता होती है, जिससे वह धीमा और भारी हो जाता है। Splash कोई बैकपैक नहीं जोड़ता; यह बस मौजूदा कमरे के अंदर के फर्नीचर को पुनर्व्यवस्थित करता है। रोबोट उतना ही तेज़ और हल्का रहता है जितना पहले था।
  • एक-चरणीय प्रशिक्षण: पुराने तरीकों में स्पर्श सिखाने के बाद भाषा सिखाने और फिर उन्हें मिलाने की एक लंबी, जटिल प्रक्रिया की आवश्यकता होती थी। Splash यह सब एक बार में करता है, जैसे बिना गिरे एक साथ करतब दिखाना और साइकिल चलाना सीखना।

परिणाम

शोधकर्ताओं ने छोटे रोबोटों (1 बिलियन और 3 बिलियन "न्यूरॉन्स" वाले मॉडल का उपयोग करके) पर इसका परीक्षण किया।

  • स्पर्श बेहतर है: Splash रोबोट पिछले तरीकों की तुलना में बनावट (जैसे "खुरदरा", "नरम" या "दानेदार") का वर्णन करने में बहुत बेहतर हो गए, यहाँ तक कि उन्होंने बहुत बड़े और अधिक शक्तिशाली रोबोटों को भी पीछे छोड़ दिया।
  • देखना अभी भी शानदार है: सामान्य दृष्टि कार्यों (जैसे छवियों के आधार पर गणित की समस्याओं को हल करना या वस्तुओं की पहचान करना) पर परीक्षण करने पर, Splash रोबोटों ने स्पर्श सीखने से पहले के प्रदर्शन के समान ही प्रदर्शन किया। उन्होंने अपने मूल कौशल नहीं खोए।

संक्षेप में

Splash एक ऐसी तकनीक है जो छोटे, कुशल रोबोटों को देखना या बोलना भूलने के बिना स्पर्श की समझ सीखने में मदद करती है। यह रोबोट के मस्तिष्क में "अप्रयुक्त स्थान" को खोजने और उसमें नई स्पर्श संबंधी जानकारी भरने का काम करता है, जबकि "महत्वपूर्ण स्थान" को पूरी तरह सुरक्षित और अछूता रखता है। यह एक कार के इंजन को अपग्रेड करने जैसा है ताकि वह नए ईंधन पर चल सके, बिना स्टीयरिंग व्हील या ब्रेक को खोले।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →