← नवीनतम पेपर
🤖 AI

How to Teach Large Multimodal Models New Skills

यह शोध पत्र यह प्रदर्शित करता है कि लार्ज मल्टीमॉडल मॉडल्स के विशिष्ट घटकों, जैसे कि सेल्फ-अटेंशन प्रोजेक्शन्स या एमएलपी गेट्स को चुनिंदा रूप से ट्यून करना, आउटपुट डिस्ट्रीब्यूशन शिफ्ट को नियंत्रित करके क्रमिक कौशल शिक्षण (sequential skill learning) के दौरान होने वाले कैटास्ट्रोफिक फॉरगेटिंग को प्रभावी ढंग से कम करता है, जो जटिल तंत्रों जैसे कि रिप्ले या सहायक मापदंडों की आवश्यकता के बिना फुल फाइन-ट्यूनिंग और मौजूदा शमन विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Zhen Zhu, Yiming Gong, Yao Xiao, Yaoyao Liu, Derek Hoiem

प्रकाशित 2026-04-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhen Zhu, Yiming Gong, Yao Xiao, Yaoyao Liu, Derek Hoiem

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, बहुमुखी सहायक है जिसका नाम "द मॉडल" (The Model) है। यह सहायक तस्वीरों का वर्णन कर सकता है, मेडिकल स्कैन पढ़ सकता है, समय बता सकता है और पक्षियों की पहचान कर सकता है। यह अविश्वसनीय रूप से बुद्धिमान है, लेकिन इसे एक विशाल, सामान्य डेटासेट पर प्रशिक्षित किया गया था। अब, आप इसे एक बहुत ही विशिष्ट नया कौशल सिखाना चाहते हैं: चित्र में वस्तुओं को गिनना

समस्या यह है कि जब आप इसे यह नया कौशल सिखाने की कोशिश करते हैं, तो यह अजीब व्यवहार करने लगता है। वे गिनती करने में तो बहुत अच्छे हो सकते हैं, लेकिन अचानक वे सामान्य रूप से दृश्य का वर्णन करना भूल जाते हैं, या वे हर सवाल का जवाब नंबरों के साथ देने लगते हैं, भले ही आपने उनसे विवरण माँगा हो। इसे "कैटैस्ट्रोफिक फॉरगेटिंग" (Catastrophic Forgetting - विनाशकारी विस्मृति) कहा जाता है। यह वैसा ही है जैसे एक छात्र गणित की परीक्षा के लिए इतनी मेहनत से पढ़ाई करे कि वह अपनी मातृभाषा बोलना ही भूल जाए।

यह शोध पत्र एक सरल प्रश्न पूछता है: हम इस सहायक को सब कुछ भुलाए बिना एक नया कौशल कैसे सिखा सकते हैं?

यहाँ उनकी खोज का विवरण दिया गया है, रोज़मर्रा के उदाहरणों का उपयोग करते हुए।

1. समस्या: "ओवर-राइटर" (Over-Writer)

शोधकर्ताओं ने पाया कि जब आप मॉडल के पूरे मस्तिष्क (सभी पैरामीटर्स) को अपडेट करके उसे एक नया कौशल सिखाने की कोशिश करते हैं, तो यह एक छात्र को लाल मार्कर थमाने और उसे एक नया अध्याय सीखने के लिए अपनी पूरी पाठ्यपुस्तक को फिर से लिखने के लिए कहने जैसा है। वे उस नए अध्याय को पूरी तरह से सीख सकते हैं, लेकिन वे गलती से पुराने अध्यायों को भी मिटा देते हैं, जिससे वे अपठनीय हो जाते हैं।

तकनीकी शब्दों में, मॉडल अपने आउटपुट को बायस (Bias - पक्षपाती) करने लगता है। यदि आप इसे गिनना सिखाते हैं, तो यह नंबरों के प्रति जुनूनी हो जाता है। यह सोचने लगता है, "ओह, आपने मुझसे सवाल पूछा? मुझे आपको एक नंबर देना चाहिए!" भले ही आपने उससे विवरण माँगा हो।

2. खोज: "विशेष उपकरण" (Specialized Tools)

टीम ने महसूस किया कि मॉडल का मस्तिष्क एक एकल पिंड नहीं है; यह विभिन्न उपकरणों से बना है। उन्होंने यह देखने के लिए मस्तिष्क के विभिन्न हिस्सों को अपडेट करके परीक्षण किया कि किस से सबसे कम नुकसान होता है।

उन्होंने दो "जादुई उपकरण" पाए जो पूरी तरह से काम करते हैं:

उपकरण A: "ट्रैफ़िक डायरेक्टर" (सेल्फ-अटेंशन प्रोजेक्शंस)

  • उपमा: कल्पना कीजिए कि मॉडल एक व्यस्त हवाई अड्डा है। सेल्फ-अटेंशन (Self-Attention) लेयर्स एयर ट्रैफिक कंट्रोलर हैं। वे तय करते हैं कि कौन सा विमान (सूचना का टुकड़ा) किस अन्य विमान से बात करेगा। वे उड़ान योजनाएँ नहीं लिखते; वे केवल ट्रैफ़िक को रूट करते हैं।
  • परिणाम: जब शोधकर्ताओं ने केवल "ट्रैफ़िक कंट्रोलर्स" को अपडेट किया, तो मॉडल ने नया कौशल (गिनना) बहुत अच्छी तरह से सीखा। लेकिन क्योंकि उन्होंने "फ्लाइट प्लान लेखकों" को नहीं छुआ, इसलिए मॉडल नंबरों के प्रति जुनूनी नहीं हुआ। वह अभी भी अपने पुराने रास्तों पर पूरी तरह से उड़ सकता था।
  • चुनौती: इसने नया कौशल अच्छी तरह से सीखा, लेकिन उतना तेज़ नहीं जितना कि यदि उन्होंने पूरी किताब को फिर से लिखा होता।

उपकरन B: "फैक्ट राइटर" (MLP गेट एंड अप)

  • उपमा: MLP (फीड-फॉरवर्ड नेटवर्क) मस्तिष्क का वह हिस्सा है जो वास्तव में तथ्यों को संग्रहीत करता है और उत्तर लिखता है। यह एक लाइब्रेरियन की तरह है जो शेल्फ से किताबें निकालता है।
  • समस्या: आमतौर पर, जब आप लाइब्रेरियन को एक नया तथ्य सिखाते हैं, तो वे इतने उत्साहित हो जाते हैं कि वे उस तथ्य को हर किसी पर चिल्लाकर बताने लगते, भले ही आप सिर्फ मौसम के बारे में पूछना चाहते हों।
  • समाधान: शोधकर्ताओं ने पाया कि लाइब्रेरियन के "खोज कौशल" (Gate & Up) को अपडेट करना और उनके "चिल्लाने के कौशल" (Down projection) को फ्रीज (स्थिर) करना काम करता है।
  • परिणाम: लाइब्रेरियन ने नया तथ्य पूरी तरह से सीखा लेकिन वे हर किसी पर चिल्लाना शुरू नहीं कर पाए। वे अभी भी सामान्य सवालों के जवाब सामान्य रूप से दे सकते थे। यह सबसे अच्छा संतुलन था: उन्होंने नया कौशल लगभग "फुल रीराइट" विधि जितना ही अच्छा सीखा, लेकिन वे लगभग कुछ भी नहीं भूले।

3. "रिकवरी" (Recovery - पुनः प्राप्ति) घटना

सबसे रोमांचक खोजों में से एक यह थी कि विस्मृति हमेशा स्थायी नहीं होती है।

  • उपमा: कल्पना कीजिए कि मॉडल एक मानसिकता में "फँस" गया है। गिनती सीखने के बाद, वह सोचता है, "सब कुछ एक नंबर है!"
  • जादू: यदि आप फिर से उसे एक अलग कौशल सिखाते हैं, जैसे मेडिकल रिपोर्ट पढ़ना (जिसके लिए शब्दों की आवश्यकता होती है, नंबरों की नहीं), तो मॉडल "जाग" जाता है। नंबरों का जुनून कम हो जाता है, और वह चीजों का वर्णन करना फिर से याद कर लेता है।
  • पाठ: जानकारी वास्तव में डिलीट नहीं हुई थी; यह केवल एक नई, संकीकर आदत के नीचे अस्थायी रूप से दब गई थी। कार्य बदलने से इसे वापस निकाला जा सकता है।

4. समाधान: "चयनात्मक ट्यूनिंग" (Selective Tuning)

पुराने डेटा को बचाने के लिए जटिल, महंगे तरीकों (जैसे कि छात्र द्वारा पढ़ी गई हर किताब का बैकअप रखना) का उपयोग करने के बजाय, शोधकर्ता एक सरल नियम का सुझाव देते हैं:

पूरी किताब को फिर से न लिखें। बस उन विशिष्ट पृष्ठों को अपडेट करें जो नए कौशल को संभालते हैं।

  • यदि आप स्थिरता चाहते हैं: केवल "ट्रैफ़िक कंट्रोलर्स" (सेल्फ-अटेंशन) को अपडेट करें।
  • यदि आप न्यूनतम क्षति के साथ अधिकतम सीखना चाहते हैं: लाइब्रेरियन के "खोज कौशल" (MLP गेट एंड अप) को अपडेट करें लेकिन "चिल्लाने" वाले हिस्से को फ्रीज रहने दें।

यह क्यों महत्वपूर्ण है

AI को नए कौशल सिखाना आमतौर पर महंगा और जोखिम भरा होता है। आप एक मॉडल को प्रशिक्षित करने में लाखों डॉलर खर्च कर सकते हैं, केवल यह देखने के लिए कि वह सामान्य रूप से मददगार होना भूल गया है।

यह शोध पत्र हमें एक सरल, सस्ता और प्रभावी नुस्खा देता है: सर्जिकल (Surgical) बनें। पूरे मस्तिष्क को न बदलें। बस उन विशिष्ट हिस्सों को ट्यून करें जो नए कार्य को संभालते हैं। इस तरह, AI गिनना, मेडिकल रिपोर्ट पढ़ना या पक्षियों की पहचान करना सीख सकता है, और साथ ही एक सहायक, सामान्य सहायक के रूप में भी याद रख सकता है।

संक्षेप में: एक सुपर-इंटेलिजेंट AI को उसके पुराने कौशल भुलाए बिना एक नया करतब सिखाने के लिए, उसे सब कुछ फिर से सीखने के लिए मजबूर न करें। बस उसे अपने मौजूदा उपकरणों का थोड़ा नए तरीके से उपयोग करना दिखाएं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →