← नवीनतम पेपर
🤖 machine learning

SAME: Stabilized Mixture-of-Experts for Multimodal Continual Instruction Tuning

यह शोध पत्र SAME का प्रस्ताव करता है, जो मल्टीमॉडल कॉन्टिनुअल इंस्ट्रक्शन ट्यूनिंग के लिए एक स्टेबलाइज्ड मिक्सचर-ऑफ-एक्सपर्ट्स फ्रेमवर्क है, जो ऑर्थोगोनल सबस्पेस रूटिंग, कर्वेचर-अवेयर स्केलिंग और एडेप्टिव एक्सपर्ट एक्टिवेशन के माध्यम से राउटर और एक्सपर्ट ड्रिफ्ट को कम करता है, जिससे एक नए लॉन्ग-सीक्वेंस बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त होता है।

मूल लेखक: Zhen-Hao Xie, Jun-Tao Tang, Yu-Cheng Shi, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

प्रकाशित 2026-08-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhen-Hao Xie, Jun-Tao Tang, Yu-Cheng Shi, Han-Jia Ye, De-Chuan Zhan, Da-Wei Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसा छात्र है जो गणित की समस्याओं को हल करने में बहुत प्रतिभाशाली है लेकिन, जब उसे कोई कविता पढ़ने के लिए कहा जाता है, तो वह अचानक गिनती करना भूल जाता है। यह आधुनिक आर्टिफिशियल इंटेलिजेंस सिस्टम की मुख्य चुनौती है जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (multimodal large language models) कहा जाता है। ये शक्तिशाली कंप्यूटर हैं जो चित्र देख सकते हैं और टेक्स्ट पढ़ सकते हैं, और डेटा की विशाल मात्रा का अध्ययन करके दुनिया के बारे में सवालों के जवाब देना सीखते हैं। उन्हें निर्देशों का पालन करने के लिए प्रशिक्षित किया जाता है, जैसे "तस्वीर में बिल्ली का वर्णन करें" या "इस भौतिकी की समस्या को हल करें।" हालांकि, वास्तविक दुनिया में, ये सिस्टम सब कुछ एक साथ नहीं सीखते हैं। इसके बजाय, वे एक के बाद एक नए प्रकार के कार्यों का सामना करते हैं, जैसे कि एक छात्र का गणित की कक्षा से इतिहास की कक्षा में, और फिर कला की कक्षा में जाना। समस्या यह है कि जैसे-जैसे ये मॉडल नए कौशल सीखते हैं, वे अक्सर पुराने कौशल भूल जाते हैं, जिसे वैज्ञानिक 'कैटैस्ट्रोफिक फॉरगेटिंग' (catastrophic forgetting) कहते हैं। इन मॉडलों को उपयोगी बनाए रखने के लिए, शोधकर्ताओं को उन्हें नया सिखाने का एक ऐसा तरीका खोजने की आवश्यकता है जिससे वे वह सब कुछ न मिटा दें जो वे पहले से जानते हैं।

कुछ समय से, विशेषज्ञों ने मॉडल को विशेष सहायकों की एक टीम देकर इसे हल करने का प्रयास किया है, जिसे 'मिक्सचर ऑफ एक्सपर्ट्स' (mixture of experts) नामक संरचना कहा जाता है। मॉडल को एक बड़े कार्यालय के रूप में सोचें जहाँ विभिन्न कार्यकर्ता, या "विशेषज्ञ", अलग-अलग प्रकार के काम संभालते हैं। जब कोई प्रश्न आता है, तो एक मैनेजर, जिसे राउटर (router) कहा जाता है, यह तय करता है कि कौन सा कार्यकर्ता उत्तर देने के लिए सबसे उपयुक्त है। यदि प्रश्न किसी चार्ट के बारे में है, तो राउटर उसे डेटा विश्लेषक के पास भेज देता है; यदि वह किसी कविता के बारे में है, तो वह उसे लेखक के पास भेज देता है। यह प्रणाली तब अच्छी तरह काम करती है जब कार्य स्थिर होते हैं, लेकिन शोधकर्ताओं ने पाया कि जब मॉडल को कार्यों के एक लंबे क्रम को सीखने की आवश्यकता होती है, तो इसमें एक दोष होता है। जैसे-जैसे मॉडल नए कौशल सीखता है, मैनेजर गलतियाँ करने लगता है, और पुराने प्रकार के प्रश्नों को गलत कार्यकर्ताओं के पास भेजने लगता है। साथ ही, कार्यकर्ता स्वयं भी बदलने लगते हैं, और उन पिछले कार्यों के लिए विकसित किए गए विशिष्ट कौशल खो देते हैं। इस दोहरी विफलता का अर्थ था कि मॉडल न केवल प्रश्नों को गलत लोगों के पास भेज रहा था, बल्कि वह यह भी भूल रहा था कि उन लोगों को क्या काम करना था।

शोधकर्ताओं की एक टीम ने अब इन समस्याओं को ठीक करने के लिए SAME नामक एक नई विधि प्रस्तावित की है। उन्होंने पाया कि मैनेजर का भ्रमित होना और कार्यकर्ताओं की याददाश्त खोना दो अलग-अलग समस्याएं थीं जिनके लिए अलग-अलग समाधानों की आवश्यकता थी। मैनेजर को भ्रमित होने से रोकने के लिए, शोधकर्ताओं ने एक ऐसी प्रणाली डिजाइन की जो सावधानीपूर्वक ट्रैक करती है कि मॉडल दुनिया को कैसे देखता है। मैनेजर को हर नए सबक के साथ अपना निर्णय पूरी तरह से बदलने देने के बजाय, वे उसके ध्यान केंद्रित करने के तरीके में बदलाव को सीमित कर देते हैं। वे मैनेजर को प्रश्नों को छाँटने के नए तरीके सीखने की अनुमति देते हैं, लेकिन छाँटने के उन पुराने तरीकों की रक्षा करते हैं जो पिछले कार्यों के लिए आवश्यक थे। यह सुनिश्चित करता है कि, उदाहरण के लिए, मेडिकल इमेज (चिकित्सा चित्र) के बारे में एक प्रश्न, मेडिकल विशेषज्ञ के पास ही जाए, भले ही मॉडल ने मानचित्र पढ़ना या रसायन विज्ञान की समस्याओं को हल करना सीख लिया हो।

कार्यकर्ताओं को अपना काम भूलने से रोकने के लिए, शोधकर्ताओं ने एक तरीका पेश किया जिससे यह मापा जा सके कि एक कार्यकर्ता का नया सीखना उनके पुराने कौशल को कितना नुकसान पहुँचा सकता है। उन्होंने देखा कि कार्यकर्ताओं ने अतीत में किस प्रकार के डेटा को देखा था और उस इतिहास का उपयोग उन परिवर्तनों को धीमा करने के लिए किया जो उनके पुराने कौशल को नुकसान पहुँचा सकते थे। यह एक कार्यकर्ता को यह बताने जैसा है, "आप यह नया कौशल सीख सकते हैं, लेकिन इसे इस तरह से सीखें कि यह आपके पुराने मशीनों को ठीक करने के तरीके को न मिटा दे।" ऐसा करके, मॉडल उन विशिष्ट क्षमताओं को सुरक्षित रखता है जो उसने पिछले कार्यों से प्राप्त की थीं, जबकि नए कार्यों के अनुकूल होने में भी सक्षम रहता है। इसके अतिरिक्त, शोधकर्ताओं ने पाया कि हर सबक के लिए हर कार्यकर्ता का सक्रिय होना आवश्यक नहीं है। उन्होंने एक नियम बनाया जो उन कार्यकर्ताओं को अस्थायी रूप से रोक देता है जिनकी वर्तमान कार्य के लिए आवश्यकता नहीं है, जिससे ऊर्जा बचती है और उन्हें अप्रासंगिक जानकारी द्वारा गलती से बदले जाने से रोका जा सकता है।

टीम ने चुनौतीपूर्ण बेंचमार्क पर इस नए दृष्टिकोण का परीक्षण किया, जिसमें उनके द्वारा बनाया गया एक नया सेट भी शामिल था जो वास्तविक दुनिया की अव्यवस्थित और विविध वास्तविकता की नकल करता है। इस नए परीक्षण में दस अलग-अलग प्रकार के कार्य शामिल थे, जिनमें मेडिकल दस्तावेज़ों को पढ़ना और वैज्ञानिक चार्ट का विश्लेषण करने से लेकर जटिल सड़क दृश्यों और रासायनिक सूत्रों को समझना शामिल है। परिणामों ने दिखाया कि उनकी विधि, SAME, पिछले तरीकों की तुलना में पुराने कार्यों को याद रखने में काफी बेहतर थी। एक विशिष्ट परीक्षण में, जिसमें आठ कार्यों का एक लंबा क्रम शामिल था, नई विधि ने अन्य दृष्टिकोणों की तुलना में पहले कार्य पर बहुत उच्च स्तर की सटीकता बनाए रखी। यह अधिक कुशल भी साबित हुई, क्योंकि इसे प्रशिक्षित करने के लिए कम समय और कंप्यूटर मेमोरी की आवश्यकता थी क्योंकि इसने केवल आवश्यक कार्यकर्ताओं को ही अपडेट किया।

शायद सबसे महत्वपूर्ण बात यह है कि शोधकर्ताओं ने देखा कि उनके तरीके ने उस सूक्ष्म लेकिन सामान्य विफलता को रोका जहाँ मॉडल सही उत्तर तो देता है लेकिन उसे गलत प्रारूप (format) में देता है। उदाहरण के लिए, यदि किसी कार्य के लिए उत्तर बड़े अक्षरों (capital letters) में चाहिए, तो मॉडल नया कार्य सीखने के बाद छोटे अक्षरों (lowercase letters) में उत्तर देने लग सकता है। नया सिस्टम मॉडल को सुसंगत रखता है, यह सुनिश्चित करता है कि वह प्रत्येक कार्य के विशिष्ट प्रारूप नियमों का पालन करे बिना अगले कार्य की शैली से भ्रमित हुए। निर्णय लेने वाले (कि कौन उत्तर देगा) और उत्तर देने वाले (की स्मृति) दोनों को स्थिर करके, यह कार्य कृत्र-निर्मित बुद्धिमत्ता (AI) के लिए निरंतर सीखने का एक अधिक विश्वसनीय तरीका प्रदान करता है, जिससे उसकी क्षमताओं का विस्तार होता है बिना उसके आधार को खोए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →