← नवीनतम पेपर
💬 NLP

A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAMΔ\Delta Integration into Upcycled MoE

यह शोध पत्र \method नामक एक डेटा-कुशल विधि प्रस्तुत करता है जो डेंस मॉडल्स को मिक्सचर-ऑफ-एक्सपर्ट्स आर्किटेक्चर में अपसाइकिल करता है और बहुभाषी क्षमताओं के विस्तार के लिए पोस्ट-ट्रेनिंग पैरामीटर डेल्टा को एकीकृत करता है, जिससे महंगी निरंतर प्री-ट्रेनिंग या जटिल अलाइनमेंट की आवश्यकता के बिना, नई भाषा अधिग्रहण और मूल मॉडल क्षमताओं के संरक्षण के बीच प्रभावी ढंग से संतुलन बनाया जा सके।

मूल लेखक: Hao Zhou, Tianhao Li, Zhijun Wang, Shuaijie She, Linjuan Wu, Hao-Ran Wei, Baosong Yang, Jiajun Chen, Shujian Huang

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hao Zhou, Tianhao Li, Zhijun Wang, Shuaijie She, Linjuan Wu, Hao-Ran Wei, Baosong Yang, Jiajun Chen, Shujian Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रचनात्मक उपमाओं का उपयोग करते हुए शोध पत्र "DeltaMoE: A Data-Efficient Path to Multilingual LLMs" की व्याख्या दी गई है।

बड़ी समस्या: "द्विभाषी शेफ" (Bilingual Chef) की दुविधा

कल्पना कीजिए कि आपके पास एक विश्व स्तरीय शेफ (एक लार्ज लैंग्वेज मॉडल) है जो अंग्रेजी व्यंजन बनाने में विशेषज्ञ है। वे इसमें अद्भुत हैं। अब, आप चाहते हैं कि यह शेफ हंगेरियन, सर्बियाई और बंगाली व्यंजन बनाना भी सीख जाए।

पारंपरिक तरीका यह है कि शेफ को एक बहुत बड़े कुकिंग स्कूल में लंबे समय के लिए भेजा जाए (जिसे कंटीन्यूड प्री-ट्रेनिंग कहा जाता है)। वे उन नई भाषाओं में हजारों कुकबुक्स का अध्ययन करते हैं। लेकिन इसमें एक पेंच है:

  1. "भुलक्कड़" शेफ: यदि वे नई भाषाओं में बहुत अधिक मेहनत करते हैं, तो वे अपनी मूल अंग्रेजी रेसिपी भूल सकते हैं।
  2. "फीका" शेफ: यदि आप सावधान रहने की कोशिश करते हैं और उनके पुराने अंग्रेजी ज्ञान को नए ज्ञान के साथ धीरे-धीरे मिलाने की कोशिश करते हैं, तो वे दोनों में ही औसत दर्जे के रह जाते हैं। वे अंग्रेजी नहीं भूलते, लेकिन वे नई भाषाओं में भी बहुत अच्छे नहीं बन पाते।

यह वह "ट्रेड-ऑफ" (समझौता) है जिसके बारे में पेपर बात करता है: आपको आमतौर पर या तो नई भाषाएँ अच्छी तरह सीखने या अपने पुराने कौशल को एकदम सही बनाए रखने में से किसी एक को चुनना पड़ता है। आपको शायद ही कभी दोनों मिलते हैं।

समाधान: DeltaMoE ("विशेषज्ञ रसोई" का दृष्टिकोण)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे DeltaMoE कहा जाता है। शेफ को उसका पूरा दिमाग फिर से प्रशिक्षित करके स्मार्ट बनाने के बजाय, वे उसे एक विशेषज्ञ रसोई अपग्रेड देते हैं।

यह तीन सरल चरणों में कैसे काम करता है, यहाँ देखें:

चरण 1: "मिक्सचर ऑफ एक्सपर्ट्स" रसोई बनाना (Upcycling)

कल्पना कीजिए कि शेफ की रसोई का विस्तार किया जाता है। एक बड़े काउंटर के बजाय जहाँ सब कुछ होता है, वे एक मिक्सचर ऑफ एक्सपर्ट्स (MoE) रसोई बनाते हैं।

  • मूल काउंटर (फ्रोजन एक्सपर्ट): शेफ अपना मूल अंग्रेजी काउंटर बिल्कुल वैसा ही रखता है जैसा वह था। वे इसे लॉक कर देते हैं। यहाँ कुछ भी नहीं बदलता। यह सुनिश्चित करता है कि वे अपनी अंग्रेजी रेसिपी कभी न भूलें।
  • नए काउंटर (ट्रेन करने योग्य एक्सपर्ट्स): वे विशेष रूप से नई भाषाओं (हंगेरियन, सर्बियाई, बंगाली) के लिए तीन नए काउंटर बनाते हैं।
  • हेड वेटर (द राउटर): वे एक स्मार्ट हेड वेटर को काम पर रखते हैं। जब कोई ग्राहक अंग्रेजी व्यंजन का ऑर्डर देता है, तो वेटर उन्हें मूल काउंटर पर भेजता है। जब कोई हंगेरियन ऑर्डर देता है, तो वेटर उन्हें हंगेरियन काउंटर पर भेजता है।

शेफ केवल नए काउंटरों पर खाना बनाना सीखता है। मूल काउंटर स्थिर (frozen) रहता है, इसलिए अंग्रेजी कौशल पूरी तरह से सुरक्षित रहता है।

चरण 2: "डेल्टा ग्राफ्ट" (जादुई स्थानांतरण)

अब, नए काउंटर खाना बनाने में तो अच्छे हैं, लेकिन वे ग्राहकों से विनम्रता से बात करना या जटिल निर्देशों का पालन करना नहीं जानते (इसे अलाइनमेंट कहा जाता है)। आमतौर पर, उन्हें यह सीखने के लिए महीनों तक प्रशिक्षण देना होगा।

पेपर की चतुर तकनीक डेल्टा मर्जिंग है।

  • कल्पना कीजिए कि एक अन्य प्रसिद्ध शेफ (एक प्री-ट्रेंड "इंस्ट्रक्ट" मॉडल) है जो पहले से ही ग्राहकों से बात करने और नियमों का पालन करने में माहिर है, लेकिन वह केवल अंग्रेजी बोलता है।
  • नए काउंटरों को शून्य से सिखाने के बजाय, लेखक उस प्रसिद्ध शेफ और उनके मूल आधार के बीच के "अंतर" (डेल्टा) को लेते हैं। इसे एक स्टिकी नोट पर लिखी गई "विनम्रता की रेसिपी" के रूप में सोचें।
  • वे इस स्टिकी नोट को नए काउंटरों पर चिपका देते हैं। क्योंकि नए काउंटर उसी "आटे" (dough) से बने हैं जिससे मूल मॉडल बना था, इसलिए यह "विनम्रता की रेसिपी" तुरंत काम करती है।

परिणाम: नए काउंटर अब हंगेरियन खाना बना सकते हैं और विनम्रता से बात भी कर सकते हैं, और इसके लिए उन्हें महंगे, डेटा-भारी प्रशिक्षण प्रक्रिया से गुजरने की आवश्यकता नहीं होती।

यह पुराने तरीके से बेहतर क्यों है?

पेपर ने अन्य तरीकों के मुकाबले इसका परीक्षण किया और पाया कि:

  1. कोई समझौता नहीं (No More Trade-offs):

    • पुराना तरीका A (एवरेजिंग): पुराने और नए कौशल को मिलाने की कोशिश की। परिणाम: शेफ अंग्रेजी में खराब हो गया और नई भाषाओं में केवल ठीक-ठाक रहा।
    • पुराना तरीका B (डायरेक्ट डेल्टा): केवल नए कौशल को ऊपर से चिपकाने की कोशिश की। परिणाम: शेफ नई भाषाओं में बहुत अच्छा हो गया लेकिन अंग्रेजी बोलना भूल गया।
    • DeltaMoE: शेफ अंग्रेजी में बहुत अच्छा है (क्योंकि मूल काउंटर स्थिर था) और नई भाषाओं में भी बहुत अच्छा है (क्योंकि नए काउंटरों ने उन्हें सीखा और उन्हें "विनम्रता" का ग्राफ्ट मिला)।
  2. डेटा दक्षता (Data Efficiency):

    • अन्य तरीकों को नई भाषा में विनम्र होना सिखाने के लिए लाखों उदाहरणों की आवश्यकता होती है।
    • DeltaMoE इस क्षमता को मौजूदा मॉडल से "ग्राफ्ट" करके मुफ्त में प्राप्त कर लेता है। यह बहुत अधिक समय और कंप्यूटिंग पावर बचाता है।
  3. स्केलेबिलिटी (Scalability):

    • लेखकों ने दिखाया कि भले ही वे अधिक भाषाएँ (जैसे 3 के बजाय 8) जोड़ दें, तो भी सिस्टम टूटता नहीं है। हेड वेटर (राउटर) बस ऑर्डर को सही काउंटर पर भेजना सीख जाता है, और सिस्टम स्थिर रहता है।

निचोड़ (The Bottom Line)

DeltaMoE एक मास्टर शेफ को एक विशेष, मॉड्यूलर रसोई देने जैसा है।

  • वे अपने मूल कार्यक्षेत्र को सुरक्षित रखने के लिए अप्रतिबंधित (untouched) रखते हैं।
  • वे नई भाषाओं के लिए नए कार्यक्षेत्र जोड़ते हैं।
  • वे बिना पुन: प्रशिक्षण के नए कार्यक्षेत्रों में तुरंत "ग्राहक सेवा कौशल" स्थानांतरित कर देते हैं।

यह AI मॉडल्स को कई नई भाषाओं में धाराप्रवाह और विनम्र बनाने की अनुमति देता है, बिना उनकी मूल बुद्धिमत्ता खोए या भारी मात्रा में नए डेटा की आवश्यकता के।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →