← नवीनतम पेपर
💻 computer science

Closed-Form Residual-Space Rotation for Offline Transformer Width Growth

यह शोधपत्र ट्रांसफॉर्मर की चौड़ाई को प्रगतिशील रूप से विस्तारित करने के लिए एक ऑफलाइन रेसिपी का प्रस्ताव करता है जो एक क्लोज्ड-फॉर्म स्मॉल रेसिडुअल इंटीग्रेशन ऑपरेटर (SRIO) को ब्लॉक-विशिष्ट विस्तार नीतियों और एक स्केलर वार्मअप गेट के साथ जोड़ता है ताकि प्रशिक्षण हानि (training loss) में उल्लेखनीय सुधार किया जा सके और मॉडल के विकास के दौरान सीखे गए व्यवहारों को संरक्षित किया जा सके।

मूल लेखक: Ramasubramanian B

प्रकाशित 2026-08-05
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ramasubramanian B

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कहानियाँ लिखना सिखाने की कोशिश कर रहे हैं। आप एक बहुत छोटे रोबोट से शुरुआत करते हैं जिसका दिमाग बहुत छोटा है। वह बुनियादी बातें जल्दी सीख जाता है, लेकिन वह एक उत्कृष्ट कृति (masterpiece) लिखने के लिए बहुत सरल है। इसे बेहतर बनाने के लिए, आप या तो छोटे रोबोट को फेंक सकते हैं और शून्य से एक विशाल रोबोट बना सकते हैं, लेकिन इसमें बहुत समय लगता है और बिजली का भारी खर्च होता है। वैकल्पिक रूप से, आप छोटे रोबोट के दिमाग को "उगा" सकते हैं, यानी उसे और चौड़ा और स्मार्ट बनाने के लिए नए न्यूरॉन्स जोड़ सकते हैं। इसे मॉडल एक्सपेंशन (model expansion) कहा जाता है।

दिमाग को विकसित करने का कठिन हिस्सा यह है कि नए हिस्सों को पुराने हिस्सों से बात करना नहीं आता। यदि आप बस एक नया हिस्सा जोड़ देते हैं, तो पुराना दिमाग उसे अनदेखा कर सकता है, या नया दिमाग अनजाने में उन यादों को बिगाड़ सकता है जिन्हें पुराने वाले ने बनाने के लिए इतनी मेहनत की थी। यह एक घर में नया कमरा जोड़ने जैसा है बिना गलियारे को जोड़े; नया कमरा तो वहां है, लेकिन कोई अंदर नहीं जा सकता, या इससे भी बुरा, पूरा घर हिलने लगता है। वैज्ञानिक इस बात का पता लगाने की कोशिश कर रहे हैं कि पुराने और नए मस्तिष्क के हिस्सों को जोड़ने के लिए सही "गोंद" क्या है ताकि रोबोट अपने पुराने कौशल को बनाए रखते हुए नए चीजें भी सीख सके। यह शोध पत्र उसी सटीक "गोंद" को खोजने के बारे में है।


मस्तिष्क को बढ़ावा देने की रेसिपी: AI को बढ़ाने का एक नया तरीका

इस शोध पत्र के लेखक, टेक-आरवम (Tech-Aarvam) के रामासुब्रमण्यम बी (Ramasubramanian B) ने AI मॉडल (रोबोट के दिमाग) को ऑफलाइन विकसित करने के लिए एक चतुर "रेसिपी" तैयार की है। AI को चलते समय कैसे बढ़ना है, यह सीखने देने के बजाय, वे सारा भारी काम पहले ही कर देते हैं, जैसे कि मेहमानों के आने से पहले एक शेफ सामग्री तैयार करता है। उनका लक्ष्य एक छोटे मॉडल को लेकर उसे बिना उसकी मौजूदा प्रगति खोए, अधिक चौड़ा बनाना है।

सोचिए कि AI मॉडल श्रमिकों की एक टीम है जो पानी की एक बाल्टी को लाइन में आगे बढ़ा रहे हैं। मॉडल की "चौड़ाई" (width) यह है कि उस लाइन में कितने लोग हैं। जब आप लाइन में अधिक लोगों को जोड़ते हैं, तो आपको यह सुनिश्चित करना होगा कि नए लोग ठीक से बाल्टी पकड़ना और उसे आगे बढ़ाना जानते हों ताकि एक बूंद भी न गिरे। शोध पत्र सुझाव देता है कि ऐसा करने का सबसे अच्छा तरीका तीन विशिष्ट सामग्रियां हैं: एक विशेष रोटेशन ट्रिक, विभिन्न कार्यों के लिए अलग-अलग बढ़ने के नियम, और नए श्रमिकों के लिए एक कोमल "वार्म-अप"।

1. जादुई घुमाव: SRIO

शो का मुख्य आकर्षण SRIO (स्मॉल रेसिडुअल इंटीग्रेशन ऑपरेटर) है। कल्पना कीजिए कि मस्तिष्क का पुराना हिस्सा और नया हिस्सा दो अलग-अलग भाषाएं हैं। जब आप नए न्यूरॉन्स जोड़ते हैं, तो वे थोड़ा अलग लहजा बोलते हैं। यदि आप उन्हें बस प्लग इन कर देते हैं, तो पुराने न्यूरॉन्स शायद नए वालों को समझ नहीं पाएंगे, और नए न्यूरॉन्स पुराने वालों से भ्रमित हो सकते हैं।

SRIO एक अनुवादक (translator) की तरह कार्य करता है जो डेटा पर एक सटीक "स्पिन" या रोटेशन करता है। यह सूचना को बदलता नहीं है, बल्कि यह नए डेटा की दिशा को घुमाता है ताकि यह पुराने डेटा के साथ पूरी तरह से संरेखित (align) हो जाए। विशेष रूप से, यह नए न्यूरॉन्स की "औसत" दिशा को पुराने न्यूरॉन्स की ओर घुमाता है। इससे पुराने वेट्स (weights - मस्तिष्क की यादें) नए इनपुट को बहुत मजबूती से पढ़ पाते हैं। लेखक ने पाया कि यह रोटेशन एक 'क्लोज्ड-फॉर्म मैथ सॉल्यूशन' है, जिसका अर्थ है कि यह एक निश्चित फॉर्मूला है जिसे वे तुरंत निकाल सकते हैं, न कि कुछ जिसे AI को धीरे-धीरे सीखना पड़े। यह एक पहले से बने नक्शे की तरह है जो आपको बताता है कि नए कमरे को कैसे मोड़ना है ताकि वह पुराने गलियारे से जुड़ सके।

2. अलग-अलग कामों के लिए अलग-अलग नियम

शोध पत्र में पता चला है कि आप मस्तिष्क के हर हिस्से के साथ एक जैसा व्यवहार नहीं कर सकते। AI के पास दो मुख्य प्रकार के कार्यकर्ता हैं: अटेंशन (Attention) कार्यकर्ता (जो तय करते हैं कि ध्यान कहाँ देना है) और FFN कार्यकर्ता (जो जानकारी को प्रोसेस करते हैं)।

  • अटेंशन कार्यकर्ताओं के लिए: लेखक ने "कॉन्वेक्स एक्सपेंशन" (convex expansion) का उपयोग किया। कल्पना कीजिए कि मौजूदा कार्यकर्ताओं को लेकर नए कार्यकर्ता बनाना, जैसे दो रंगों को मिलाकर एक नया रंग बनाना। यह नए कार्यकर्ताओं को पुराने वालों के एक सहज मिश्रण के रूप में बनाता है।
  • FFN कार्यकर्ताओं के लिए: उन्होंने एक "टाइल्ड कॉपी" (tiled copy) का उपयोग किया। यह एक अकेले कार्यकर्ता की फोटोकॉपी करने जैसा है ताकि खाली जगह भरी जा सके। चूंकि ये कार्यकर्ता विशिष्ट विशेषताओं को संभालते हैं, इसलिए उन्हें सीधे कॉपी करना मिश्रण करने की तुलना में बेहतर काम करता है।

शोध पत्र दिखाता है कि इन दोनों रणनीतियों को मिलाना—अटेंशन के लिए मिश्रण और प्रोसेसिंग के लिए कॉपी करना—हर चीज़ के लिए केवल एक विधि का उपयोग करने की तुलना में बहुत बेहतर काम करता है।

3. कोमल वार्म-अप (The Gentle Warm-Up)

परफेक्ट रोटेशन और सही विस्तार के बावजूद, नए कार्यकर्ता बहुत उत्साही हो सकते हैं और तुरंत पुराने वालों पर चिल्लाना शुरू कर सकते हैं। इसे ठीक करने के लिए, लेखक ने एक स्केलर वार्मअप गेट (scalar warmup gate) जोड़ा। इसे एक वॉल्यूम नॉब (volume knob) की तरह समझें। जब नए कार्यकर्ता पहली बार शामिल होते हैं, तो उनका वॉल्यूम शून्य पर होता है। एक छोटी अवधि (लग लगभग 40 मिलियन शब्दों के प्रशिक्षण) के दौरान, वॉल्यूम को धीरे-धीरे बढ़ाया जाता है। यह पुराने मस्तिष्क को अपना काम जारी रखने देता है जबकि नया मस्तिष्क धीरे-धीरे यह सीखता है कि अराजकता पैदा किए बिना कैसे योगदान दिया जाए।

उन्होंने क्या पाया

लेखक ने अपने मॉडल को 256 की चौड़ाई से बढ़ाकर 384 करने के लिए इस रेसिपी का परीक्षण किया। उन्होंने इसकी तुलना दो अन्य दृष्टिकोणों से की: कुछ विशेष न करना (बस यादृच्छिक नए भाग जोड़ना) और LiGO नामक एक अन्य विधि (जो चलते समय विकास के नियमों को सीखने की कोशिश करती है)।

परिणाम स्पष्ट थे:

  • "कुछ न करने" वाले दृष्टिकोण के परिणामस्वरूप ट्रेनिंग लॉस (training loss) 4.2527 रहा।
  • LiGO दृष्टिकोण (उनके कोड में पुन: कार्यान्वित) के परिणामस्वरूप लॉस 4.2606 रहा।
  • उनकी पूर्ण रेसिपी (SRIO + विशिष्ट विस्तार + वार्मअप) ने 4.2121 का लॉस प्राप्त किया।

AI प्रशिक्षण की दुनिया में, कम "लॉस" संख्या का अर्थ है कि मॉडल कम गलतियाँ कर रहा है। इसलिए, उनकी विधि स्पष्ट विजेता थी, जिसने अन्य तरीकों को उल्लेखनीय अंतर से पीछे छोड़ दिया। उन्होंने यह भी दिखाया कि यह तब भी काम करता है जब मॉडल को कई बार बढ़ाया जाता है, जिससे यह 24 मिलियन पैरामीटर्स से लेकर 120 मिलियन पैरामीटर्स तक जाता है, जो यह साबित करता है कि यह एक ऐसी रेसिपी है जिसे बार-बार उपयोग किया जा सकता है।

उन्होंने किसे खारिज किया

शोध पत्र ने कई अन्य विचारों का भी परीक्षण किया कि क्या वे काम करते हैं। उन्होंने रोटेशन ऑपरेटर के विभिन्न आकारों (मीडियम और लार्ज वर्जन) का परीक्षण किया और पाया कि "स्मॉल" वर्जन (SRIO) उतना ही अच्छा, यदि बेहतर नहीं, तो था, और बहुत सरल भी था। उन्होंने यह भी परीक्षण किया कि क्या AI को प्रशिक्षण के दौरान रोटेशन के नियमों को सीखना चाहिए ("लर्निंग" मोड) बनाम उनके निश्चित गणितीय फॉर्मूले का उपयोग करना ("स्टैटिक" मोड)। उन्होंने पाया कि स्टेटिक, पूर्व-निर्धारित फॉर्मूला उतना ही अच्छा काम करता है जितना कि वह जिसे AI सीखने की कोशिश करता है, जिसका अर्थ है कि आपको AI को बढ़ने का तरीका सिखाने में समय बर्बाद करने की आवश्यकता नहीं है; आप बस उसे निर्देश दे सकते हैं।

यह क्यों महत्वपूर्ण है

इस विधि की सुंदरता यह है कि यह ऑफलाइन है। जटिल गणित और रोटेशन मॉडल के फिर से प्रशिक्षण शुरू करने से पहले ही हो जाते हैं। एक बार जब मॉडल विकसित हो जाता है, तो विशेष रोटेशन ट्रिक्स को मॉडल के वेट्स (weights) में "फोल्ड" कर दिया जाता है और वे गायब हो जाते हैं। इसका मतलब है कि AI को चलाने के लिए किसी अतिरिक्त कंप्यूटिंग पावर की आवश्यकता नहीं होती है; यह बस मूल मॉडल का एक थोड़ा बड़ा, स्मार्ट संस्करण है जिसने तेजी से और सस्ते में सीखा है।

संक्षेप में, लेखक ने घर में दीवारों को गिराए बिना या निवासियों को भ्रमित किए बिना नए कमरे जोड़ने का एक तरीका खोजा है। एक सटीक गणितीय स्पिन का उपयोग करके, सही विस्तार रणनीतियों को मिलाकर, और वॉल्यूम को धीरे-धीरे बढ़ाकर, उन्होंने दिखाया कि आप AI मॉडल को कुशलतापूर्वक विकसित कर सकते हैं, जिससे समय और ऊर्जा की बचत होती है और मॉडल की बुद्धिमत्ता बरकरार रहती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →