Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less
यह लेख "ऑप्टिमाइज़र-मॉडल कंसिस्टेंसी" (Optimizer-Model Consistency) की अवधारणा को प्रस्तुत करता है और यह प्रदर्शित करता है कि प्री-ट्रेनिंग और फुल फाइन-ट्यूनिंग दोनों के लिए एक ही ऑप्टिमाइज़र का उपयोग करने से अन्य ऑप्टिमाइज़र्स या LoRA की तुलना में कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) कम होती है और लर्निंग-फॉरगेटिंग ट्रेड-ऑफ में सुधार होता है, साथ ही यह भी दिखाता है कि Muon जैसे कुछ ऑप्टिमाइज़र्स रटंत विद्या (rote memorization) की प्रवृत्ति के कारण रीजनिंग कार्यों पर खराब प्रदर्शन कर सकते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली छात्र है जिसने वर्षों तक एक विशाल पुस्तकालय की हर किताब को पढ़कर बिताया है (यह Pretraining है)। उनके पास सामान्य ज्ञान, व्याकरण और दुनिया के बारे में सोचने का तरीका है। अब, आप उन्हें एक विशिष्ट नया कौशल सिखाना चाहते हैं, जैसे गणित की समस्याओं को हल करना या कंप्यूटर कोड लिखना (यह Supervised Finetuning या SFT है)।
मुख्य चुनौती यह है: आप उन्हें यह नया कौशल कैसे सिखाएं कि वे पुस्तकालय में सीखी गई हर चीज़ को भूल न जाएं? यदि वे गणित पर बहुत अधिक ध्यान केंद्रित करते हैं, तो वे एक साधारण कहानी लिखना भी भूल सकते हैं। इसे "Learning-Forgetting-Tradeoff" कहा जाता है।
यह कार्य इस बात की खोज करता है कि इस छात्र को सिखाने का सबसे अच्छा तरीका क्या है, और इसका संबंध इस बात से है कि आप उन्हें कैसे सिखाते हैं, न कि केवल इस बात से कि आप उन्हें क्या सिखाते हैं।
मुख्य खोज: "वही शिक्षक, वही शैली"
लेखकों ने पाया कि नए कौशल को सिखाने का सबसे अच्छा तरीका वही शिक्षण शैली (Optimizer) उपयोग करना है जिसका उपयोग पुस्तकालय पढ़ने के दौरान किया गया था।
- उपमा: कल्पना कीजिए कि छात्र ने एक विशिष्ट विधि के साथ पढ़ना सीखा, मान लीजिए "विधि A" (जैसे टेक्स्ट को हाइलाइट करने और नोट्स लेने का एक खास तरीका)। यदि आप उन्हें गणित सिखाने के लिए "विधि B" (हाइलाइट करने और नोट्स लेने का एक बिल्कुल अलग तरीका) का उपयोग करने का प्रयास करते हैं, तो छात्र भ्रमित हो जाता है। वे गणित सीख सकते हैं, लेकिन वे अपने पढ़ने के कौशल को भूलने लगते हैं क्योंकि नई विधि उस तरीके से टकराती है जिससे उनका मस्तिष्क वर्षों के अभ्यास के माध्यम से बना है।
- अंतर्दृष्टि: यदि आप गणित निर्देश के लिए भी "विधि A" का पालन करते हैं, तो छात्र गणित सीखता है और अपने पढ़ने के कौशल को भी बरकरार रखता है। यह कार्य इसे "Optimizer-Model Consistency" कहता है।
यह क्यों होता है? ("मस्तिष्क की आकृति" का सिद्धांत)
यह कार्य बताता है कि विभिन्न शिक्षण विधियाँ वास्तव में छात्र के मस्तिष्क (मॉडल के आंतरिक भार/weights) को अलग-अलग तरीकों से आकार देती हैं।
- विभिन्न आकृतियाँ: कुछ शिक्षण विधियाँ (जैसे AdamW, जो सबसे आम है) मस्तिष्क को "स्पार्स" (sparse) या "कुशल" बनाने के लिए प्रशिक्षित करती हैं, जैसे कि एक पुस्तकालय जहाँ किताबें खाली स्थानों के बीच करीने से व्यवस्थित होती हैं। अन्य विधियाँ (जैसे Muon, एक नई, परिष्कृत विधि) मस्तिष्क को "डेंस" (dense) बनाने के लिए प्रशिक्षित करती हैं, जैसे कि एक पुस्तकालय जहाँ किताबें एक साथ कसकर भरी होती हैं।
- विसंगति: यदि आप मस्तिष्क को वर्षों तक "स्पार्स" बनाने के लिए प्रशिक्षित करते हैं और फिर अचानक गणित के लिए एक "डेंस" शिक्षण विधि पर स्विच करते हैं, तो मस्तिष्क को अपनी पूरी संरचना को पुनर्गठित करने के लिए घबराहट (panic) होनी चाहिए। यह अराजकता पुरानी किताबों को गिरा देती है (भूलना)।
- मिलान: यदि आप गणित के लिए भी उसी "स्पार्स" विधि का उपयोग करना जारी रखते हैं, तो मस्तिष्क बस मौजूदा अलमारियों में नई किताबें जोड़ता है। उसे पुस्तकालय को फिर से बनाने की आवश्यकता नहीं होती, इसलिए वह कम भूलता है।
LoRA का आश्चर्य
एक लोकप्रिय शॉर्टकट है जिसे LoRA (Low-Rank Adaptation) कहा जाता है। कल्पना कीजिए कि LoRA छात्र के लिए एक अलग, छोटी नोटबुक है, जहाँ वे अपने मुख्य पुस्तकालय की किताबों को छुए बिना गणित के उत्तर लिखते हैं। कई लोगों ने सोचा कि यह भूलने से बचने का सबसे अच्छा तरीका है।
कार्य का मोड़: लेखकों ने पाया कि जबकि LoRA अच्छा है, फुल रिट्रेनिंग (पूरे मस्तिष्क को फिर से लिखना) जिसमें पहले वाली ही शिक्षण विधि का उपयोग किया गया हो, वास्तव में और भी बेहतर है।
- उपमा: LoRA एक अलग नोटबुक ले जाने जैसा है। यह काम करता है, लेकिन यदि आप अपने मुख्य मस्तिष्क को फिर से लिखने के लिए उसी शिक्षण शैली का उपयोग करते हैं, तो आप केवल एक साइड नोटबुक की तुलना में नए गणित और पुराने पढ़ने के कौशल को और भी प्रभावी ढंग से सुरक्षित रख सकते हैं।
"रट सीखने वाले" (Muon) का मामला
इस कार्य में एक विशिष्ट, उन्नत शिक्षण विधि का भी परीक्षण किया गया जिसे Muon कहा जाता है।
- अच्छा: Muon प्रीट्रेनिंग (Library phase) में उत्कृष्ट है। यह छात्र को तथ्यों को अविश्वसनीय रूप से अच्छी तरह से याद रखने में मदद करता है।
- बुरा: जब बात बहुत कम डेटा के साथ नए सोचने के कौशल (जैसे गणित) सीखने की आती है, तो Muon एक "रट सीखने वाला" (rote learner) बनने की प्रवृत्ति रखता है। यह अंतर्निहित पैटर्न को समझने के बजाय उन विशिष्ट गणितीय समस्याओं को रटने की कोशिश करता है जिन्हें वह देखता है।
- परिणाम: यदि आप पूरी यात्रा (Library + Math) के लिए Muon का उपयोग करते हैं, तो छात्र तथ्यों को शानदार ढंग से सुनाने में सक्षम हो सकता है लेकिन नई, अनदेखी गणितीय समस्याओं को हल करने में संघर्ष कर सकता है। उन्होंने उदाहरणों को रट लिया है लेकिन तर्क को नहीं समझा है।
सरल भाषा में सारांश
- निरंतरता महत्वपूर्ण है: पुराने को भूले बिना नया कौशल सीखने के लिए, उसी लर्निंग एल्गोरिदम (Optimizer) का उपयोग जारी रखें जिससे मॉडल को मूल रूप से प्रशिक्षित किया गया था।
- शैली न बदलें: शिक्षण एल्गोरिदम को बीच में बदलने से मॉडल को अपने "मस्तिष्क" को पुनर्गठित करने के लिए मजबूर होना पड़ता है, जिससे वह पुराना ज्ञान खो देता है।
- शॉर्टकट से बेहतर फुल रिट्रेनिंग: कभी-कभी, सही एल्गोरिदम के साथ फुल रिट्रेनिंग, LoRA जैसे शॉर्टकट से बेहतर होती है, क्योंकि यह मॉडल के मस्तिष्क की मूल संरचना के साथ बेहतर तालमेल बिठाती है।
- अति-स्मरण (Over-Memorization) से सावधान रहें: कुछ उन्नत एल्गोरिदम (जैसे Muon) याद रखने में बहुत अच्छे हैं लेकिन डेटा की कमी होने पर नए पैटर्न सीखने में खराब हो सकते हैं।
यह कार्य निष्कर्ष निकालता है कि यदि आप नया सीखने और पुराने को याद रखने के बीच सबसे अच्छा संतुलन चाहते हैं, तो आपको उसी शिक्षक के साथ बने रहना चाहिए जिससे आपने शुरुआत की थी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।