← नवीनतम पेपर
💬 NLP

Sharpness-Aware Pretraining Mitigates Catastrophic Forgetting

यह शोध पत्र प्रदर्शित करता है कि शार्पनेस-अवेयर मिनिमाइजेशन (Sharpness-Aware Minimization), उच्च लर्निंग रेट्स, या संक्षिप्त एनीलिंग अवधियों जैसे तरीकों के माध्यम से प्रीट्रेनिंग ऑप्टिमाइजेशन को फ्लैटर मिनिमा (flatter minima) की ओर झुकाना, विभिन्न मॉडल आकारों और पोस्ट-ट्रेनिंग कार्यों में कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को महत्वपूर्ण रूप से कम करता है और डाउनस्ट्रीम प्रदर्शन में सुधार करता है।

मूल लेखक: Ishaan Watts, Catherine Li, Sachin Goyal, Jacob Mitchell Springer, Aditi Raghunathan

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ishaan Watts, Catherine Li, Sachin Goyal, Jacob Mitchell Springer, Aditi Raghunathan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ (AI मॉडल) को प्रशिक्षित कर रहे हैं, जिसमें उन्हें लाखों अलग-अलग व्यंजनों का स्वाद चखाया जा रहा है (प्री-ट्रेनिंग)। लक्ष्य यह है कि उन्हें एक विशिष्ट रेस्टोरेंट की रसोई में काम पर भेजने से पहले उन्हें सबसे बेहतरीन शेफ बनाया जाए (पोस्ट-ट्रेनिंग/फाइन-ट्यूनिंग)।

लंबे समय तक, शोधकर्ताओं को लगा कि इस प्रारंभिक प्रशिक्षण चरण के दौरान शेफ को केवल सबसे बेहतरीन स्वाद चखने के लिए प्रशिक्षित करना ही एकमात्र महत्वपूर्ण बात है। उन्होंने माना कि यदि शेफ को एक "परफेक्ट" जनरललिस्ट के रूप में शुरुआत करने के लिए प्रशिक्षित किया जाता है, तो वे बाद में एक बेहतरीन स्पेशलिस्ट स्वतः ही बन जाएंगे, चाहे रसोई में कोई भी बदलाव क्यों न हो।

समस्या: "कठोर" शेफ
यह पेपर तर्क देता है कि यह धारणा गलत है। यह पता चला है कि कुछ शेफों को सामान्य स्वाद के मामले में इतना कठोर रूप से पूर्ण होने के लिए प्रशिक्षित किया जाता है कि कुछ नया करने के लिए कहे जाने पर वे आसानी से टूट जाते हैं।

इसे एक घाटी में बैठे गेंद की तरह समझें।

  • मानक दृष्टिकोण (AdamW): यह शेफ को एक बहुत ही गहरी, संकरी और तीखी घाटी में बैठने के लिए प्रशिक्षित करता है। वे बिल्कुल वहीं रहने में बहुत अच्छे होते हैं जहाँ वे हैं। लेकिन यदि आप उन्हें थोड़ा सा भी धकेलते हैं (जैसे कि उन्हें एक नई रेसिपी सीखने के लिए कहना या उनकी मेमोरी को एक छोटे पॉकेट में फिट करने के लिए कंप्रेस करना), तो वे घाटी से तुरंत बाहर निकल जाते हैं। वे वह सब "भूल" जाते हैं जो वे जानते थे।
  • पेपर का समाधान (Sharpness-Aware): यह शेफ को एक चौड़ी, सपाट घाटी में बैठने के लिए प्रशिक्षित करता है। वे शायद घाटी के बिल्कुल सबसे गहरे बिंदु पर नहीं होंगे, लेकिन वे चारों ओर से समतल जमीन से घिरे हुए हैं। यदि आप उन्हें धकेलते हैं, तो वे बाहर नहीं गिरते; वे बस थोड़ा सा लुढ़कते हैं और सुरक्षित रहते हैं। वे "मजबूत" (robust) हैं।

शोधकर्ताओं ने क्या किया
टीम ने इन "तीखी घाटी" वाले शेफ के बजाय इन "सपाट घाटी" वाले शेफ को प्रशिक्षित करने के तीन तरीके परीक्षण किए:

  1. "हिलाने" की विधि (SAM): उन्होंने 'शार्पनेस-अवेयर मिनिमाइजेशन' (Sharpness-Aware Minimization) नामक एक विशेष तकनीक का उपयोग किया। कल्पना करें कि जब शेफ सीख रहा होता है, तो आप मेज को धीरे से हिलाते हैं। यदि शेफ मेज हिलने के दौरान भी भोजन का सही स्वाद ले सकता है, तो वे स्थिर होना सीख रहे हैं। यह मॉडल को उन चौड़ी, सपाट घाटियों को खोजने के लिए मजबूर करता है।
  2. "फास्ट लेन" विधि (High Learning Rates): उन्होंने शेफ को शुरुआत में अधिक तेजी से और आक्रामक रूप से सीखना सिखाया। यह एक दौड़ लगाने जैसा है; यदि आप पर्याप्त तेजी से दौड़ते हैं, तो आप स्वाभाविक रूप से सड़क के छोटे, गहरे गड्ढों में फंसने से बच जाते हैं।
  3. "त्वरित रोक" विधि (Shorter Annealing): आमतौर पर, प्रशिक्षण तब समाप्त होता है जब हम धीरे-धीरे शेफ की गति को कम कर देते हैं। शोधकर्ताओं ने पाया कि इस धीमेपन को जल्दी रोकना (गति को लंबे समय तक बनाए रखना) शेफ को उस स्थिर, सपाट क्षेत्र में रहने में मदद करता है।

परिणाम
उन्होंने विभिन्न आकारों के मॉडलों (छोटे से मध्यम-बड़े तक) पर इनका परीक्षण किया और पाया:

  • कम भूलना (Less Forgetting): जब इन "सपाट घाटी" वाले मॉडलों को बाद में विशिष्ट कार्यों (जैसे गणित या कोडिंग) को सीखने के लिए कहा गया या उनकी मेमोरी को कुशलता के लिए कंप्रेस (quantization) किया गया, तो वे अपने मूल ज्ञान को बहुत कम भूल पाए।
  • "मिड-ट्रेनिंग" हैक: आपको इस विशेष "हिलाने" वाली विधि का पूरे प्रशिक्षण प्रक्रिया के लिए उपयोग करने की आवश्यकता नहीं है, जो कि काफी महंगा है। उन्होंने पाया कि प्रशिक्षण के अंतिम 10% (एनीलिंग चरण) के लिए इसका उपयोग करने से बहुत कम लागत में लगभग सभी लाभ मिल गए।
  • वास्तविक दुनिया का प्रमाण: उन्होंने एक बड़े 1-बिलियन पैरामीटर वाले मॉडल (OLMo-2-1B) पर परीक्षण किया। भले ही इस विधि से प्रशिक्षित मॉडल सामान्य कार्यों में शुरुआत में थोड़ा "कमजोर" था, लेकिन यह गणित सीखने के बाद अपने कौशल को याद रखने में 31% बेहतर रहा, और दक्षता के लिए कंप्रेस होने के बाद अपने कौशल को बनाए रखने में 40% बेहतर रहा।

बड़ी सीख
यह पेपर निष्कर्ष निकालता है कि हमें एआई को केवल शुरुआती रेखा पर "सर्वश्रेष्ठ" होने के लिए प्रशिक्षित नहीं करना चाहिए। हमें इसे लचीला और स्थिर बनाना चाहिए ताकि जब हम बाद में इसके वातावरण को बदलें, तो यह टूट न जाए।

यह एक जिम्नास्ट को एक आदर्श, कठोर मुद्रा बनाए रखने के लिए प्रशिक्षित करने बनाम उसे एक मजबूत, संतुलित केंद्र बिंदु (center of gravity) रखने के लिए प्रशिक्षित करने के बीच का अंतर है (जो कि फर्श के झुकने पर गिर सकता है)। केवल "पूर्णता" (तीखापन) के बजाय इस "संतुलन" (सपाटता) पर ध्यान केंद्रित करके, हमें ऐसे एआई मॉडल मिलते हैं जो पुराने को भूले बिना नई चीजें सीखने में बहुत बेहतर होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →