← नवीनतम पेपर
🤖 machine learning

Unlocking [CLS] Features for Continual Post-Training

यह शोध पत्र TOSCA का प्रस्ताव करता है, जो एक पैरामीटर-कुशल निरंतर शिक्षण (continual learning) विधि है जो स्थिरता और प्लास्टिसिटी को प्रभावी ढंग से संतुलित करने के लिए [CLS] टोकन पर एक स्पार्स "लर्न एंड कैलिब्रेट" (LuCA) मॉड्यूल का उपयोग करती है, जिससे मौजूदा दृष्टिकोणों की तुलना में काफी कम मापदंडों के साथ अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Murat Onur Yildirim, Elif Ceren Gok Yildirim, Joaquin Vanschoren

प्रकाशित 2026-02-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Murat Onur Yildirim, Elif Ceren Gok Yildirim, Joaquin Vanschoren

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, विश्व स्तरीय शेफ (फाउंडेशन मॉडल) है, जिसने हजारों अलग-अलग व्यंजन बनाने में वर्षों बिताए हैं। यह शेफ काटने, भूनने और मसाले डालने की बुनियादी बातों को पूरी तरह से जानता है।

अब, कल्पना कीजिए कि आप इस शेफ को कुछ नई, बहुत विशिष्ट रेसिपी (जैसे "वीगन सुशी" या "स्पाइसी टैकोस") सिखाना चाहते हैं, बिना उसके मूल हजारों व्यंजनों को भुलाए।

यह कंटीन्यूअल लर्निंग (Continual Learning) की समस्या है। यदि आप बस शेफ को "ये नई रेसिपी सीखो" कह देंगे, तो वे भ्रमित हो सकते हैं और पास्ता में सोया सॉस डालना शुरू कर सकते हैं (इसे कैटैस्ट्रोफिक फॉरगेटिंग - Catastrophic Forgetting कहा जाता है)। यदि आप बहुत अधिक सावधान रहने की कोशिश करते हैं और उन्हें कुछ भी बदलने से रोकते हैं, तो वे नई रेसिपी नहीं सीख पाएंगे (यह स्टेबिलिटी-प्लास्टिसिटी डिलेमा - Stability-Plasticity Dilemma है)।

अधिकांश वर्तमान तरीके इसे हल करने का प्रयास करते हैं, या तो:

  1. हर रेसिपी के लिए शेफ को एक नया एप्रन देना (प्रॉम्प्ट्स/Prompts): यह सुरक्षित है, लेकिन शेफ भ्रमित हो सकते हैं कि किस व्यंजन के लिए कौन सा एप्रन पहनना है।
  2. हर रेसिपी के लिए एक नया किचन स्टेशन जोड़ना (एडेप्टर्स/Adapters): यह अच्छा काम करता है, लेकिन इसके लिए रसोई में बहुत अधिक जगह चाहिए और इसे बनाना बहुत महंगा है।

समाधान: TOSCA (एक "स्मार्ट टेस्टिंग स्पून")

लेखक इस पेपर में एक नया, बहुत सरल तरीका प्रस्तावित करते हैं जिसे TOSCA कहा जाता है।

यह कैसे काम करता है, एक सरल उपमा का उपयोग करके देखें:

1. "वेंट्रल स्ट्रीम" बनाम "प्रीफ्रंटल कॉर्टेक्स"

यह पेपर मानव मस्तिष्क से प्रेरणा लेता है।

  • वेंट्रल स्ट्रीम (शेफ की मसल मेमोरी): यह मस्तिष्क का वह हिस्सा है जो स्थिर, अपरिवर्तित तथ्यों (जैसे "चाकू कैसे पकड़ना है") को संभालता है। पेपर कहता है कि हमें फाउंडेशन मॉडल की मुख्य परतों (core layers) को वैसे ही छोड़ देना चाहिए, जैसे हम हर बार नया व्यंजन सीखने पर शेफ को दोबारा यह नहीं सिखाते कि चाकू कैसे पकड़ना है।
  • प्रीफ्रंटल कॉर्टेक्स (निर्णय लेने वाला): यह मस्तिष्क का वह हिस्सा है जो वर्तमान स्थिति के आधार पर अंतिम निर्णय लेता है।

2. "LuCA" मॉड्यूल (लर्न एंड कैलिब्रेट - Learn and Calibrate)

एक पूरा नया किचन बनाने के बजाय, TOSCA कुकिंग लाइन के बिल्कुल अंत में, खाना परोसने से ठीक पहले एक छोटा, स्मार्ट डिवाइस लगा देता है। इस डिवाइस को LuCA कहा जाता है। इसके दो भाग हैं:

  • द एडेप्टर (एडजस्टर/समायोजक): यह एक छोटे चम्मच की तरह है जो विशेष रूप से नए व्यंजन के लिए थोड़ा अतिरिक्त मसाला या सॉस जोड़ता है। यह भोजन में सूक्ष्म परिवर्तन करता है।
  • द कैलिब्रेटर (टेस्टर/चखने वाला): यह एक स्मार्ट टेस्टर है जो भोजन की जांच करता है। यदि "एडजस्टर" ने बहुत अधिक मसाला डाल दिया है, तो "टेस्टर" कहता है, "रुको, इसे थोड़ा कम करो।" यदि भोजन बहुत फीका है, तो "टेस्टर" कहता है, "एक चुटकी और डालो।" यह सुनिश्चित करता है कि इस विशिष्ट नई रेसिपी के लिए अंतिम स्वाद एकदम सही हो।

3. "टोकन-लेवल" ट्रिक

यहाँ असली बुद्धिमानी है: वे इस डिवाइस को केवल अंतिम प्लेट पर लगाते हैं।
कंप्यूटर के संदर्भ में, मॉडल कई परतों के माध्यम से एक इमेज को प्रोसेस करता है। अधिकांश तरीके इन "एडजस्टर/टेस्टर" उपकरणों को मॉडल की हर एक परत में जोड़ने का प्रयास करते हैं। यह एक टेस्टर को पेंट्री, चूल्हा, फ्रिज और ओवन—हर जगह रखने जैसा है। यह बहुत बर्बादी भरा और अव्यवस्थित है।

TOSCA कहता है: "आइए इस टेस्टर को केवल अंतिम प्लेट ([CLS] टोकन) पर रखें, ग्राहक के पास जाने से ठीक पहले।"

  • क्यों? क्योंकि जब तक भोजन अंतिम प्लेट तक पहुँचता है, शेफ पहले ही सारा कठिन काम कर चुका होता है। टेस्टर को बस एक सूक्ष्म बदलाव करने की आवश्यकता होती है ताकि यह सुनिश्चित हो सके कि यह नए ऑर्डर के लिए एकदम सही है।
  • परिणाम: आपको शेफ की मसल मेमोरी को बिगाड़े बिना एक बेहतरीन नया व्यंजन मिलता है, और आपको नया किचन बनाने की भी आवश्यकता नहीं होती।

यह एक बड़ी बात क्यों है?

  1. यह बहुत छोटा है: अन्य तरीकों की तुलना में TOSCA लगभग 8 गुना कम पैरामीटर्स (मेमोरी स्पेस) का उपयोग करता है। यह एक पूरे पेंट्री के बजाय केवल एक मसाला जार जोड़ने जैसा है।
  2. यह तेज़ है: क्योंकि यह इतना छोटा है, यह अविश्वसनीय रूप से तेज़ी से ट्रेन और रन होता है।
  3. यह भूलता नहीं है: केवल प्रक्रिया के बिल्कुल अंत में बदलाव करके, मॉडल अपने पुराने कौशल को पूरी तरह से याद रखता है जबकि नए चीजें सीखता है।
  4. कोई "चीट शीट" नहीं: जब मॉडल का परीक्षण किया जाता है, तो उसे यह बताने की आवश्यकता नहीं होती कि "यह एक सुशी ऑर्डर है।" वह बस भोजन को देखता है, अपने सीखे हुए विभिन्न "टेस्टर्स" को आज़माता है, और उस टेस्टर को चुनता है जो भोजन को सबसे अधिक आत्मविश्वास (सबसे कम अनिश्चितता) के साथ स्वादिष्ट बनाता है।

सारांश

TOSCA को एक फैक्ट्री के निकास द्वार पर रखे गए एक स्मार्ट, छोटे फिल्टर के रूप में सोचें। फैक्ट्री (AI मॉडल) बिल्कुल उसी तरह चलती रहती है जैसे वह हमेशा चलती आई है, उच्च गुणवत्ता वाली वस्तुएं बनाती रहती है। जब एक नया उत्पाद लाइन से नीचे आता है, तो फिल्टर एक सूक्ष्म, सटीक समायोजन करता है ताकि यह सुनिश्चित हो सके कि यह नए स्पेसिफिकेशन के अनुरूप है, बिना मशीनरी को रोके या फैक्ट्री को फिर से बनाए।

यह "पुरानी चीजों को भूले बिना नई चीजें सीखने" की समस्या को हल करता है क्योंकि यह अविश्वसनीय रूप से कुशल, जैविक रूप से प्रेरित और आश्चर्यजनक रूप से सरल है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →