← नवीनतम पेपर
💻 computer science

Dominant-Layer ZO: A Single Layer Dominates Zeroth-Order Fine-Tuning of LLMs

यह शोध पत्र प्रकट करता है कि लार्ज लैंग्वेज मॉडल्स का ज़ीरोथ-ऑर्डर फाइन-ट्यूनिंग एक एकल, कार्य-अज्ञेय (टास्क-अग्नोस्टिक) डिकोडिंग लेयर द्वारा नियंत्रित होता है जिसे एक्टिवेशन आउटलेर्स के माध्यम से पहचाना जा सकता है, जो एक ऐसी विधि को सक्षम बनाता है जो पूर्ण-मॉडल प्रदर्शन के बराबर या उससे बेहतर प्रदर्शन करती है और साथ ही 4.52x तक प्रशिक्षण की गति बढ़ाती है।

मूल लेखक: Wanhao Yu, Ziyan Wang, Zheng Wang, Abeer Matar Almalky, Yihang Zuo, Shuteng Niu, Sen Lin, Adnan Siraj Rakin, Deliang Fan, Li Yang

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wanhao Yu, Ziyan Wang, Zheng Wang, Abeer Matar Almalky, Yihang Zuo, Shuteng Niu, Sen Lin, Adnan Siraj Rakin, Deliang Fan, Li Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से जटिल फैक्ट्री है (एक लार्ज लैंग्वेज मॉडल) जिसमें एक उत्पाद बनाने के लिए 32 अलग-अलग असेंबली लाइनें (लेयर्स) मिलकर काम करती हैं। आमतौर पर, जब आप इस फैक्ट्री को कोई नया हुनर सिखाना चाहते हैं (फाइन-ट्यूनिंग), तो आप हर एक असेंबली लाइन का निरीक्षण और समायोजन करने के लिए एक मैनेजर भेजते हैं। इसमें बहुत समय, ऊर्जा और मेमोरी लगती है।

हाल ही में, वैज्ञानिकों ने एक "ज़ीरोथ-ऑर्डर" (ZO) विधि विकसित की है। इसमें पारंपरिक बैकप्रोपैगेशन (backpropagation) की तरह हर कदम को पीछे की ओर जाकर ट्रेस करने के बजाय, वे बस फैक्ट्री को एक रैंडम छड़ी से थपथपाते हैं, देखते हैं कि अंतिम उत्पाद में क्या बदलाव आया, और फिर अंदाज़ा लगाते हैं कि कहाँ सुधार करने की आवश्यकता है। यह मेमोरी के मामले में बहुत सस्ता है, लेकिन कोई नहीं जानता था कि फैक्ट्री का वास्तव में कौन सा हिस्सा सबसे अधिक काम कर रहा है।

यह शोध पत्र एक चौंकाने वाला रहस्य उजागर करता है: आपको पूरी फैक्ट्री को बदलने की ज़रूरत नहीं है। आपको केवल एक विशिष्ट असेंबली लाइन को ट्यून करने की आवश्यकता है।

यहाँ उनकी खोज का सरल उपमाओं (analogies) के माध्यम से विवरण दिया गया है:

1. "एक स्टार प्लेयर" की घटना

शोधकर्ताओं ने इसका परीक्षण विभिन्न AI मॉडलों (जैसे LLaMA और Qwen) और विभिन्न कार्यों (जैसे प्रश्नों के उत्तर देना या कहानियाँ लिखना) पर किया। उन्होंने पाया कि जब वे "थपथपाने और अंदाज़ा लगाने" (ZO) वाली विधि का उपयोग करते हैं, तो मॉडल के बीच की एक अकेली लेयर लगभग सारा काम करती है।

  • उपमा: एक सॉकर टीम की कल्पना करें। एक सामान्य खेल (मानक प्रशिक्षण) में, हर खिलाड़ी योगदान देता है। लेकिन इस विशिष्ट "थपथपाने और अंदाज़ा लगाने" वाले खेल में, यह पता चला कि यदि आप केवल कप्तान (प्रमुख लेयर) को अभ्यास करने देते हैं, तो टीम का प्रदर्शन उतना ही अच्छा होता है जितना कि पूरी टीम के अभ्यास करने पर होता है। यदि आप अन्य 31 खिलाड़ियों को प्रशिक्षित करने की कोशिश करते हैं, तो वे बहुत कम मदद करते हैं।
  • परिणाम: केवल इस एक "डोमिनेंट लेयर" (Dominant Layer) को ट्यून करने से ऐसे परिणाम मिले जो पूरे मॉडल को प्रशिक्षित करने के बराबर या कभी-कभी उससे भी बेहतर थे।

2. बिना प्रशिक्षण के "कैप्टन" को कैसे खोजें

शोधकर्ता इस "कैप्टन" को खोजने के लिए हर लेयर का परीक्षण करके समय बर्बाद नहीं करना चाहते थे। उन्हें एक शॉर्टकट मिला।

  • उपमा: फैक्ट्री की असेंबली लाइनों को पानी के पाइपों की एक श्रृंखला के रूप में सोचें। अधिकांश पाइपों में पानी सामान्य दबाव पर बहता है। लेकिन एक विशिष्ट पाइप में, पानी का दबाव अचानक बहुत अधिक बढ़ जाता है (इन्हें "एक्टिवेशन आउटलेयर्स" कहा जाता है)।
  • खोज: "डोमिनेंट लेयर" हमेशा वह पहला पाइप होता है जहाँ यह भारी दबाव का उछाल (spike) आता है।
  • शॉर्टकट: इस लेयर को खोजने के लिए आपको मॉडल को प्रशिक्षित करने की आवश्यकता नहीं है। आप बस मॉडल को एक बार चला सकते हैं (जैसे पानी चालू करना) और दबाव के उछाल वाले पहले पाइप को देख सकते हैं। वही आपका डोमिनेंट लेयर है। आप वास्तविक प्रशिक्षण शुरू करने से पहले ही इसे तुरंत पहचान सकते हैं।

3. यह एक लेयर इतनी अच्छी तरह से क्यों काम करती है?

इस विशिष्ट लेयर को सारा श्रेय क्यों मिलता है? यह समय (timing) और डोमिनो प्रभाव (domino effects) के बारे में है।

  • उपमा: डोमिनोज़ (dominoes) की एक पंक्ति की कल्पना करें।
    • फर्स्ट-ऑर्डर ट्रेनिंग (मानक): आप हर डोमिनो को व्यक्तिगत रूप से एक सटीक बल के साथ धक्का देते हैं। सभी हिल जाते हैं।
    • ज़ीरोथ-ऑर्डर ट्रेनिंग (ZO): आप केवल अंदाज़ा लगाकर डोमिनोज़ को धक्का दे सकते हैं।
    • डोमिनेंट लेयर: यह लेयर पंक्ति में बहुत शुरुआत में स्थित है, और यह ऐसे पदार्थ से बनी है जो एक हल्के से धक्के के प्रति बहुत संवेदनशील है। जब आप इस शुरुआती लेयर को थपथपाते हैं, तो "शॉकवेव" (shockwave) पूरी लाइन में नीचे की ओर जाती है, और इसके बाद आने वाले हर डोमिनो से टकराती है। क्योंकि यह शुरुआत में है, इसका प्रभाव बढ़ता जाता है और जैसे-जैसे यह फैक्ट्री के बाकी हिस्सों से गुजरता है, यह संचित (accumulate) होता जाता है।
    • अन्य लेयर्स: यदि आप लाइन के अंत के पास किसी डोमिनो को धक्का देते हैं, तो उसके पास टकराने के लिए बहुत कम डोमिनोज़ बचते हैं। प्रभाव छोटा होता है और खो जाता है।

चूंकि डोमिनेंट लेयर शुरुआती और संवेदनशील है, इसलिए वहां एक छोटा सा धक्का प्रक्रिया के अंत में एक बहुत बड़ा और स्पष्ट संकेत पैदा करता है। यह "अंदाज़ा लगाने" वाले एल्गोरिदम को बहुत आत्मविश्वासी और प्रभावी बनाता है।

4. प्रतिफल: गति और दक्षता

चूंकि आपको पूरे मॉडल के बजाय केवल इस एक लेयर को अपडेट करने की आवश्यकता है, इसलिए यह प्रक्रिया अविश्वसनीय रूप से तेज़ हो जाती है।

  • परिणाम: शोधकर्ताओं ने दिखाया कि यह विधि मानक विधि की तुलना में प्रशिक्षण को 4.5 गुना तेज़ बना सकती है। यह ऐसा है जैसे यह महसूस करना कि घड़ी को सही चलाने के लिए आपको केवल एक गियर को ठीक करने की आवश्यकता है, जिससे आपके घंटों का काम बच जाता है।

सारांश

यह शोध पत्र दावा करता है कि इस विशिष्ट प्रकार के मेमोरी-कुशल AI प्रशिक्षण के लिए:

  1. एक लेयर ही सब कुछ नियंत्रित करती है: एक अकेली लेयर ही मुख्य काम करती है।
  2. यह अनुमान योग्य है: आप मॉडल के डेटा में पहले "प्रेशर स्पाइक" को देखकर इस लेयर को तुरंत पहचान सकते हैं।
  3. यह कुशल है: केवल इस लेयर पर ध्यान केंद्रित करने से प्रशिक्षण बहुत तेज़ हो जाता है और परिणाम पूरे मॉडल को प्रशिक्षित करने जितने ही अच्छे रहते हैं।

लेखक नोट करते हैं कि हालांकि यह वर्तमान तरीकों की तुलना में एक बड़ा सुधार है, फिर भी यह पारंपरिक (लेकिन मेमोरी-भारी) तरीके की तरह पूरी तरह से तेज़ या पूर्ण नहीं है, और वे भविष्य में अधिक मॉडलों पर इसका परीक्षण करने की योजना बना रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →