← नवीनतम पेपर
🤖 machine learning

Deterministic Differentiable Structured Pruning for Large Language Models

यह शोध पत्र डिटरमिनिस्टिक डिफरेंशिएबल प्रूनिंग (DDP) को प्रस्तुत करता है, जो सीधे l0l_0 ऑब्जेक्टिव के एक डिटरमिनिस्टिक सॉफ्ट सरोगेट को अनुकूलित करके पूर्व स्ट्रक्चर्ड प्रूनिंग दृष्टिकोणों की ट्रेन-टेस्ट मिसमैच और स्टोकेस्टिसिटी को समाप्त करने वाली एक नवीन विधि है, जिससे उच्च स्पर्सिटी स्तरों पर Qwen3 जैसे बड़े भाषा मॉडलों पर तेज़ अभिसरण, अधिक अभिव्यक्तता और बेहतर प्रदर्शन प्रतिधारण (जैसे, ~1% हानि) प्राप्त होता है।

मूल लेखक: Weiyu Huang, Pengle Zhang, Xiaolu Zhang, Jun Zhou, Jun Zhu, Jianfei Chen

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weiyu Huang, Pengle Zhang, Xiaolu Zhang, Jun Zhou, Jun Zhu, Jianfei Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान पुस्तकालय है (एक लार्ज लैंग्वेज मॉडल, या LLM) जो कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है और कोड लिख सकता है। लेकिन एक पेच है: यह पुस्तकालय इतना बड़ा है कि एक अकेला पन्ना पढ़ने के लिए भी आपको महंगे कंप्यूटरों से भरे एक गोदाम की आवश्यकता होती है। यह धीमा है, इसे चलाना महंगा है, और इसे एक सामान्य बैकपैक (जैसे फोन या लैपटॉप) में फिट करना कठिन है।

इस शोध पत्र का लक्ष्य अच्छी किताबों को खोए बिना इस पुस्तकालय को सिकोड़ना (shrink) है।

समस्या: "वन-शॉट" बनाम "मेसी डाइस" (The "One-Shot" vs. The "Messy Dice")

पहले, लोग इन पुस्तकालयों को सिकोड़ने के लिए दो मुख्य तरीकों का उपयोग करते थे:

  1. "वन-शॉट" दृष्टिकोण (The "One-Shot" Approach): कल्पना कीजिए कि एक लाइब्रेरियन अलमारियों को देखता है और कहता है, "मुझे लगता है कि ये 20% किताबें उबाऊ हैं," और उन्हें तुरंत फेंक देता है। यह तेज़ है, लेकिन लाइब्रेरियन अनजाने में एक छिपा हुआ रत्न भी फेंक सकता है, जिससे पुस्तकालय के ज्ञान में रिक्तता रह सकती है।
  2. "स्टोकेस्टिक" दृष्टिकोण (The "Stochastic" Approach - पुराना तरीका): यह पुस्तकालय को सिकोड़ने के लिए पासा (dice) फेंकने जैसा है। आप तय करने के लिए कि कौन सी किताब रहेगी और कौन सी जाएगी, हर किताब के लिए पासा फेंकते हैं। यदि पासा कहता है "रखो," तो आप उसे रखते हैं; यदि "जाओ" कहता है, तो आप उसे फेंक देते हैं।
    • दोष: प्रशिक्षण (training) के दौरान, जब आप हर बार एक किताब पढ़ते हैं, तो आप पासा फेंकते हैं। लेकिन जब आप बाद में पुस्तकालय का वास्तव में उपयोग करते हैं, तो आप पासा नहीं फेंक सकते; आपको किताबों की एक निश्चित सूची की आवश्यकता होती है। यह एक बेमेल स्थिति पैदा करता है: पुस्तकालय ने एक अराजक, यादृच्छिक (random) सूची के साथ अभ्यास किया लेकिन उसे एक निश्चित सूची के साथ प्रदर्शन करना है। यह एक संगीतकार के लिए वैसा ही है जो एक मेट्रोनोम के साथ अभ्यास करता है जो रैंडम तरीके से तेज़ और धीमा होता है, और फिर एक कॉन्सर्ट को बिल्कुल सही समय पर बजाने की कोशिश करता है।

समाधान: डिटरमिनिस्टिक डिफरेंशिएबल प्रूनिंग (DDP)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे DDP कहा जाता है। इसे पुस्तकालय की किताबों के लिए एक साधारण ऑन/ऑफ स्विच या पासा फेंकने के बजाय, एक स्मार्ट, एडजस्टेबल डिमर स्विच (dimmer switch) के रूप में समझें।

यह इस प्रकार काम करता है:

1. "डिमर स्विच" (Deterministic)

पासा फेंकने के बजाय, कल्पना कीजिए कि हर किताब के बगल में एक डिमर स्विच है।

  • 0 का अर्थ है कि किताब को पूरी तरह से हटा दिया गया है।
  • 1 का अर्थ है कि किताब पूरी तरह से खुली है।
  • 0.5 का अर्थ है कि किताब आधी खुली है (वह अभी भी वहीं है, लेकिन कम योगदान दे रही है)।

कंप्यूटर अनुमान नहीं लगाता; वह सटीक रूप से गणना करता है कि प्रत्येक स्विच कितना उज्ज्वल होना चाहिए। यह "शोर" (noise) को हटा देता है जो यादृच्छिक पासा फेंकने से उत्पन्न होता है। अभ्यास सत्र (training) और वास्तविक शो (deployment) अब बिल्कुल एक जैसे हैं।

2. "सॉफ्ट सरोगेट" (The "Soft Surrogate")

जटिल हिस्सा यह है कि हम चाहते हैं कि स्विच अंततः या तो पूरी तरह से OFF (0) या पूरी तरह से ON (1) हो जाएं। हम नहीं चाहते कि वे हमेशा 0.5 पर अटके रहें।

लेखक एक चतुर तकनीक का उपयोग करते हैं जिसे "एनील्ड सॉफ्ट सरोगेट" (annealed soft surrogate) कहा जाता है।

  • मिट्टी के एक टुकड़े की कल्पना करें। प्रशिक्षण की शुरुआत में, मिट्टी नरम और लचीली होती है। डिमर स्विच कहीं भी हो सकते हैं (0.2, 0.5, 0.8)। यह कंप्यूटर को अन्वेषण करने और सही कॉन्फ़िगरेशन खोजने के लिए बहुत अधिक स्वतंत्रता देता है।
  • जैसे-जैसे प्रशिक्षण आगे बढ़ता है, मिट्टी सख्त होती जाती है। स्विचों को मजबूर किया जाता है कि वे या तो पूरी तरह से ON या पूरी तरह से OFF होकर अपनी जगह पर सेट हो जाएं।
  • अंत तक, आपके पास एक पूरी तरह से संरचित पुस्तकालय होता है जहाँ ठीक 20% किताबें गायब हैं, लेकिन शेष किताबें सबसे कुशल तरीके से व्यवस्थित हैं।

3. "शिक्षक" (Knowledge Distillation)

यह सुनिश्चित करने के लिए कि सिकुड़ा हुआ पुस्तकालय अभी भी बुद्धिमान बना रहे, कंप्यूटर मूल, विशाल पुस्तकालय का उपयोग एक "शिक्षक" के रूप में करता है।

  • "छात्र" (सिकुड़ा हुआ पुस्तकालय) "शिक्षक" के उत्तरों की नकल करने की कोशिश करता है।
  • यदि शिक्षक कहता है, "आसमान नीला है," तो छात्र को भी यह कहना सीखना होगा, भले ही उसके पास कम किताबें हों। यह सुनिश्चित करता है कि छात्र अपनी बुद्धिमत्ता नहीं खोता है, भले ही वह छोटा हो गया हो।

यह एक बड़ी बात क्यों है?

  • कोई बेमेल नहीं (No More Mismatch): क्योंकि कंप्यूटर उसी नियम के साथ अभ्यास करता है जिसका उपयोग वह वास्तविक दुनिया में करता है, इसलिए इसके परिणाम बहुत अधिक स्थिर होते हैं।
  • बेहतर गुणवत्ता: परीक्षणों में, इस पद्धति ने पुस्तकालय की बुद्धिमत्ता को लगभग बरकरार रखा (केवल लगभग 1% प्रदर्शन का नुकसान हुआ), भले ही 20% से 50% सामग्री को हटा दिया गया हो। पिछली विधियों में बहुत अधिक बुद्धिमत्ता का नुकसान हुआ था।
  • गति: उन्होंने वास्तविक हार्डवेयर (जैसे NVIDIA H20 और RTX 5090) पर इसका परीक्षण किया। परिणाम? सिकुड़े हुए पुस्तकालयों ने 1.3x से 2.2x तेज़ गति से काम किया। यह एक धीमे, भारी ट्रक को बिना अपना सामान खोए, एक फुर्तीले स्पोर्ट्स कार में बदलने जैसा है।

निष्कर्ष (The Bottom Line)

यह शोध पत्र विशाल AI मॉडल को कम करने का एक स्मार्ट तरीका पेश करता है। हिस्सों को बेतरतीब ढंग से काटने या अव्यवस्थित अनुमान लगाने के बजाय, यह एक सटीक, गणितीय "डिमर स्विच" का उपयोग करता है जो धीरे-धीरे एक अंतिम, कुशल आकार में बदल जाता है।

परिणाम: आपको एक छोटा, तेज़, सस्ता AI मिलता है जो मूल विशाल मॉडल जितना ही बुद्धिमान है, जिससे हमारे द्वारा रोज़ाना उपयोग किए जाने वाले उपकरणों पर शक्तिशाली AI चलाना संभव हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →