← नवीनतम पेपर
🤖 machine learning

SparseForge: Efficient Semi-Structured LLM Sparsification via Annealing of Hessian-Guided Soft-Mask

SparseForge एक पोस्ट-ट्रेनिंग फ्रेमवर्क है जो हेसियन-गाइडेड महत्व अनुमान (Hessian-guided importance estimation) को प्रोग्रेसिव सॉफ्ट-मास्क एनीलिंग (progressive soft-mask annealing) के साथ जोड़कर सेमी-स्ट्रक्चर्ड LLM स्पार्सिफिकेशन की दक्षता को बढ़ाता है, जिससे मौजूदा तरीकों की तुलना में काफी कम रिट्रेनिंग टोकन के साथ बेहतर सटीकता प्राप्त होती है।

मूल लेखक: Liu Hanzuo, Chaofan Lin, Weixuan Sun, Yulong Wang, Key, Rayying, Mingyu Gao

प्रकाशित 2026-05-08
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Liu Hanzuo, Chaofan Lin, Weixuan Sun, Yulong Wang, Key, Rayying, Mingyu Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान पुस्तकालय है (एक लार्ज लैंग्वेज मॉडल, या LLM) जो लगभग सब कुछ जानता है। यह इतना बड़ा है कि यह एक पूरे गोदाम में जगह घेरता है और इसे चलाने के लिए पुस्तकालयाध्यक्षों की एक बड़ी टीम की आवश्यकता होती है। आप इस पुस्तकालय को सिकोड़कर एक सामान्य कार्यालय में फिट करना चाहते हैं और इसे तेज़ चलाना चाहते हैं, लेकिन आप बस यादृच्छिक (रैंडम) किताबें फेंक नहीं सकते; यदि आप ऐसा करते हैं, तो पुस्तकालय अर्थहीन हो जाएगा।

यह समस्या है जिसे SparseForge हल करता है।

समस्या: "समूह निर्णय" की दुविधा

आधुनिक कंप्यूटर चिप्स (जैसे NVIDIA के) "सिकुड़ने" के एक विशिष्ट प्रकार को संभालने में माहिर हैं जिसे 2:4 स्पर्सिटी (sparsity) कहा जाता है। इसे चार दोस्तों के एक मेज पर बैठने के नियम की तरह समझें: ठीक दो को जाना होगा, और दो को रुकना होगा।

पुराने तरीके इस समस्या को हल करने के लिए प्रत्येक पुस्तक को व्यक्तिगत रूप रूप से देखते थे, यह तय करते थे कि कौन सी पुस्तकें "सबसे कम महत्वपूर्ण" हैं, और फिर समूहों को नियमों का पालन करने के लिए मजबूर करते थे।

  • दोष: यह चार दोस्तों से यह तय करने जैसा है कि कौन जाए, लेकिन निर्णय तुरंत लिया जाता है। यदि आप गलत दो लोगों को जाने के लिए चुन लेते हैं क्योंकि आपने पर्याप्त गहराई से नहीं सोचा, तो पूरी बातचीत टूट जाती है। इस टूटी हुई बातचीत को ठीक करने के लिए, पुराने तरीकों को पुस्तकालय को हजारों बार (विशाल मात्रा में डेटा का उपयोग करके) फिर से सिखाना पड़ता था, जो धीमा और महंगा था।

समाधान: "एनीलिंग" (Annealing) प्रक्रिया

इस पेपर के लेखक, SparseForge, एक स्मार्ट तरीका प्रस्तावित करते हैं। एक कठोर, तत्काल निर्णय लेने के बजाय, वे निर्णय को धातु विज्ञान (metalworking) की तरह मानते हैं।

  1. गर्म करना (The Soft Mask): कल्पना कीजिए कि पुस्तकालय की पुस्तकें नरम, लचीली मिट्टी से बनी हैं। तुरंत "रुकें" या "जाएं" का निर्णय लेने के बजाय, सिस्टम प्रत्येक पुस्तक को 0 और 1 के बीच एक "सॉफ्ट" स्कोर देता है। यह ऐसा है जैसे पुस्तकें थोड़ी लचीली हैं। सिस्टम धीरे से मिट्टी को आकार देता है, जिससे पुस्तकों को विभिन्न स्थितियों का पता लगाने की अनुमति मिलती है। यह अभी अंतिम निर्णय नहीं थोपता है।
  2. हेसियन गाइड (The Hessian Guide - विशेषज्ञ मूर्तिकार): यह जानने के लिए कि कौन सी पुस्तकें वास्तव में महत्वपूर्ण हैं, सिस्टम एक विशेष "वक्रता सेंसर" (जिसे Hessian-awareness कहा जाता है) का उपयोग करता है। केवल यह देखने के बजाय कि कोई पुस्तक कितनी भारी है (परिमाण), यह देखता है कि यदि उस विशिष्ट पुस्तक को हटा दिया जाए तो पुस्तकालय की समझ को कितना नुकसान होगा। यह सिस्टम को यह समझने में मदद करता है कि हर चार के समूह में कौन से दो मित्र सबसे महत्वपूर्ण हैं जिन्हें रखना है।
  3. क्वेंचिंग (Quenching - ठंडा करना/कठोर बनाना): एक बार जब सिस्टम सभी संभावनाओं का पता लगा लेता है और सही व्यवस्था पा लेता है, तो यह मिट्टी को धीरे-धीरे "ठंडा" करता है। यह धीरे-धीरे सॉफ्ट स्कोर को एक कठोर "रुकें" (1) या "जाएं" (0) के निर्णय में बदल देता है। क्योंकि सिस्टम ने पहले विकल्पों का पता लगाया था, इसलिए अंतिम कठोर निर्णय बहुत अधिक सटीक होता है।

परिणाम: कम में अधिक करना

पेपर का दावा है कि यह विधि दक्षता के लिए गेम-चेंजर है:

  • कम डेटा, वही बुद्धिमत्ता: अपने पुस्तकालय को अच्छी तरह से काम करने के लिए, SparseForge को केवल 5 बिलियन शब्द (टोकन) फिर से पढ़ने की आवश्यकता थी।
  • दिग्गजों को पछाड़ना: एक पिछले शीर्ष-स्तरीय तरीके को समान परिणाम प्राप्त करने के लिए 40 बिलियन शब्दों को फिर से पढ़ने की आवश्यकता थी। SparseForge ने उसी (या थोड़ा बेहतर) स्तर की बुद्धिमत्ता का उपयोग करके 8 गुना कम डेटा का उपयोग किया।
  • तेज़ और छोटा: क्योंकि अंतिम पुस्तकालय "2 में से 4" के नियम का पालन करता है, इसलिए यह कंप्यूटर की मेमोरी में बहुत बेहतर तरीके से फिट होता है (लगभग 58% स्थान का उपयोग करता है) और आधुनिक हार्डवेयर पर 1.4 गुना तेज़ चलता है।

निष्कर्ष

SparseForge एक मास्टर मूर्तिकार की तरह है जो केवल छेनी से पत्थर को काटता नहीं है (पुराने तरीके)। इसके बजाय, वे पत्थर को गर्म करते हैं, उसे सही आकार में ढलने देते हैं, और फिर एक उत्कृष्ट कृति प्रकट करने के लिए उसे ठंडा करते हैं। यह उन्हें विशाल AI मॉडलों को उनकी बुद्धिमत्ता खोए बिना एक प्रबंधनीय आकार में सिकोड़ने की अनुमति देता है, जिससे समय और कंप्यूटिंग शक्ति की भारी बचत होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →