← नवीनतम पेपर
🤖 machine learning

MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs

MaskPro एक नवीन रैखिक-स्थान (linear-space) संभाव्य ढांचे (probabilistic framework) को प्रस्तुत करता है जो बिना प्रतिस्थापन के N-वे सैंपलिंग (N-way sampling without replacement) के माध्यम से बड़े भाषा मॉडलों में (N:M)-विरलता (sparsity) को कुशलतापूर्वक उत्पन्न करने के लिए श्रेणीगत वितरणों (categorical distributions) को सीखता है, जबकि प्रशिक्षण को स्थिर करने और मौजूदा ग्रीडी (greedy) या ग्रेडिएंट-संचालित विधियों की तुलना में बेहतर मेमोरी दक्षता और मजबूती प्राप्त करने के लिए लॉस रेसिडुअल्स (loss residuals) के मूविंग एवरेज का उपयोग करता है।

मूल लेखक: Yan Sun, Qixin Zhang, Zhiyuan Yu, Xikun Zhang, Li Shen, Dacheng Tao

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yan Sun, Qixin Zhang, Zhiyuan Yu, Xikun Zhang, Li Shen, Dacheng Tao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से विस्तृत पुस्तकालय है (एक लार्ज लैंग्वेज मॉडल) जिसमें अरबों पुस्तकें (पैरामीटर्स) हैं। इस पुस्तकालय को ले जाने में आसान और जल्दी पढ़ने योग्य बनाने के लिए, आप कुछ पुस्तकें फेंकना चाहते हैं। हालाँकि, आप मनमाने ढंग से पुस्तकें नहीं फेंक सकते; आपको एक सख्त नियम का पालन करना होगा: प्रत्येक 4 पुस्तकों के समूह के लिए, आपको ठीक 2 को रखना होगा और अन्य 2 को फेंक देना होगा। यही वह नियम है जिसे पेपर (N:M) स्पर्सिटी (sparsity) (विशेष रूप से 2:4) कहता है।

चुनौती यह figuring out करने की है कि हर समूह के 4 में से किन 2 पुस्तकों को रखा जाए ताकि पुस्तकालय अभी भी बेहतरीन कहानियाँ सुनाता रहे। यदि आप गलत किताबें चुनते हैं, तो पुस्तकालय का अर्थ समझ से बाहर हो जाएगा।

यहाँ कैसे MaskPro इस समस्या को हल करता है, इसे सरल उपमाओं (analogies) के माध्यम से समझाया गया है:

1. समस्या: "बहुत अधिक विकल्पों" का दुःस्वप्न

लोग इससे पहले दो तरीकों से इसे हल करने की कोशिश कर चुके हैं, और दोनों में बड़ी खामियां हैं:

  • "नियम पुस्तिका" (The "Rulebook" Method) विधि: यह दृष्टिकोण सरल गणितीय नियमों (जैसे "सबसे भारी पुस्तकें रखें") का उपयोग करके अनुमान लगाता है कि किसे रखना है। यह तेज़ है, लेकिन अक्सर गलत होता है क्योंकि यह पूरी तस्वीर को नहीं देखता है। यह केवल उनकी ऊंचाई देखकर सबसे अच्छे टीम खिलाड़ियों को चुनने जैसा है, उनके वास्तविक कौशल को नजरअंदाज करना।
  • "प्रयास और त्रुटि" (The "Trial and Error" Method) विधि: यह दृष्टिकोण लाखों संभावनाओं का परीक्षण करके सबसे अच्छा संयोजन सीखने की कोशिश करता है। समस्या यह है कि संयोजनों की संख्या इतनी विशाल है (जैसे रेगिस्तान में एक विशिष्ट रेत के कण को खोजने जैसा) कि कंप्यूटर की मेमोरी खत्म हो जाती है और वह क्रैश हो जाता है। यह 100-अंकों वाले ताले के हर संभावित संयोजन को याद करने जैसा है; इसमें बहुत अधिक दिमागी शक्ति लगती है।

2. समाधान: MaskPro (एक "स्मार्ट लॉटरी")

लेखक MaskPro का प्रस्ताव देते हैं, जो एक नया तरीका है जिससे बिना मेमोरी खत्म किए या गलत अनुमान लगाए यह सीखा जा सके कि कौन सी पुस्तकें रखनी हैं।

"लीनियर स्पेस" ट्रिक (मैप को सरल बनाना)
हर एक संभव पुस्तक संयोजन की संभावना को याद करने के बजाय (जो असंभव है), MaskPro 4 पुस्तकों के प्रत्येक समूह के लिए एक सरल "लॉटरी टिकट" बनाता है।

  • पुराना तरीका: कल्पना करें कि एक लॉटरी है जिसमें अरबों टिकट हैं, जो 4 में से 2 पुस्तकें चुनने के हर संभव तरीके के लिए एक है। उन सभी टिकटों को रखने के लिए आपको एक गोदाम की आवश्यकता होगी।
  • MaskPro का तरीका: इसके बजाय, आपके पास 4 छोटे बॉक्स हैं (प्रत्येक पुस्तक के लिए एक)। आप प्रत्येक बॉक्स में एक टिकट रखते हैं जो कहता है, "इस पुस्तक के चुने जाने की कितनी संभावना है?" फिर आप एक विशेष लॉटरी चलाते हैं जहाँ आप इन 4 बॉक्सों में से 2 विजेता चुनते हैं, यह सुनिश्चित करते हुए कि आप एक ही पुस्तक को दो बार न चुनें।
  • परिणाम: यह आवश्यक मेमोरी को एक "गोदाम" से घटाकर एक "बैकपैक" तक कम कर देता है। यह लीनियरली स्केल करता है, जिसका अर्थ है कि यदि पुस्तकालय विशाल हो जाता है, तो भी आपका बैकपैक भारी नहीं होगा।

"स्मूथिंग ट्रैकर" (एक याददाश्त वाला कोच)
कंप्यूटर को सही पुस्तकें चुनना सिखाने के लिए, आप उसे उदाहरण (डेटा) दिखाते हैं। कभी-कभी, एक "खराब" सेट की पुस्तकें अच्छी लग सकती हैं क्योंकि उदाहरण आसान था, और एक "अच्छी" सेट खराब लग सकती है क्योंकि उदाहरण कठिन था। यह कंप्यूटर को भ्रमित कर देता है।

  • समस्या: यदि कंप्यूटर देखता है कि पुस्तकों का एक "खराब" सेट एक आसान टेस्ट पर अच्छा प्रदर्शन करता है, तो वह सोच सकता है, "बहतरीन! मैं ऐसा ही करता रहूँगा!" भले ही यह केवल एक इत्तेफाक हो।
  • समाधान: MaskPro एक "याददाश्त वाले कोच" (एक मूविंग एवरेज ट्रैकर) को पेश करता है। केवल वर्तमान स्कोर को देखने के बजाय, कोच पिछले कुछ टेस्ट के औसत स्कोर और वर्तमान स्कोर के बीच के अंतर को देखता है।
  • उपमा: एक छात्र की कल्पना करें जो टेस्ट दे रहा है। यदि वह एक परफेक्ट स्कोर प्राप्त करता है, तो कोच पूछता है, "क्या यह टेस्ट आसान था? क्या आप आमतौर पर इतने ऊंचे स्कोर पर रहते थे?" यदि छात्र आमतौर पर 80% प्राप्त करता है और अचानक एक सुपर आसान टेस्ट में 100% प्राप्त करता है, तो कोच कहता है, "यह वास्तविक सुधार नहीं है; अभी अपनी पढ़ाई की आदतें न बदलें।" यह कंप्यूटर को रैंडम किस्मत से भ्रमित होने से रोकता है और प्रशिक्षण को स्थिर रखता है।

3. परिणाम: तेज़, सस्ता और विश्वसनीय

पेपर का दावा है कि MaskPro तीन कारणों से गेम-चेंजर है:

  • मेमोरी कुशल (Memory Efficient): यह मानक कंप्यूटरों पर फिट बैठता है जहाँ अन्य तरीके क्रैश हो जाते हैं। यह जेब में फिट होने वाले टेंट को पैक करने जैसा है, न कि उस टेंट को जिसके लिए ट्रक की आवश्यकता होती है।
  • डेटा कुशल (Data Efficient): आपको इसे सिखाने के लिए प्रशिक्षण डेटा के विशाल पुस्तकालय की आवश्यकता नहीं है। पेपर दिखाता है कि यह केवल एक एकल उदाहरण के साथ भी प्रभावी ढंग से सीख सकता है (हालाँकि अधिक बेहतर है)। यह एक ऐसे शेफ की तरह है जो एक बार चखने के बाद नई रेसिपी सीख सकता है, बजाय इसके कि उसे हज़ार बार चखना पड़े।
  • प्रदर्शन (Performance): यह मॉडल को स्मार्ट बनाए रखता है। जब उन्होंने प्रसिद्ध AI मॉडलों (जैसे LLaMA और Gemma) पर इसका परीक्षण किया, तो MaskPro ने पुराने "नियम पुस्तिका" तरीकों की तुलना में मॉडल की बुद्धिमत्ता को बहुत बेहतर बनाए रखा और महंगे "प्रयास और त्रुटि" तरीकों के लगभग समान प्रदर्शन किया, लेकिन बिना उस लागत के।

सारांश

MaskPro एक नया टूल है जो विशाल AI मॉडलों को छोटा करने में मदद करता है यह सिखाकर कि उनके कौन से हिस्से काटे जाने चाहिए। यह इसे निम्नलिखित तरीकों से करता है:

  1. गणित को सरल बनाकर ताकि इसे विकल्पों को याद रखने के लिए सुपरकंप्यूटर की आवश्यकता न हो।
  2. एक "स्मार्ट कोच" का उपयोग करके जो रैंडम किस्मत को अनदेखा करता है और वास्तविक सुधारों पर ध्यान केंद्रित करता है।
  3. बहुत कम डेटा के साथ काम करके, जो इसे व्यावहारिक और सस्ता बनाता है।

लेखकों ने अपना कोड उपलब्ध कराया है ताकि अन्य लोग इसे आज़मा सकें, जो यह साबित करता है कि आप अपनी बौद्धिक क्षमता खोए बिना AI मॉडलों को छोटा और तेज़ बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →