← नवीनतम पेपर
🤖 machine learning

Gated Subspace Inference for Transformer Acceleration

यह शोध पत्र गेटेड सबस्पेस इन्फरेंस (Gated Subspace Inference) को प्रस्तुत करता है, जो एक रिट्रेनिंग-मुक्त विधि है जो एक्टिवेशन्स को लो-रैंक सबस्पेस और रेजिडुअल घटकों में एडेप्टिव गेटिंग के साथ विघटित करके ट्रांसफॉर्मर इन्फरेंस को त्वरित करती है, जिससे आउटपुट गुणवत्ता और विशिष्ट मॉडलों पर सटीक कैरेक्टर-लेवल सटीकता को बनाए रखते हुए लीनियर लेयर्स पर महत्वपूर्ण गति प्राप्त होती है।

मूल लेखक: Stephen J. Thomas

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Stephen J. Thomas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल पहेली को हल करने की कोशिश कर रहे हैं, लेकिन मेज पर रखे हर एक टुकड़े को देखने के बजाय, आप महसूस करते हैं कि जिस विशिष्ट चित्र को आप बना रहे हैं, उसके लिए केवल कुछ ही टुकड़े वास्तव में मायने रखते हैं। बाकी सब बस "शोर" (noise) हैं या ऐसे टुकड़े हैं जो वर्तमान दृश्य में फिट नहीं होते।

यह गेटेड सबस्पेस इन्फरेंस (Gated Subspace Inference - GSI) का मूल विचार है, जो एक नई विधि है जिसे इस शोध पत्र (paper) में वर्णित किया गया है ताकि AI भाषा मॉडलों (जैसे वे जो कहानियाँ लिखते हैं या सवालों के जवाब देते हैं) को बिना किसी सटीकता को खोए बहुत तेज़ी से चलाया जा सके।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "भारी बॉक्स" की बाधा (The "Heavy Box" Bottleneck)

एक विशाल पुस्तकालय (AI मॉडल) की कल्पना करें जहाँ किताबें (डेटा) एक दूर स्थित विशाल गोदाम (कंप्यूटर की मेमोरी) में संग्रहीत हैं। एक एकल प्रश्न का उत्तर देने के लिए, लाइब्रेरियन को विशिष्ट पृष्ठों को लेने के लिए गोदाम तक बार-बार दौड़ना पड़ता है।

शोध पत्र बताता है कि आधुनिक AI के लिए, कंप्यूटर वास्तव में "सोच" में धीमा नहीं है; यह बस भारी बक्से उठाकर ले जाने में सांस फूलने के कारण रुक जाता है। गणित आसान है, लेकिन डेटा प्राप्त करना (fetching) धीमा है। AI डेटा के आने की प्रतीक्षा करने में फंसा हुआ है, जैसे कि एक शेफ सामग्री की डिलीवरी की प्रतीक्षा कर रहा हो। इसे मेमोरी बैंडविड्थ बॉटलनेक (memory bandwidth bottleneck) कहा जाता है।

2. खोज: "छिपा हुआ पैटर्न" (The "Hidden Pattern")

शोधकर्ताओं ने एक आश्चर्यजनक बात खोजी कि ये AI मॉडल कैसे सोचते हैं। जब AI एक वाक्य को प्रोसेस करता है, तो उसके आंतरिक "विचार" (जिन्हें एक्टिवेशन कहा जाता है) यादृच्छिक (random) नहीं होते। वे वास्तव में एक बहुत ही विशिष्ट, लो-डायमेंशनल पैटर्न का पालन करते हैं।

उपमा: एक 4,000-डायमेंशनल कमरे की कल्पना करें (AI का आंतरिक स्थान)। आप सोच सकते हैं कि AI उस कमरे में किसी भी दिशा में जा सकता है। लेकिन शोधकर्ताओं ने पाया कि किसी दिए गए वाक्य के लिए, AI के "विचार" वास्तव में उस विशाल कमरे के भीतर तैरते हुए एक बहुत ही छोटे, चपटे कागज के टुकड़े (sheet of paper) तक सीमित हैं। भले ही कमरा विशाल है, AI हमेशा उसी एक कागज के टुकड़े पर चलता है।

3. समाधान: "शॉर्टकट मैप" और "गेट" (The "Shortcut Map" and the "Gate")

GSI विधि इस खोज का उपयोग एक शॉर्टकट बनाने के लिए करती है। यह तीन चीजें करती है:

  • चरण A: शॉर्टकट मैप (द सबस्पेस): पूरे 4,000-डायमेंशनल बुकशेल्फ़ को ले जाने के बजाय, AI एक छोटा, संकुचित "मैप" (एक लो-रैंक इमेज) बनाता है जो केवल उस विशिष्ट कागज के टुकड़े को कवर करता है जहाँ विचार हो रहे हैं। इस छोटे मैप को पढ़ना अविश्वसनीय रूप से तेज़ है क्योंकि यह पूरे बुकशेल्फ़ की तुलना में बहुत छोटा है।
  • चरण B: गेटकीपर (The Gatekeeper): यहाँ चतुराई भरा हिस्सा है। AI केवल यह मान नहीं लेता कि शॉर्टकट हमेशा सटीक होगा। प्रत्येक शब्द को प्रोसेस करते समय, वह एक "गेट" (gate) की जाँच करता है।
    • जाँच: "क्या इस शब्द का विचार हमारे इस छोटे कागज के टुकड़े पर ही रह रहा है?"
    • यदि हाँ (फास्ट पाथ): AI उस छोटे, तेज़ मैप का उपयोग करता है। वह भारी काम को छोड़ देता है।
    • यदि नहीं (स्लो पाथ): यदि शब्द अजीब या जटिल है और उस कागज के टुकड़े से बाहर गिर जाता है, तो गेट खुल जाता है, और AI सामान्य, धीमे तरीके से गणना करने के लिए पूरा, भारी बुकशेल्फ़ उठा लेता है।
  • चरण C: सुरक्षा जाल (The Safety Net): "गेट" यह सुनिश्चित करता है कि यदि शॉर्टकट पूरी तरह सटीक नहीं है, तो AI तुरंत गलती को ठीक कर दे। यह महत्वपूर्ण है। शोध पत्र दिखाता है कि यदि आप केवल शॉर्टकट का उपयोग करते हैं और गलतियों को अनदेखा कर देते हैं (जिसे "स्टैटिक प्रोजेक्शन" कहा जाता है), तो AI बेतुकी बातें बनाने लगता है। गेट गुणवत्ता को एकदम सही रखता है।

4. परिणाम: त्याग के बिना गति (Speed Without Sacrifice)

शोधकर्ताओं ने तीन अलग-अलग AI मॉडलों (GPT-2, GPT-J, और OPT) पर शक्तिशाली कंप्यूटर चिप्स (AMD MI300X) का उपयोग करके इसका परीक्षण किया।

  • गति: क्योंकि AI अपना अधिकांश समय "फास्ट पाथ" (छोटे मैप का उपयोग करके) पर बिताता है, यह सामान्य से 3 से 16 गुना तेज़ी से डेटा पढ़ता है।
  • गुणवत्ता: तेज़ होने के बावजूद, इसका आउटपुट मूल, धीमे मॉडल के समान है। कई परीक्षणों में, AI ने बिल्कुल वही शब्द, अक्षर-दर-अक्षर, उत्पन्न किए।
  • कोई रिट्रेनिंग नहीं: आपको AI को कुछ भी नया सिखाने की आवश्यकता नहीं है। आप बस इस "गेट और मैप" सिस्टम को मौजूदा मॉडल पर लागू करते हैं, और यह तुरंत काम करता है।

5. "कैस्केड" प्रभाव (The "Cascade" Effect)

शोध पत्र ने यह भी पाया कि AI के एक स्तर (layer) से दूसरे स्तर तक ये "कागज के टुकड़े" (विचारों के पैटर्न) बहुत समान होते हैं। यह एक सीढ़ी पर चढ़ने जैसा है जहाँ प्रत्येक कदम नीचे वाले कदम के लगभग समान होता है।

इस कारण से, AI पिछले चरण के मैप का उपयोग अगले चरण को शुरू करने में मदद करने के लिए कर सकता है। यह सिस्टम को सेट करने को और भी तेज़ और कुशल बनाता है, जैसे कि हर नए कमरे में प्रवेश करने के लिए नया उपकरण खरीदने के बजाय अपने पड़ोसी से एक उपकरण उधार लेना।

सारांश

GSI को AI के लिए एक स्मार्ट डिलीवरी सर्विस के रूप में समझें।

  • पुराना तरीका: डिलीवरी ट्रक विशाल गोदाम तक जाता है, पूरी इमारत को लोड करता है, और उसे किचन में लाता है, भले ही शेफ को केवल चुटकी भर नमक की आवश्यकता हो।
  • GSI तरीका: ड्राइवर ऑर्डर की जाँच करता है। यदि शेफ को केवल चुटकी भर नमक चाहिए, तो वे एक छोटा, पहले से पैक किया गया मसाला जार लेते हैं और दौड़ते हैं। यदि शेफ को एक पूरी गाय चाहिए, तो वे बड़ा बॉक्स उठाते हैं।
  • परिणाम: किचन को उनकी सामग्री 10 गुना तेज़ी से मिलती है, लेकिन भोजन का स्वाद बिल्कुल वैसा ही रहता है।

शोध पत्र निष्कर्ष निकालता है कि यह विधि इसलिए काम करती है क्योंकि AI के "विचार" स्वाभाविक रूप से इस तरह व्यवस्थित होते हैं कि इन शॉर्टकट्स का उपयोग किया जा सके, और एक स्मार्ट गेट का उपयोग करके यह तय करना कि कब शॉर्टकट लेना है, हम बुद्धिमत्ता को खोए बिना AI को काफी तेज़ बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →