← नवीनतम पेपर
💬 NLP

AGoQ: Activation and Gradient Quantization for Memory-Efficient Distributed Training of LLMs

यह शोध पत्र AGoQ को पेश करता है, जो बड़े भाषा मॉडलों (large language models) के लिए एक मेमोरी-कुशल वितरित प्रशिक्षण ढांचा (distributed training framework) है, जो मॉडल अभिसरण (convergence) और सटीकता बनाए रखते हुए मेमोरी उपयोग को 52% तक कम करने और प्रशिक्षण गति को 1.34× तक बढ़ाने के लिए लेयर-अवेयर एक्टिवेशन क्वांटाइजेशन (layer-aware activation quantization) और प्रिसिजन-प्रिजर्विंग 8-बिट ग्रेडिएंट क्वांटाइजेशन (precision-preserving 8-bit gradient quantization) का उपयोग करता है।

मूल लेखक: Wenxiang Lin, Juntao Huang, Luhan Zhang, Laili Li, Xiang Bao, Mengyang Zhang, Bing Wang, Shaohuai Shi

प्रकाशित 2026-05-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenxiang Lin, Juntao Huang, Luhan Zhang, Laili Li, Xiang Bao, Mengyang Zhang, Bing Wang, Shaohuai Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अविश्वसनीय रूप से बुद्धिमान रोबोट (एक लार्ज लैंग्वेज मॉडल या LLM) को कहानियाँ लिखना, कोड करना और प्रश्न पूछना सिखाने की कोशिश कर रहे हैं। ऐसा करने के लिए, आपको रोबोट की याददाश्त (GPU मेमोरी) का एक विशाल पुस्तकालय चाहिए होगा ताकि वह सीखने के दौरान अपने सभी विचारों को रख सके। समस्या यह है कि जैसे-जैसे रोबोट अधिक स्मार्ट होता जाता है, उसके "विचार" (activations) और उसकी गलतियों पर लिखे गए नोट्स (gradients) इतने विशाल होते जाते हैं कि वे सबसे शक्तिशाली कंप्यूटरों की मेमोरी में भी फिट नहीं हो पाते।

यह पेपर AGoQ (एक्टिवेशन एंड ग्रेडिएंट क्वांटाइजेशन) नामक एक नया सिस्टम पेश करता है। AGoQ को रोबोट की सीखने की प्रक्रिया के लिए एक चतुर पैकिंग और शिपिंग सेवा के रूप में समझें। यह डेटा को बिना रोबोट के दिमाग को नुकसान पहुँचाए छोटे बक्सों में सिकोड़ देता है, जिससे वह तेज़ और सस्ते हार्डवेयर पर तेज़ी से सीख पाता है।

AGoQ कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. समस्या: एक अव्यवस्थित मूविंग ट्रक

इन मॉडल्स को प्रशिक्षित करते समय, कंप्यूटर को मुख्य रूप से दो चीजें स्टोर करनी पड़ती हैं:

  • एक्टिवेशंस (Activations): ये रोबोट के "वर्तमान विचार" हैं जब वह एक वाक्य पढ़ रहा होता है। ये बहुत अधिक जगह घेरते हैं, जैसे विशाल, मुलायम तकियों से भरा हुआ एक ट्रक।
  • ग्रेडिएंट्स (Gradients): ये वे "सुधार नोट्स" हैं जो रोबोट अपनी गलतियों को ठीक करने के लिए लिखता है। ये भारी होते हैं और इन्हें उन कई कंप्यूटरों (GPUs) के बीच साझा किया जाना चाहिए जो मिलकर काम कर रहे हैं, जैसे कि एक भारी क्रेट जिसे एक टीम के बीच पास किया जाना है।

वर्तमान तरीके इन्हें सिकोड़ने की कोशिश करते हैं, लेकिन यदि आप इन्हें बहुत अधिक सिकोड़ देते हैं (जैसे एक तकिए को छोटे कंकड़ में बदल देना), तो रोबठोट भ्रमित हो जाएगा और खराब तरीके से सीखेगा।

2. समाधान: "स्मार्ट पैकिंग" रणनीति (एक्टिवेशन क्वांटाइजेशन)

AGoQ एक तकनीक का उपयोग करता है जिसे लेयर-अवेयर एक्टिवेशन क्वांटाइजेशन कहा जाता है। कल्पना कीजिए कि आप मूविंग ट्रक में अलग-अलग प्रकार की वस्तुओं को पैक कर रहे हैं: नाजुक कांच, भारी किताबें और नरम कपड़े।

  • पुराना तरीका: आप हर चीज़ को एक ही आकार के बॉक्स में रखने की कोशिश करते हैं। यदि आप कांच को एक छोटे बॉक्स में रखते हैं, तो वह टूट जाता है। यदि आप कपड़ों को एक बहुत बड़े बॉक्स में रखते हैं, तो आप जगह बर्बाद करते हैं।
  • AGoQ का तरीका: यह हर वस्तु को देखता है और उसके लिए एकदम सही बॉक्स का आकार तय करता है।
    • "कांच" (अटेंशन लेयर्स): रोबोट के दिमाग के कुछ हिस्से बहुत संवेदनशील होते हैं। AGoQ समझ जाता है कि इन "विचारों" को बहुत छोटा करने से त्रुटियां होती हैं। इसलिए, यह इन हिस्सों को उनके मूल, बड़े बक्सों में ही रहने देता है (उच्च सटीकता)।
    • "कपड़े" (अन्य लेयर्स): अन्य हिस्से अधिक लचीले होते हैं। AGoQ इन्हें छोटे, 4-बिट बॉक्स में सिकोड़ देता है (जैसे कपड़ों को वैक्यूम बैग में फोल्ड करना)। इससे बहुत अधिक जगह बचती है।
    • "डायनेमिक एडजस्टमेंट": सिस्टम यह भी नोटिस करता है कि टीम के कुछ कंप्यूटरों में खाली जगह है जबकि अन्य भरे हुए हैं। यह "पैकिंग डेंसिटी" को इस तरह बदलता है कि जिनके पास अधिक जगह है वे थोड़े बड़े बॉक्स उठा सकें, जिससे लोड का संतुलन बना रहे।

परिणाम: रोबलेट के "विचार" पहले की तुलना में लगभग एक-चौथाई स्थान लेते हैं, लेकिन रोबोट फिर भी सब कुछ पूरी तरह से समझ पाता है।

3. समाधान: "प्रिसिजन शिपिंग" रणनीति (ग्रेडिएंट क्वांटाइजेशन)

एक बार जब रोबोट अपनी गलतियों को समझ लेता है, तो उसे उन "सुधार नोट्स" (ग्रेडिएंट्स) को अपनी टीम के अन्य सभी कंप्यूटरों को भेजना पड़ता है ताकि वे सभी एक ही सबक सीख सकें।

  • समस्या: नोट्स को पूरी डिटेल में भेजना धीमा है और नेटवर्क को जाम कर देता है। उन्हें बहुत कम गुणवत्ता वाले फॉर्मेट में भेजने से अक्सर "खोई हुई डाक" या गणितीय त्रुटियां (overflow) होती हैं, जिससे रोबोट गलत चीजें सीख जाता है।
  • AGoQ का तरीका: यह 8-बिट ग्रेडिएंट्स का उपयोग करता है।
    • लोकल एक्यूमुलेशन (Local Accumulation): नोट्स भेजने से पहले, कंप्यूटर एक त्वरित "सेंटी चेक" करता है। यह नोट्स को जोड़ने के लिए अस्थायी रूप से वापस पूर्ण आकार में फैला देता है, और फिर उन्हें वापस सिकोड़ देता है। यह गणित को टूटने से बचाता है।
    • स्मार्ट शिपिंग: नोट्स को शिपिंग के दौरान जोड़ने की कोशिश करने के बजाय (जिससे ट्रैफिक जाम और त्रुटियां होती हैं), AGoQ इस प्रक्रिया को विभाजित करता है। यह पहले संपीड़ित (compressed) नोट्स सबको भेजता है, फिर हर कोई उन्हें स्थानीय रूप से जोड़ता है, और अंत में, वे अंतिम परिणाम साझा करते हैं। यह एक स्थानीय हब को पैकेज भेजने, फिर उसे अनपैक करने, उसमें अपना आइटम जोड़ने और फिर अंतिम पैकेज को फिर से शिप करने जैसा है, न कि 100mph की रफ्तार से चलते ट्रक में सामान जोड़ने जैसा।

परिणाम: "सुधार नोट्स" बहुत छोटे हैं, और टीम उन्हें बिना किसी सटीकता खोए बहुत तेज़ी से साझा कर सकती है।

4. "फ्यूजन" ट्रिक: दो काम एक साथ करना

आमतौर पर, डेटा को सिकोड़ना (क्वांटाइजेशन) और गणित करना (कैलकुलेटिंग) दो अलग-अलग चरण हैं जो गति को धीमा कर देते हैं। AGoQ इन दोनों को एक ही चरण में मिला देता है, जैसे कि एक शेफ जो सब्जियां काटने और बर्तन चलाने के बीच में चक्कर लगाने के बजाय, एक ही समय में सब्जियां काटता है और बर्तन चलाता है। यह पूरी प्रक्रिया को अविश्वसनीय रूप से तेज़ बनाता है।

निचोड़ (The Bottom Line)

इन स्मार्ट पैकिंग और शिपिंग ट्रिक्स का उपयोग करके, लेखकों ने 64 शक्तिशाली कंप्यूटरों तक का उपयोग करके बड़े भाषा मॉडल्स (जैसे LLaMA) पर AGoQ का परीक्षण किया।

  • मेमोरी बचत: उन्होंने मेमोरी की आवश्यकता को 52% तक कम कर दिया। इसका मतलब है कि आप उसी हार्डवेयर पर बड़े मॉडल प्रशिक्षित कर सकते हैं, या बहुत सस्ते हार्डवेयर पर समान मॉडल प्रशिक्षित कर सकते हैं।
  • गति: क्योंकि डेटा छोटा है और शिपिंग स्मार्ट है, प्रशिक्षण प्रक्रिया वर्तमान सर्वोत्तम प्रणालियों की तुलना में 1.34 गुना तेज़ हो गई।
  • सटीकता: महत्वपूर्ण रूप से, रोबोट भ्रमित नहीं हुआ। इसने मानक परीक्षणों पर प्रदर्शन में बिना किसी कमी के, बड़े, अनकंप्रेस्ड वर्ज़न की तरह ही अच्छी तरह से सीखा।

संक्षेप में, AGoQ एक ऐसा सिस्टम है जो हमें सिखाता है कि एक विशाल हाथी को उसके पैर बिल्कुल सही तरीके से मोड़कर एक कॉम्पैक्ट कार में कैसे फिट किया जाए, बिना हाथी को चोट पहुँचाए या कार की गति कम किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →