← नवीनतम पेपर
🤖 machine learning

SCAPE: Accurate and Efficient LLM Training with Extreme Sparse Communication

SCAPE एक संचार-कुशल वितरित ऑप्टिमाइज़र है जो एडम-शैली के प्रथम-मोमेंट सांख्यिकी का लाभ उठाकर आक्रामक ग्रेडिएंट स्पार्सिफिकेशन (99% तक) को सक्षम करता है, जिससे मॉडल की गुणवत्ता और प्रशिक्षण स्थिरता को बनाए रखते हुए बड़े भाषा मॉडलों के लिए प्री-ट्रेनिंग वॉल-क्लॉक समय और संचार ओवरहेड को महत्वपूर्ण रूप से कम किया जाता है।

मूल लेखक: Mingkai Zheng, Junlin Chen, Haotian Xie, Zhao Zhang

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingkai Zheng, Junlin Chen, Haotian Xie, Zhao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अत्यंत बुद्धिमान रोबोट (एक लार्ज लैंग्वेज मॉडल) को लिखना, तर्क करना और बातचीत करना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, आपको कंप्यूटरों की एक विशाल टीम (GPUs) की आवश्यकता है जो मिलकर काम करें। वे सभी एक विशाल पुस्तक के अलग-अलग हिस्सों को देखते हैं, उनसे सीखते हैं, और फिर रोबोट के मस्तिष्क को अपडेट करने के लिए अपने पाठों को संयोजित करने का प्रयास करते हैं।

समस्या क्या है? टीम वास्तव में सीखने के बजाय एक-दूसरे से बात करने में अधिक समय बिता देती है।

हर बार जब एक कंप्यूटर अपना पाठ पूरा करता है, तो उसे पूरे दल को अपने निष्कर्ष चिल्लाकर बताने होते हैं ताकि सभी अगले कदम पर सहमत हो सकें। जैसे-जैसे रोबोट अधिक स्मार्ट होता जाता है और टीम बड़ी होती जाती है, यह "चिल्लाना" (संचार) एक बाधा बन जाता है। यह एक ऐसे सिम्फनी (symphony) को समन्वित करने जैसा है जहाँ संगीतकार वाद्य यंत्र बजाने के बजाय नोट्स बताने के लिए कंडक्टर के मंच तक दौड़कर जाने में 90% समय बिताते हैं।

मौजूदा समाधान या तो:

  1. बहुत अधिक सारांश निकालते हैं: "मैं केवल अपने नोट्स का शीर्ष 10% ही बताऊंगा।" लेकिन यह अक्सर रोबोट को भ्रमित कर देता है, जिससे वह गलत चीजें सीख जाता है।
  2. कोड में बात करते हैं: "मैं अपने नोट्स को छोटे टुकड़ों में कंप्रेस (compress) कर दूँगा।" इससे जगह तो बचती है लेकिन उन्हें डिकोड करने में अतिरिक्त समय लगता है, और आप अनंत रूप से कंप्रेस नहीं कर सकते।

यहाँ आता है SCAPE

बड़ा विचार: "स्टिकी नोट" रणनीति

SCAPE इन कंप्यूटरों के बात करने का एक नया तरीका है। अपने पाठ का हर एक विवरण चिल्लाने के बजाय, वे रोबोट के मस्तिष्क के सीखने के तरीके पर आधारित एक चतुर ट्रिक का उपयोग करते हैं।

यहाँ इसका सादृश्य (analogy) दिया गया है:

1. "शोर वाला" बनाम "स्थिर" सिग्नल
कल्पना कीजिए कि रोबोट के मस्तिष्क के पास चीजों को याद रखने के दो तरीके हैं:

  • कच्ची पकड़ (AdamW): यह एक ऐसे छात्र की तरह है जो जो कुछ भी सुनता है उसे पागलों की तरह लिख रहा है। यह तेज़ है लेकिन बहुत शोर भरा और अस्थिर है। यदि आप उन्हें केवल उनके लिखे हुए "शीर्ष 10% शब्द" दिखाते हैं, तो वे भ्रमित हो जाते हैं और बड़ी तस्वीर भूल जाते हैं।
  • सुचारू प्रवाह (AdamS): यह एक ऐसे छात्र की तरह है जो थोड़ा सोचता है, "ठीक है, उस पैराग्राफ का मुख्य विचार क्या था?" यह संस्करण बहुत अधिक स्थिर और कम शोर वाला है।

SCAPE ने पाया कि क्योंकि यह "सुचारू प्रवाह" इतना स्थिर है, इसलिए आप 90% या यहाँ तक कि 99% विवरण को बिना रोबोट को भ्रमित किए सुरक्षित रूप से हटा सकते हैं। यदि आप छोटे विवरणों को अनदेखा कर देते हैं, तो भी "मुख्य विचार" वैसा ही रहता है।

2. "आलसी" मास्क (Delayed Sync)
आमतौर पर, जब टीम यह तय करती है कि क्या चिल्लाना है, तो उन्हें चिल्लाना शुरू करने से पहले एक सूची पर सहमत होने के लिए रुकना पड़ता है। यह काम को रोक देता है।

SCAPE एक ऐसी टीम की तरह है जो कहती है, "आइए अभी तय करें कि क्या चिल्लाना है, लेकिन हम इसे अगले राउंड तक चिल्लाएंगे नहीं।"

  • चरण 1: कंप्यूटर अपने भारी काम (कंप्यूटिंग) को करते समय "महत्वपूर्ण शब्दों" (मास्क) की गणना करते हैं।
  • चरण 2: जब तक वे अपना भारी काम पूरा करते हैं, तब तक "महत्वपूर्ण शब्दों" की सूची तैयार हो जाती है। वे बिना किसी प्रतीक्षा के इसे तुरंत चिल्ला सकते हैं।
  • परिणाम: "बात करने" में लगने वाला समय उनके "काम करने" के समय के भीतर ही छिप जाता है। यह एक शेफ की तरह है जो सूप उबलने के दौरान सब्जियां काट रहा है, ताकि कटाई का काम रात के खाने में देरी न करे।

3. "वन-स्टॉप" शॉप
आमतौर पर, रोबोट के मस्तिष्क को अपडेट करने के लिए, टीम को दो बार मिलना पड़ता है: एक बार "दिशा" पर सहमत होने के लिए और एक बार "गति" पर सहमत होने के लिए। SCAPE ने एक ही बार में दोनों मीटिंग्स करने का तरीका खोज निकाला है। वे एक ऐसा कंप्रेस्ड संदेश भेजते हैं जिसमें मस्तिष्क को अपडेट करने के लिए आवश्यक सब कुछ शामिल होता है, जिससे बहुत सारा समय बचता है।

परिणाम: तेज़, स्मार्ट और सस्ता

शोधकर्ताओं ने दो अलग-अलग रोबोट मस्तिष्क (एक 500-मिलियन पैरामीटर मॉडल और एक 1.8-बिलियन पैरामीटर मॉडल) पर 32 सुपर-पावरफुल GPUs का उपयोग करके इसका परीक्षण किया।

  • गति: बड़े रोबोट के लिए, SCAPE ने कुल प्रशिक्षण समय को 43% कम कर दिया। और भी बड़े रोबोट के लिए, इसने प्रत्येक स्टेप को 3 गुना तेज़ बना दिया।
  • गुणवत्ता: संचार के दौरान 90% से 99% डेटा को फेंक देने के बावजूद, रोबोट ने उतना ही अच्छा सीखा जितना कि यदि उन्होंने सब कुछ चिल्लाया होता। इसने पढ़ने की समझ, तर्क और सामान्य ज्ञान के परीक्षणों में समान (या बेहतर) स्कोर किया।
  • दक्षता: टीम केवल तेज़ ही नहीं हुई; वह अधिक कुशल भी हुई। जब उन्होंने टीम में अधिक कंप्यूटर जोड़े, तो सिस्टम संचार के कारण "ट्रैफिक जाम" की वजह से धीमा नहीं हुआ जैसा कि आमतौर पर होता है।

संक्षेप में

SCAPE उन अत्यधिक कुशल शोधकर्ताओं की तरह है जिन्होंने महसूस किया कि उन्हें एक-दूसरे को पेपर का हर एक ड्राफ्ट ईमेल करने की आवश्यकता नहीं है। इसके बजाय, वे मुख्य रूप से रूपरेखा (outline) पर सहमत होते हैं (जो बहुत स्थिर है), केवल वही भेजते हैं, और ऐसा तब करते हैं जब वे पहले से ही अगले अध्याय पर काम कर रहे होते हैं। परिणाम? वे आधा समय लेकर किताब पूरी करते हैं, और कहानी उतनी ही अच्छी होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →