← नवीनतम पेपर
💬 NLP

Out of the Memory Barrier: A Highly Memory Efficient Training System for LLMs with Million-Token Contexts

OOMB एक अत्यधिक मेमोरी-कुशल प्रशिक्षण प्रणाली है जो लंबे-संदर्भ वाले लार्ज लैंग्वेज मॉडल्स के लिए चंक-रिकरेंट फ्रेमवर्क का उपयोग करती है, जिसमें ऑन-द-फ्लाई एक्टिवेशन रीकंप्यूटेशन और सिनर्जिस्टिक KV कैश ऑप्टिमाइज़ेशन शामिल है ताकि सिंगल GPU पर Qwen2.5-7B जैसे मॉडल्स को मिलियन-टोकन संदर्भों के साथ प्रशिक्षित किया जा सके।

मूल लेखक: Wenhao Li, Daohai Yu, Gen Luo, Yuxin Zhang, Fei Chao, Rongrong Ji, Yifan Wu, Jiaxin Liu, Ziyang Gong, Zimu Liao

प्रकाशित 2026-03-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenhao Li, Daohai Yu, Gen Luo, Yuxin Zhang, Fei Chao, Rongrong Ji, Yifan Wu, Jiaxin Liu, Ziyang Gong, Zimu Liao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसी किताब पढ़ने की कोशिश कर रहे हैं जो 40 लाख पन्नों लंबी है (यह लगभग वॉर एंड पीस की 400 प्रतियों के ढेर के बराबर है)। आप एक सुपर-स्मार्ट AI को प्रशिक्षित करना चाहते है ताकि वह पूरी कहानी को एक साथ समझ सके।

समस्या क्या है? आपका मस्तिष्क (कंप्यूटर का GPU मेमोरी) उस पूरी किताब को एक साथ खोलने के लिए बहुत छोटा है। आमतौर पर, इतनी लंबी किताब पढ़ने के लिए, आपको एक विशाल पुस्तकालय की आवश्यकता होगी जिसमें सैकड़ों सहायक (एक विशाल कंप्यूटर क्लस्टर) हों जो आपके लिए अलग-अलग पन्ने थामे रहें।

यह पेपर एक नई प्रणाली पेश करता है जिसे OOMB (आउट ऑफ द मेमोरी बैरियर) कहा जाता है। यह एक जादू की तरह है जो एक अकेले व्यक्ति को एक छोटी सी मेज का उपयोग करके उस 40 लाख पन्नों की किताब को पढ़ने की अनुमति देता है, बिना किसी पुस्तकालय की आवश्यकता के।

OOMB कैसे काम करता है, यहाँ सरल उपमाओं (analogies) के माध्यम से समझाया गया है:

1. पुराना तरीका: "कागजों का ढेर" वाली समस्या

सामान्य रूप से, जब एक AI लंबा टेक्स्ट पढ़ता है, तो वह अब तक पढ़े गए हर एक शब्द के लिए एक "स्टिकी नोट" (sticky note) रखने की कोशिश करता है।

  • उपमा: कल्पना कीजिए कि आप एक किताब पढ़ रहे हैं और हर वाक्य को पढ़ने के बाद उसके लिए एक स्टिकी नोट लिख रहे हैं। यदि किताब 40 लाख पन्नों लंबी है, तो आपके पास स्टिकी नोट्स का एक ऐसा ढेर लग जाएगा जो आपकी मेज को कुचल देगा। आपका कंप्यूटर मेमोरी (RAM) खत्म कर देगा और इससे पहले कि आप पहला अध्याय भी पूरा कर पाएं, क्रैश हो जाएगा।

2. OOMB का समाधान: "रीसायकल बिन" रणनीति

OOMB नियमों को बदल देता है। हर स्टिकी नोट को हमेशा के लिए रखने के बजाय, यह एक Chunk-Recurrent दृष्टिकोण का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप किताब को छोटे अध्यायों (chunks) में पढ़ रहे हैं।
    1. आप एक अध्याय पढ़ते हैं।
    2. आप अब तक की कहानी का सार (the gist) लिखते हैं ("की-वैल्यू कैश" या Key-Value Cache)।
    3. आप उस विशिष्ट अध्याय के सभी स्टिकी नोट्स को तुरंत फेंक देते हैं
    4. यदि आपको बाद में गणित की किसी समस्या को हल करने के लिए उस अध्याय के किसी विवरण को याद करने की आवश्यकता होती है (ट्रेनिंग के लिए "बैकवर्ड पास"), तो आप नोट्स को अपनी मेज पर रखने के बजाय, उन्हें फिर से बनाने के लिए तुरंत किताब से उस विशिष्ट अध्याय को दोबारा पढ़ते हैं।
  • परिणाम: आपकी मेज कभी भी अव्यवस्थित नहीं होती। किताब चाहे कितनी भी लंबी क्यों न हो, आप हमेशा एक समय में केवल एक छोटा अध्याय ही अपने पास रखते हैं। यह आपके मेमोरी उपयोग को स्थिर रखता है।

3. नई बाधा: "विशाल फाइलिंग कैबिनेट"

स्टिकी नोट्स को फेंककर, OOMB ने मेमोरी की समस्या को हल कर दिया, लेकिन इसने एक नई समस्या पैदा कर दी: "सार" (KV Cache) को अभी भी सहेजना होगा क्योंकि AI को अगला शब्द समझने के लिए पूरी कहानी को याद रखने की आवश्यकता होती है।

  • उपमा: भले ही आपने स्टिकी नोट्स फेंक दिए हों, फिर भी आपके पास "कहानी के सारांशों" का एक बढ़ता हुआ ढेर है जो हर पन्ने के साथ बड़ा होता जा रहा है। अंततः, सारांशों का यह ढेर आपकी मेज के लिए बहुत बड़ा हो जाएगा।

4. तीन जादुई उपकरण जिनका उपयोग OOMB करता है

इस बढ़ते हुए सारांशों के ढेर को संभालने के लिए, OOMB तीन चतुर तरीकों का उपयोग करता है:

  • तरीका A: "पेज्ड" (Paged) फाइलिंग सिस्टम

    • पुराना तरीका: जब आप एक नया सारांश जोड़ते हैं, तो आप उसे कागज की एक लंबी पट्टी के अंत में चिपकाने की कोशिश करते हैं। यदि पट्टी भर जाती है, तो आपको एक नई, बड़ी पट्टी खरीदनी पड़ती है और सब कुछ फिर से कॉपी करना पड़ता है। यह धीमा है और जगह बर्बाद करता है।
    • OOMB का तरीका: यह एक पेज्ड मेमोरी सिस्टम (नंबर वाले पन्नों वाली किताब की तरह) का उपयोग करता है। आप बस अपना नया सारांश अगले उपलब्ध खाली पन्ने पर रख देते हैं। कोई कॉपी करने की जरूरत नहीं, कोई बर्बाद जगह नहीं, कोई अव्यवस्था नहीं।
  • तरीका B: "नाइट शिफ्ट" (Async Offloading)

    • समस्या: पन्नों के होने के बावजूद, सारांशों का ढेर अंततः आपकी मेज के लिए बहुत बड़ा हो जाता है।
    • समाधान: OOMB के पास एक नाइट शिफ्ट सहायक (CPU) है। जब आप वर्तमान अध्याय पढ़ने में व्यस्त होते हैं (गणित कर रहे होते हैं), तो सहायक चुपचाप पुराने सारांशों को आपके डेस्क से बेसमेंट के स्टोरेज रूम (CPU मेमोरी) में ले जाता है।
    • जादू: सहायक इतना तेज़ है और बैकग्राउंड में काम करता है कि आपको उनके काम करने का पता भी नहीं चलता। जब तक आपको किसी पुराने सारांश की आवश्यकता होती है, वह पहले से ही आपके लिए तैयार रहता है।
  • तरीका C: "हाइलाइटर" (Sparse Attention)

    • समस्या: कभी-कभी, एक वाक्य को समझने के लिए, आपको पिछले हर पन्ने को देखने की आवश्यकता नहीं होती है। आपको केवल सबसे महत्वपूर्ण हिस्सों को देखने की आवश्यकता होती है।
    • समाधान: OOMB स्पार्स अटेंशन (Sparse Attention) का उपयोग करता है। पूरे इतिहास को पढ़ने के बजाय, यह एक हाइलाइटर की तरह काम करता है, जो देखने के लिए केवल सबसे प्रासंगिक शीर्ष 1% पन्नों को चुनता है। यह पढ़ने की प्रक्रिया को अविश्वसनीय रूप से तेज़ बनाता है और और भी अधिक जगह बचाता है।

भव्य परिणाम

इन तरीकों के कारण, OOMB एक विशाल AI मॉडल (Qwen2.5-7B) को एक 4-मिलियन-टोकन कॉन्टेक्स्ट (40 लाख पन्नों की किताब) को समझने के लिए एक सिंगल हाई-एंड कंप्यूटर चिप (H200 GPU) पर प्रशिक्षित कर सकता है।

  • पहले: आपको यह करने के लिए 256 कंप्यूटरों के एक विशाल क्लस्टर की आवश्यकता होती।
  • अब: आप इसे एक ही मशीन पर कर सकते हैं।

यह क्यों मायने रखता है?

इसे अंतरिक्ष यात्रा के लोकतंत्रीकरण की तरह समझें। पहले, केवल बड़े देशों के पास अरबों डॉलर थे जो चंद्रमा पर रॉकेट बना सकते थे। OOMB एक ईंधन-कुशल इंजन के आविष्कार जैसा है जो एक अकेले व्यक्ति को अपने गैरेज में रॉकेट बनाने की अनुमति देता है। यह सुपर-स्मार्ट, लंबी मेमोरी वाले AI को सामान्य शोधकर्ताओं और छोटी कंपनियों के लिए सुलभ बनाता है, जिससे पैसा, ऊर्जा और समय की बचत होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →