← नवीनतम पेपर
🤖 machine learning

RetroInfer: A Vector Storage Engine for Scalable Long-Context LLM Inference

RetroInfer एक वेक्टर स्टोरेज इंजन है जिसे एक विशेष "वेव इंडेक्स" और एक GPU-CPU बफ़र मैनेजर का उपयोग करके केवल सबसे प्रासंगिक KV कैश टोकन को कुशलतापूर्वक पुनर्प्राप्त करने के लिए डिज़ाइन किया गया है, जो फुल-अटेंशन सटीकता बनाए रखते हुए थ्रूपुट को महत्वपूर्ण रूप से बढ़ाता है और लंबी-संदर्भ (long-context) LLM इन्फरेंस को तेज़ करता है।

मूल लेखक: Yaoqi Chen, Jinkai Zhang, Baotong Lu, Qianxi Zhang, Chengruidong Zhang, Jing Liu, Jingjia Luo, Di Liu, Huiqiang Jiang, Qi Chen, Bailu Ding, Xiao Yan, Jiawei Jiang, Chen Chen, Mingxing Zhang, Cheng Li
प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yaoqi Chen, Jinkai Zhang, Baotong Lu, Qianxi Zhang, Chengruidong Zhang, Jing Liu, Jingjia Luo, Di Liu, Huiqiang Jiang, Qi Chen, Bailu Ding, Xiao Yan, Jiawei Jiang, Chen Chen, Mingxing Zhang, Cheng Li, Yuqing Yang, Fan Yang, Mao Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विश्व-स्तरीय शोधकर्ता हैं जिन्हें एक विशाल, 1,000-पृष्ठों का विश्वकोश लिखने का काम सौंपा गया है। अपना काम अच्छी तरह से करने के लिए, आपको अपने द्वारा लिखे गए हर एक तथ्य को याद रखने की आवश्यकता है।

समस्या: बड़े डेटा का "ब्रेन फॉग" (Brain Fog)

जैसे-जैसे आप अधिक लिखते जाते हैं, दो चीजें होती हैं:

  1. स्मृति की समस्या (The Memory Problem): आपकी "मानसिक नोटबुक" (KV Cache) इतनी विशाल हो जाती है कि वह भौतिक रूप से आपकी मेज (GPU memory) पर फिट नहीं होती। आपको अपने नोट्स को बेसमेंट में रखे एक विशाल, अव्यवस्थित फाइलिंग कैबिनेट में डालना पड़ता है (CPU memory)।
  2. गति की समस्या (The Speed Problem): हर बार जब आप एक नया वाक्य लिखना चाहते हैं, तो आपको यह सुनिश्चित करने के लिए उस 1,000-पृष्ठों के विश्वकोश के हर एक पन्ने को स्कैन करना पड़ता है कि आप खुद को दोहरा नहीं रहे हैं। इसमें बहुत समय लगता है, और पन्ने पलटते-पलटते आपका "मस्तिष्क" (GPU bandwidth) थक जाता है।

वर्तमान AI सिस्टम इसे ठीक करने के लिए केवल कुछ "महत्वपूर्ण" पृष्ठों को देखने की कोशिश करते हैं, लेकिन वे अक्सर महत्वपूर्ण विवरणों को छोड़ देते हैं, जिससे AI "भुलक्कड़" या "मूर्ख" हो जाता है।


समाधान: RetroInfer (सुपर-लाइब्रेरियन)

RetroInfer आपके शोध को प्रबंधित करने के लिए एक प्रतिभाशाली लाइब्रेरियन को नियुक्त करने जैसा है। बेसमेंट में नोट्स खोजने के लिए पागलों की तरह भागने के बजाय, लाइब्रेरियन दो शानदार उपकरणों का उपयोग करता है: वेव इंडेक्स (Wave Index) और वेव बफ़र (Wave Buffer)

1. वेव इंडेक्स (The Wave Index): "स्मार्ट हाइलाइटर"

हर पन्ने को पढ़ने के बजाय, लाइब्रेरियन एक विशेष इंडेक्सिंग प्रणाली का उपयोग करता है। कल्पना कीजिए कि लाइब्रेरियन आपके नोट्स को तीन क्षेत्रों में विभाजित करता है:

  • "हमेशा महत्वपूर्ण" क्षेत्र (Steady Zone): ये सबसे महत्वपूर्ण तथ्य हैं (जैसे आपकी पुस्तक का शीर्षक) जिन्हें लाइब्रेरियन हर समय आपकी मेज पर रखता है।
  • "खोज और खोजें" क्षेत्र (Retrieval Zone): लाइब्रेरियन अभी आपके लिए सबसे प्रासंगिक विशिष्ट पृष्ठों को खोजने के लिए एक उच्च-गति वाले खोज उपकरण का उपयोग करता है और उन्हें मेज पर लाता है।
  • "त्वरित सारांश" क्षेत्र (Estimation Zone): यह इस तकनीक का जीनियस हिस्सा है। हजारों अन्य पृष्ठों के लिए, लाइब्रेरियन उन्हें शब्द-दर-शब्द नहीं पढ़ता है। इसके बजाय, वे प्रत्येक समूह के एक "सारांश" (centroid) को देखते हैं। यह कुछ ऐसा कहने जैसा है, "मैं जीव विज्ञान के पूरे अध्याय को नहीं पढ़ूँगा, लेकिन मैं जानता हूँ कि यह कोशिकाओं के बारे में है, इसलिए मैं बस उसे ध्यान में रखूँगा।" यह भारी मेहनत किए बिना आपको एक बहुत सटीक "सार" देता है।

2. वेव बफ़र (The Wave Buffer): "कुशल सहायक"

इंडेक्स होने के बावजूद, बेसमेंट (CPU) से कागज के भारी बक्से मेज (GPU) तक ले जाने में समय लगता है। वेव बफ़र एक सहायक है जो इस आवाजाही को पूरी तरह से प्रबंधित करता है:

  • "त्वरित-पहुंच शेल्फ" (Block Cache): सहायक ध्यान देता है कि यदि आपको एक मिनट पहले "गुरुत्वाकर्षण" के बारे में एक पन्ने की आवश्यकता थी, तो आपको जल्द ही इसकी फिर से आवश्यकता होगी। वे उन पृष्ठों को आपकी मेज के ठीक बगल में एक छोटी शेल्फ पर रखते हैं ताकि उन्हें दोबारा बेसमेंट में न जाना पड़े।
  • "पूर्व-सक्रिय धावक" (Asynchronous Management): जब आप अपना वर्तमान वाक्य लिख रहे होते हैं, तब सहायक पहले से ही बेसमेंट में उन पृष्ठों के अगले सेट को लाने के लिए दौड़ रहा होता है जिनकी आपको शायद आवश्यकता हो सकती है। वे बैकग्राउंड में काम करते हैं ताकि आपको डिलीवरी का इंतजार करने के लिए अपना लेखन न रोकना पड़े।

परिणाम: तेज़, स्मार्ट, लंबा

इस "सुपर-लाइब्रेरियन" के कारण, AI:

  • बहुत अधिक पढ़ सकता है: यह अपनी "डेस्क स्पेस" खत्म किए बिना भारी मात्रा में जानकारी (1 मिलियन टोकन तक!) को संभाल सकता है।
  • बहुत तेज़ी से काम कर सकता है: यह "स्पार्स" (sparse) होने की कोशिश करने वाले पिछले तरीकों की तुलना में 12 गुना तेज़ी से टेक्स्ट जेनरेट कर सकता है।
  • स्मार्ट बना रहता है: अन्य सिस्टमों के विपरीत जो मेमोरी बचाने के प्रयास में "भ्रमित" हो जाते हैं, RetroInfer उतना ही सटीक रहता है जितना कि यदि वह पूरे विश्वकोश के हर एक शब्द को पढ़ रहा होता।

संक्षेप में: RetroInfer एक धीमे, अभिभूत शोधकर्ता को एक उच्च-गति, सुपर-इंटेलिजेंट विद्वान में बदल देता है, जो उसकी स्मृति को व्यवस्थित करता है और उसकी अनुसंधान प्रक्रिया को स्वचालित करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →