← नवीनतम पेपर
🤖 machine learning

Tail-Replay: Escaping the Curse of Linear Attention in Prefix Caching for Hybrid LLMs

टेल-रिप्ले (Tail-Replay) हाइब्रिड लार्ज लैंग्वेज मॉडल्स के लिए एक प्रीफिक्स कैशिंग मैकेनिज्म है जो केवल मेल खाते प्रीफिक्स के एक संक्षिप्त, हालिया सफिक्स (suffix) को रिप्ले करके लीनियर-अटेंशन स्टेट्स को पुनर्गठित करने के माध्यम से अनकन्स्ट्रेंड टोकन-लेवल रियूज़ को सक्षम करता है, जिससे रिकरेंट-स्टेट चेकपॉइंट्स की आवश्यकता समाप्त हो जाती है और लगभग पूर्ण गुणवत्ता प्रतिधारण और महत्वपूर्ण इन्फरेंस स्पीडअप प्राप्त होता है।

मूल लेखक: Yirui Liu, Ruoling Qi, Xuaner Wu, Penghang Liu, Jian Chen

प्रकाशित 2026-09-01✓ Author reviewed
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yirui Liu, Ruoling Qi, Xuaner Wu, Penghang Liu, Jian Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक आर्टिफिशियल इंटेलिजेंस की दुनिया में, लार्ज लैंग्वेज मॉडल्स लेखन सहायकों से लेकर जटिल डेटा विश्लेषण तक सब कुछ चलाने वाले इंजन बन गए हैं। ये सिस्टम विशाल मात्रा में टेक्स्ट को प्रोसेस करके, टोकन दर टोकन, यह अनुमान लगाते हैं कि आगे क्या आएगा। हालाँकि, जैसे-जैसे इन मॉडल्स को लंबी बातचीत या दस्तावेज़ों को संभालने के लिए कहा जाता है, उन्हें एक महत्वपूर्ण बाधा का सामना करना पड़ता है: अब तक पढ़े गए सब कुछ को याद रखने की लागत। इसे हल करने के लिए, शोधकर्ताओं ने दो मुख्य रणनीतियाँ विकसित की हैं। एक दृष्टिकोण मॉडल के आंतरिक आर्किटेक्चर को अधिक कुशल बनाने में शामिल है, जिसमें मानक मेमोरी लेयर्स और विशेष, सुव्यवस्थित (streamlined) लेयर्स का मिश्रण उपयोग किया जाता है जो हर एक विवरण को संग्रहीत करने के बजाय जानकारी का सारांश प्रस्तुत करती हैं। दूसरा दृष्टिकोण 'प्रिफिक्स कैशिंग' नामक एक सिस्टम ट्रिक है, जो यह पहचानता है कि विभिन्न उपयोगकर्ता अक्सर अपने अनुरोधों की शुरुआत समान शब्दों से करते हैं। उन समान शुरुआती वाक्यों को हर बार फिर से पढ़ने के बजाय, सिस्टम उस पहले पास (pass) के परिणाम को सहेज लेता है और उसका पुन: उपयोग करता है। जबकि ये दोनों रणनीतियाँ अपने आप में अच्छी तरह काम करती हैं, इन्हें मिलाना कठिन साबित हुआ है क्योंकि सुव्यवस्थित मेमोरी लेयर्स को मानक समकक्षों के विपरीत, किसी भी बिंदु पर आसानी से रोका या फिर से शुरू नहीं किया जा सकता है।

इस असंगति ने इंजीनियरों के लिए, जो तेज़ और अधिक कुशल AI सिस्टम बनाने की कोशिश कर रहे थे, एक विशिष्ट समस्या पैदा कर दी। जब एक मानक मेमोरी लेयर का पुन: उपयोग किया जाता है, तो सिस्टम सीधे सेव किए गए टेक्स्ट के किसी भी बिंदु पर जा सकता है। लेकिन सुव्यवस्थित लेयर्स, जिन्हें जानकारी को संकुचित करने के लिए डिज़ाइन किया गया है, एक निरंतर अवस्था (state) बनाए रखती हैं जिसे बिना अर्थ खोए किसी भी मनमाने शुरुआती बिंदु पर वापस नहीं ले जाया जा सकता। पिछले समाधानों ने निश्चित अंतराल पर सिस्टम की अवस्था के स्नैपशॉट (snapshots) सहेजकर इस समस्या को दूर करने की कोशिश की, लेकिन इसका मतलब यह था कि सिस्टम केवल तभी टेक्स्ट का पुन: उपयोग कर सकता था जब साझा हिस्सा ठीक उन्हीं स्नैपशॉट्स पर समाप्त होता हो। यदि किसी उपयोगकर्ता का अनुरोध शब्दों की एक लंबी श्रृंखला साझा करता था जो एक स्नैपशॉट के ठीक बाद समाप्त होती थी, तो सिस्टम को मैच को छोड़ देना पड़ता था और फिर से शुरुआत करनी पड़ती थी, जिससे दक्षता का लाभ व्यर्थ हो जाता था।

चीन टेलीकॉम के इंस्टीट्यूट ऑफ आर्टिफिशियल इंटेलिजेंस और शंघाई जियाओ टोंग यूनिवर्सिटी के शोधकर्ताओं ने इस समस्या को हल करने के लिए 'टेल-रिप्ले' (Tail-Replay) नामक एक नई विधि विकसित की है। उनका दृष्टिकोण यह सुनिश्चित करता है कि सिस्टम स्नैपशॉट कहाँ भी लिए गए हों, साझा टेक्स्ट का पुन: उपयोग कर सके। मूल विचार सुव्यवस्थित मेमोरी लेयर्स के एक विशिष्ट गुण पर आधारित है: उन्हें हाल की जानकारी को पुरानी जानकारी की तुलना में अधिक महत्व देने के लिए डिज़ाइन किया गया है। जैसे-जैसे सिस्टम एक लंबे टेक्स्ट को प्रोसेस करता है, पहले के शब्दों का प्रभाव धीरे-धीरे कम होता जाता है, जबकि हाल के शब्द वर्तमान अवस्था पर हावी हो जाते हैं। शोधकर्ताओं ने महसूस किया कि मैच किए गए प्रिफिक्स की अवस्था को पुन: निर्मित करने के लिए, सिस्टम को उस टेक्स्ट के पूरे इतिहास को फिर से चलाने (replay) की आवश्यकता नहीं है। इसके बजाय, उसे केवल उस साझा टेक्स्ट के सबसे हालिया, छोटे खंड को फिर से चलाने की आवश्यकता है।

यह नई विधि प्रत्येक शब्द के लिए मानक लेयर्स की सटीक और विस्तृत मेमोरी को सहेजकर, और सुव्यवस्थित लेयर्स के लिए स्नैपशॉट्स को छोड़कर काम करती है। जब कोई नया अनुरोध आता है जो पिछले किसी अनुरोध के साथ एक लंबा प्रिफिक्स साझा करता है, तो सिस्टम मैचिंग भाग के लिए सहेजी गई विस्तृत मेमोरी को प्राप्त करता है। सुव्यवस्थित लेयर्स के लिए, एक आदर्श स्नैपशॉट खोजने के बजाय, सिस्टम साझा टेक्स्ट के अंतिम कुछ शब्दों की सहेजी गई विस्तृत मेमोरी लेता है और उन्हें शुरुआत से ही सुव्यवस्थित लेयर्स के माध्यम से चलाता है। यह छोटा 'रिप्ले' आवश्यक अवस्था को उच्च सटीकता के साथ पुन: निर्मित करता है। चूंकि सिस्टम को केवल टेक्स्ट के एक छोटे 'टेल' (tail) को फिर से चलाने की आवश्यकता होती है, इसलिए यह प्रक्रिया तेज़ है और इसमें भारी, मध्यवर्ती स्नैपशॉट्स को संग्रहीत करने की आवश्यकता नहीं होती है जो पहले लचीलेपन को सीमित करते थे।

टीम ने लंबी दस्तावेज़ों और जटिल तर्क कार्यों को मापने के लिए डिज़ाइन किए गए मानक बेंचमार्क का उपयोग करके तीन अलग-अलग हाइब्रिड लैंग्वेज मॉडल्स पर इस पद्धति का परीक्षण किया। उन्होंने पाया कि केवल पांच से दस प्रतिशत मैच किए गए टेक्स्ट को फिर से चलाने से, सिस्टम ने उस गुणवत्ता के बीच 92.8 और 99.9 प्रतिशत स्तर को बनाए रखा जो उसने पूरे टेक्स्ट को शुरू से प्रोसेस करने पर प्राप्त की होती। व्यावहारिक रूप से, इसका अर्थ है कि सिस्टम सटीकता से समझौता किए बिना हजारों शब्दों को फिर से पढ़ने की भारी मेहनत को छोड़ सकता है। परिणामों ने दिखाया कि यह पद्धति लंबी कहानियों के बारे में प्रश्न पूछने से लेकर विशाल डेटासेट से विशिष्ट तथ्यों को निकालने तक, विभिन्न प्रकार के कार्यों में लगातार काम करती है।

सटीकता के अलावा, इस पद्धति ने गति में नाटकीय सुधार भी किया। जब सिस्टम को 8,000, 16,000 या 32,000 शब्दों के साझा प्रिफिक्स वाले अनुरोधों को प्रोसेस करने के लिए कहा गया, तो पहला उत्तर उत्पन्न करने में लगने वाला समय काफी कम हो गया। सबसे लंबे टेक्स्ट के लिए, नई विधि पारंपरिक 'सब कुछ फिर से पढ़ने' के दृष्टिकोण की तुलना में 14.3 गुना तक तेज़ थी। जैसे-जैसे टेक्स्ट लंबा होता गया, यह गति वृद्धि (speedup) और बड़ी होती गई, जो दर्शाता है कि दक्षता का लाभ तब सबसे अधिक होता है जब संदर्भ सबसे अधिक चुनौतीपूर्ण होता है। शोधकर्ताओं ने मेमोरी और प्रोसेसर के बीच डेटा ले जाने में लगने वाले समय को और कम करने के लिए अनुकूलन (optimizations) भी विकसित किए, जिससे यह सुनिश्चित हुआ कि रिप्ले प्रक्रिया एक नया बॉटलनेक (bottleneck) न बन जाए।

यह कार्य प्रदर्शित करता है कि कुशल मॉडल आर्किटेक्चर को स्मार्ट कैशिंग सिस्टम के साथ जोड़ने की सीमाओं को प्रदर्शन से समझौता किए बिना पार किया जा सकता है। यह समझते हुए कि इन सुव्यवस्थित लेयर्स में पुरानी जानकारी का प्रभाव स्वाभाविक रूप से कम होता जाता है, शोधकर्ताओं ने एक बाधा को एक अवसर में बदल दिया। 'टेल-रिप्ले' पद्धति सिस्टम को साझा टेक्स्ट को स्वतंत्र रूप से पुन: उपयोग करने की अनुमति देती है, जो केवल शब्दों द्वारा निर्धारित होता है न कि मनमाने चेकपॉइंट्स द्वारा। यह प्रगति उन अधिक उत्तरदायी और कुशल AI सेवाओं की ओर एक मार्ग सुझाती है जो कंप्यूटिंग पावर में भारी वृद्धि की आवश्यकता के बिना लंबे-संदर्भ (long-context) वाले अनुप्रयोगों की बढ़ती मांगों को संभाल सकती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →