← नवीनतम पेपर
🤖 AI

KV-Rescue: Recovering Reasoning Language Model KV Eviction Loss via Stepwise Interleaving

KV-Rescue एक प्रशिक्षण-मुक्त अनुमान ढांचा (training-free inference framework) है जो एक हल्के फुल-कॉन्टेक्स्ट हेल्पर मॉडल के स्टेप्स को बेस मॉडल के साथ इंटरलीव करने और विसंगत जनरेशन को समाप्त करने के लिए एक ऑनलाइन डिटेक्टर का उपयोग करने के माध्यम से, आक्रामक KV-कैशे इविक्शन बजट के तहत रीजनिंग लैंग्वेज मॉडल्स में सटीकता की हानि और अनियंत्रित क्षरण (runaway degeneration) को कम करता है।

मूल लेखक: Minsoo Cheong, Woosang Lim, Vincent-Daniel Yun, Sungjoo Yoo

प्रकाशित 2026-08-18
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Minsoo Cheong, Woosang Lim, Vincent-Daniel Yun, Sungjoo Yoo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) तर्क करने के शक्तिशाली इंजनों के रूप में कार्य करते हैं, जो जटिल गणितीय समस्याओं को हल करने या जटिल कार्यों की योजना बनाने में सक्षम होते हैं। ऐसा करने के लिए, वे एक विशाल आंतरिक कार्यक्षेत्र पर निर्भर करते हैं जिसे 'मेमोरी कैश' कहा जाता है, जो बातचीत में अब तक कही गई और सोची गई हर चीज़ का इतिहास रखता है। यह स्मृति आवश्यक है; इसके बिना, मॉडल अपने पिछले चरणों को भूल जाएगा और अपने तर्क के सूत्र को खो देगा। हालाँकि, जैसे-जैसे ये बातचीत लंबी होती जाती है, इस स्मृति की आवश्यकता एक भारी बोझ बन जाती है, जो इतनी अधिक कंप्यूटर शक्ति का उपभोग करती है कि सिस्टम धीमा हो जाता है या क्रैश हो जाता है। चीजों को सुचारू रूप से चलाने के लिए, इंजीनियरों ने इस स्मृति के पुराने हिस्सों को फेंक देने के तरीके विकसित किए हैं, जिससे केवल वही रखा जाता है जो सबसे महत्वपूर्ण प्रतीत होता है। लेकिन सूचना को त्यागने का यह कार्य जोखिम भरा है। जब एक मॉडल अपने अतीत के बहुत अधिक हिस्से को भूल जाता है, तो वह केवल एक साधारण गलती नहीं करता; वह भ्रम में फंस सकता है, बार-बार उन्हीं शब्दों को दोहरा सकता है या तब तक निरर्थक बातें उत्पन्न कर सकता है जब तक कि वह बोलने की अपनी कठोर सीमा तक न पहुँच जाए।

सियोल नेशनल यूनिवर्सिटी और यूनिवर्सिटी ऑफ सदर्न कैलिफोर्निया के शोधकर्ताओं ने इस प्रक्रिया में एक विशिष्ट कमजोरी की पहचान की है और बिना मॉडलों को फिर से प्रशिक्षित किए इसे ठीक करने का एक तरीका निकाला है। उन्होंने पाया कि स्मृति को फेंक देने से होने वाली समस्या मॉडल की अपनी बुद्धिमत्ता की कमी नहीं है, बल्कि सूचना का एक सरल अंतराल है। एक बड़ा, शक्तिशाली मॉडल जिसने अपने इतिहास के कुछ हिस्सों को भुला दिया है, वह इसलिए संघर्ष करता है क्योंकि उसके पास संदर्भ (कॉन्टेक्स्ट) की कमी है, न कि इसलिए कि उसने सोचने की अपनी क्षमता खो दी है। एक चतुर मोड़ में, उन्होंने पाया कि एक बहुत छोटा, कम शक्तिशाली मॉडल जो सब कुछ याद रखता है, अक्सर उन रिक्त स्थानों को भर सकता है जिन्हें बड़ा, विस्मृत मॉडल छोड़ देता है। जहाँ बड़ा मॉडल उस विशिष्ट संख्या को भूल सकता है जिसकी उसे आवश्यकता है, वहीं छोटा मॉडल उसे पूरी तरह से याद रखता है। इसके विपरीत, छोटे मॉडल में समस्या को हल करने के लिए गहन तर्क कौशल की कमी हो सकती है, जबकि बड़े मॉडल के पास कौशल तो है लेकिन स्मृति नहीं है।

इस अंतर को पाटने के लिए, टीम ने KV-Rescue नामक एक नई प्रणाली बनाई है। बड़े मॉडल को उसकी अपूर्ण स्मृति के साथ अकेले संघर्ष करने देने के बजाय, यह प्रणाली उसे एक छोटे, हल्के सहायक (हेल्पर) के साथ जोड़ती है जो पूर्ण इतिहास को ध्यान में रखता है। जैसे-जैसे दोनों मॉडल मिलकर चरण दर चरण एक समस्या को हल करते हैं, वे विचारों को उत्पन्न करने के लिए बारी-बारी से काम करते हैं। प्रत्येक चरण पर, एक स्कोरिंग प्रणाली मूल्यांकन करती है कि कौन सा विचार बेहतर है और उसे आगे बढ़ाती है, जिससे तर्क का एक एकल, साझा पथ बनता है। यदि बड़ा मॉडल बहुत अधिक भूल जाने के कारण निरर्थक बातों या दोहराव वाले लूपों में भटकने लगता है, तो प्रणाली इसे जल्दी पहचान लेती है और उस पथ को तुरंत रोक देती है, और विचार के प्रवाह को पटरी पर रखने के लिए सहायक पर भरोसा करती है। यह प्रक्रिया बड़े मॉडल को अपनी श्रेष्ठ तर्क शक्ति का त्याग किए बिना, छोटे मॉडल की सटीक स्मृति का लाभ उठाने की अनुमति देती है।

इस दृष्टिकोण के परिणाम आश्चर्यजनक हैं। एक शक्तिशाली सात-बिलियन-पैरामीटर वाले मॉडल का उपयोग करके पांच अलग-अलग गणितीय बेंचमार्क पर परीक्षण करने पर, इस नई पद्धति ने उस लगभग नब्बे प्रतिशत सटीकता को पुनः प्राप्त किया जो स्मृति को आक्रामक रूप से फेंक देने पर खो गई थी। उन स्थितियों में जहाँ मेमोरी बजट अत्यंत सीमित था, कई अलग-अलग उत्तरों को आज़माने की पारंपरिक विधि अक्सर विफल रही, जिससे मॉडल खुद को दोहराने लगा या बड़बड़ाने लगा। हालाँकि, नई प्रणाली ने इन विफलताओं को रोका और औसतन तैंतालीस प्रतिशत कंप्यूटर कार्य की बर्बादी को कम किया। शोधकर्ताओं ने देखा कि छोटे सहायक ने पूरे कार्य पर कब्जा नहीं किया; इसके बजाय, इसने सबसे कठिन परिदृश्यों में लगभग एक-तिहाई चरणों में योगदान दिया, और ठीक उसी समय हस्तक्षेप किया जब बड़े मॉडल को अतीत की याद दिलाने की आवश्यकता थी। एक बड़े मॉडल की गहन सोच को एक छोटे मॉडल की सटीक स्मृति के साथ जोड़कर, शोधकर्ताओं ने दिखाया है कि यह संभव है कि लंबे तर्क कार्यों को सटीक और कुशल रखा जाए, भले ही कंप्यूटर की स्मृति गंभीर रूप से सीमित क्यों न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →