← नवीनतम पेपर
💬 NLP

Dynamic Thinking-Token Selection for Efficient Reasoning in Large Reasoning Models

यह शोध पत्र डायनेमिक थिंकिंग-टोकन सिलेक्शन (DynTS) का प्रस्ताव करता है, जो एक ऐसी विधि है जो रीजनिंग ट्रेसेस में निर्णय-महत्वपूर्ण टोकन के केवल की-वैल्यू (Key-Value) कैश स्टेट्स को पहचानने और बनाए रखने तथा अनावश्यक प्रविष्टियों को हटाने के माध्यम से लार्ज रीजनिंग मॉडल्स की दक्षता को बढ़ाती है।

मूल लेखक: Zhenyuan Guo, Tong Chen, Wenlong Meng, Chen Gong, Xin Yu, Chengkun Wei, Wenzhi Chen

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenyuan Guo, Tong Chen, Wenlong Meng, Chen Gong, Xin Yu, Chengkun Wei, Wenzhi Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: एक खराब याददाश्त वाला "अति-विचार करने वाला" (Over-Thinker)

कल्पना कीजिए कि आप एक बहुत ही जटिल रहस्य सुलझाने वाले एक शानदार जासूस हैं। उत्तर खोजने के लिए, आप केवल अनुमान नहीं लगाते; आप अपने हर विचार, सुराग और निष्कर्ष को एक विशाल नोटबुक में लिखते हैं। लार्ज रीजनिंग मॉडल्स (LRMs) इसी तरह काम करते हैं। वे आपको अंतिम उत्तर देने से पहले लंबे "रीजनिंग ट्रेसेस" (जैसे कि सोच की एक श्रृंखला या chain of thought) उत्पन्न करते हैं।

हालाँकि, एक समस्या है। जैसे-जैसे जासूस अधिक लिखता जाता है, नोटबुक अविश्वसनीय रूप से भारी होती जाती है। AI की दुनिया में, इस नोटबुक को KV कैश (KV Cache) कहा जाता है। यह मॉडल ने अब तक जो कुछ भी प्रोसेस किया है, उसकी स्मृति (memory) को संग्रहीत करता है।

  • समस्या: नोटबुक इतनी बड़ी हो जाती है कि यह जासूस को धीमा कर देती है और इसे बहुत अधिक डेस्क स्पेस (कंप्यूटर मेमोरी) की आवश्यकता होती है।
  • बाधा (Bottleneck): नोटबुक को छोटा करने के तरीके मौजूदा विधियों में या तो अंधाधुंध पन्ने फाड़ने जैसे हैं या केवल हाल के पन्नों को रखने जैसे हैं। ऐसा करने से अक्सर जासूस महत्वपूर्ण सुराग भूल जाता है, जिससे गलत उत्तर मिलते हैं।

अंतर्दृष्टि (Insight): सोचने का 80/20 नियम

शोधकर्ताओं ने इन "नोटबुक्स" का बारीकी से अध्ययन किया और एक आश्चर्यजनक खोज की, जिसे वे AI तर्क (reasoning) में पारेटो सिद्धांत (Pareto Principle) या 80/20 नियम कहते हैं:

  • अवलोकन: मॉडल अपनी सोचने की प्रक्रिया के दौरान हजारों शब्द लिखता है, लेकिन उनमें से केवल एक बहुत छोटा हिस्सा (लगभग 20-20%) ही वास्तव में अंतिम उत्तर खोजने के लिए महत्वपूर्ण होता है।
  • रूपक (Metaphor): रीजनिंग ट्रेस को एक लंबी फिल्म की तरह समझें। फिल्म का अधिकांश हिस्सा बैकग्राउंड की बातचीत, चलने वाले दृश्यों या सेटअप के बारे में होता है। लेकिन केवल कुछ ही विशिष्ट "प्लॉट-ट्विस्ट" (कहानी बदलने वाले) क्षण होते हैं जो वास्तव में यह तय करते हैं कि कहानी कैसे समाप्त होगी। बाकी सब केवल "फिलर" (अनावश्यक सामग्री) है।
  • निष्कर्ष: यदि आप केवल उन महत्वपूर्ण "प्लॉट-ट्विस्ट" टोकन (शब्दों) को रखते हैं और बाकी फिलर को हटा देते हैं, तो AI अभी भी समस्या को सही ढंग से हल कर सकता है। फिलर शब्द ज्यादातर व्याकरण संबंधी जोड़ने वाले शब्द या अनावश्यक चरण होते हैं जो परिणाम को नहीं बदलते।

समाधान: DYNTS (स्मार्ट संपादक)

मेमोरी की समस्या को सटीकता खोए बिना हल करने के लिए, लेखकों ने DYNTS (डायनेमिक थिंकिंग-टोकन सिलेक्शन) नामक एक विधि बनाई।

अंधाधुंध पन्ने हटाने के बजाय, DYNTS एक स्मार्ट संपादक (Smart Editor) की तरह कार्य करता है जो वास्तविक समय में जासूस के नोट्स को पढ़ता है और निर्णय लेता है कि क्या रखना है।

  1. इम्पॉर्टेंस प्रेडिक्टर (महत्व का पूर्वानुमान लगाने वाला): उन्होंने AI के साथ एक छोटा, हल्का "मस्तिष्क" (एक सरल न्यूरल नेटवर्क) जोड़ा। जैसे ही AI अपने तर्क का प्रत्येक शब्द लिखता है, यह छोटा मस्तिष्क भविष्यवाणी करता है: "क्या यह शब्द अंतिम उत्तर के लिए महत्वपूर्ण है, या यह केवल फिलर है?"
  2. संपादक को प्रशिक्षित करना: उन्होंने इस संपादक को पूरे हो चुके मामलों (cases) को देखकर प्रशिक्षित किया। उन्होंने गणना की कि अतीत में कौन से शब्द सबसे महत्वपूर्ण थे, यह देखकर कि अंतिम उत्तर किन शब्दों पर "ध्यान (attention)" दे रहा था। संपादक ने इन उच्च-मूल्य वाले शब्दों को पहचानना सीख लिया।
  3. डुअल-विंडो सिस्टम (दोहरी-खिड़की प्रणाली): समाधान प्रक्रिया के दौरान, DYNTS दो ज़ोन का उपयोग करके मेमोरी प्रबंधित करता है:
    • लोकल विंडो (Local Window): यह हाल के विचारों (जैसे पिछले कुछ वाक्य) को सुरक्षित रखता है क्योंकि संदर्भ (context) मायने रखता है।
    • सिलेक्शन विंडो (Selection Window): यह पुराने विचारों को रखता है। यहाँ, "स्मार्ट संपादक" सक्रिय होता है। यह केवल शीर्ष-स्कोर वाले "महत्वपूर्ण" टोकन को रखता है और स्थान बचाने के लिए बाकी को हटा (evict) देता है।

परिणाम: तेज़ और स्मार्ट

शोधकर्ताओं ने दो लोकप्रिय AI मॉडलों का उपयोग करके छह कठिन बेंचमार्क (गणित और विज्ञान की समस्याओं) पर DYNTS का परीक्षण किया। परिणाम प्रभावशाली थे:

  • वही सटीकता, कम मेमोरी: DYNTS ने मानक विधि की तुलना में मेमोरी फुटप्रिंट को 3.3 से 5.7 गुना कम कर दिया। यह एक 10-खंडों वाले विश्वकोश को एक सिंगल पॉकेट-साइज़ गाइड में सिकोड़ने जैसा है, बिना तथ्यों को खोए।
  • तेज़ गति: क्योंकि नोटबुक छोटी है, AI जानकारी को तेज़ी से प्रोसेस करता है। इसने इन्फरेंस लेटेंसी (धीमापन) को 1.8 से 2.6 गुना कम कर दिया।
  • प्रतिद्वंद्वियों से बेहतर: अन्य अत्याधुनिक मेमोरी-बचत विधियों की तुलना में, DYNTS समान मेमोरी बजट का उपयोग करते हुए 2.6% अधिक सटीक था। अन्य विधियाँ अक्सर प्रदर्शन को नुकसान पहुँचाती हैं क्योंकि वे गलती से महत्वपूर्ण सुरागों को हटा देती हैं; DYNTS ने ऐसा इसलिए किया क्योंकि इसने विशेष रूप से "निर्णय-महत्वपूर्ण" (decision-critical) टोकन को लक्षित किया।

सारांश

संक्षेप में, यह शोध पत्र दिखाता है कि AI रीजनिंग मॉडल ज़रूरत से ज़्यादा बातें करते हैं। एक छोटे, प्रशिक्षित सहायक का उपयोग करके जो केवल महत्वपूर्ण सोचने वाले चरणों की पहचान करता है और उन्हें रखता है और बाकी को हटा देता है, हम इन शक्तिशाली मॉडलों को बिना मूर्ख बनाए बहुत तेज़ी से चलाने और काफी कम मेमोरी का उपयोग करने के योग्य बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →