← नवीनतम पेपर
💬 NLP

DND: Boosting Large Language Models with Dynamic Nested Depth

यह शोध पत्र डायनेमिक नेस्टेड डेप्थ (DND) को प्रस्तुत करता है, जो एक नवीन पोस्ट-ट्रेनिंग विधि है जो एक नेस्टेड डेप्थ तंत्र के माध्यम से महत्वपूर्ण टोकन की गतिशील रूप से पहचान करने और उन्हें पुन: संसाधित करने द्वारा ऑफ-द-शेल्फ LLMs को उन्नत करती है, जिससे न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ विविध बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

मूल लेखक: Tieyuan Chen, Xiaodong Chen, Haoxing Chen, Zhenzhong Lan, Weiyao Lin, Jianguo Li

प्रकाशित 2026-01-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Tieyuan Chen, Xiaodong Chen, Haoxing Chen, Zhenzhong Lan, Weiyao Lin, Jianguo Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र हैं जो एक बहुत कठिन परीक्षा दे रहे हैं। आपके पास सीमित समय और मानसिक ऊर्जा है।

पुराना तरीका (स्टैंडर्ड AI):
आज के अधिकांश लार्ज लैंग्वेज मॉडल्स (LLMs) एक ऐसे छात्र की तरह काम करते हैं जो परीक्षा के हर सवाल के साथ बिल्कुल एक जैसा व्यवहार करता है। चाहे सवाल "2+2 क्या है?" हो या "ब्लैक होल के क्वांटम मैकेनिक्स को समझाएं," छात्र उसी तरह समान समय और दिमागी शक्ति खर्च करता है। वह आसान सवाल को पढ़ता है, एक सेकंड के लिए सोचता है, उत्तर लिखता है, और आगे बढ़ जाता है। वह कठिन सवाल के साथ भी यही करता है, लेकिन क्योंकि वह उसी "एक-आकार-सभी-के-लिए" (one-size-fits-all) प्रयास का उपयोग कर रहा है, इसलिए वह कठिन हिस्से में जल्दबाजी कर सकता है और गलत हो सकता है, या आसान हिस्से पर ज़रूरत से ज़्यादा सोचने में समय बर्बाद कर सकता है।

नया विचार (DND):
यह पेपर डायनेमिक नेस्टेड डेप्थ (Dynamic Nested Depth - DND) नामक एक विधि पेश करता है। इसे एक स्मार्ट ट्यूटर के रूप में सोचें जो छात्र को परीक्षा देते हुए देखता है और केवल आवश्यकता पड़ने पर ही हस्तक्षेप करता है।

यह इस प्रकार काम करता है, जिसे सरल चरणों में विभाजित किया गया है:

1. "ट्रैफिक पुलिस" (द राउटर)

जैसे ही मॉडल एक वाक्य को प्रोसेस करता है, वह हर लेयर (सोचने की प्रक्रिया का एक चरण) के अंत में एक "ट्रैफिक पुलिस" से टकराता है। यह पुलिस हर शब्द (टोकन) को व्यक्तिगत रूप से देखती है।

  • आसान शब्द: यदि शब्द सरल है (जैसे "the" या "and"), तो पुलिस कहती है, "तुम ठीक हो, आगे बढ़ो।" मॉडल इसे सामान्य रूप से प्रोसेस करता है और अगले चरण पर चला जाता है।
  • कठिन शब्द: यदि शब्द पेचीदा है (जैसे कोई जटिल गणितीय प्रतीक या पहेली में कोई तार्किक संयोजक), तो पुलिस कहती है, "रुको! इस पर अधिक ध्यान देने की आवश्यकता है।"

2. "डिटूर" (नेस्टेड डेप्थ)

जब पुलिस किसी कठिन शब्द को फ्लैग करती है, तो वह उसे केवल जाने नहीं देती। इसके बजाय, वह उस विशिष्ट शब्द को एक डिटूर (मार्ग परिवर्तन) पर भेज देती है।

  • कल्पना कीजिए कि शब्द को अध्ययन के दूसरे दौर के लिए वापस क्लासरूम में भेज दिया गया है। इसे फिर से पढ़ा जाता है, फिर से विश्लेषण किया जाता है, और मॉडल के आंतरिक तर्क द्वारा "समीक्षा" की जाती है।
  • यही "नेस्टेड डेप्थ" है। मॉडल आसान शब्दों पर समय बर्बाद किए बिना केवल उन कठिन शब्दों में गहराई तक जाता है। यह एक किताब के भ्रमित करने वाले पैराग्राफ को दोबारा पढ़ने जैसा है जबकि आसान हिस्सों को सरसरी तौर पर पढ़ा जा रहा हो।

3. "मर्जिंग" (फ्यूजन)

कठिन शब्दों की अतिरिक्त "समीक्षा" होने के बाद, उन्हें मुख्य लाइन में वापस लाया जाता है। मॉडल फिर मूल समझ को इस नई, गहरी समझ के साथ जोड़ता है ताकि अंतिम उत्तर बनाया जा सके।

यह विशेष क्यों है?

पेपर का दावा है कि यह एक "प्लग-एंड-प्ले" अपग्रेड है। आपको पूरा स्कूल (मॉडल) फिर से बनाने की आवश्यकता नहीं है। आप बस मौजूदा मॉडल्स (जैसे Qwen, Llama, या Gemma) में इस स्मार्ट ट्रैफिक पुलिस सिस्टम को जोड़ सकते हैं और उसे थोड़े समय के लिए प्रशिक्षित कर सकते हैं।

परिणाम (रिपोर्ट कार्ड):
लेखकों ने इनका परीक्षण कई अलग-अलग मॉडल्स पर किया:

  • छोटे मॉडल्स: उन्होंने छोटे मॉडल्स (जैसे 1 बिलियन पैरामीटर्स वाले) को काफी स्मार्ट बनाया। उदाहरण के लिए, एक मॉडल के रीजनिंग और कोडिंग स्कोर में लगभग 2.5% से 2.6% का सुधार हुआ।
  • बड़े मॉडल्स: उन्होंने एक विशाल, जटिल मॉडल (30 बिलियन पैरामीटर्स) पर भी इसका परीक्षण किया। इसने उस मॉडल के प्रदर्शन में लगभग 1% का सुधार किया।
  • दक्षता (Efficiency): सबसे अच्छी बात यह है कि इसने मॉडल को बहुत धीमा या बड़ा नहीं बनाया। इसने केवल बहुत कम अतिरिक्त "दिमागी शक्ति" (पैरामीटर्स) और कंप्यूटेशन जोड़ी। यह बिना दोगुना समय पढ़े बेहतर ग्रेड पाने जैसा है।

सीक्रेट सॉस (ट्रेनिंग स्ट्रैटेजी)
पेपर यह भी बताता है कि "ट्रैफिक पुलिस" को सटीक होने के लिए सिखाना कठिन है। यदि पुलिस बहुत अधिक सख्त है, तो वह सब कुछ रोक देती है; यदि वह बहुत आलसी है, तो वह कुछ भी नहीं रोकती।

  • समाधान: उन्होंने एक विशेष प्रशिक्षण नियम बनाया। उन्होंने पुलिस को "आसान" और "कठिन" शब्दों के बीच अंतर करने में बहुत अच्छा बनाया (ताकि वह भ्रमित न हो) और उसे अपनी सख्ती (थ्रेशोल्ड) को एडजस्ट करने का एक डायनेमिक तरीका दिया ताकि वह हमेशा समीक्षा के लिए सही मात्रा में शब्दों को चुने।

सारांश में:
DND एक ऐसा तरीका है जिससे AI को स्मार्ट बनाया जाता है, जिससे वह वाक्य के केवल कठिन हिस्सों पर अतिरिक्त समय खर्च कर सके, जबकि आसान हिस्सों से तेज़ी से निकल जाए। यह हर चीज़ पर अधिक मेहनत करने के बजाय, अधिक स्मार्ट तरीके से सोचने का एक कुशल तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →