← नवीनतम पेपर
💬 NLP

The Diminishing Returns of Early-Exit Decoding in Modern LLMs

यह शोध पत्र प्रदर्शित करता है कि अर्ली-एग्जिट डिकोडिंग (early-exit decoding), जो LLM इन्फरेंस लेटेंसी और लागत को कम करने की एक तकनीक है, आधुनिक मॉडलों में कम होती लेयर रेडंडेंसी (layer redundancy) के कारण तेजी से अप्रभावी होती जा रही है, जिसमें डेंस, बड़े पैमाने के बेस मॉडल, मिक्स्चर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts) या स्टेट स्पेस मॉडल्स (State Space Models) की तुलना में अधिक अर्ली-एग्जिट क्षमता बनाए रखते हैं।

मूल लेखक: Rui Wei, Rui Du, Hanfei Yu, Devesh Tiwari, Jian Li, Zhaozhuo Xu, Hao Wang

प्रकाशित 2026-03-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rui Wei, Rui Du, Hanfei Yu, Devesh Tiwari, Jian Li, Zhaozhuo Xu, Hao Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ आधुनिक LLMs में "अर्ली-एग्जिट डिकोडिंग" (Early-Exit Decoding) के घटते लाभों पर आधारित शोध पत्र का सरल भाषा में अनुवाद दिया गया है।

मुख्य विचार: वह "फास्ट-ट्रैक" जो अब ब्लॉक हो रहा है

कल्पना कीजिए कि आप एक जटिल पैकेज (एक प्रश्न) एक विशाल, बहु-मंजिला फैक्ट्री (एक लार्ज लैंग्वेज मॉडल या LLM) के माध्यम से भेज रहे हैं। पुराने दिनों में, इस फैक्ट्री में कई मंजिलें थीं, लेकिन निचली मंजिलों के कर्मचारी अक्सर ऊपरी मंजिलों के कर्मचारियों जैसा ही काम कर रहे होते थे।

"अर्ली-एग्जिट डिकोडिंग" (Early-Exit Decoding) एक स्मार्ट सिस्टम की तरह है जो कहता है: "अरे, 5वीं मंजिल के कर्मचारियों ने उत्तर ढूंढ लिया है! हमें इस पैकेज को 20वीं मंजिल तक भेजने की ज़रूरत नहीं है। चलिए इसे अभी शिप कर देते हैं!"

यह समय और पैसा (कंप्यूटिंग पावर) बचाता है। पुराने AI मॉडल्स के लिए, यह बहुत अच्छा काम करता था। लेकिन यह पेपर एक महत्वपूर्ण सवाल पूछता है: क्या यह अभी भी नवीनतम, सबसे उन्नत AI मॉडल्स के लिए काम करता है?

संक्षिप्त उत्तर? वास्तव में नहीं। "फास्ट ट्रैक" अब ब्लॉक हो रहा है।


उपमा: एक विशेषज्ञ असेंबली लाइन

यह समझने के लिए कि ऐसा क्यों हो रहा है, आइए देखें कि ये फैक्ट्रियां कैसे बदली हैं।

1. पुरानी फैक्ट्री (पुराने AI मॉडल्स)

पुराने मॉडल्स (जैसे Llama 2) में, असेंबली लाइन थोड़ी ढीली-ढाली थी।

  • परिदृश्य: आप पूछते हैं, "फ्रांस की राजधानी क्या है?"
  • प्रक्रिया: जब तक पैकेज तीसरी मंजिल तक पहुँचता है, कर्मचारियों को पहले से ही पता होता है कि उत्तर "पेरिस" है। चौथी से लेकर 20वीं मंजिल तक के कर्मचारी केवल दोबारा जाँच कर रहे हैं, लेकिन वे कुछ नया जोड़ नहीं रहे हैं।
  • परिणाम: आप तीसरी मंजिल पर रुक सकते हैं, 85% समय बचा सकते हैं, और फिर भी सही उत्तर प्राप्त कर सकते हैं।

2. नई फैक्ट्री (आधुनिक AI मॉडल्स)

नए मॉडल्स (जैसे Llama 3, Qwen 3, या Mamba) को फिर से डिज़ाइन किया गया है। इन्हें "बेहतर रेसिपी" के साथ बनाया गया है।

  • परिदृश्य: आप वही प्रश्न पूछते हैं।
  • प्रक्रिया: नई फैक्ट्री को इस तरह डिज़ाइन किया गया है कि हर एक मंजिल कुछ अनूठा जोड़ती है। तीसरी मंजिल के कर्मचारी शायद "पेरिस" का अनुमान लगा लें, लेकिन 10वीं मंजिल के कर्मचारी व्याकरण को सुधारते हैं, 15वीं मंजिल के कर्मचारी लहजे (tone) की जाँच करते हैं, और 20वीं मंजिल के कर्मचारी सुनिश्चित करते हैं कि तर्क (logic) एकदम सटीक हो।
  • परिणाम: यदि आप तीसरी मंजिल पर रुकने की कोशिश करते हैं, तो उत्तर "पेरिस" तो हो सकता है, लेकिन वह व्याकरणिक रूप से गलत या संदर्भ के हिसाब से अजीब हो सकता है। एक अच्छा उत्तर पाने के लिए, आपको लगभग हमेशा सबसे ऊपरी मंजिल तक जाना ही होगा।

पेपर का निष्कर्ष: जैसे-जैसे AI मॉडल अधिक स्मार्ट और जटिल होते जा रहे हैं, वे अपनी "रिडंडेंसी" (अतिरिक्तता) खो रहे हैं। अंतिम उत्पाद को खराब किए बिना आप अब बीच के चरणों को छोड़ नहीं सकते।


"फास्ट ट्रैक" के चार नियम

शोधकर्ताओं ने दर्जनों मॉडल्स का परीक्षण किया और चार मुख्य नियम पाए जो यह निर्धारित करते हैं कि क्या आप "फास्ट ट्रैक" (अर्ली एग्जिट) का उपयोग कर सकते हैं:

नियम 1: बड़ा बेहतर है (आकार मायने रखता है)

  • उपमा: एक छोटी बेकरी बनाम एक विशाल औद्योगिक खाद्य संयंत्र के बारे में सोचें।
  • निष्कर्ष: आश्चर्यजनक रूप से, बड़े मॉडल्स (20 बिलियन से अधिक पैरामीटर्स वाले) छोटे मॉडल्स की तुलना में अर्ली एग्जिट करने में वास्तव में बेहतर होते हैं।
  • क्यों? एक विशाल फैक्ट्री में इतनी सारी परतें होती हैं कि यदि आप पहली कुछ छोड़ भी दें, तो भी समझने के लिए पर्याप्त "बौद्धिक शक्ति" बची रहती है। छोटे मॉडल्स इतने सघन (compact) होते हैं कि उनकी हर एक परत महत्वपूर्ण होती; एक भी छोड़ी, तो सब कुछ ढह जाएगा।

नियम 2: फैक्ट्री का आकार (आर्किटेक्चर)

  • उपमा:
    • डेंस ट्रांसफॉर्मर्स (Standard): कर्मचारियों की एक सीधी रेखा जहाँ हर कोई एक-दूसरे से बात करता है। ये अर्ली एग्जिट के लिए अच्छे हैं।
    • MoE (Mixture of Experts): कल्पना कीजिए कि एक फैक्ट्री है जहाँ प्रत्येक कार्य के लिए केवल 3 विशिष्ट विशेषज्ञों को बुलाया जाता है, और बाकी ब्रेक पर होते हैं। यह अर्ली एग्जिट के लिए बुरा है क्योंकि "विशेषज्ञ" अक्सर अंतिम निर्णय लेने के लिए अंत तक प्रतीक्षा करते हैं।
    • SSMs (State Space Models): एक कन्वेयर बेल्ट जहाँ एक चरण का आउटपुट अगले चरण से मजबूती से जुड़ा होता है। आप बीच में नहीं रुक सकते, अन्यथा चेन टूट जाएगी।
  • निष्कर्ष: मानक "डेंस" मॉडल्स अर्ली एग्जिट के लिए सबसे अधिक अनुकूल हैं। फैंसी नए आर्किटेक्चर (MoE और SSMs) शॉर्टकट लेने में बहुत कठिन हैं।

नियम 3: ट्रेनिंग इसे कठिन बनाती है

  • उपमा:
    • बेस मॉडल: एक कच्चा, बिना पॉलिश किया हुआ हीरा। यह खुरदरा है, लेकिन इसकी परतें थोड़ी अव्यवस्थित और रिडंडेंट हैं।
    • ट्यून्ड मॉडल: एक पॉलिश किया हुआ, तराशा हुआ हीरा। इसका हर पहलू सटीक है।
  • निष्कर्ष: जब आप किसी मॉडल को "फाइन-ट्यून" करते हैं (उसे निर्देश मानने या चैट करने के लिए सिखाते हैं), तो आप वास्तव में उसकी अर्ली एग्जिट करने की क्षमता को कम कर देते हैं। ट्रेनिंग प्रक्रिया मॉडल को उत्तर सही पाने के लिए अंतिम परतों पर बहुत अधिक निर्भर रहने के लिए मजबूर करती है, जिससे शुरुआती परतों का "सुरक्षा जाल" खत्म हो जाता है।

नियम 4: कार्य मायने रखता है (थोड़ा बहुत)

  • उपमा: गणित की समस्या हल करना बनाम कविता लिखना।
  • निष्कर्ष: आप जो प्रश्न पूछते हैं उससे फैक्ट्री का लेआउट बहुत अधिक नहीं बदलता है। चाहे आप कोड मांग रहे हों या मजाक, मॉडल की आंतरिक "फास्ट ट्रैक" क्षमता लगभग समान रहती है। यह मॉडल के स्वयं के बारे में अधिक है न कि कार्य के बारे में।

"घटते रिटर्न" (Diminishing Returns) का निष्कर्ष

पेपर का शीर्षक, "The Diminishing Returns," का अर्थ है कि जैसे-जैसे AI बेहतर होता जाता है, "कदमों को छोड़ने" (skipping steps) के जरिए इसे तेज करने का लाभ छोटा होता जाता है।

  • 2023 में: आप 50% काम छोड़ सकते थे और फिर भी एक शानदार उत्तर प्राप्त कर सकते थे।
  • 2025/2026 में: आप उत्तर खराब होने से पहले केवल 10% ही छोड़ पाएंगे।

आपको इसकी परवाह क्यों करनी चाहिए?

यदि आप एक डेवलपर या कंपनी हैं जो AI चला रही है:

  1. "अर्ली एग्जिट" को नवीनतम, सबसे स्मार्ट मॉडल्स के लिए एक जादुई स्पीड बटन न मानें: यह आपको उतनी उम्मीद के मुताबिक बचत नहीं कराएगा जितना आप चाहते हैं।
  2. यदि आपको गति की आवश्यकता है: यदि आप परतों को छोड़ना चाहते हैं, तो बड़े, डेंस मॉडल्स पर टिके रहें (छोटे मॉडल्स या नवीनतम "मिक्सचर ऑफ एक्सपर्ट्स" वाले मॉडल्स के बजाय)।
  3. भविष्य: शोधकर्ताओं को नए मॉडल्स पर पुराने शॉर्टकट थोपना बंद करना होगा। हमें AI को तेज़ बनाने के नए तरीके खोजने होंगे जो "मंजिलें छोड़ने" पर निर्भर न हों।

संक्षेप में: आधुनिक AI मॉडल्स हाई-परफॉर्मेंस रेस कारों की तरह हैं। आप उन्हें तेज़ करने के लिए बीच के गियर नहीं निकाल सकते; इंजन बहुत बारीकी से ट्यून किया गया है। बेहतरीन परिणाम पाने के लिए आपको पूरी कार चलानी ही होगी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →