← नवीनतम पेपर
🤖 machine learning

TIDE: Token-Informed Depth Execution for Per-Token Early Exit in LLM Inference

TIDE एक पोस्ट-ट्रेनिंग सिस्टम है जो लार्ज लैंग्वेज मॉडल्स में चेकपॉइंट लेयर्स के साथ हल्के सीखे हुए राउटर्स को जोड़कर प्रति-टोकन अर्ली एग्जिट (early exit) सक्षम बनाता है, जिससे बिना मॉडल रिट्रेनिंग के टोकन्स को उनके हिडन स्टेट्स अभिसरित (converge) होने पर अनावश्यक गणनाओं को छोड़ने की अनुमति मिलती है।

मूल लेखक: Jaber Jaber, Osama Jaber

प्रकाशित 2026-03-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jaber Jaber, Osama Jaber

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, उच्च श्रेणी की फैक्ट्री चला रहे हैं जो कस्टम कहानियाँ बनाती है, एक समय में एक शब्द। इस फैक्ट्री में 32 (या 80) अलग-अलग वर्कस्टेशन, या "लेयर्स" (परतें) हैं जिनसे होकर हर एक शब्द को गुजरना पड़ता है।

एक स्टैंडर्ड लार्ज लैंग्वेज मॉडल (LLM) में, हर शब्द को वीआईपी (VIP) ट्रीटमेंट मिलता है।

  • शब्द "the" (एक उबाऊ, सामान्य शब्द) सभी 32 लेयर्स से गुजरता है, जिसे एक जटिल गणितीय समीकरण या एक गहन दार्शनिक विचार की तरह ही पॉलिश, विश्लेषित और प्रोसेस किया जाता है।
  • यह एक साधारण "Hello" को 32-चरणीय सुरक्षा जांच, 32-चरणीय गुणवत्ता नियंत्रण निरीक्षण और 32-चरणीय गोर्मेट कुकिंग प्रक्रिया से भेजने जैसा है। यह सुरक्षित है, लेकिन यह अविश्वसनीय रूप से बर्बादी है। आप उन शब्दों पर बिजली और समय का एक बड़ा हिस्सा खर्च कर रहे हैं जिन्हें इसकी आवश्यकता नहीं है।

टीइड (TIDE) से मिलिए: "स्मार्ट बाउंसर"

TIDE (टोकन-इन्फॉर्म्ड डेप्थ एक्जीक्यूशन) इस फैक्ट्री के लिए एक सुपर-स्मार्ट बाउंसर की तरह काम करता है। यह शब्दों को फैक्ट्री में प्रवेश करने से नहीं रोकता, बल्कि यह तय करता है कि वे कब जल्दी बाहर निकल सकते हैं।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "अभ्यास सत्र" (कैलिब्रेशन)

बिजनेस शुरू होने से पहले, TIDE एक त्वरित "रिहर्सल" करता है। यह मॉडल को 2,000 सरल वाक्य (जैसे कि एक विकिपीडिया लेख) फीड करता है और देखता है कि शब्द लेयर्स के माध्यम से गुजरते समय कैसे बदलते हैं।

  • यह देखता है कि "the" जैसे शब्द के लिए, लेयर 8 के बाद अर्थ बदलना बंद हो जाता है। लेयर 9 तक, यह फिर से वही शब्द बन जाता है।
  • एक जटिल गणितीय शब्द के लिए, अर्थ लेयर 31 तक विकसित होता रहता है।
  • TIDE छोटे, हल्के "राउटर्स" (छोटे निर्णय लेने वाले चिप्स की तरह) को इस पैटर्न को पहचानने के लिए प्रशिक्षित करता है। इसे सीखने में केवल 3 मिनट लगते हैं, और परिणामी "नियम पुस्तिका" बहुत छोटी (केवल 4 MB) है।

2. "पोस्ट-गेम रिव्यू" (इन्फरेंस)

यही वह चतुर हिस्सा है। TIDE शब्द के प्रोसेस होने के दौरान उसे सभी 32 लेयर्स से गुजरने से नहीं रोकता है। क्यों? क्योंकि जल्दी रोकने से फैक्ट्री की मेमोरी (जिसे "KV कैश" कहा जाता है) टूट जाती है, जिससे त्रुटियां होती हैं।

इसके बजाय, TIDE शब्द को सभी 32 लेयर्स से गुजरने देता है, बिल्कुल सामान्य तरीके से, लेकिन यह बैकग्राउंड में कुछ विशेष करता है:

  • जैसे-जैसे शब्द प्रत्येक चेकपॉइंट से गुजरता है, छोटा राउटर फुसफुसाता है, "हे, यह शब्द तैयार है! यह पूरी तरह से बन चुका है!"
  • एक बार जब शब्द सभी 32 लेयर्स को पूरा कर लेता है, तो सिस्टम राउटर के नोट्स को देखता है।
  • यदि राउटर ने कहा, "यह शब्द लेयर 8 पर तैयार था," तो सिस्टम लेयर 9 से 32 के बीच किए गए काम को अनदेखा कर देता है। यह लेयर 8 से प्राप्त परिणाम को लेता है और आगे बढ़ जाता है।

इसे एक छात्र द्वारा 32-प्रश्नों की परीक्षा देने के रूप में सोचें:

  • पुराना तरीका: छात्र सभी 32 प्रश्नों के उत्तर देता है, भले ही उसे प्रश्न 1 का उत्तर तुरंत पता हो।
  • TIDE का तरीका: छात्र सभी 32 प्रश्नों के उत्तर देता है (फ्लो को सुचारू बनाए रखने के लिए), लेकिन शिक्षक उन्हें उस सबसे शुरुआती प्रश्न के आधार पर ग्रेड करता है जहाँ छात्र ने सही उत्तर दिया था। यदि उन्होंने प्रश्न 1 को सही बताया, तो शिक्षक उस विशिष्ट उत्तर के लिए बाकी के पेपर को अनदेखा कर देता है।

3. परिणाम: गति और बचत

क्योंकि TIDE समझ जाता है कि अधिकांश शब्द (जैसे "the," "is," "and") सरल हैं और उन्हें गहरी सोच की आवश्यकता नहीं है, यह अनावश्यक काम को हटा देता है।

  • साधारण शब्दों के लिए: वे लेयर 11 पर बाहर निकल सकते हैं, जिससे 21 लेयर्स का काम बच जाता है।
  • कठिन शब्दों के लिए: वे अंत तक जाते हैं।
  • गणित: एक गणित की समस्या के परीक्षण में, 99% शब्द इतने सरल थे कि वे जल्दी बाहर निकल सके, फिर भी मॉडल ने जटिल समस्या को पूरी तरह से हल किया।

यह एक बड़ी बात क्यों है?

  • कोई री-ट्रेनिंग नहीं: आपको फैक्ट्री को फिर से बनाने या श्रमिकों को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। TIDE मौजूदा मॉडलों (जैसे Hugging Face से) में एक छोटा "एड-ऑन" जोड़ देता है।
  • किसी भी मॉडल पर काम करता है: चाहे वह Llama हो, Qwen हो, या GPT, TIDE यह समझ लेता है कि इसमें कैसे प्लग इन करना है।
  • तेज़ और सस्ता: साधारण शब्दों के लिए अतिरिक्त काम को छोड़कर, फैक्ट्री तेजी से चलती है (कम लेटेंसी) और एक साथ अधिक ग्राहकों को संभाल सकती है (उच्च थ्रूपुट)। शक्तिशाली GPU पर, इसका मतलब है टेक्स्ट को 8% तक तेजी से जेनरेट करना और कम ऊर्जा खर्च करना।

कमी (सीमाएं)

TIDE वर्तमान में एक "पोस्ट-गेम रिव्यू" सिस्टम है। यह मेमोरी के साथ सुरक्षित रहने के लिए अभी भी भौतिक रूप से शब्द को सभी लेयर्स के माध्यम से चलाता है।

  • उपमा: यह एक क्लब में जाने वाले बाउंसर जैसा है, जो सबको अंदर जाने देता है, लेकिन फिर दरवाजे पर उनकी आईडी चेक करता है। यदि वे लिस्ट में हैं, तो वह डीजे को उनके लिए संगीत बजाना बंद करने के लिए कहता है। इससे संगीत पर ऊर्जा तो बचती है, लेकिन वे दरवाजे से अंदर तो आए ही हैं।
  • भविष्य: अगला कदम यह है कि बाउंसर को उन्हें बाद के कमरों में प्रवेश करने से पहले ही रोक देना है, जिससे और भी अधिक समय बचेगा।

सारांश

TIDE एक स्मार्ट दक्षता उपकरण (efficiency tool) है। यह समझता है कि हर शब्द को पीएचडी-स्तर के विश्लेषण की आवश्यकता नहीं होती है। मौजूदा AI मॉडल में छोटे, सीखे हुए "स्मार्ट सेंसर्स" लगाकर, यह सरल शब्दों को फैक्ट्री से जल्दी बाहर निकलने देता है जबकि जटिल शब्दों को पूरी प्रक्रिया के लिए रुकने देता है। परिणाम? तेज़ AI, कम लागत, और वही उच्च-गुणवत्ता वाले उत्तर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →