TIDE: Token-Informed Depth Execution for Per-Token Early Exit in LLM Inference
TIDE एक पोस्ट-ट्रेनिंग सिस्टम है जो लार्ज लैंग्वेज मॉडल्स में चेकपॉइंट लेयर्स के साथ हल्के सीखे हुए राउटर्स को जोड़कर प्रति-टोकन अर्ली एग्जिट (early exit) सक्षम बनाता है, जिससे बिना मॉडल रिट्रेनिंग के टोकन्स को उनके हिडन स्टेट्स अभिसरित (converge) होने पर अनावश्यक गणनाओं को छोड़ने की अनुमति मिलती है।