EntMTP: Accelerating LLM Inference with Entropy Guided Multi Token Prediction
EntMTP एक प्रशिक्षण-मुक्त (training-free) शेड्यूलर है जो आउटपुट गुणवत्ता बनाए रखते हुए इन्फरेंस थ्रूपुट को अधिकतम करने के लिए स्थानीय जनरेशन एंट्रॉपी के आधार पर मल्टी-टोकन प्रेडिक्शन डेप्थ को गतिशील रूप से समायोजित करता है, जिससे मौजूदा बेसलाइनों की तुलना में 1.36x तक की गति वृद्धि प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपका एक बहुत सख्त नियम है: आप एक बार में केवल एक शब्द लिख सकते हैं, और हर एक शब्द के बाद, आपको अपना पूरा काम दोबारा जांचना होगा ताकि यह सुनिश्चित हो सके कि वह शब्द एकदम सही है, और फिर आगे बढ़ना होगा। इस तरह वर्तमान के लार्ज लैंग्वेज मॉडल्स (LLMs) आमतौर पर काम करते हैं। यह अविश्वसनीय रूप से सटीक है, लेकिन यह बहुत धीमा भी है क्योंकि आप लगातार रुककर अपना काम चेक करते रहते हैं।
इस प्रक्रिया को तेज करने के लिए, शोधकर्ताओं ने मल्टी-टोकन प्रेडिक्शन (MTP) नामक एक तकनीक का आविष्कार किया। एक शब्द लिखकर उसे चेक करने के बजाय, मॉडल एक साथ अगले तीन या चार शब्दों का अनुमान लगाने की कोशिश करता है, जैसे कि एक कच्चा ड्राफ्ट हो। फिर, वह एक बड़ा "चेक" करता है यह देखने के लिए कि उसके कितने अनुमान सही थे। यदि उसने तीन शब्द सही अनुमानित किए, तो वह बहुत सारा समय बचा लेता है।
हालाँकि, पेपर EntMTP इस ओर इशारा करता है कि इस तकनीक का उपयोग वर्तमान में कैसे गलत तरीके से किया जा रहा है।
समस्या: "एक ही आकार सबके लिए" वाली गलती (The "One-Size-Fits-All" Mistake)
वर्तमान में, मॉडल्स एक स्थिर (static) रणनीति का उपयोग करते हैं। कल्पना कीजिए कि आप कार चला रहे हैं। वर्तमान विधि कहती है: "चाहे आप एक चिकनी हाईवे पर गाड़ी चला रहे हों या एक ऊबड़-खाबड़ कच्ची सड़क पर, आपको हमेशा एक ही गति से एक्सीलरेटर पर पैर रखना है और ठीक 100 फीट आगे देखना है।"
- चिकनी हाईवे पर (लो एंट्रॉपी/Low Entropy): रास्ता अनुमानित है। आप सुरक्षित रूप से 100 फीट आगे देख सकते हैं और अगले कुछ मोड़ों का सटीक अनुमान लगा सकते हैं।
- ऊबड़-खाबड़ कच्ची सड़क पर (हाई एंट्रॉपी/High Entropy): रास्ता अराजक है। 100 फीट आगे देखना समय की बर्बादी है क्योंकि आप किसी गड्ढे या हिरण से टकरा सकते हैं। आपको केवल कुछ फीट आगे देखना चाहिए और सावधानी से गाड़ी चलानी चाहिए।
मौजूदा मॉडल्स (जैसे Hydra और Medusa) शुरू करने से पहले एक "लुक-अहेड डिस्टेंस" (एक विशिष्ट ट्री शेप) चुन लेते हैं और हमेशा उसी पर टिके रहते हैं। यह अक्षम है। कभी-कभी वे बहुत आगे का अनुमान लगाते हैं जिससे ऊर्जा बर्बाद होती है; और कभी-कभी वे बहुत कम देखते हैं जिससे गति बढ़ाने का मौका हाथ से निकल जाता है।
समाधान: EntMTP (स्मार्ट को-पायलट)
लेखक EntMTP (एंट्रॉपी-गाइडेड मल्टी-टोकन प्रेडिक्शन) का प्रस्ताव देते हैं। इसे एक स्मार्ट को-पायलट के रूप में सोचें जो लगातार सड़क की स्थिति की जांच करता है और ड्राइवर को बताता है कि कितनी दूर तक देखना है।
"एंट्रॉपी" को पढ़ना (सड़क की स्थिति):
मॉडल लगातार यह मापता है कि अगले शब्द कितने "आश्चर्यजनक" हैं।- लो एंट्रॉपी (अनुमानित): टेक्स्ट सुचारू रूप से बह रहा है (जैसे, "सूरज पूर्व में...")। को-पायलट कहता है, "आसान है! चलिए अगले 4 शब्दों का अनुमान लगाते हैं!"
- हाई एंट्रॉपी (अराजक): टेक्स्ट कठिन या जटिल है (जैसे, कोई कठिन गणितीय समस्या या अचानक आया कहानी का मोड़)। को-पायलट कहता है, "ओह, यह जोखिम भरा है। चलिए सुरक्षित रहने के लिए केवल अगले 1 शब्द का अनुमान लगाते हैं।"
"ट्री बैंक" (टूलकिट):
मॉडल के लिखने शुरू करने से पहले, शोधकर्ता विभिन्न अनुमान लगाने की रणनीतियों (ट्रीज़) का एक छोटा "बैंक" तैयार करते हैं। कुछ बड़े और आक्रामक होते हैं (कई शब्दों का अनुमान लगाना), और कुछ छोटे और रूढ़िवादी होते हैं (कम शब्दों का अनुमान लगाना)।- महत्वपूर्ण बात यह है कि वे केवल एक नहीं चुनते। वे विभिन्न स्थितियों के लिए सबसे अच्छे विकल्पों का एक मेनू बनाते हैं।
द स्विच (गियर शिफ्ट):
लिखने की प्रक्रिया के दौरान, EntMTP एक गियर शिफ्टर की तरह काम करता है।- यदि टेक्स्ट आसान है, तो यह हाई गियर (बड़ा ट्री) में शिफ्ट हो जाता है ताकि तेजी से आगे बढ़ सके।
- यदि टेक्स्ट कठिन हो जाता है, तो यह दुर्घटना से बचने के लिए तुरंत लो गियर (छोटा ट्री) में शिफ्ट हो जाता है।
- जादू: गियर बदलने में लगभग शून्य समय लगता है। यह कंप्यूटर की मेमोरी में केवल एक त्वरित पॉइंटर स्वैप है, न कि कोई भारी पुनर्निर्माण।
परिणाम: गुणवत्ता खोए बिना तेज़ गति
शोधकर्ताओं ने इस नए "स्मार्ट को-पायलट" का परीक्षण तीन बहुत अलग प्रकार के कार्यों पर किया:
- कोडिंग (HumanEval): कंप्यूटर प्रोग्राम लिखना।
- गणित (GSM8K): स्कूल स्तर की गणित की समस्याओं को हल करना।
- चैटिंग (ShareGPT): बातचीत करना।
परिणाम:
- गति: EntMTP पिछले सबसे अच्छे तरीकों (Hydra) की तुलना में लगातार 9% से 15% तेज़ था। कुछ मामलों में, यह पुराने तरीकों की तुलना में 36% तेज़ था।
- गुणवत्ता: क्योंकि मॉडल अभी भी अपने काम की पूरी तरह से जांच करता है, इसलिए लेखन की गुणवत्ता में बिल्कुल भी गिरावट नहीं आई। यह तेज़ गाड़ी चलाने लेकिन बिल्कुल उसी सुरक्षित गंतव्य तक पहुँचने जैसा है।
- दक्षता: इसने यह गति वृद्धि कंप्यूटर को अधिक शक्तिशाली बनाकर नहीं, बल्कि कंप्यूटर को इस बारे में स्मार्ट बनाकर हासिल की कि कब आगे का अनुमान लगाना है और कब सावधान रहना है।
निचोड़ (The Bottom Line)
पुराने तरीके को एक ऐसे धावक के रूप में सोचें जो 100 मीटर तक पूरी गति से दौड़ता है, फिर रुककर अपने जूते के फीते बांधता है, फिर 100 मीटर दौड़ता है, और फिर रुक जाता है, चाहे ट्रैक समतल हो या बाधाओं से भरा हो।
EntMTP वह धावक है जो ट्रैक को देखता है। यदि ट्रैक समतल है, तो वह पूरी ताकत से दौड़ता है। यदि उसे कोई बाधा दिखती है, तो वह बस इतना धीमा हो जाता है कि उसे सुरक्षित रूप से पार कर सके, और फिर तुरंत फिर से दौड़ना शुरू कर देता है। यह उसे बिना गिरे बहुत तेज़ी से दौड़ पूरी करने की अनुमति देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।