TreeFlash: Parallel AR-Approximation for Faster Speculative Decoding
TreeFlash एक नवीन समानांतर स्पेक्युलेटिव डिकोडिंग विधि है जो ऑटोरेग्रेसिव डिस्ट्रीब्यूशन को अनुमानित करने के लिए एक MLP लेयर को शामिल करके वन-शॉट ब्लॉक ड्राफ्टर्स को उन्नत करती है, जिससे निरंतर डिकोडिंग टाइम कॉम्प्लेक्सिटी बनाए रखते हुए ब्लॉक दक्षता और स्पीडअप में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक वाक्य में अगले शब्द की भविष्यवाणी करने की कोशिश कर रहे हैं, जैसे किसी दोस्त की कहानी पूरी करना।
पुराना तरीका (ऑटोरिग्रेसिव - Autoregressive)
सामान्य तौर पर, बड़े AI मॉडल (जैसे यह पेपर लिख रहे हैं) बहुत सावधान लेकिन धीमे होते हैं। वे एक शब्द लिखते हैं, उसे चेक करते हैं, फिर उस शब्द के आधार पर अगला शब्द लिखते हैं, और इसी तरह आगे बढ़ते हैं। यह एक ही व्यक्ति द्वारा एक-एक अक्षर करके वाक्य टाइप करने जैसा है। वे गति नहीं बढ़ा सकते क्योंकि उन्हें अगला अक्षर टाइप करने के लिए पिछले अक्षर का इंतज़ार करना पड़ता है।
"स्पेक्युलेटिव" (अनुमानित) शॉर्टकट
चीजों को तेज़ करने के लिए, शोधकर्ताओं ने एक "ड्राफ्टिंग" प्रणाली का आविष्कार किया। एक छोटा, तेज़ AI (ड्राफ्टर/Drafter) एक साथ शब्दों का पूरा ब्लॉक अनुमानित करता है। फिर, बड़ा, धीमा AI (वेरिफायर/Verifier) उन सभी को एक बार में चेक करता है। यदि अनुमान सही हैं, तो बड़ा AI उन सभी को तुरंत स्वीकार कर लेता है, जिससे बहुत सारा समय बचता है।
"वन-शॉट" ड्राफ्टिंग की समस्या
हाल ही में, DFlash नामक एक विधि पेश की गई थी। शब्दों को एक-एक करके अनुमान लगाने के बजाय, ड्राफ्टर एक ही झटके में (एक "वन-शॉट") शब्दों का पूरा ब्लॉक उगलने की कोशिश करता है।
- उपमा: कल्पना कीजिए कि एक शेफ सूप के अगले 10 अवयवों (ingredients) का अनुमान एक साथ लगाने की कोशिश कर रहा है, बिना पहले 9 को चखे।
- दोष: क्योंकि शेफ ने पिछले अवयवों को चखा नहीं, इसलिए उसका 10वें अवयव के लिए अनुमान केवल मूल रेसिपी पर आधारित है, न कि इस तथ्य पर कि उसने अभी "नमक" या "मिर्च" डाला था। जैसे-जैसे अनुमानों की सूची लंबी होती जाती है, शेफ के अनुमान उस चीज़ से दूर होने लगते हैं जो वास्तविक रेसिपी (वेरिफायर) वास्तव में चाहती है।
- ट्री (पेड़) की समस्या: नए तरीके एक साथ कई अलग-अलग रास्तों (जैसे कई शाखाओं वाला एक पेड़) का अनुमान लगाने की कोशिश करते हैं। लेकिन यदि शाखाएं एक सामान्य शुरुआत साझा करती हैं, तो उन्हें अगले कदम के लिए एक ही अनुमान का उपयोग करने के लिए मजबूर किया जाता है, भले ही एक शाखा में "नमक" था और दूसरी में "चीनी"। यह पेड़ को अव्यवस्थित और कम सटीक बनाता है।
समाधान: TreeFlash
इस पेपर के लेखकों ने TreeFlash बनाया। उन्होंने महसूस किया कि शेफ को यह याद रखने के लिए थोड़े से सहयोग की आवश्यकता है कि उसने अभी क्या "चाखा" था।
- जादुई ट्रिक: उन्होंने ड्राफ्टर में एक बहुत ही छोटा, हल्का "सहायक" लेयर (AR-Approximator) जोड़ा है।
- यह कैसे काम करता है: भले ही ड्राफ्टर अभी भी एक ही झटके में पूरे ब्लॉक का अनुमान लगा रहा है (इसे सुपर फास्ट रखता है), यह सहायक तुरंत पिछले शब्द को देखता है और फुसफुसाता है, "हे, चूंकि हमने अभी 'नमक' कहा है, इसलिए अगला शब्द शायद 'मिर्च' होना चाहिए, 'चीनी' नहीं।"
- परिणाम: अब ड्राफ्टर ऐसे अनुमान लगा सकता है जो उनके ठीक पहले वाले शब्दों पर निर्भर करते हैं, बिल्कुल वैसे ही जैसे एक सामान्य इंसान करता है, लेकिन यह सब वह एक ही झटके में करता है।
यह एक बड़ी बात क्यों है
पेपर का दावा है कि इस छोटे से सहायक को जोड़ने से:
- यह तेज़ रहता है: यह प्रक्रिया को धीमा नहीं करता है क्योंकि सहायक बहुत छोटा है और गणित समानांतर (parallel) रूप से किया जाता है।
- यह अधिक सटीक है: अनुमान बड़े AI जो वास्तव में चाहता है, उसके बहुत करीब रहते हैं, विशेष रूप से ब्लॉक के बाद के शब्दों के लिए।
- यह बेहतर पेड़ बनाता है: एक साथ कई रास्तों का अनुमान लगाते समय, TreeFlash विभिन्न शाखाओं को सही ढंग से संभाल सकता है (उदाहरण के लिए, एक शाखा को "नमक" मिलता है, दूसरी को "चीनी," और अगले शब्द उसके अनुसार बदल जाते हैं)।
परिणाम
जब उन्होंने विभिन्न प्रकार के AI मॉडल का उपयोग करके विभिन्न कार्यों (जैसे गणित की समस्याएं, कोडिंग और सामान्य बातचीत) पर TreeFlash का परीक्षण किया, तो इसने लगातार पिछले सर्वश्रेष्ठ तरीकों को पछाड़ दिया।
- इसने प्रति अनुमान अधिक सही शब्द स्वीकार किए (उच्च दक्षता)।
- इसने पूरी प्रक्रिया को तेज़ कर दिया (उच्च स्पीडअप)।
- सुधार और भी बेहतर हो गया जब उन्होंने AI को शब्दों की लंबी सूचियाँ अनुमानित करने के लिए कहा।
संक्षेप में
TreeFlash एक स्पीड-रीडिंग रोबोट को एक छोटी मेमोरी स्टिक देने जैसा है। यह रोबोट को एक सेकंड में एक पूरा पैराग्राफ अनुमानित करने की अनुमति देता है, लेकिन अंधे होकर अनुमान लगाने के बजाय, यह पिछले शब्द को याद रखता है ताकि अगला अनुमान स्मार्ट हो सके। यह AI को गुणवत्ता खोए बिना बहुत तेज़ी से लिखने में सक्षम बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।