← नवीनतम पेपर
🤖 machine learning

TreeFlash: Parallel AR-Approximation for Faster Speculative Decoding

TreeFlash एक नवीन समानांतर स्पेक्युलेटिव डिकोडिंग विधि है जो ऑटोरेग्रेसिव डिस्ट्रीब्यूशन को अनुमानित करने के लिए एक MLP लेयर को शामिल करके वन-शॉट ब्लॉक ड्राफ्टर्स को उन्नत करती है, जिससे निरंतर डिकोडिंग टाइम कॉम्प्लेक्सिटी बनाए रखते हुए ब्लॉक दक्षता और स्पीडअप में महत्वपूर्ण सुधार होता है।

मूल लेखक: Peer Rheinboldt, Frédéric Berdoz, Roger Wattenhofer

प्रकाशित 2026-06-03
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Peer Rheinboldt, Frédéric Berdoz, Roger Wattenhofer

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वाक्य में अगले शब्द की भविष्यवाणी करने की कोशिश कर रहे हैं, जैसे किसी दोस्त की कहानी पूरी करना।

पुराना तरीका (ऑटोरिग्रेसिव - Autoregressive)
सामान्य तौर पर, बड़े AI मॉडल (जैसे यह पेपर लिख रहे हैं) बहुत सावधान लेकिन धीमे होते हैं। वे एक शब्द लिखते हैं, उसे चेक करते हैं, फिर उस शब्द के आधार पर अगला शब्द लिखते हैं, और इसी तरह आगे बढ़ते हैं। यह एक ही व्यक्ति द्वारा एक-एक अक्षर करके वाक्य टाइप करने जैसा है। वे गति नहीं बढ़ा सकते क्योंकि उन्हें अगला अक्षर टाइप करने के लिए पिछले अक्षर का इंतज़ार करना पड़ता है।

"स्पेक्युलेटिव" (अनुमानित) शॉर्टकट
चीजों को तेज़ करने के लिए, शोधकर्ताओं ने एक "ड्राफ्टिंग" प्रणाली का आविष्कार किया। एक छोटा, तेज़ AI (ड्राफ्टर/Drafter) एक साथ शब्दों का पूरा ब्लॉक अनुमानित करता है। फिर, बड़ा, धीमा AI (वेरिफायर/Verifier) उन सभी को एक बार में चेक करता है। यदि अनुमान सही हैं, तो बड़ा AI उन सभी को तुरंत स्वीकार कर लेता है, जिससे बहुत सारा समय बचता है।

"वन-शॉट" ड्राफ्टिंग की समस्या
हाल ही में, DFlash नामक एक विधि पेश की गई थी। शब्दों को एक-एक करके अनुमान लगाने के बजाय, ड्राफ्टर एक ही झटके में (एक "वन-शॉट") शब्दों का पूरा ब्लॉक उगलने की कोशिश करता है।

  • उपमा: कल्पना कीजिए कि एक शेफ सूप के अगले 10 अवयवों (ingredients) का अनुमान एक साथ लगाने की कोशिश कर रहा है, बिना पहले 9 को चखे।
  • दोष: क्योंकि शेफ ने पिछले अवयवों को चखा नहीं, इसलिए उसका 10वें अवयव के लिए अनुमान केवल मूल रेसिपी पर आधारित है, न कि इस तथ्य पर कि उसने अभी "नमक" या "मिर्च" डाला था। जैसे-जैसे अनुमानों की सूची लंबी होती जाती है, शेफ के अनुमान उस चीज़ से दूर होने लगते हैं जो वास्तविक रेसिपी (वेरिफायर) वास्तव में चाहती है।
  • ट्री (पेड़) की समस्या: नए तरीके एक साथ कई अलग-अलग रास्तों (जैसे कई शाखाओं वाला एक पेड़) का अनुमान लगाने की कोशिश करते हैं। लेकिन यदि शाखाएं एक सामान्य शुरुआत साझा करती हैं, तो उन्हें अगले कदम के लिए एक ही अनुमान का उपयोग करने के लिए मजबूर किया जाता है, भले ही एक शाखा में "नमक" था और दूसरी में "चीनी"। यह पेड़ को अव्यवस्थित और कम सटीक बनाता है।

समाधान: TreeFlash
इस पेपर के लेखकों ने TreeFlash बनाया। उन्होंने महसूस किया कि शेफ को यह याद रखने के लिए थोड़े से सहयोग की आवश्यकता है कि उसने अभी क्या "चाखा" था।

  • जादुई ट्रिक: उन्होंने ड्राफ्टर में एक बहुत ही छोटा, हल्का "सहायक" लेयर (AR-Approximator) जोड़ा है।
  • यह कैसे काम करता है: भले ही ड्राफ्टर अभी भी एक ही झटके में पूरे ब्लॉक का अनुमान लगा रहा है (इसे सुपर फास्ट रखता है), यह सहायक तुरंत पिछले शब्द को देखता है और फुसफुसाता है, "हे, चूंकि हमने अभी 'नमक' कहा है, इसलिए अगला शब्द शायद 'मिर्च' होना चाहिए, 'चीनी' नहीं।"
  • परिणाम: अब ड्राफ्टर ऐसे अनुमान लगा सकता है जो उनके ठीक पहले वाले शब्दों पर निर्भर करते हैं, बिल्कुल वैसे ही जैसे एक सामान्य इंसान करता है, लेकिन यह सब वह एक ही झटके में करता है।

यह एक बड़ी बात क्यों है
पेपर का दावा है कि इस छोटे से सहायक को जोड़ने से:

  1. यह तेज़ रहता है: यह प्रक्रिया को धीमा नहीं करता है क्योंकि सहायक बहुत छोटा है और गणित समानांतर (parallel) रूप से किया जाता है।
  2. यह अधिक सटीक है: अनुमान बड़े AI जो वास्तव में चाहता है, उसके बहुत करीब रहते हैं, विशेष रूप से ब्लॉक के बाद के शब्दों के लिए।
  3. यह बेहतर पेड़ बनाता है: एक साथ कई रास्तों का अनुमान लगाते समय, TreeFlash विभिन्न शाखाओं को सही ढंग से संभाल सकता है (उदाहरण के लिए, एक शाखा को "नमक" मिलता है, दूसरी को "चीनी," और अगले शब्द उसके अनुसार बदल जाते हैं)।

परिणाम
जब उन्होंने विभिन्न प्रकार के AI मॉडल का उपयोग करके विभिन्न कार्यों (जैसे गणित की समस्याएं, कोडिंग और सामान्य बातचीत) पर TreeFlash का परीक्षण किया, तो इसने लगातार पिछले सर्वश्रेष्ठ तरीकों को पछाड़ दिया।

  • इसने प्रति अनुमान अधिक सही शब्द स्वीकार किए (उच्च दक्षता)।
  • इसने पूरी प्रक्रिया को तेज़ कर दिया (उच्च स्पीडअप)।
  • सुधार और भी बेहतर हो गया जब उन्होंने AI को शब्दों की लंबी सूचियाँ अनुमानित करने के लिए कहा।

संक्षेप में
TreeFlash एक स्पीड-रीडिंग रोबोट को एक छोटी मेमोरी स्टिक देने जैसा है। यह रोबोट को एक सेकंड में एक पूरा पैराग्राफ अनुमानित करने की अनुमति देता है, लेकिन अंधे होकर अनुमान लगाने के बजाय, यह पिछले शब्द को याद रखता है ताकि अगला अनुमान स्मार्ट हो सके। यह AI को गुणवत्ता खोए बिना बहुत तेज़ी से लिखने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →