← नवीनतम पेपर
🤖 machine learning

DARTree: Speculative Diffusion Decoding with Autoregressive Draft Trees

DARTree एक प्रशिक्षण-मुक्त (training-free) स्पेक्युलेटिव डिकोडिंग विधि है जो ऑटोरेग्रेसिव सुधार (autoregressive correction) को लीनियर चेन से फिक्स्ड-विड्थ कैंडिडेट ट्रीज़ तक विस्तारित करती है, जिससे टोकन स्वीकृति को अधिकतम करने के लिए AR-हेड इन्फरेंस को अनुक्रमिक ऑपरेशन्स से अलग करके स्टेट-ऑफ-द-आर्ट लॉसलेस स्पीडअप प्राप्त किया जाता है।

मूल लेखक: Tianyi Li, Yaxin Luo, Xinyi Shang, Zhiqiang Shen

प्रकाशित 2026-08-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tianyi Li, Yaxin Luo, Xinyi Shang, Zhiqiang Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन अविश्वसनीय रूप से धीमे, रोबोट दोस्त के साथ एक कहानी लिखने की कोशिश कर रहे हैं। यह रोबोट दुनिया को समझने में माहिर है और अद्भुत वाक्य लिख सकता है, लेकिन इसका एक सख्त नियम है: यह एक बार में केवल एक ही शब्द लिख सकता है। अगला शब्द लिखने से पहले, इसे अब तक लिखे गए सब कुछ पर विचार करना होता है, और फिर सावधानी से सबसे अच्छा शब्द चुनना होता है। यह बिल्कुल वैसा ही है जैसे एक शेफ जो एक बड़े भोजन को पकाने से पहले एक बार में केवल एक ही सामग्री का स्वाद लेता है। हालांकि यह सुनिश्चित करता है कि सूप का स्वाद एकदम सही हो, लेकिन इसमें एक बड़ा भोजन पकाने में बहुत समय लगता है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इस "एक बार में एक शब्द" वाली प्रक्रिया को ऑटोरिग्रेसिव जनरेशन (autoregressive generation) कहा जाता है, और यही मुख्य कारण है कि शक्तिशाली AI चैटबॉट्स कभी-कभी सुस्त महसूस होते हैं।

चीजों को खराब किए बिना गति बढ़ाने के लिए, वैज्ञानिकों ने एक तरकीब खोजी जिसे स्पेक्टिवल डिकोडिंग (Speculative Decoding) कहा जाता है। इसे धीमे रोबोट के लिए अगले कुछ शब्दों का अनुमान लगाने के लिए एक तेज़, ऊर्जावान इंटर्न को काम पर रखने के रूप में सोचें। इंटर्न एक पूरा वाक्य चिल्लाकर बोलता है, और धीमा रोबोट तुरंत जांचता है कि क्या इंटर्न सही था। यदि इंटर्न ने सही अनुमान लगाया, तो रोबोट तुरंत पूरे वाक्य को स्वीकार कर लेता है और आगे बढ़ जाता है। यदि इंटर्न ने कोई गलती की, तो वह बस उस एक शब्द को ठीक करता है और फिर से शुरू करता है। जादू तब होता है जब इंटर्न लगातार कई शब्दों को सही ढंग से अनुमान लगाने में सक्षम होता है, जिससे धीमा रोबोट कठिन सोचने वाले हिस्से को छोड़कर सीधे एक पूरे टेक्स्ट ब्लॉक को "हाँ, यह सही है!" कहकर स्वीकार कर लेता है।

हाल ही में, शोधकर्ताओं ने इंटर्न को और भी तेज़ बनाने के लिए एक अलग प्रकार के दिमाग का उपयोग करने की कोशिश की जिसे डिफ्यूजन मॉडल (Diffusion Model) कहा जाता है। एक-एक करके शब्द अनुमान लगाने के बजाय, यह इंटर्न एक ही झटके में पूरे अगले वाक्य की कल्पना करने की कोशिश करता है, जैसे एक चित्रकार एक ही स्ट्रोक में पूरे कैनवास को भर देता है। यह बहुत तेज़ है, लेकिन इसमें एक दोष है: क्योंकि इंटर्न पूरे वाक्य का अनुमान एक साथ लगाता है, इसलिए उसे वास्तव में यह नहीं पता होता कि पहला शब्द दूसरे को कैसे प्रभावित करता है, या दूसरा तीसरे को कैसे प्रभावित करता है। यह फिल्म के बीच के दृश्यों को देखे बिना उसके अंत का अनुमान लगाने जैसा है। इसे ठीक करने के लिए, अन्य शोधकर्ताओं ने एक "सुधार" चरण जोड़ा, लेकिन उन्होंने इसे इतने बोझिल तरीके से किया कि रोब-रोब को इंटर्न के काम की जांच एक-एक शब्द करके करनी पड़ती थी, जिससे इसका उद्देश्य ही खत्म हो गया।

यहीं से MBZUAI के VILA लैब का एक नया पेपर आता है जिसमें DARTree नामक एक चतुर समाधान दिया गया है। शोधकर्ताओं ने महसूस किया कि इंटर्न के काम को जांचने का पुराना तरीका एक लाइब्रेरी को व्यवस्थित करने जैसा था जहाँ आप एक किताब उठाते हैं, उसकी शेल्फ चेक करते हैं, उसे वापस रखते हैं, फिर अगली किताब उठाते हैं, और इसी तरह चलते रहते हैं। यह बहुत अधिक भाग-दौड़ वाला काम था। इसके बजाय, DARTree संभावनाओं का एक "पेड़" (tree) बनाने का एक नया तरीका सुझाता है। कल्पना कीजिए कि इंटर्न केवल एक शब्द का रास्ता नहीं बताता, बल्कि विभिन्न कहानी की संभावनाओं का एक पूरा घना पेड़ बनाता है। धीमा रोबोट फिर पूरे पेड़ को एक साथ देखता है, लेकिन एक विशेष मोड़ के साथ: वह पेड़ की "शाखाओं" को बड़े समूहों (batches) में जांचता है, न कि एक-एक करके।

मुख्य नवाचार यह है कि DARTree "अनुमान लगाने" और "जांचने" को अलग करता है। पहले, यह एक ही बार में कई संभावित कहानी पथों का एक चौड़ा, अस्थायी पेड़ बनाता है। फिर, यह एक स्मार्ट प्रूनिंग (छंटाई) टूल का उपयोग करता है जो उन शाखाओं को काट देता है जो आशाजनक नहीं लगती हैं, जिससे केवल सबसे अच्छा पेड़ धीमे रोबोट को दिखाने के लिए बचता है। कहानी के पथों की जांच बड़े बैचों में भारी काम करके, वे उस धीमी, चरण-दर-चरण चलने वाली प्रक्रिया से बच जाते हैं जो पहले सब कुछ धीमा कर देती थी। पेपर दिखाता है कि यह तरीका एक बड़ी सफलता है। गणित की समस्याओं, कोडिंग कार्यों और चैट बातचीत से जुड़े विभिन्न परीक्षणों पर, DARTree ने जांच के प्रत्येक दौर में 12.97 टोकन (शब्द या शब्दों के हिस्से) को स्वीकार करने में सफलता प्राप्त की। यह पिछले तरीकों की तुलना में एक बड़ी छलांग है; यह DFlash नामक एक शीर्ष प्रतिद्वंद्वी से 98.6% बेहतर और Domino से 27.9% बेहतर था।

परिणामस्वरूप, यह एक ऐसा सिस्टम है जो अविश्वसनीय रूप से तेज़ है लेकिन फिर भी पूरी तरह से सटीक है। शोधकर्ताओं ने मापा कि यह नया तरीका AI को मानक लेखन के तरीके से 9.73 गुना तेज़ बना सकता है, बिना इसकी गुणवत्ता खोए या गलत तथ्य बनाए। उन्होंने इसे विभिन्न प्रकार के AI मॉडल पर परखा और पाया कि चाहे AI बहुत सख्त और तार्किक (जैसे गणित में) हो या रचनात्मक और रैंडम (जैसे चैट में), यह बहुत अच्छा काम करता है। पेपर का तर्क है कि यह "पेड़" वाला दृष्टिकोण, जो अंतिम कट लगाने से पहले कई पथों को समानांतर (parallel) में जांचता है, इन स्मार्ट रोबोटों को तेज़ करने का सबसे अच्छा तरीका है। यह साबित करता है कि आपको गति और बुद्धिमत्ता के बीच चुनाव करने की आवश्यकता नहीं है; सही संरचना के साथ, आप दोनों पा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →