Structuring The Future: Diffusion LLM Speculative Decoding via Calibrated Draft Graphs
यह शोध पत्र स्पिफ़ी (Spiffy) को पेश करता है, जो एक स्पेक्युलेटिव डिकोडिंग एल्गोरिदम है जो कैलिब्रेटेड, डायनामिकली प्रूनड (dynamically pruned) निर्देशित ड्राफ्ट ग्राफों का उपयोग करके डिफ्यूजन एलएलएम (Diffusion LLM) इन्फरेंस को त्वरित करता है, जिससे मॉडल इन्फरेंस और टोकन जनरेशन दरों में महत्वपूर्ण कमी आती है और मूल आउटपुट वितरण को प्रमाणित रूप से संरक्षित किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत बड़े, जटिल पहेली को हल करने की कोशिश कर रहे हैं।
पुराना तरीका (ऑटोरेग्रेसिव मॉडल्स):
अधिकांश वर्तमान AI मॉडल एक बहुत ही सावधान, धीमे पहेली सुलझाने वाले की तरह काम करते हैं। वे एक टुकड़ा रखते हैं, देखते हैं कि वह फिट बैठता है या नहीं, फिर अगला टुकड़ा रखते हैं, फिर से देखते हैं, और इसी तरह। वे एक बार में केवल एक ही टुकड़ा रख सकते हैं। भले ही वे बहुत बुद्धिमान हों, लेकिन वे "एक समय में एक कदम" की लय में फंसे रहते हैं, जो उन्हें धीमा बना देता है।
नया तरीका (डिफ्यूजन मॉडल्स):
हाल ही में, एक नया प्रकार का AI जिसे "डिफ्यूजन LLM" कहा जाता है, आया है। इस डिफ्यूजन मॉडल को एक ऐसे चित्रकार के रूप में सोचें जो एक साथ पूरे कैनवास को देख सकता है। एक-एक करके ब्रश स्ट्रोक लगाने के बजाय, यह पूरी तस्वीर को देखता है और सैद्धांतिक रूप से एक साथ कई हिस्सों को ठीक कर सकता है। इसमें अविश्वसनीय रूप से तेज़ होने की क्षमता है।
समस्या:
हालाँकि, व्यवहार में, ये "चित्रकार" बहुत अधिक सावधान हो रहे हैं। यह सुनिश्चित करने के लिए कि तस्वीर एकदम सही दिखे, उन्हें वर्तमान में एक बार में कैनवास के केवल एक छोटे से हिस्से को ठीक करने की अनुमति है। उनके पास पूरी दीवार को पेंट करने की सुपरपावर है, लेकिन वे एक सिंगल डॉट (बिंदु) पेंट करने की तरह काम कर रहे हैं। यह उनकी गति की क्षमता को बर्बाद करता है।
समाधान: स्पिफ़ी (Spiffy)
यह पेपर एक नया तरीका पेश करता है जिसे Spiffy (Speculation for Diffusion LLM Efficiency) कहा जाता है। यह एक तरीका है जो इन सावधान चित्रकारों को तस्वीर खराब किए बिना तेज़ी से काम करने में मदद करता है।
Spiffy कैसे काम करता है, यहाँ कुछ उपमाओं (analogies) का उपयोग किया गया है:
1. "ऑटो-पायलट" अनुमान लगाने का खेल
आमतौर पर, गति बढ़ाने के लिए, आप एक दूसरा, छोटा, तेज़ चित्रकार (एक "ड्राफ्ट मॉडल") काम पर रख सकते हैं जो अनुमान लगा सके कि अगले कुछ टुकड़े कैसे दिखने चाहिए। मुख्य चित्रकार फिर यह जाँचता है कि वे अनुमान सही हैं या नहीं।
- चुनौती: दूसरा चित्रकार रखने में पैसा और प्रशिक्षण का समय लगता है।
- Spiffy की तरकीब: Spiffy दूसरा चित्रकार नहीं रखता। इसके बजाय, यह मुख्य चित्रकार से काम करते समय अपने ही भविष्य के कदमों का अनुमान लगाने के लिए कहता है। यह ऐसा है जैसे चित्रकार एक पल के लिए रुककर कहता है, "अगर मैं इस जगह को ठीक करता हूँ, तो मुझे यकीन है कि मैं इसके बगल के तीन स्थानों को भी तुरंत ठीक कर सकता हूँ।"
2. संभावनाओं का "फ्लोचार्ट" (ड्राफ्ट ग्राफ्स)
पुराने "एक समय में एक टुकड़ा" वाले संसार में, अनुमान आमतौर पर एक सीधी रेखा में लगाए जाते हैं (जैसे कि एक कतार में खड़े लोग)।
- Spiffy का नवाचार: क्योंकि डिफ्यूजन मॉडल पूरी तस्वीर को देख सकते हैं (द्विदिश/bidirectional), Spiffy अपने अनुमानों को एक फ्लोचार्ट (जिसे "डायरेक्टेड ड्राफ्ट ग्राफ" कहा जाता है) में व्यवस्थित करता है।
- उपमा: एक 'चूज़-योर-ओन-एडवेंचर' (अपनी पसंद का रोमांच चुनें) किताब की कल्पना करें। केवल अगली पंक्ति का अनुमान लगाने के बजाय, Spiffy एक साथ कई संभावित रास्तों का मानचित्र बनाता है।
- पथ A: "बिल्ली चटाई पर बैठी थी।"
- पथ B: "बिल्ली कालीन पर बैठी थी।"
- पथ C: "कुत्ता चटाई पर बैठा था।"
Spiffy इन पथों को एक विशिष्ट संरचना में सेट करता है जो मॉडल की पीछे और आगे दोनों तरफ एक साथ देखने की क्षमता का लाभ उठाती है।
3. "कैलिब्रेशन" (मानचित्र का प्रशिक्षण)
असली काम शुरू करने से पहले, Spiffy उदाहरणों के एक छोटे सेट पर एक त्वरित, एक बार का अभ्यास सत्र करता है।
- उपमा: यह एक कोच की तरह है जो खिलाड़ी को कुछ बार अभ्यास करते हुए देखता है और फिर खिलाड़ी द्वारा किए जाने वाले सबसे संभावित मूव्स का एक विशिष्ट मानचित्र बनाता है। यह मानचित्र "कैलिब्रेटेड" है ताकि यह सबसे कुशल मार्ग हो।
- परिणाम: यह मानचित्र एक बार, ऑफलाइन बनाया जाता है और फिर प्रत्येक कार्य के लिए उपयोग किया जाता है। यह वास्तविक काम को धीमा नहीं करता है।
4. "प्रूनिंग" (मृत अंत को काटना)
कभी-कभी, फ्लोचार्ट बहुत बड़ा और भ्रमित करने वाला हो सकता है।
- उपमा: Spiffy एक स्मार्ट माली की तरह कार्य करता है। जैसे-जैसे चित्रकार काम करता है, Spiffy फ्लोचार्ट की शाखाओं को देखता है। यदि कोई शाखा सही पथ होने की संभावना कम दिखती है, तो Spiffy उसे तुरंत काट देता है। यह प्रक्रिया को तेज़ और केवल सबसे आशाजनक अनुमानों पर केंद्रित रखता है।
परिणाम
इस पद्धति का उपयोग करके, Spiffy डिफ्यूजन मॉडल को आगे बढ़ने की अनुमति देता है। एक वाक्य पूरा करने के लिए 100 कदम उठाने के बजाय, यह एक बार में 10 कदमों को सत्यापित करने के लिए 100 कदम ले सकता है।
पेपर ने क्या पाया:
- गति: उन्होंने कई ओपन-सोर्स AI मॉडल्स (जैसे LLaDA, Dream, और SDAR) पर इसका परीक्षण किया।
- दक्षता: उन्होंने मॉडल के "सोचने" (गणना करने) के समय को 8.6 गुना तक कम कर दिया।
- आउटपुट स्पीड: शब्दों (टोकन) को उत्पन्न करने की वास्तविक दर 6.3 गुना तक बढ़ गई।
- सटीकता: महत्वपूर्ण रूप से, गति के बावजूद, उत्तरों की गुणवत्ता बिल्कुल वैसी ही रही। मॉडल ने केवल इसलिए गलतियाँ करना शुरू नहीं किया क्योंकि वह तेज़ी से चल रहा था।
सारांश में:
Spiffy एक चतुर तरकीब है जो डिफ्यूजन AI मॉडल्स को पूरी तस्वीर को देखने की उनकी स्वाभाविक क्षमता का उपयोग करने देती है। एक समय में एक कदम आगे बढ़ने के बजाय, वे भविष्य के संभावित कदमों के पूर्व-निर्धारित मानचित्र का उपयोग करके आगे बढ़ते हैं, उन छलांगों को तुरंत सत्यापित करते हैं, और बिना किसी गुणवत्ता को खोए अपना काम बहुत तेज़ी से पूरा करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।