Follow the Latent Roadmap: Navigating Revocable Decoding for Diffusion LLMs with Anchor Tokens
यह शोध पत्र ASRD को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो डिकोडिंग संदर्भों को विश्वसनीय एंकर टोकन और अनिश्चित उम्मीदवारों में अलग करके डिफ्यूजन लार्ज लैंग्वेज मॉडल्स को बेहतर बनाता है ताकि त्रुटि प्रसार और स्थानीय त्रुटि सुदृढ़ीकरण को एक साथ दबाया जा सके, जिससे सटीकता और अनुमान थ्रूपुट दोनों में महत्वपूर्ण सुधार प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जटिल पहेली हल करने की कोशिश कर रहे हैं, जैसे कि कोई गणित की समस्या या कोड लिखना, लेकिन आपको यह सब एक साथ सभी टुकड़ों का अनुमान लगाकर करना है, न कि एक-एक करके। डिफ्यूजन लार्ज लैंग्वेज मॉडल्स (dLLMs) इसी तरह काम करते हैं। वे एक खाली स्लेट (जहाँ सभी टुकड़े ढके हुए होते हैं) से शुरू करते हैं और पूरी तस्वीर को समानांतर (parallel) रूप में प्रकट करने की कोशिश करते हैं।
समस्या क्या है? कभी-कभी वे शुरुआत में कुछ टुकड़े गलत अनुमान लगा लेते हैं। क्योंकि वे सब कुछ एक साथ प्रकट करते हैं, इसलिए वे गलत अनुमान सही अनुमानों के साथ मिल जाते हैं। जब मॉडल अगले टुकड़ों का अनुमान लगाने की कोशिश करता है, तो वह अपने ही द्वारा किए गए गलत अनुमानों से भ्रमित हो जाता है। यह एक कहानी पूरी करने जैसा है जबकि कोई आपके कान में गलत प्लॉट ट्विस्ट फुसफुसाता जा रहा हो।
यह पेपर एक नई विधि पेश करता है जिसे ASRD (एंकर सुपरवाइज्ड रिवोकेबल डिकोडिंग) कहा जाता है ताकि इस गड़बड़ी को ठीक किया जा सके। इसे मॉडल के मस्तिष्क के लिए एक "क्वालिटी कंट्रोल मैनेजर" के रूप में समझें।
ASRD कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:
1. समस्या: "खराब पड़ोस" का प्रभाव (The "Bad Neighborhood" Effect)
पिछली विधियों में, मॉडल एक शब्द का अनुमान लगाता था, जाँचता था कि क्या वह ठीक लग रहा है, और यदि वह एक बुनियादी परीक्षण पास कर लेता था, तो वह उसे रख लेता था। लेकिन यहाँ एक पेंच है: मॉडल इन नए शब्दों की जाँच उन अन्य अनवेरिफाइड (unverified), संभावित रूप से गलत शब्दों के बीच कर रहा था।
- उदाहरण: कल्पना कीजिए कि आप एक कमरे में लोगों के समूह के बीच एक पहेली सुलझाने की कोशिश कर रहे हैं। कुछ लोग गलत उत्तर चिल्ला रहे हैं। यदि आप बाकी सब की बातें सुनते हुए पहेली के अगले भाग का अनुमान लगाने की कोशिश करते हैं, तो आप अनजाने में उनकी गलतियों को कॉपी कर सकते हैं। इसे एरर प्रोपेगेशन (Error Propagation) कहा जाता है।
- जाल: कभी-कभी, लोगों का एक समूह केवल इसलिए एक गलत उत्तर पर सहमत हो सकता है क्योंकि वे एक-दूसरे की नकल कर रहे हैं। वे आत्मविश्वास महसूस करते हैं, लेकिन वे गलत होते हैं। यह लोकल एरर रीइन्फोर्समेंट (Local Error Reinforcement) है।
2. समाधान: "एंकर" प्रणाली (The "Anchor" System)
ASRD नियम बदल देता है। सभी पर भरोसा करने के बजाय, यह "एंकर" नामक एक छोटे समूह की पहचान करता है—पहेली के वे टुकड़े जिनके बारे में मॉडल पूरी तरह से आश्वस्त है क्योंकि वे कई चरणों तक स्थिर रहे हैं।
- द एंकर टोकन कैश (ATC): इसे एक "विश्वसनीय टीम" या "ठोस आधार" के रूप में सोचें। मॉडल किसी शब्द को इस टीम में तभी प्रमोट करता है जब वह कुछ राउंड के अनुमानों के बाद सुसंगत और स्थिर रहा हो। एक बार जब कोई शब्द "एंकर" बन जाता है, तो उसे एक तथ्य माना जाता है।
3. दो जादुई चालें (The Two Magic Moves)
ASRD इस "विश्वसनीय टीम" का उपयोग मॉडल की सोच को दो तरीकों से ठीक करने के लिए करता है:
क. अनुमानों को दिशा देना (Anchor-Guided Generation)
जब मॉडल को एक नया शब्द (एक मास्क किया हुआ स्थान) अनुमान लगाने की आवश्यकता होती है, तो वह आमतौर पर अनवेरिफाइड शब्दों के शोर भरे कमरे को देखता है। ASRD मॉडल को बताता है: "एक पल के लिए शोर मचाती भीड़ को अनदेखा करें। अपनी विश्वसनीय टीम (एंकर्स) को देखें और उन्हें एक दिशा-सूचक (compass) के रूप में उपयोग करें।"
- उदाहरण: यह कोहरे से भरे समुद्र में एक जहाज की तरह है। अन्य भ्रमित जहाजों को देखने के बजाय, कप्तान लाइटहाउस (एंकर्स) को देखकर जहाज चलाता है। यह जहाज को कोहरे के कारण अपने रास्ते से भटकने से रोकता है।
- परिणाम: मॉडल नए शब्द उत्पन्न करता है जो सही होने की बहुत अधिक संभावना रखते हैं क्योंकि उन्हें विश्वसनीय तथ्यों की ओर खींचा जा रहा है।
ख. अनुमानों की तनाव-परीक्षा (Anchor-Perturbed Verification)
मॉडल अपने नए अनुमान को लॉक करने से पहले, ASRD उसे थोड़ा "झटका" देता है। यह पूछता है: "क्या आप सुनिश्चित हैं कि आप सही हैं, या आप बस अपने शोर मचाते पड़ोसियों से सहमत हो रहे हैं?"
- उदाहरण: कल्पना कीजिए कि दोस्तों का एक समूह फिल्म की कहानी पर सहमत है। यदि आप बातचीत को थोड़ा अलग दिशा में (विश्वसनीय टीम का संदर्भ लेकर) मोड़ देते हैं, तो वे दोस्त जो केवल नकल कर रहे थे, लड़खड़ा जाएंगे और स्वीकार करेंगे कि वे गलत थे। लेकिन जो दोस्त वास्तव में सच जानते हैं, वे स्थिर रहेंगे।
- परिणाम: यदि कोई अनुमान "झटके" के दौरान बिखर जाता है, तो ASRD उसे मिटा देता है और फिर से प्रयास करता है। यह गलत शब्दों के एक-दूसरे को मजबूत करने के चक्र को तोड़ देता है।
यह क्यों महत्वपूर्ण है?
पेपर दिखाता है कि यह विधि एक बड़ी जीत है:
- यह स्मार्ट है: "विश्वसनीय तथ्यों" को "अनिश्चित अनुमानों" से अलग करके, मॉडल कम गलतियाँ करता है। गणित और कोडिंग परीक्षणों में, इसने काफी अधिक प्रश्न सही हल किए (6.4% तक बेहतर)।
- यह तेज़ है: क्योंकि मॉडल कम गलतियाँ करता है, उसे बहुत अधिक चीज़ें ठीक करने के लिए वापस नहीं जाना पड़ता। यह कम चरणों में पहेली पूरी कर सकता है, जिससे यह पहले की तुलना में 7.2 गुना तेज़ हो जाता है।
सारांश
संक्षेप में, ASRD AI को सिखाता है कि अराजक भीड़ को सुनना बंद करे और अपनी स्वयं की स्थिर, विश्वसनीय यादों पर भरोसा करना शुरू करे। यह एक बुद्धिमान संपादक की तरह कार्य करता है जो कहता है, "आइए उन हिस्सों को लॉक कर दें जिन्हें हम सच जानते हैं, बाकी को निर्देशित करने के लिए उनका उपयोग करें, और उन हिस्सों को बाहर निकाल दें जो केवल एक-दूसरे की नकल कर रहे हैं।" परिणाम एक तेज़, अधिक सटीक AI है जो अपनी ही गलतियों में नहीं खो जाता।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।