← नवीनतम पेपर
🤖 machine learning

Mean-Field Parallel Decoding for Discrete Diffusion Language Models

यह शोध पत्र 'मीन-फील्ड पैरेलल डिकोडिंग' नामक एक प्रशिक्षण-मुक्त, हल्के फ्रेमवर्क को प्रस्तुत करता है जो युग्मवार इंटरेक्शन स्कोर के माध्यम से समानांतर टोकन अपडेट्स को समन्वित करके डिस्क्रीट डिफ्यूजन लैंग्वेज मॉडल्स को बेहतर बनाता है, जिससे बिना मॉडल पुनप्रशिक्षण के गुणवत्ता-विलंबता व्यापार-संतुलन (क्वालिटी-लेटेंसी ट्रेड-ऑफ) में सुधार होता है।

मूल लेखक: Tamim Zoabi, Ameen Ali, Liran Ringel, Lior Wolf

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tamim Zoabi, Ameen Ali, Liran Ringel, Lior Wolf

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कहानी लिखने की कोशिश कर रहे हैं, लेकिन आपके पास एक जादुई सहायक है जो अगले शब्द का अनुमान लगा सकता है। हालाँकि, यह सहायक उन सहायकों से थोड़ा अलग तरीके से काम करता है जिन्हें आप जानते होंगे। एक-एक करके शब्द लिखने के बजाय, यह समय बचाने के लिए एक साथ कई शब्दों का अनुमान लगाने की कोशिश करता है। "डिस्क्रीट डिफ्यूजन लैंग्वेज मॉडल्स" (Discrete Diffusion Language Models) इसी तरह काम करते हैं।

समस्या क्या है? जब सहायक एक साथ पाँच शब्दों का अनुमान लगाता है, तो हो सकता है कि वह प्रत्येक व्यक्तिगत शब्द को सही बता दे, लेकिन उनका संयोजन (combination) निरर्थक हो सकता है।

समस्या: "सोलो एक्सपर्ट" बनाम "ग्रुप केओस" (Group Chaos)

सोचिए कि इन मॉडल्स के काम करने का मानक तरीका पाँच सोलो एक्सपर्ट्स (अकेले विशेषज्ञों) के एक कमरे जैसा है।

  • एक्सपर्ट A से पूछा गया, "'The cat' के बाद क्या आता है?" वे आत्मविश्वास से कहते हैं, "sat।"
  • एक्सपर्ट B से पूछा गया, "'The dog' के बाद क्या आता है?" वे आत्मविश्वास से कहते हैं, "sat।"
  • एक्सपर्ट C से पूछा गया, "'The bird' के बाद क्या आता है?" वे आत्मविश्वास से कहते हैं, "flew।"

यदि आप केवल व्यक्तिगत रूप से प्रत्येक विशेषज्ञ को सुनते हैं, तो वे सभी बुद्धिमान लगते हैं। लेकिन यदि आप उन्हें एक वाक्य में रखते हैं जैसे "The cat sat, the dog sat, the bird flew," तो यह समझ में आ सकता है। लेकिन क्या होगा यदि संदर्भ (context) "The cat and the dog..." हो?

  • एक्सपर्ट A (बिल्ली के लिए) कहता है "sat।"
  • एक्सपर्ट B (कुत्ते के लिए) कहता है "flew।"

व्यक्तिगत रूप से, "sat" और "flew" दोनों उच्च-आत्मविश्वास वाले अनुमान हैं। लेकिन एक साथ, "The cat and the dog flew" एक अजीब वाक्य है। मॉडल, जो उन्हें एक-एक करके देखता है, यह नहीं समझ पाता कि वे एक-दूसरे से टकरा रहे हैं। इसे "जॉइंट इनकंसिस्टेंसी" (Joint Inconsistency) कहा जाता है। यह एक ऐसे गायक दल (choir) की तरह है जहाँ हर गायक एक सटीक सुर लगाता है, लेकिन वे सभी एक ही समय में अलग-अलग गाने गा रहे होते हैं।

समाधान: "मीन-फील्ड टीम हडल" (Mean-Field Team Huddle)

लेखकों ने एक नई विधि पेश की जिसे "मीन-फील्ड पैरेलल डिकोडिंग" (Mean-Field Parallel Decoding) कहा जाता है। विशेषज्ञों को स्वतंत्र रूप से अपने उत्तर चिल्लाने देने के बजाय, वे उन्हें अपने शब्द तय करने से पहले एक त्वरित "टीम हडल" (टीम की छोटी बैठक) करने के लिए मजबूर करते हैं।

यहाँ इस उपमा (analogy) का कार्य कैसे होता है:

  1. व्यक्तिगत आत्मविश्वास (Unary Potential): सबसे पहले, प्रत्येक विशेषज्ञ अपना हाथ उठाता है और कहता है, "मैं 90% निश्चित हूँ कि मेरा शब्द 'sat' है।" यह उनका स्थानीय आत्मविश्वास है।
  2. टीम चेक (Pairwise Interactions): इससे पहले कि कोई अपना शब्द लॉक करे, सिस्टम पूछता है: "हे, अगर मैं 'sat' कहता हूँ और तुम 'flew' कहते हो, तो क्या यह एक साथ सही लगेगा?"
    • सिस्टम यह मापने के लिए कि विशेषज्ञों के अनुमान आपस में कितने मेल खाते हैं या टकराते हैं, एक गणितीय उपकरण (Jensen-Shannon Divergence) का उपयोग करता है।
    • यदि दो विशेषज्ञ ऐसी चीजें भविष्यवाणी कर रहे हैं जो आपस में टकराती हैं (जैसे कि "cat" और "flew", जहाँ उन्हें मेल खाना चाहिए था), तो सिस्टम उनके बीच एक तनाव (tension) पैदा करता है। यह एक रेफरी की तरह है जो कहता है, "आप दोनों एक-दूसरे के पैरों पर पैर रख रहे हैं; आप में से किसी एक को पीछे हटना होगा।"
  3. हडल (Mean-Field Update): विशेषज्ञ केवल एक बार चिल्लाते नहीं हैं। वे "हडल" (गणितीय रूप से iterations कहा जाता है) के कुछ तीव्र दौरों से गुजरते हैं।
    • राउंड 1 में, आत्मविश्वासी "sat" वाला विशेषज्ञ कहता है, "मैं 'sat' पर कायम हूँ।"
    • "flew" वाला विशेषज्ञ इसे सुनता है और महसूस करता है, "ओह, अगर बिल्ली बैठी (sat) है, तो इस विशिष्ट वाक्य संरचना में मुझे शायद यह नहीं कहना चाहिए कि कुत्ता उड़ गया (flew)।"
    • "flew" वाला विशेषज्ञ अपना आत्मविश्वास कम कर देता है।
    • सिस्टम कुछ बार इस प्रक्रिया को दोहराता है जब तक कि समूह उन शब्दों के सेट पर सहमत नहीं हो जाता जो एक साथ फिट बैठते हैं

यह एक बड़ी बात क्यों है

  • कोई नया प्रशिक्षण नहीं (No New Training): सबसे अच्छी बात यह है कि मॉडल को फिर से स्कूल जाने की ज़रूरत नहीं है। लेखकों को AI को फिर से प्रशिक्षित करने या उसकी मदद के लिए एक नया "शिक्षक" AI जोड़ने की आवश्यकता नहीं पड़ी। उन्होंने बस लिखने की प्रक्रिया के दौरान मॉडल के शब्द चुनने के नियमों को बदल दिया
  • गति बनाम गुणवत्ता (Speed vs. Quality): आमतौर पर, आपको या तो गति (तेज़ी से लिखना) या गुणवत्ता (सही ढंग से लिखना) में से किसी एक को चुनना पड़ता है।
    • पुराना तरीका: सुरक्षित रहने के लिए धीरे लिखें, या तेज़ लिखें और गलतियाँ करें।
    • यह तरीका: आप तेज़ (पैरेलल) लिख सकते हैं लेकिन फिर भी सुरक्षित रह सकते हैं क्योंकि "हडल" समूह को सामूहिक गलती करने से रोकता है।
  • परिणाम: गणितीय समस्याओं और कोडिंग कार्यों में परीक्षण के दौरान, इस पद्धति ने AI को बिना सही ढंग से समस्याओं को हल करने की क्षमता खोए, बहुत तेज़ी से (कुछ मामलों में 8 गुना तक तेज़) टेक्स्ट जेनरेट करने की अनुमति दी।

निचोड़ (Bottom Line)

इस पेपर को AI शब्द निर्माण के लिए एक ट्रैफिक लाइट सिस्टम के आविष्कार के रूप में देखें।
पहले, AI एक व्यस्त चौराहे की तरह था जहाँ कारें (शब्द) एक ही समय में गुजरने की कोशिश करती थीं, जिससे दुर्घटनाएँ (निरर्थक वाक्य) होती थीं।
अब, AI के पास एक स्मार्ट ट्रैफिक लाइट है जो यह जाँचती है कि कारों के एक साथ आगे बढ़ने से पहले वे एक-दूसरे के अनुकूल हैं या नहीं। यह यातायात को तेज़ (उच्च गति) रखता है लेकिन दुर्घटनाओं (उच्च गुणवत्ता) को रोकता है, और यह सब बिना चौराहे को दोबारा बनाए बिना किया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →