← नवीनतम पेपर
💬 NLP

Forward-Free Diffusion Language Models

यह शोध पत्र FReDA को प्रस्तुत करता है, जो एक फॉरवर्ड-फ्री डिफ्यूजन लैंग्वेज मॉडल है जो कृत्रिम भ्रष्टाचार योजनाओं (artificial corruption schemes) को मॉडल-जनित ड्राफ्ट्स का उपयोग करके एक पुनरावर्ती वितरण परिशोधन प्रक्रिया (recursive distribution refinement process) से बदल देता है, जिससे पारंपरिक डिफ्यूजन बेसलाइन की तुलना में महत्वपूर्ण गति वृद्धि के साथ बेहतर तर्क और कोडिंग प्रदर्शन प्राप्त होता है।

मूल लेखक: Haotian Sun, Rushi Qiang, Yuqian Zheng, Bo Dai

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haotian Sun, Rushi Qiang, Yuqian Zheng, Bo Dai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "फॉरवर्ड-फ्री डिफ्यूजन लैंग्वेज मॉडल्स" (FReDA) पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करते हुए स्पष्टीकरण दिया गया है।

समस्या: "खराब संपादक" बनाम "असली ड्राफ्ट"

कल्पना कीजिए कि आप एक रोबोट को कहानी लिखना सिखाने की कोशिश कर रहे हैं।

  • पुराना तरीका (ऑटोरिग्रेसिव): रोबोट एक बार में एक शब्द लिखता है, बाएं से दाएं, जैसे कोई इंसान टाइप करता है। यदि वह शुरुआत में कोई गलती कर देता है, तो वह उसी के साथ फंस जाता है।
  • नया तरीका (डिफ्यूजन): रोबोट बकवास (या खाली स्थानों) से भरी एक पूरी सतह से शुरुआत करता है और धीरे-धीरे उसे शब्द दर शब्द साफ करता है, जब तक कि वह समझ में आने योग्य न हो जाए। यह शक्तिशाली है क्योंकि यह कहानी में कहीं भी गलतियों को एक साथ ठीक कर सकता है।

पेंच:
रोबोट को गंदगी (mess) साफ करना सिखाने के लिए, शोधकर्ताओं को आमतौर पर एक "प्रशिक्षण सिमुलेशन" (training simulation) बनाना पड़ता था। वे एक आदर्श वाक्य लेते थे और उसे जानबूझकर एक बहुत ही विशिष्ट, कृत्रिम तरीके से बिगाड़ देते थे (जैसे शब्दों को [MASK] या [BLANK] से बदलना)। फिर वे रोबोट को उस विशिष्ट गड़बड़ी को उलटने (reverse करने) के लिए प्रशिक्षित करते थे।

पेपर का अंतर्दृष्टि (Insight):
लेखकों ने महसूस किया कि यह प्रशिक्षण सिमुलेशन त्रुटिपूर्ण था। यह ऐसा था जैसे किसी अग्निशमन कर्मी को केवल उस आग को बुझाना सिखाना जो एक विशिष्ट प्रकार की माचिस से लगाई गई हो। लेकिन वास्तविक जीवन में, आग कई तरह के अप्रत्याशित तरीकों से शुरू होती है। रोबोट उस विशिष्ट कृत्रिम गड़बड़ी को ठीक करने में तो अच्छा हो गया, लेकिन जब उसका सामना वास्तविक दुनिया के उपयोग के दौरान खुद द्वारा बनाए गए अव्यवस्थित ड्राफ्ट से हुआ, तो वह संघर्ष करने लगा।

समाधान: FReDA (फॉरवर्ड-फ्री डिफ्यूजन)

लेखक FReDA का प्रस्ताव करते हैं, जिसका अर्थ है Forward-Free Diffusion Language Model।

रोबोट को मानव डिज़ाइनर द्वारा बनाई गई कृत्रिम गड़बड़ी को ठीक करना सिखाने के बजाय, FReDA रोबोट को अपने स्वयं के ड्राफ्ट को ठीक करके सीखने देता है।

उपमा: आत्म-सुधार करने वाला लेखक
कल्पना कीजिए कि एक लेखक है जो टाइपिंग में बहुत बुरा है।

  1. पुरानी विधि: एक शिक्षक लेखक का एक आदर्श निबंध लेता है, यादृच्छिक रूप से (randomly) शब्दों को हटा देता है, और कहता है, "यह गड़बड़ी है। अब मूल संस्करण वापस लिखो।" लेखक हटाए गए उस विशिष्ट पैटर्न को ठीक करने के लिए रट लेता है।
  2. FReDA विधि: लेखक एक निबंध लिखने की कोशिश करता है। वह एक अव्यवस्थित पहला ड्राफ्ट तैयार करता है। फिर, वह अपने ही ड्राफ्ट को पढ़ता है, महसूस करता है कि यह अजीब है, और इसे बेहतर बनाने के लिए इसे फिर से लिखता है। वह इसे बार-बार करता है।
    • "शिक्षक" (प्रशिक्षण एल्गोरिदम) कोई नकली गड़बड़ी पैदा नहीं करता।
    • "शिक्षक" बस इतना कहता है: "जो ड्राफ्ट तुमने अभी लिखा है, उसे लो और उसे और भी बेहतर बनाने की कोशिश करो।"
    • रोबोट जो भी ड्राफ्ट बनाता है, उसे परिष्कृत (refine) करना सीख जाता है, जिससे प्रशिक्षण वास्तविक पीढ़ी प्रक्रिया के साथ पूरी तरह से संरेखित हो जाता है।

यह कैसे काम करता है (दो तरकीबें)

पेपर दो तरीके बताता है जिनसे रोबोट अपने ड्राफ्ट को परिष्कृत करता है:

  1. सेल्फ-रिफाइनमेंट (एकल संपादक):
    रोबोट अपने वर्तमान ड्राफ्ट को देखता है और सीधे उसे सुधारने की कोशिश करता है। यह एक लेखक की तरह है जो अपने काम को पढ़ता है और एक ही बार में टाइपो या अजीब वाक्यों को ठीक करता है।

  2. बेस्ट-ऑफ-एन रिफाइनमेंट (निर्णायकों का पैनल):
    यह "पावर यूजर" मोड है।

  • रोबोट एक परिष्कृत ड्राफ्ट के N अलग-अलग संस्करण बनाता है (उदाहरण के लिए, पैराग्राफ को ठीक करने के 4 अलग तरीके)।
  • एक छोटा, तेज़ "स्कोरर" (निर्णायक) उन सभी 4 संस्करणों को देखता है और सबसे अच्छे को चुनता है।
  • रोबोट फिर उस विजेता को लेता है और उसे फिर से परिष्कृत करता है।
  • उपमा: कल्पना कीजिए कि आप एक फोटो एडिट कर रहे हैं। केवल एक फ़िल्टर लगाने के बजाय, आप 4 अलग-अलग फ़िल्टर जनरेट करते हैं, एक दोस्त से पूछते हैं कि कौन सा सबसे अच्छा दिखता है, उस चुने हुए को चुनते हैं, और फिर उसी विशिष्ट फोटो पर एडिटिंग का दूसरा दौर लागू करते हैं।

यह क्यों महत्वपूर्ण है (परिणाम)

लेखकों ने इस नई विधि के साथ एक मॉडल का परीक्षण किया जो अपेक्षाकृत छोटा (4 बिलियन पैरामीटर्स) है। उन्होंने इसकी तुलना बहुत बड़े डिफ्यूजन मॉडल्स (7-8 बिलियन पैरामीटर्स) से की जो पुराने "कृत्रिम गड़बड़ी" वाले प्रशिक्षण का उपयोग करते थे।

  • स्मार्टर (ज्यादा समझदार): छोटा FReDA मॉडल गणित और कोडिंग कार्यों पर बड़े, पुराने मॉडल्स से बेहतर प्रदर्शन करता है। यह 15% तक अधिक सटीक था।
  • फास्टर (ज्यादा तेज़): क्योंकि मॉडल अपने ड्राफ्ट को परिष्कृत करने में बहुत अच्छा है, इसलिए इसे एक अच्छा उत्तर पाने के लिए कम चरणों की आवश्यकता होती है। यह प्रतिस्पर्धा की तुलना में 1.5 से 1.8 गुना तेज़ है।
  • फ्लेक्सिबल (लचीला): आप एक त्वरित उत्तर के लिए प्रक्रिया को जल्दी रोक सकते हैं, या यदि आपको एक सटीक उत्तर चाहिए तो इसे लंबे समय तक चलने दे सकते है। आप जितना अधिक समय देंगे, गुणवत्ता उतनी ही लगातार सुधरती जाएगी।

मुख्य निष्कर्ष (The Bottom Line)

FReDA खेल के नियम बदल देता है। एक भाषा मॉडल को एक नकली, कृत्रिम समस्या को ठीक करना सिखाने के बजाय, यह मॉडल को अपनी गलतियों को ठीक करना सिखाता है। ऐसा करके, मॉडल टेक्स्ट जनरेट करने में बेहतर, तर्क करने में स्मार्ट और परिणाम देने में तेज़ हो जाता है, और यह सब पिछले तरीकों की तुलना में कम कंप्यूटिंग पावर का उपयोग करके करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →