← नवीनतम पेपर
💬 NLP

Causal Autoregressive Diffusion Language Model

यह शोधपत्र CARD प्रस्तुत करता है, जो एक नवीन ढांचा है जो कॉज़ल अटेंशन मास्क के तहत डिफ्यूजन प्रक्रिया को पुनर्गठित करके ऑटोरेग्रेसिव मॉडल्स की प्रशिक्षण दक्षता को डिफ्यूजन मॉडल्स के उच्च-थ्रूपुट इन्फरेंस के साथ एकीकृत करता है, जिससे ARM-स्तर की डेटा दक्षता प्राप्त होती है और काफी कम प्रशिक्षण विलंबता के साथ गतिशील समानांतर डिकोडिंग सक्षम होती है।

मूल लेखक: Junhao Ruan, Bei Li, Yongjing Yin, Pengcheng Huang, Xin Chen, Jingang Wang, Xunliang Cai, Tong Xiao, JingBo Zhu

प्रकाशित 2026-01-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junhao Ruan, Bei Li, Yongjing Yin, Pengcheng Huang, Xin Chen, Jingang Wang, Xunliang Cai, Tong Xiao, JingBo Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कहानी लिखना सिखाने की कोशिश कर रहे हैं। इसके दो मुख्य तरीके हैं, और दोनों में एक बड़ी खामी है।

पुराना तरीका (ऑटोरेग्रेसिव मॉडल्स - Autoregressive Models):
इसे एक ऐसे छात्र की तरह सोचें जो परीक्षा दे रहा है जहाँ उसे एक बार में एक शब्द लिखना है, सख्ती से बाएँ से दाएँ। वह अगला शब्द नहीं लिख सकता जब तक कि वह वर्तमान शब्द को पूरा न कर ले।

  • अच्छाई: वे बहुत कुशलता से सीखते हैं और बहुत कम गलतियाँ करते हैं।
  • बुराई: यह अविश्वसनीय रूप से धीमा है। यदि कहानी लंबी है, तो रोबोट को आगे बढ़ने से पहले हर एक शब्द लिखे जाने का इंतज़ार करना होगा। यह एक ऐसी सिंगल-लेन सड़क की तरह है जहाँ ट्रैफ़िक एक बार में केवल एक कार की गति से ही चल सकता है।

नया तरीका (डिफ्यूजन मॉडल्स - Diffusion Models):
यह एक मूर्तिकार की तरह है जो पत्थर के एक ऐसे ब्लॉक से शुरुआत करता है जो कोहरे से ढका हुआ है। रोबोट एक साथ पूरी कहानी का अनुमान लगाने की कोशिश करता है, और फिर धीरे-धीरे कोहरे को हटाकर शब्दों को प्रकट करता है।

  • अच्छasi: यह एक साथ कई शब्दों का अनुमान लगा सकता है (पैरेलल प्रोसेसिंग), जो सैद्धांतिक रूप से बहुत तेज़ है।
  • बुराई: इसके लिए, इसे आमतौर पर एक ही समय में पूरी कहानी को देखना पड़ता है (पत्थर के पूरे ब्लॉक को देखने की तरह)। यह उन मेमोरी शॉर्टकट्स (जिन्हें "KV कैशिंग" कहा जाता है) का उपयोग करना कठिन बना देता है जो चीज़ों को तेज़ करते हैं, और इसकी ट्रेनिंग प्रक्रिया अस्थिर होती है, जैसे हवा के झोंके में ताश के पत्तों के घर को संतुलित करने की कोशिश करना।

समाधान: CARD (कॉज़ल ऑटोरेग्रेसिव डिफ्यूजन - Causal Autoregressive Diffusion)
लेखकों ने एक नया सिस्टम बनाया है जिसे CARD कहा जाता है। CARD को एक स्मार्ट, अनुकूलन योग्य निर्माण दल (construction crew) के रूप में सोचें जो दोनों दुनिया की बेहतरीन चीज़ों को एक साथ लाता है।

यहाँ बताया गया है कि CARD कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "सख्ती से कॉज़ल" नियम (एकतरफा रास्ता)

अधिकांश डिफ्यूजन मॉडल्स गायब हिस्सों का अनुमान लगाने के लिए पूरे वाक्य को देखते हैं। हालाँकि, CARD को केवल गायब हिस्से से पहले के शब्दों को देखने के लिए मजबूर किया जाता है, ठीक उसी तरह जैसे पुराने धीमे तरीके में होता है।

  • यह क्यों मायने रखता है: क्योंकि यह केवल पीछे देखता है, यह उन मेमोरी शॉर्टकट्स (KV कैशिंग) का उपयोग कर सकता है जो "पुराने तरीके" को बहुत तेज़ बनाते हैं। यह "पत्थर के ब्लॉक" वाले दृष्टिकोण को "एकतरफा सड़क" वाले दृष्टिकोण में बदल देता है, लेकिन एक साथ कई शब्दों का अनुमान लगाने की क्षमता के साथ।

2. "सॉफ्ट टेल" रणनीति (सुरक्षित क्षेत्र)

यदि आप एक रोबोट को वाक्य के यादृच्छिक (random) हिस्सों को छिपाकर शब्द अनुमान लगाना सिखाने की कोशिश करते हैं, तो वह भ्रमित हो जाता है। यदि आप वाक्य का पहला शब्द छिपा देते हैं, तो रोबोट के पास अनुमान लगाने के लिए कोई संदर्भ (context) नहीं होता—वह बस अंधेरे में अनुमान लगा रहा होता है।

  • CARD का समाधान: रैंडम शब्दों को छिपाने के बजाय, CARD वाक्य के अंत (the "tail") को छिपाता है।
  • उपमा: कल्पना कीजिए कि आप किसी को वाक्य पूरा करना सिखा रहे हैं। आप उन्हें वाक्य का पहला आधा हिस्सा स्पष्ट रूप से देते हैं ("बिल्ली बैठी थी...") और अंत को छिपा देते हैं। उनके पास बाकी हिस्से का अनुमान लगाने के लिए पर्याप्त संदर्भ होता है। लेकिन यदि आप शुरुआत को छिपा देते हैं ("...मैट पर बैठी थी"), तो उन्हें पता ही नहीं चलेगा कि वाक्य किस बारे में है। CARD यह सुनिश्चित करता है कि रोबोट के पास निर्माण करने के लिए एक "सुरक्षित क्षेत्र" का स्पष्ट इतिहास हमेशा मौजूद रहे।

3. "स्मार्ट वेटिंग" सिस्टम (एक निष्पक्ष शिक्षक)

पुराने डिफ्यूजन तरीकों में, रोबोट को हर गलती के लिए समान रूप से दंडित किया जाता है, भले ही वह गलती टालना असंभव हो (जैसे बिना किसी संदर्भ के शब्द का अनुमान लगाना)। यह रोबोट को भ्रमित करता है और सीखने की प्रक्रिया को अस्थिर बनाता है।

  • CARD का समाधान: CARD एक स्मार्ट शिक्षक की तरह काम करता है। यदि वाक्य का कोई हिस्सा बहुत अधिक अस्त-व्यस्त या भ्रमित करने वाला है (पास में बहुत सारे छिपे हुए शब्द हैं), तो शिक्षक कहता है, "अभी इस हिस्से की चिंता मत करो; यह बहुत कठिन है।" यह उन भ्रमित करने वाले हिस्सों के महत्व को कम कर देता है और रोबोट की ऊर्जा उन हिस्सों पर केंद्रित करता है जहाँ वह वास्तव में सीख सकता है। यह प्रशिक्षण को स्थिर और कुशल बनाए रखता है।

4. "कॉन्फिडेंस" स्पीड बूस्ट

जब रोबोट वास्तव में कहानी लिख रहा होता है (इन्फरेंस), तो CARD केवल एक-एक करके शब्द का अनुमान नहीं लगाता। यह शब्दों के एक ब्लॉक का एक साथ अनुमान लगाता है।

  • उपमा: एक धावक की कल्पना करें जो स्प्रिंट कर सकता है। यदि उसे विश्वास है कि वह रास्ता जानता है, तो वह आगे दौड़ता है और ट्रैक के एक पूरे हिस्से को भर देता है। यदि वह अनिश्चित है, तो वह धीमा हो जाता है और अपना पैर जमाने के लिए संतुलन देखता है।
  • CARD इसे गतिशील रूप से करता है। यदि वह आत्मविश्वासी है, तो वह समानांतर (parallel) में कई शब्द उत्पन्न करता है। यदि वह फंस जाता है, तो वह एक-एक करके लिखने के तरीके पर वापस आ जाता है। यह इसे बिना गुणवत्ता खोए, पुराने धीमे तरीके की तुलना में 1.7 से 4 गुना तेज़ बनाता है।

उन्होंने क्या पाया?
लेखकों ने इसे 1-बिलियन-पैरामीटर मॉडल (एक बहुत बड़ा मस्तिष्क) पर टेस्ट किया जिसे 300 बिलियन शब्दों पर प्रशिक्षित किया गया था।

  • गति: CARD अन्य "ब्लॉक" डिफ्यूजन तरीकों की तुलना में 3 गुना तेज़ प्रशिक्षित होता है और मानक "धीमे" तरीके की गति से मेल खाता है।
  • गुणवत्ता: यह मानक "धीमे" तरीके जितना ही अच्छा लिखता है, और अन्य डिफ्यूजन मॉडल्स को बड़े अंतर से पीछे छोड़ देता है।
  • डेटा दक्षता: जब डेटा कम होता है, तो CARD अभ्यास के साथ बेहतर होता जाता है, जबकि मानक तरीका जल्दी ही सुधार करना बंद कर देता है।

संक्षेप में:
CARD AI को प्रशिक्षित करने का एक नया तरीका है जो शब्द-दर-शब्द लिखने की स्थिरता को एक साथ कई शब्दों का अनुमान लगाने की गति के साथ जोड़ता है। यह ऐसा इसलिए करता है क्योंकि यह AI को केवल पीछे देखने (कॉज़ल), वाक्य के अंत में "कठिन हिस्सों" को छिपाने (सॉफ्ट टेल), और प्रशिक्षण के दौरान "असंभव हिस्सों" को अनदेखा करने (स्मार्ट वेटिंग) के लिए मजबूर करता है। परिणाम एक ऐसा सिस्टम है जो तेज़, स्थिर है और उच्च गुणवत्ता वाला टेक्स्ट लिखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →