← नवीनतम पेपर
🤖 machine learning

Looped Diffusion Language Models

यह शोध पत्र LoopMDM प्रस्तुत करता है, जो मास्क्ड डिफ्यूजन मॉडल्स (Masked Diffusion Models) के लिए एक नवीन दृष्टिकोण है जो मानक MDMs की तुलना में बेहतर प्रशिक्षण दक्षता और तर्क प्रदर्शन प्राप्त करने के लिए शुरुआती-मध्यवर्ती ट्रांसफार्मर परतों को चुनिंदा रूप से लूप करता है, साथ ही इन्फरेंस के समय लचीले कंप्यूट स्केलिंग को भी सक्षम बनाता है।

मूल लेखक: Sanghyun Lee, Chunsan Hong, Seungryong Kim, Jonghyun Lee, Jongho Park, Dongmin Park

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sanghyun Lee, Chunsan Hong, Seungryong Kim, Jonghyun Lee, Jongho Park, Dongmin Park

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि सुडोकू या कोई कठिन गणित की समस्या। आपके पास विशेषज्ञों की एक टीम (एक कंप्यूटर मॉडल) है जो उत्तर खोजने की कोशिश कर रही है।

AI भाषा मॉडलों की दुनिया में, ये टीमें काम करने के दो मुख्य तरीके हैं:

  1. "वन-पास" टीम (ऑटोरेग्रेसिव): वे पहेली को बाएं से दाएं पढ़ते हैं, एक-एक करके अगले शब्द का अनुमान लगाते हैं। यदि वे शुरुआत में कोई गलती करते हैं, तो बाद में उसे सुधारना मुश्किल हो जाता है।
  2. "स्क्रैचपैड" टीम (मास्क्ड डिफ्यूजन): वे एक ऐसी पहेली से शुरुआत करते हैं जहाँ सभी उत्तर छिपे हुए (मास्क्ड) होते हैं। वे एक ही बार में सभी छिपे हुए स्थानों पर अनुमान लगाते हैं, अपने काम की जाँच करते हैं, और फिर अपने अनुमानों को परिष्कृत (refine) करते हैं। वे तब तक "अनुमान लगाने और जाँचने" का चक्र दोहराते रहते हैं जब तक कि पहेली हल नहीं हो जाती।

यह पेपर "लूपएमडीएम" (LoopMDM) नामक एक नया तरीका पेश करता है जो इस "स्क्रैचपैड" टीम के लिए है।

समस्या: बहुत अधिक काम, कम दिमाग

आमतौर पर, "स्क्रैचपैड" टीम को स्मार्ट बनाने के लिए, आपको अधिक विशेषज्ञों को काम पर रखना पड़ता है (न्यूरल नेटवर्क में अधिक लेयर्स जोड़ना)। लेकिन अधिक लोगों को काम पर रखना महंगा और धीमा है। शोधकर्ताओं ने पूछा: क्या हम मौजूदा टीम को बिना और अधिक लोग बढ़ाए स्मार्ट बना सकते हैं?

समाधान: "लूप" रणनीति

लेखकों ने महसूस किया कि पहेली सुलझाने की प्रक्रिया के बीच में, टीम को एक नए कमरे में जाने की आवश्यकता नहीं होती है। इसके बजाय, वे बीच वाले कमरे में रह सकते हैं और अपने विचारों को बार-बार परिष्कृत करने के लिए आगे-पीछे दौड़ सकते हैं।

इसे जासूसों के एक समूह की तरह समझें जो अपराध सुलझा रहे हैं:

  • मानक मॉडल (Standard Model): जासूस A सुराग देखता है, फ़ाइल जासूस B को सौंप देता है, जो उसे जासूस C को सौंप देता है। एक बार जब फ़ाइल उनके हाथों से निकल जाती है, तो वे अपना विचार नहीं बदल सकते।
  • लूपएमडीएम (LoopMDM): जासूस A सुराग देखता है, फिर वह फिर से देखने के लिए वापस लौटता (loop back) है, फिर वह अपने तर्क को दोबारा जांचने के लिए तीसरी बार वापस आता है, इससे पहले कि वह फ़ाइल जासूस B को सौंपे।

वे इसे "सिलेक्टिव लूपिंग" (Selective Looping) कहते हैं। वे हर जासूस को वापस लौटने के लिए मजबूर नहीं करते; वे केवल प्रक्रिया के मध्य में मौजूद जासूसों को ऐसा करने के लिए कहते हैं। यही वह सटीक बिंदु है जहाँ टीम को कड़ी मेहनत करने की आवश्यकता होती है लेकिन उसने अभी तक अंतिम निर्णय नहीं लिया होता है।

उन्होंने क्या पाया (परिणाम)

पेपर का दावा है कि यह सरल ट्रिक अविश्वसनीय रूप से शक्तिशाली है:

  1. सस्ता प्रशिक्षण (Cheaper Training): क्योंकि टीम नए कमरे बनाने के बजाय उसी "बीच वाले कमरे" का पुन: उपयोग कर रही है, वे मानक मॉडल के समान कौशल स्तर तक पहुँचने के लिए 3.3 गुना कम कंप्यूटिंग पावर (FLOPs) का उपयोग करके मॉडल को प्रशिक्षित कर सकते हैं। यह मौजूदा कार को खरीदने के बजाय केवल उसे ट्यून करके फेरारी इंजन प्राप्त करने जैसा है।
  2. बेहतर गणित: गणित की समस्याओं पर (जैसे GSM8K बेंचमार्क), इस पद्धति ने समान आकार के मानक मॉडल की तुलना में सटीकता में 8.5 अंक का सुधार किया। इसने उन मॉडलों को भी मात दी जो शारीरिक रूप से बड़े (गहरे) थे लेकिन इस लूपिंग ट्रिक का उपयोग नहीं करते थे।
  3. लचीली गति (Flexible Speed): आप कितनी बार लूप करना है यह बदलकर मॉडल की "बुद्धिमत्ता" को नियंत्रित कर सकते हैं।
    • त्वरित उत्तर चाहिए? इसे एक बार लूप करें।
    • कठिन गणित की समस्या के लिए एक सटीक उत्तर चाहिए? इसे 12 बार लूप करें।
    • आप मॉडल को बीच के लूप में जितना अधिक "सोचने" देंगे, यह उतना ही बेहतर होता जाएगा।

यह क्यों काम करता है? (क्यों)

शोधकर्ताओं ने यह सिद्ध करने के लिए कि यह क्यों काम करता है, एक "सुडोकू" प्रयोग का उपयोग किया।

  • जब उन्होंने मॉडल को एक सख्त क्रम में सुडोकू हल करने के लिए मजबूर किया (जैसे किताब पढ़ना), तो एक मानक मॉडल बुरी तरह विफल रहा।
  • लेकिन लूपएमडीएम (LoopMDM) इसे पूरी तरह से हल कर सका। क्यों? क्योंकि "लूप" ने मॉडल को छिपे हुए स्थानों (खाली स्थानों) को एक साझा कार्यक्षेत्र (shared workspace) के रूप में उपयोग करने की अनुमति दी।
  • जैसे-जैसे मॉडल लूप करता है, छिपे हुए स्थान एक-दूसरे से "बात" करते हैं। यदि कोई अनुमान गलत है, तो लूप मॉडल को यह एहसास करने और अंतिम उत्तर देने से पहले मिलकर उसे ठीक करने की अनुमति देता है। यह एक व्हाइटबोर्ड होने जैसा है जहाँ टीम एक लाइन में चिल्लाने के बजाय, एक साथ अपने विचारों को मिटा और फिर से लिख सकती है।

"एडैप्टिव" बोनस

पेपर यह भी सुझाव देता है कि इसका उपयोग करने का एक स्मार्ट तरीका है: एडैप्टिव लूपिंग (Adaptive Looping)
हर शब्द के लिए मॉडल को ठीक 12 बार लूप करने के लिए मजबूर करने के बजाय, मॉडल अपने आत्मविश्वास की जाँच कर सकता है।

  • यदि उत्तर स्पष्ट है, तो यह एक बार लूप करता है और आगे बढ़ जाता है।
  • यदि उत्तर कठिन है, तो यह 12 बार लूप करता है।
    यह ऊर्जा बचाते हुए गुणवत्ता को उच्च रखता है।

सारांश

लूपएमडीएम (LoopMDM) AI मॉडलों को स्मार्ट और तेज़ बनाने का एक तरीका है, जिससे उन्हें अपनी प्रोसेसिंग के बीच में "चक्करों में सोचने" की अनुमति मिलती है। एक बड़ा, अधिक महंगा मस्तिष्क बनाने के बजाय, वे बस मौजूदा मस्तिष्क को अपने काम को दोबारा जांचने के लिए कुछ अतिरिक्त सेकंड देते हैं। परिणाम यह है कि यह मॉडल तेजी से सीखता है, कठिन गणित की समस्याओं को बेहतर ढंग से हल करता है, और कम बिजली का उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →