← नवीनतम पेपर
💬 NLP

DARE: Diffusion Large Language Models Alignment and Reinforcement Executor

DARE एक ओपन-सोर्स फ्रेमवर्क है जो डिफ्यूजन लार्ज लैंग्वेज मॉडल्स (dLLMs) के लिए पोस्ट-ट्रेनिंग और इवैल्यूएशन पाइपलाइन्स को एकीकृत करने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग, प्रेफरेंस ऑप्टिमाइज़ेशन और रीइन्फोर्समेंट लर्निंग को जोड़कर पारिस्थितिकी तंत्र के विखंडन को संबोधित करता है और विविध मॉडल परिवारों में पुनरुत्पादनीय, निष्पक्ष तुलना सक्षम करता है।

मूल लेखक: Jingyi Yang, Yuxian Jiang, Xuhao Hu, Shuang Cheng, Biqing Qi, Jing Shao

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jingyi Yang, Yuxian Jiang, Xuhao Hu, Shuang Cheng, Biqing Qi, Jing Shao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो पास्ता पकाने का एक नया तरीका खोजने की कोशिश कर रहे हैं। सालों से, हर कोई पानी उबालकर उसमें नूडल्स एक-एक करके डालता रहा है (यह पुराने Autoregressive AI मॉडल जैसा है)। लेकिन हाल ही में, शेफों के एक नए समूह ने "डिफ्यूजन" (diffusion) विधि का उपयोग करना शुरू किया: वे कच्ची और अव्यवस्थित सामग्रियों के एक कटोरे से शुरुआत करते हैं और धीरे-धीरे उन्हें एक साथ एक बेहतरीन डिश में परिष्कृत (refine) करते हैं। यह नया Diffusion Large Language Model (dLLoma) है।

समस्या क्या है? हर शेफ इस नए आंदोलन में अपने खुद के अलग कमरे (isolated kitchen) में काम कर रहा है।

  • शेफ A के पास अपनी रेसिपी बुक है, अपने मापने वाले कप हैं, और खाना चखने का अपना तरीका है।
  • शेफ B पूरी तरह से अलग उपकरणों और पास्ता पकने की जांच करने के अपने अलग तरीके का उपयोग करता है।
  • यदि आप तुलना करना चाहते हैं कि कौन सबसे अच्छा पास्ता बनाता है, तो आपको पहले शेफ A का किचन फिर से बनाना होगा, फिर शेफ B का किचन, और फिर आपको उम्मीद करनी होगी कि आपने माप में कोई गलती नहीं की। यह इंजीनियरिंग का एक दुस्वप्न है, और यह जानना असंभव है कि क्या शेफ A वास्तव में बेहतर है या बस उसके पास एक बेहतर ओवन था।

पेश है DARE (Diffusion Large Language Models Alignment and Reinforcement Executor)।

DARE को एक सार्वभौमिक, हाई-टेक "सुपर-किचन" के रूप में सोचें जिसका उपयोग हर शेफ कर सकता है।

1. सार्वभौमिक किचन (The Framework)

हर शोधकर्ता को अपना किचन शून्य से बनाने के लिए मजबूर करने के बजाय, DARE एक एकल, साझा कार्यक्षेत्र प्रदान करता है।

  • काउंटरटॉप: यह सभी प्रकार के पास्ता मेकर (जैसे LLaDA, Dream, SDAR मॉडल) को संभालता है। चाहे शेफ "मास्क्ड" (masked) विधि (सामग्री छिपाना और उन्हें प्रकट करना) का उपयोग करे या "ब्लॉक" (block) विधि (टुकड़ों में पकाना) का, काउंटरटॉप उन सभी के लिए उपयुक्त है।
  • उपकरण: इसके साथ मानकीकृत मापने वाले कप, टाइमर और चखने के चम्मच आते हैं। इसका मतलब है कि जब शेफ A और शेफ B एक नई रेसिपी आज़माते हैं, तो वे बिल्कुल उन्हीं उपकरणों का उपयोग कर रहे होते हैं। यदि शेफ A का पास्ता बेहतर स्वाद देता है, तो हम जानते हैं कि यह रेसिपी के कारण है, न कि इसलिए कि उनके पास एक शानदार ओवन था।

2. "टेस्ट-टेस्ट" इंजन (Reinforcement Learning)

AI में, "रीइन्फोर्समेंट लर्निंग" (Reinforcement Learning) एक शेफ द्वारा अपने व्यंजन को चखने, स्कोर प्राप्त करने और अगली बार उच्च स्कोर प्राप्त करने के लिए रेसिपी को समायोजित करने जैसा है।

  • पुराना तरीका: हर शेफ के पास चखने और स्कोर करने का अपना अजीब तरीका था। कुछ आंखों पर पट्टी बांधकर चखते थे, तो कुछ माइक्रोस्कोप से। आप स्कोर की तुलना नहीं कर सकते थे।
  • DARE का तरीका: DARE एक मानकीकृत टेस्ट-पैनल प्रदान करता है। यह शोधकर्ताओं को एक ही किचन में विभिन्न "स्कोरिंग एल्गोरिदम" (जैसे VRPO, d1, या GRPO) को प्लग इन करने की अनुमति देता है। अब, हम स्पष्ट रूप से देख सकते हैं: "ओह, एल्गोरिदम X गणित की समस्याओं के लिए बहुत अच्छा है, लेकिन एल्गोरिदम Y कोडिंग लिखने के लिए बेहतर है।"

3. स्पीड बूस्ट (Acceleration)

डिफ्यूजन पास्ता बनाना कंप्यूटेशनल रूप से भारी होता है—सामग्रियों को परिष्कृत करने में बहुत समय लगता है।

  • समस्या: प्रक्रिया के कुछ हिस्से इसलिए धीमे होते हैं क्योंकि शेफ अक्षम उपकरणों (जैसे मिक्सर के बजाय चम्मच से चलाना) का उपयोग कर रहे होते हैं।
  • DARE समाधान: DARE एक स्मार्ट किचन मैनेजर की तरह है। वह जानता है कि जब आप पका रहे होते हैं (ट्रेनिंग), तो आपको एक प्रकार के हाई-स्पीड मिक्सर की आवश्यकता होती है। लेकिन जब आप चख रहे और तालमेल बिठा रहे होते हैं (rollout), तो आपको एक अलग, और भी तेज़ उपकरण की आवश्यकता होती है। DARE प्रत्येक विशिष्ट चरण के लिए उपलब्ध सबसे तेज़ उपकरणों को स्वचालित रूप से बदल देता है, जिससे पूरी प्रक्रिया 4 गुना से 14 गुना तेज़ हो जाती है।

4. "कोई साइलो नहीं" परिणाम

DARE से पहले, यदि कोई शोधकर्ता एक नया विचार आज़माना चाहता था, तो उसे अपना किचन सेट करने में ही महीनों बिताने पड़ते थे। अब, वे DARE किचन में जा सकते हैं, एक मॉडल चुन सकते हैं, एक रेसिपी चुन सकते हैं और तुरंत खाना बनाना शुरू कर सकते हैं।

बड़ी खोज:
जब शोधकर्ताओं ने इस सुपर-किचन का उपयोग करके सभी अलग-अलग रेसिपीज़ का परीक्षण किया, तो उन्हें कुछ आश्चर्यजनक पता चला: कोई एक "सर्वश्रेष्ठ शेफ" नहीं है।

  • कुछ रेसिपी गणित की समस्याओं को हल करने में अद्भुत थीं लेकिन कोडिंग लिखने में बहुत खराब थीं।
  • कुछ रेसिपी स्थिर और विश्वसनीय थीं, जबकि अन्य जोखिम भरी थीं और कभी-कभी किचन को क्रैश कर देती थीं।
  • क्योंकि सभी एक ही किचन का उपयोग कर रहे थे, वे अंततः इन अंतरों को स्पष्ट रूप से देख सके। पहले, अलग-अलग किचन के शोर-शराबे ने सच्चाई को छिपा दिया था।

संक्षेप में

DARE नए डिफ्यूजन AI जगत का "एंड्रॉइड" या "iOS" है।
जिस तरह स्मार्टफोन ने विभिन्न ऐप्स को एक ही फोन पर चलने की अनुमति दी, उसी तरह DARE विभिन्न AI ट्रेनिंग विधियों को एक ही इंफ्रास्ट्रक्चर पर चलने की अनुमति देता है। यह शोधकर्ताओं को किचन बनाने में समय बर्बाद करने से रोकता है और उन्हें अगला महान AI व्यंजन बनाने पर ध्यान केंद्रित करने देता है। यह एक खंडित, अव्यवस्थित पारिस्थितिकी तंत्र को नवाचार के लिए एक स्वच्छ, निष्पक्ष और तेज़ खेल के मैदान में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →