← नवीनतम पेपर
💬 NLP

DREAMSTATE: Diffusing States and Parameters for Recurrent Large Language Models

यह शोध पत्र DREAMSTATE को प्रस्तुत करता है, जो एक कंडीशनल डिफ्यूजन ट्रांसफॉर्मर (conditional Diffusion Transformer) का उपयोग करके RWKV रिकरेंट स्टेट्स को संपादन योग्य ज्ञान निरूपण (editable knowledge representations) के रूप में मॉडल करता है और एक नवीन हाइब्रिड आर्किटेक्चर प्रस्तावित करता है जहाँ एक समानांतर DiT वैश्विक संदर्भ (global context) के आधार पर रिकरेंट पैरामीटर्स को गतिशील रूप से समायोजित करता है ताकि अनुकूलन क्षमता को बढ़ाया जा सके।

मूल लेखक: Liu Xiao

प्रकाशित 2026-01-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Liu Xiao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट, तेज़ रोबोट है जो कहानियों को एक-एक शब्द करके पढ़ता है। यह रोबोट विशेष है क्योंकि इसे एक बार में पूरी कहानी याद रखने की ज़रूरत नहीं है; इसके बजाय, यह अपने दिमाग में एक छोटा, संकुचित (compressed) "नोट" रखता है जो हर नए शब्द के साथ अपडेट होता रहता है। आधुनिक रिकरेंट न्यूरल नेटवर्क (जैसे कि पेपर में उल्लेखित RWKV मॉडल) इसी तरह काम करते हैं।

यह पेपर DREAMSTATE नामक एक नई प्रणाली पेश करता है जो इस रोबोट को और भी स्मार्ट और लचीला बनाने के लिए दो मुख्य काम करती है। यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: रोबोट का "नोट" बहुत कठोर है

रोबोट के आंतरिक "नोट" (स्टेट) को अब तक पढ़ी गई चीज़ों के मानसिक स्नैपशॉट के रूप में सोचें।

  • समस्या: वर्तमान में, रोबोट जिस नियम का उपयोग इस नोट को अपडेट करने के लिए करता है, वह निश्चित (fixed) है। यह एक ऐसे शेफ की तरह है जिसके पास सामग्री मिलाने के लिए एक ही, अपरिवर्तनीय रेसिपी है। चाहे शेफ तीखी करी बना रहा हो या मीठा केक, वे हमेशा एक ही मिश्रण गति और क्रम का उपयोग करते हैं।
  • परिणाम: यह "स्थिर" (static) रेसिपी ठीक-ठाक काम करती है, लेकिन यह हर स्थिति के लिए एकदम सही नहीं है। पेपर इसे "स्ट्रक्चरल नॉइज़" (structural noise) कहता है। यह थोड़े धुंधले चश्मे रखने जैसा है; रोबट देख तो सकता है, लेकिन वह दुनिया को पूरी स्पष्टता के साथ नहीं देख पाता क्योंकि उसके आंतरिक नियम संदर्भ (context) के अनुसार बदलते नहीं हैं।

2. भाग एक: "स्टेट" को 'सपना' देखना सीखना

शोधकर्ताओं ने पहले पूछा: क्या हम कंप्यूटर को यह समझा सकते हैं कि ये आंतरिक नोट्स कैसे दिखते हैं?

  • उपमा: कल्पना करें कि रोबोट के आंतरिक नोट्स अलग-अलग "मूड" या "व्यक्तित्वों" की तरह हैं। यदि रोबोट कोडिंग के बारे में पढ़ता है, तो उसका नोट एक "प्रोग्रामर" जैसा दिखता है। यदि वह कविता के बारे में पढ़ता है, तो उसका नोट एक "कवि" जैसा दिखता है।
  • प्रयोग: टीम ने इन नोट्स का अध्ययन करने के लिए एक विशेष AI टूल (जिसे डिफ्यूजन ट्रांसफॉर्मर या DiT कहा जाता है) का उपयोग किया। उन्होंने पाया कि नोट्स रैंडम नहीं हैं; वे विशिष्ट समूहों (clusters) में बँटे हुए हैं, ठीक वैसे ही जैसे समान शौक वाले लोग पार्क के एक ही हिस्से में मिलते-जुलते हैं।
  • महत्वपूर्ण उपलब्धि (Breakthrough): उन्होंने AI को शून्य से ये नोट्स बनाने (generate) के लिए प्रशिक्षित किया। रोबोट के कहानी पढ़ने का इंतज़ार करने के बजाय कि वह एक "प्रोग्रामर" नोट बनाए, अब वे तुरंत एक "प्रोग्रामर" नोट बना सकते हैं और उसे रोबोट को सौंप सकते हैं।
  • परिणाम: जब उन्होंने रोबोट को एक सामान्य नोट के बजाय "स्टोरीटेलर" नोट दिया, तो रोबोट तुरंत बेहतर और अधिक रचनात्मक कहानियाँ लिखने लगा। यह रोबोट को एक विशिष्ट "टोपी" पहनने देने जैसा है जो तुरंत उसके सोचने के तरीके को बदल देती है।

3. भाग दो: नियमों को गतिशील (Dynamic) बनाना

एक बार जब उन्होंने नोट्स बनाना सिद्ध कर दिया, तो उन्होंने पूछा: क्या हम रोबोट की "मिक्सिंग रेसिपी" को भी मौके पर (on the fly) बदल सकते हैं?

  • उपमा: उस शेफ को याद करें जिसके पास एक ही, अपरिवर्तनीय रेसिपी है? शोधकर्ताओं ने एक नया किचन सेटअप प्रस्तावित किया।
    • मुख्य शेफ (RWKV): अभी भी शब्द-दर-शब्द खाना पकाता है (तेज़ और कुशल)।
    • सू-शेफ (डिफ्यूजन मॉडल): यह नया सहायक खाना बनाना शुरू करने से पहले पूरे मेनू (ग्लोबल कॉन्टेक्स्ट) को देखता है।
  • नवाचार: सू-शेफ पूरी कहानी को देखता है और फिर उस विशेष कहानी के लिए एक नई रेसिपी लिखता है। वह मुख्य शेफ को बताता है, "इस तीखी करी के लिए, तेज़ी से मिलाएँ और अधिक गर्मी जोड़ें," या "इस मीठे केक के लिए, धीरे से मिलाएँ।"
  • यह कैसे काम करता है: सिस्टम एक समानांतर AI (DiT) का उपयोग करता है जो बड़े चित्र (big picture) को देखता है और उस विशिष्ट कार्य के लिए आवश्यक विशिष्ट "मिक्सिंग नियम" (पैरामीटर्स) उत्पन्न करता है। फिर यह इन नए नियमों को पुराने, स्थिर नियमों के साथ मिला देता है।
  • परिणाम: रोबोट अब सोचने के एक कठोर तरीके में फँसा हुआ नहीं है। यह स्थिति के अनुसार अपने आंतरिक "कानूनों" को अनुकूलित कर सकता है, जिससे वह "धुंधले चश्मे" (स्ट्रक्चरल नॉइज़) को प्रभावी ढंग से हटा देता है जिसका उल्लेख पहले किया गया था।

4. क्या यह काम आया?

शोधकर्ताओं ने इस नए हाइब्रिड सिस्टम का परीक्षण किया:

  • दृश्य प्रमाण (Visual Proof): उन्होंने दिखाया कि रोबोट द्वारा बनाए गए "नोट्स" वास्तव में व्यवस्थित और अर्थपूर्ण हैं (जैसे पार्क में क्लस्टर)।
  • प्रशिक्षण प्रमाण (Training Proof): उन्होंने पूरे सिस्टम को एक साथ प्रशिक्षित किया, और इसने बिना क्रैश हुए सफलतापूर्वक सीखा। रोबोट अगला शब्द बताने में बेहतर हो गया और साथ ही अपने स्वयं के कस्टम नियम बनाना भी सीख गया।

सारांश

संक्षेप में, DREAMSTATE एक तरीका है जिससे रोबोट के दिमाग को निश्चित नियमों वाली एक स्थिर मशीन के रूप में देखना बंद किया जा सके।

  1. यह रोबोट की आंतरिक स्मृति को एक ऐसी चीज़ के रूप में मानता है जिसे कला के एक टुकड़े की तरह बनाया और संपादित (edit) किया जा सकता है।
  2. यह एक गतिशील प्रणाली (dynamic system) बनाता है जहाँ एक सहायक AI पूरे संदर्भ को देखता है और मुख्य रोबोट के उपयोग के लिए उस विशिष्ट क्षण के लिए एकदम सही "संचालन के नियम" तैयार करता है।

यह रोबोट को अधिक लचीला बनाता है, जिससे वह तुरंत विभिन्न "मोड्स" (जैसे कोडर या कवि) के बीच स्विच कर सकता है और कार्य के अनुसार अपनी सोचने की शैली को ढाल सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →