← नवीनतम पेपर
📊 statistics

Diffusion-Driven State Space Models

यह शोध पत्र डिफ्यूजन-ड्रिवन स्टेट स्पेस मॉडल (DDSSM) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो पारंपरिक गॉसियन ट्रांजिशन को अनुक्रमिक डेटा पर ऑटोएनकोडर और डिफ्यूजन प्रक्रिया को संयुक्त रूप से प्रशिक्षित करने के लिए डिफ्यूजन मॉडल्स से बदल देता है, जिससे मौजूदा डीप स्टेट स्पेस मॉडल्स की तुलना में जटिल, मल्टीमॉडल डायनेमिक्स वाले टाइम सीरीज़ को फिट करने और पूर्वानुमान लगाने में बेहतर सटीकता प्राप्त होती है।

मूल लेखक: Jack Ruder, Michael Wojnowicz

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jack Ruder, Michael Wojnowicz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक अराजक प्रणाली (chaotic system), जैसे कि मौसम या शेयर बाजार, के भविष्य की भविष्यवाणी करना सिखाने की कोशिश कर रहे हैं। रोबोट को दो चीजों को समझने की आवश्यकता है:

  1. "अब" (The "Now"): अभी क्या हो रहा है?
  2. "अगला" (The "Next"): "अब" कैसे "अगले" में बदलता है?

लंबे समय तक, वैज्ञानिक इस काम के लिए दो अलग-अलग प्रकार के रोबोटों का उपयोग करते रहे हैं, लेकिन दोनों में एक बड़ी खामी थी।

दो पुराने रोबोट (और वे क्यों विफल रहे)

1. "गौसियन" रोबोट (डीप स्टेट स्पेस मॉडल)
यह रोबोट बहुत व्यवस्थित है। यह मानता है कि भविष्य हमेशा एक चिकनी, घंटी के आकार की वक्र (Gaussian distribution) की तरह होता है।

  • उपमा: कल्पना कीजिए कि यह रोबोट एक लाइब्रेरियन है जो मानता है कि लाइब्रेरी की हर किताब को एक शेल्फ पर बिल्कुल सीधी, अनुमानित रेखा में रखा जाना चाहिए।
  • समस्या: वास्तविक जीवन अव्यवज़ित है। कभी-कभी भविष्य दो पूरी तरह से अलग संभावनाओं में विभाजित हो जाता है (जैसे कि सिक्का उछालना: चित या पट)। गौसियन रोबोट इन दो संभावनाओं को एक चिकनी रेखा में बदलने की कोशिश करता है, जिससे बीच में एक धुंधली, गलत भविष्यवाणी पैदा होती है। यह वास्तविकता के "शिखरों" (peaks) को चूक जाता है।

2. "डिफ्यूजन" रोबोट
यह रोबोट बहुत रचनात्मक है। यह शोर (static noise) के ढेर से शुरू करके और उसे धीरे-धीरे साफ करके एक स्पष्ट तस्वीर बनाने से सीखता है। यह जटिल, अव्यवज़ित आकृतियों को पकड़ने में माहिर है।

  • उपमा: यह रोबोट एक मूर्तिकार की तरह है जो संगमरमर के एक ब्लॉक से शुरू करता है और मूर्ति को प्रकट करने के लिए शोर को तराशता है। यह बहुत विस्तृत, जटिल मूर्तियाँ बना सकता है।
  • समस्या: हालांकि यह कला बनाने में बहुत अच्छा है, लेकिन यह इस बात को समझने में बुरा है कि मूर्ति को समय के साथ कैसे बनाया गया था। इसके पास कोई सख्त "टाइमलाइन" तर्क नहीं है, इसलिए इसे चरण-दर-चरण सिस्टम के कारण-और-प्रभाव वाले नियमों को सीखने में संघर्ष करना पड़ता है।

नया समाधान: "डिफ्यूजन-ड्रिवन स्टेट स्पेस मॉडल" (DDSSM)

लेखकों ने एक हाइब्रिड रोबोट बनाया है जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ता है। वे इसे DDSSM कहते हैं।

मुख्य विचार:
यह मान लेने के बजाय कि भविष्य एक चिकनी घंटी के आकार का वक्र है (गौसियन रोबोट की तरह), उन्होंने उस उबाऊ धारणा को डिफ्यूजन रोबोट की रचनात्मक "शोर-सफाई" (noise-cleaning) की शक्ति से बदल दिया।

यह कैसे काम करता है (उपमा):
कल्पना कीजिए कि रोबोट नृत्य के अगले कदम की भविष्यवाणी करने की कोशिश कर रहा है।

  • पुराना तरीका: यह पिछले कदमों के एक सरल औसत के आधार पर अगले कदम का अनुमान लगाता है। यदि नर्तक अचानक बाएं या दाएं कूदता है, तो रोबत अनुमान लगाएगा कि वे "थोड़ा बाएं-दाएं" चलेंगे, जो गलत है।
  • DDSSM तरीका: रोबोट नृत्य का एक "मानसिक रफ पैड" (mental scratchpad) रखता है। जब इसे अगले कदम की भविष्यवाणी करने की आवश्यकता होती है, तो यह केवल एक संख्या का अनुमान नहीं लगाता है। इसके बजाय, यह एक मिनी-सिमुलेशन चलाता है:
    1. यह एक यादृच्छिक अनुमान (शोर) से शुरू करता है।
    2. यह पिछले नृत्य कदमों के अपने ज्ञान का उपयोग करके उस यादृच्छिक अनुमान को धीरे-धीरे "डिनोइज़" (denoise) करता है।
    3. यह शोर को तब तक साफ करता है जब तक कि एक स्पष्ट, विशिष्ट नृत्य कदम उभर न आए।

क्योंकि यह इस "डिनोइज़िंग" प्रक्रिया का उपयोग करता है, रोबोट आसानी से उन स्थितियों को संभाल सकता है जहाँ भविष्य में कई संभावनाएं होती हैं (जैसे कि नर्तक का बाएं या दाएं कूदना)। यह उन्हें एक एकल औसत में नहीं बदलता; यह दोनों अलग-अलग रास्तों को सीखता है।

यह क्यों मायने रखता है (पेपर के अनुसार)

लेखकों ने एक सिम्युलेटेड खेल पर इस नए रोबोट का परीक्षण किया जहाँ "अगला कदम" एक सिक्का उछालना (bimodal noise) था।

  • पुराना गौसियन रोबोट विफल रहा। इसने एक धुंधला मध्य भाग निकाला जो वास्तविकता से मेल नहीं खाता था।
  • नया DDSSM सफल रहा। इसने सही ढंग से पहचाना कि भविष्य दो अलग-अलग रास्तों में से एक हो सकता है और दोनों की सटीक भविष्यवाणी की।

बड़ी जीत:
आमतौर पर, एक रोबोट को इस "डिनोइज़िंग" और "टाइमलाइन ट्रैकिंग" को एक साथ करने के लिए प्रशिक्षित करना बहुत कठिन होता है। लेखकों ने एक पेचीदा गणितीय समस्या को हल किया जिसने रोबोट के दोनों हिस्सों को अलग-अलग प्रशिक्षित करने के बजाय एक साथ (end-to-end) प्रशिक्षित करने की अनुमति दी। यह रोबोट को सिस्टम की गतिशीलता (dynamics) के बारे में महत्वपूर्ण विवरण भूलने से रोकता है।

सारांश

यह पेपर टाइम-सीरीज डेटा की भविष्यवाणी करने का एक नया तरीका पेश करता है। यह पारंपरिक मॉडलों की कठोर, "घंटी के आकार की" धारणाओं को एक लचीली, "शोर-सफाई" प्रक्रिया से बदल देता है। यह मॉडल को सिस्टम के चरण-दर-चरण नियमों को सीखने की क्षमता खोए बिना, जटिल, बहु-पथ भविष्यों को संभालने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →