← नवीनतम पेपर
🤖 machine learning

World Machine: Towards Generative World Modeling for Time-Series

यह शोध पत्र वर्ल्ड मशीन (World Machine) को प्रस्तुत करता है, जो टाइम सीरीज़ के लिए एक ट्रांसफॉर्मर-आधारित जनरेटिव वर्ल्ड मॉडल है, जो पारंपरिक ट्रांसफॉर्मर्स की द्विघातीय (quadratic) कम्प्यूटेशनल सीमाओं को पार करने के लिए विभिन्न डेटा संदर्भों में रैखिक स्केलेबिलिटी और अनुकूलन क्षमता प्राप्त करने हेतु लेटेंट स्टेट्स (latent states) का उपयोग करता है।

मूल लेखक: Elton Cardoso do Nascimento, Alexandre da Silva Simões, Esther Luna Colombini, Ricardo Ribeiro Gudwin, Paula Dornhofer Paro Costa

प्रकाशित 2026-05-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Elton Cardoso do Nascimento, Alexandre da Silva Simões, Esther Luna Colombini, Ricardo Ribeiro Gudwin, Paula Dornhofer Paro Costa

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वॉलीबॉल खिलाड़ी को देख रहे हैं। वे केवल गेंद के टकराने पर प्रतिक्रिया नहीं देते; वे गेंद के वहां पहुँचने से पहले ही अनुमान लगा लेते हैं कि वह कहाँ जाएगी। उनका मस्तिष्क खेल की एक अदृश्य, आंतरिक फिल्म बनाता है, जो गेंद के पथ, अन्य खिलाड़ियों की गतिविधियों और नेट के भौतिकी (physics) का अनुकरण करती है। यह आंतरिक फिल्म जिसे वैज्ञानिक "वर्ल्ड मॉडल" (World Model) कहते हैं।

प्रदान किया गया पेपर "वर्ल्ड मशीन" (World Machine) नामक एक नया AI सिस्टम पेश करता है जिसे ये आंतरिक फिल्में बनाने के लिए डिज़ाइन किया गया है, विशेष रूप से टाइम-सीरीज डेटा (वह डेटा जो समय के साथ बदलता है, जैसे शेयर की कीमतें, मौसम के पैटर्न, या सेंसर रीडिंग) के लिए।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "मेमोरी वॉल" (The Memory Wall)

पारंपरिक AI मॉडल (जैसे कि कई चैटबॉट्स को चलाने वाले मॉडल) उन छात्रों की तरह हैं जो किसी प्रश्न का उत्तर देने के लिए पूरी किताब को रटने की कोशिश करते हैं ताकि पेज 50 के बारे में बताया जा सके। जैसे-जैसे किताब लंबी होती जाती है, सब कुछ याद रखने का प्रयास विस्फोटक रूप से (quadratically) बढ़ता जाता है। यदि आप चाहते हैं कि AI लंबे इतिहास के आधार पर भविष्य की भविष्यवाणी करे, तो यह बहुत भारी और धीमा हो जाता है।

2. समाधान: "वर्ल्ड मशीन" (The World Machine)

वर्ल्ड मशीन एक नया प्रकार का AI है जो अतीत के हर एक विवरण को याद रखने की कोशिश नहीं करता है। इसके बजाय, यह किसी भी क्षण पर दुनिया का एक संकुचित सारांश (compressed summary) बनाता है।

  • "लेटेंट स्टेट" (The Latent State - आंतरिक स्नैपशॉट): कल्पना कीजिए कि AI वर्तमान स्थिति की एक फोटो लेता है और उसे एक एकल, छोटी, अमूर्त "तस्वीर" (जिसे लेटेंट स्टेट कहा जाता है) में सिकोड़ देता है। इस स्नैपशॉट में वह सब कुछ होता है जो AI को यह अनुमान लगाने के लिए चाहिए कि आगे क्या होगा।
  • "कोर" (The Core - सिम्युलेटर): AI के पास एक मस्तिष्क है जिसे "कोर" कहा जाता है। पूरी इतिहास की किताब को देखने के बजाय, कोर पिछले स्नैपशॉट और वर्तमान संवेदी इनपुट (जो वह अभी देख/सुन रहा है) को देखता है ताकि अगला स्नैपशॉट तैयार किया जा सके।
  • परिणाम: यह केवल इन स्नैपशॉट्स को एक श्रृंखला में जोड़कर भविष्य की भविष्यवाणी कर सकता है, जिससे हर बार पूरे इतिहास को फिर से पढ़ने की आवश्यकता समाप्त हो जाती है।

3. यह कैसे सीखता है: "स्टेट डिस्कवरी" गेम (The State Discovery Game)

यहाँ पेचीदा हिस्सा है: AI को शुरुआत में यह नहीं पता होता कि ये "स्नैपशॉट" कैसे दिखने चाहिए। इसे उन्हें खुद आविष्कार करना पड़ता है।

लेखकों ने एक विशेष प्रशिक्षण खेल बनाया है जिसे स्टेट डिस्कवरी कहा जाता है:

  1. सेटअप: AI को डेटा का एक क्रम दिया जाता है (जैसे उछलती हुई गेंद का वीडियो)।
  2. अनुमान: AI अनुमान लगाने की कोशिश करता है कि प्रत्येक क्षण के लिए "स्नैपशॉट" कैसा होना चाहिए।
  3. शिफ्ट (बदलाव): अनुमान लगाने के बाद, AI अपने स्वयं के अनुमानों को लेता है, उन्हें समय में आगे बढ़ाता है, और अगले प्रशिक्षण दौर के लिए उन्हें "सत्य" (truth) के रूप में उपयोग करता है।
  4. लूप: समय के साथ, AI ऐसे स्नैपशॉट बनाना सीख जाता है जो इतने अच्छे होते हैं कि वे भविष्य के डेटा को अपने आप सटीक रूप से फिर से बना सकते हैं।

4. ट्रेनिंग जिम: "सीक्वेंस को तोड़ना" (Breaking the Sequence)

AI को वास्तव में मजबूत बनाने के लिए, लेखकों ने इसे केवल सामान्य रूप से अभ्यास नहीं करने दिया। उन्होंने विशेष ड्रिल (प्रोटोकॉल) के साथ एक "ट्रेनिंग जिम" का उपयोग किया ताकि AI को बेहतर सीखने के लिए मजबूर किया जा सके:

  • सेंसरी मास्किंग (Sensory Masking): वे डेटा के कुछ हिस्सों को ढक देते हैं (जैसे AI की आँखों पर पट्टी बांध देना) और उसे केवल अपने आंतरिक स्नैपशॉट का उपयोग करके गायब हिस्से का अनुमान लगाने के लिए मजबूर करते हैं।
  • सीक्वेंस ब्रेकिंग (Sequence Breaking): वे डेटा को यादृच्छिक (random) टुकड़ों में काट देते हैं। AI को शुरुआत देखे बिना बीच में से कहानी को पकड़ना सीखना होता है। यह उसे पिछले वाक्य पर निर्भर रहने के बजाय अपने आंतरिक स्नैपशॉट पर भरोसा करना सिखाता है।
  • नॉइज़ इंजेक्शन (Noise Injection): वे डेटा में शोर या "धुंध" जोड़ देते हैं ताकि AI शोर के बीच भी स्पष्ट रूप से देखना सीख सके।

5. परीक्षण: "शैलो प्रेडिक्शन" चुनौती (The Shallow Prediction Challenge)

लेखकों ने अपने वर्ल्ड मशीन का परीक्षण Toy1D नामक एक सिंथेटिक डेटासेट (बौंस करती गेंदों और लहरों की एक काल्पनिक दुनिया) पर किया।

सबसे महत्वपूर्ण परीक्षण "प्रेडिक्शन शैलो" (Prediction Shallow) था।

  • चुनौती: AI को एक अनुक्रम (sequence) का पहला आधा भाग दिखाया गया, फिर केवल अंतिम स्नैपशॉट का उपयोग करके पूरे दूसरे आधे भाग की भविष्यवाणी करने के लिए कहा गया। इसे पिछले 49 चरणों को देखने की अनुमति नहीं थी।
  • यह क्यों मायने रखता है: यह साबित करता है कि AI ने वास्तव में "दुनिया के नियमों" (भौतिकी) को सीख लिया है, न कि केवल संख्याओं की एक लंबी सूची को याद किया है। यदि यह केवल एक छोटे से स्नैपशॉट से भविष्य की भविष्यवाणी कर सकता है, तो इसका मतलब है कि इसके पास सिस्टम की वास्तविक समझ है।

6. परिणाम

  • यह काम करता है: वर्ल्ड मशीन ने सफलतापूर्वक इन आंतरिक स्नैपशॉट्स को बनाना और भविष्य की भविष्यवाणी करना सीख लिया।
  • यह कुशल है: केवल अंतिम स्नैपशॉट का उपयोग करके भविष्य की भविष्यवाणी करके, यह पारंपरिक AI की "मेमोरी वॉल" समस्या से बच जाता है।
  • कमी: जब डेटा बहुत जटिल या उच्च-आवृत्ति (high-frequency) वाला होता है (जैसे बहुत तेजी से चलती गेंद), तो इसे अभी भी थोड़ा संघर्ष करना पड़ता है, और इसे "स्नैपशॉट्स" को सही करने के लिए एक विशिष्ट, कुछ हद तक जटिल प्रशिक्षण प्रक्रिया की आवश्यकता होती है।

सारांश उपमा (Summary Analogy)

पारंपरिक AI को एक फोटोग्राफर के रूप में सोचें जो रूटीन को याद रखने के लिए नृत्य के हर कदम की तस्वीर लेता है। यदि नृत्य लंबा है, तो उनके पास एक विशाल एल्बम होगा।

वर्ल्ड मशीन एक कोरियोग्राफर (नृत्य निर्देशक) है। उसे हर कदम देखने की आवश्यकता नहीं है। वह नृत्य की शैली और भौतिकी को समझता है। यदि आप उसे अंतिम चाल दिखाते हैं, तो वह कल्पना कर सकता है कि अगली तीन चालें क्या होंगी क्योंकि उसने एक आंतरिक "फिल्म" बनाई है कि नृत्य कैसे काम करता है, न कि केवल एक फोटो एल्बम।

पेपर यह सिद्ध करता है कि इस "कोरियोग्राफर" दृष्टिकोण को अपनाना संभव है और इसे गायब जानकारी को संभालने के लिए प्रशिक्षित किया जा सकता है, हालांकि यह आज के "फोटोग्राफर्स" की तुलना में अभी भी विकास के चरण में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →