← नवीनतम पेपर
🤖 AI

Accurate and Efficient World Modeling with Masked Latent Transformers

यह शोध पत्र EMERALD को प्रस्तुत करता है, जो एक कुशल वर्ल्ड मॉडल है जो सटीक प्रक्षेप पथ (ट्रैजेक्टरी) उत्पन्न करने के लिए स्थानिक लेटेंट स्टेट्स (spatial latent states) को MaskGIT भविष्यवाणियों के साथ जोड़ता है, और 10 मिलियन स्टेप्स के भीतर मानव विशेषज्ञों से आगे निकलकर Crafter बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Maxime Burchi, Radu Timofte

प्रकाशित 2026-02-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maxime Burchi, Radu Timofte

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को Minecraft जैसा एक जटिल वीडियो गेम खेलना सिखा रहे हैं। ऐसा करने के लिए, रोबोट को एक "वर्ल्ड मॉडल" (world model) की आवश्यकता होगी—एक मानसिक मानचित्र जो उसे यह समझने में मदद करे कि यदि वह कोई निश्चित कदम उठाता है तो आगे क्या होगा।

लंबे समय तक, सबसे अच्छे रोबोट (जैसे Dreamer परिवार) गेम की दुनिया को छोटे, संक्षिप्त सारांशों में संकुचित करके सीखते थे। इसे एक हाई-डेफिनिशन फिल्म को केवल कुछ धुंधली तस्वीरों के रूप में याद रखने जैसा समझें। हालांकि यह तेज़ है, लेकिन रोबोट अक्सर महत्वपूर्ण विवरणों को मिस कर देता है, जैसे कि गुफा में छिपा हुआ हीरा या पीछे से आता हुआ कोई कंकाल दुश्मन। क्योंकि वे तस्वीरें धुंधली होती हैं, इसलिए रोबोट गलतियाँ करता है।

दूसरी ओर, नए तरीकों ने पूरी हाई-डेफिनिशन वीडियो को अपनी मेमोरी में रखने की कोशिश की। इससे रोबोट सब कुछ स्पष्ट रूप से देख पाता था, लेकिन यह इतना भारी और धीमा था कि रोबोट गेम में माहिर होने की गति से सीख नहीं पा रहा था।

EMERALD का आगमन: "स्मार्ट स्केच आर्टिस्ट"

लेखकों ने एक नया रोबक ब्रेन बनाया जिसे EMERALD कहा जाता है। उन्होंने एक ऐसा तरीका खोजा जिससे उन्हें दोनों दुनियाओं का सर्वश्रेष्ठ मिल सके: उच्च सटीकता और उच्च गति। उन्होंने इसे कैसे किया, यहाँ इसके सरल उदाहरण दिए गए हैं:

1. "ग्रुप की गई" मेमोरी (स्पेशियल लेटेंट स्टेट - Spatial Latent State)

पूरी गेम स्क्रीन को एक छोटे बिंदु में सिकोड़ने के बजाय (पिछले तरीकों की तरह), EMERALD स्क्रीन को छोटे टाइल्स के ग्रिड में तोड़ देता है, जैसे कि एक मोज़ेक (mosaic)।

  • उदाहरण: कल्पना करें कि आप अपने दोस्त को जंगल की तस्वीर का वर्णन कर रहे हैं। इसके बजाय कि आप कहें "यह एक हरा धब्बा है," आप कहते हैं, "बाईं ओर एक पेड़ है, बीच में एक नदी है, और दाईं ओर एक लोमड़ी है।"
  • लाभ: यह रोबोट को पूरी हाई-डेफिनिशन इमेज को स्टोर किए बिना विशिष्ट विवरणों (जैसे लोमड़ी या हीरा) को ट्रैक करने की अनुमति देता है। यह दुनिया के पिक्सेल को नहीं, बल्कि उसकी संरचना को याद रखता है।

2. "खाली जगह भरने" की तकनीक (MaskGIT)

यही असली सफलता का मंत्र है। जब रोबोट भविष्य की कल्पना करने की कोशिश करता है (अगले फ्रेम की भविष्यवाणी करता है), तो वह हर एक पिक्सेल को क्रमवार तरीके से शुरू से बनाने की कोशिश नहीं करता। ऐसा करने में बहुत समय लगेगा। इसके बजाय, यह MaskGIT नामक तकनीक का उपयोग करता है।

  • उदाहरण: इसे "मैड लिब्स" (Mad Libs) गेम या क्रॉसवर्ड पहेली की तरह समझें जहाँ कुछ शब्द गायब हैं।
    1. रोबोट वर्तमान दृश्य को देखता है।
    2. वह अनुमान लगाता है कि गायब हिस्से (मास्क्ड टोकन) क्या हो सकते हैं।
    3. वह उन्हें एक-एक करके नहीं, बल्कि एक साथ (पैरेलल में) भर देता है।
    4. यदि कोई अनुमान अजीब लगता है, तो वह अगले राउंड में उसे जल्दी से ठीक कर देता है।
  • लाभ: यह एक ऐसे चित्रकार की तरह है जो एक बार में पेंटिंग की पूरी रूपरेखा (outline) तैयार करता है, और फिर बारीकी से सुधार करता है, बजाय इसके कि वह एक-एक छोटा बिंदु बनाकर पेंट करे। यह बहुत तेज़ है लेकिन फिर भी बहुत सटीक है।

3. "सपनों वाली" अवस्था (The "Dreaming" Phase)

पुराने Dreamer रोबोटों की तरह, EMERALD भी "सपनों" के माध्यम से सीखता है। यह वास्तव में गेम को छुए बिना अपने दिमाग के अंदर (अपने लेटेंट स्पेस में) हजारों संभावित भविष्यों का अनुकरण (simulate) करता है।

  • उदाहरण: किसी पार्टी में जाने से पहले, आप अपने मन में अभ्यास करते हैं: "यदि मैं हेलो कहता हूँ, तो वे मुस्कुरा सकते हैं। यदि मैं अपना ड्रिंक गिरा देता हूँ, तो वे हंस सकते हैं।" आप यह अपने मन में करते हैं ताकि आपको वास्तव में ड्रिंक गिराने की ज़रूरत न पड़े।
  • अंतर: क्योंकि EMERALD के "सपने" बहुत स्पष्ट हैं (मोज़ेक मेमोरी और खाली स्थान भरने वाली तकनीक के कारण), यह धुंधली तस्वीरों वाले रोबोटों की तुलना में बहुत तेज़ी से सीखता है और कम गलतियाँ करता है।

परिणाम: इंसानों को पछाड़ना

शोधकर्ताओं ने इसका परीक्षण Crafter बेंचमार्क पर किया, जो एक कठिन गेम है जिसमें दीर्घकालिक स्मृति और तेज़ आँखों की आवश्यकता होती है।

  • स्कोर: EMERALD ने 58.1% स्कोर किया, जबकि सर्वश्रेष्ठ मानव विशेषज्ञों ने 50.5% स्कोर किया।
  • उपलब्धि: यह केवल 10 मिलियन स्टेप्स के प्रशिक्षण के साथ इस गेम में मानव विशेषज्ञों को हराने वाला पहला तरीका था।
  • उपलब्धियां: इसने सफलतापूर्वक गेम की सभी 22 संभावित उपलब्धियों को कम से कम एक बार अनलॉक किया, जिसमें हीरे इकट्ठा करने और लोहे की तलवार बनाने जैसे कठिन कार्य शामिल हैं।

यह क्यों महत्वपूर्ण है

पेपर का दावा है कि EMERALD यह साबित करता है कि आपको तेज़ होने और सटीक होने के बीच किसी एक को चुनने की ज़रूरत नहीं है। एक "स्पेशियल" ग्रिड का उपयोग करके और "मास्किंग" तकनीक के माध्यम से, रोबोट दुनिया को स्पष्ट रूप से देख सकता है और तेज़ी से सीख सकता है।

लेखक यह भी बताते हैं कि यह तरीका पुराने गेम्स (जैसे Atari) पर भी अच्छा काम करता है, जो इसे रोबोट को उनकी दुनिया समझने के लिए सिखाने का एक बहुमुखी उपकरण बनाता है। उन्होंने अपना कोड जारी कर दिया है ताकि अन्य लोग भी इसे आज़मा सकें।

संक्षेप में: EMERALD एक ऐसा रोबोट है जो हाई-डेफिनिशन में सपने देखकर सीखता है, लेकिन यह इसे इतनी कुशलता से करता है कि यह एक जटिल सर्वाइवल गेम में मानव विशेषज्ञों को भी मात दे देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →