← नवीनतम पेपर
🤖 AI

Mind-Studio: Executable World Models with Lookahead Evaluation for Partially Observable Games

माइंड-स्टूडियो (Mind-Studio) एक ऐसा फ्रेमवर्क है जो इंटरैक्शन ट्रेजेक्टरीज से निष्पादन योग्य (executable), pygame-शैली के वर्ल्ड मॉडल्स को संश्लेषित करने के लिए लार्ज लैंग्वेज मॉडल्स का उपयोग करता है, जो आंशिक रूप से दृश्यमान (partially observable) एटाारी (Atari) गेम्स में पिछले दृष्टिकोणों की तुलना में काफी बेहतर नेक्स्ट-स्टेट प्रेडिक्शन और ब्रांच-लेवल फिडेलिटी प्रदर्शित करता है।

मूल लेखक: Yifei Dong, Mingen Zheng, Linquan Wu, Jeff Z. Pan, Jiaxin Bai

प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yifei Dong, Mingen Zheng, Linquan Wu, Jeff Z. Pan, Jiaxin Bai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को Montezuma's Revenge या Skiing जैसा वीडियो गेम खेलना सिखाने की कोशिश कर रहे हैं। रोबोट स्क्रीन देख सकता है, लेकिन वह दुनिया के "नियमों" को नहीं समझता। उसे यह नहीं पता कि सीढ़ी से उतरने पर खिलाड़ी नीचे गिर जाता है, या खोपड़ी (skull) से टकराने पर उसकी जान चली जाती है।

आमतौर पर, AI यह अनुमान लगाने की कोशिश करता है कि उसने जो पहले देखा है, उसके आधार पर आगे क्या होगा। यह कार के सामने वाली गाड़ी को देखकर यह अंदाजा लगाने जैसा है कि वह कहाँ जाएगी, बिना यह समझे कि स्टीयरिंग व्हील या ब्रेक कैसे काम करते हैं।

Mind-Studio एक नया सिस्टम है जो खेल बदल देता है। केवल अनुमान लगाने के बजाय, यह कंप्यूटर के अंदर एक छोटा, चालू वीडियो गेम इंजन बनाता है। यह इंजन एक वास्तविक, चलने वाला प्रोग्राम है जिसका उपयोग AI भविष्य को "सपना" देखने या सिम्युलेट करने के लिए कर सकता है।

यह कैसे काम करता है, यहाँ कुछ सरल उपमाओं (analogies) का उपयोग किया गया है:

1. "गेम मैनुअल" (द स्किल फाइल)

AI के सीखने शुरू करने से पहले, उसे एक "चीट शीट" या गेम मैनुअल मिलता है। यह कोई पूर्ण नियम पुस्तिका नहीं है जिसे इंसान ने लिखा हो; यह उन तथ्यों की एक संक्षिप्त सूची है जिन्हें AI गेम स्क्रीन से निकालता है।

  • यह क्या जानता है: "एक खिलाड़ी है," "सीढ़ियाँ हैं," "रस्सियाँ हैं," और "खिलाड़ी बाएं, दाएं या कूद सकता है।"
  • जादू: भले ही गेम का आंतरिक कोड छिपा हुआ हो (जो इन पुराने गेम्स में अक्सर होता है), Mind-Studio इन तस्वीरों (पिक्सेल) को देखकर अपने लिए यह मैनुअल खुद लिख सकता है। यह कार की तस्वीर देखकर यह लिखने जैसा है कि, "इसमें चार पहिए और एक स्टीयरिंग व्हील है," बिना कभी उसके इंजन को देखे।

2. "डिटेक्टिव" (एन्ट्रॉपी सिलेक्शन)

AI खिलाड़ी को गेम खेलते हुए देखता है और उसकी हर चाल को रिकॉर्ड करता है। लेकिन यह सब कुछ रिकॉर्ड नहीं करता—वरना डेटा बहुत अधिक हो जाएगा।

  • उपमा: कल्पना करें कि आप एक जासूस हैं जो यह समझने की कोशिश कर रहे हैं कि एक मशीन कैसे काम करती है। आपको मशीन को एक घंटे तक स्थिर बैठे देखने की ज़रूरत नहीं है। आपको केवल उन पलों को देखने की ज़रूरत है जब कुछ बदलता है या अप्रत्याशित रूप से होता है।
  • यह कैसे काम करता है: Mind-Studio सबसे दिलचस्प पलों को चुनने के लिए "डिटेक्टिव की सहज बुद्धि" (जिसे एंट्रॉपी स्कोरिंग कहा जाता है) का उपयोग करता है: जैसे जब खिलाड़ी दीवार से टकराता है, जब कोई दुश्मन पैदा होता है, या जब कोई रस्सी झूलती है। यह उन उबाऊ हिस्सों को अनदेखा कर देता है जहाँ कुछ नहीं होता। यह इसे सबसे "सूचना-सघन" (information-dense) सबक देता है।

3. "आर्किटेक्ट" (द LLM सिंथेसाइज़र)

एक बार जब AI के पास अपना "गेम मैनुअल" और "डिटेक्टिव नोट्स" आ जाते हैं, तो वह एक शक्तिशाली AI लेखक (Large Language Model) से गेम इंजन बनाने के लिए कहता है।

  • कार्य: AI लेखक को निर्देश दिया जाता है: "यहाँ वस्तुओं की सूची है, यहाँ दिलचस्प क्षण हैं, और यहाँ लक्ष्य है। कृपया इस गेम को सिम्युलेट करने के लिए एक Python प्रोग्राम लिखें।"
  • परिणाम: AI केवल एक विवरण नहीं लिखता; वह वास्तविक कोड लिखता है। यह कोड इस गेम का एक लघु संस्करण है। इसे पता है कि यदि आप "दाएं" दबाते हैं, तो खिलाड़ी दाईं ओर चलता है। यदि आप खोपड़ी से टकराते हैं, तो खिलाड़ी मर जाता है। यह एक "वर्ल्ड मॉडल" है जिसे आप वास्तव में कंप्यूटर पर चला सकते हैं।

4. "रिहर्सल" (लुकअहेड इवैल्यूएशन)

अब, AI के पास यह चालू सिमुलेशन है। वास्तविक गेम में कोई भी चाल चलने से पहले, वह इस सिमुलेशन का उपयोग रिहर्सल करने के लिए करता है।

  • उपमा: एक शतरंज खिलाड़ी के बारे में सोचें जो मोहरा छूने से पहले अपने दिमाग में अगले 8 चालों की कल्पना करता है। Mind-Studio वीडियो गेम के लिए यही करता है। यह पूछता है: "यदि मैं अभी कूदता हूँ, तो 8 सेकंड में स्क्रीन कैसी दिखेगी? यदि मैं बाईं ओर जाता हूँ, तो क्या होगा?"
  • परीक्षण: सिस्टम इस सिमुलेशन को चलाता है और परिणाम की तुलना वास्तविक गेम में होने वाली घटनाओं से करता है। यदि सिमुलेशन भविष्यवाणी करता है कि खिलाड़ी एक प्लेटफॉर्म पर उतरेगा, और वास्तविक गेम में खिलाड़ी वहां उतरता है, तो सिमुलेशन "विश्वसनीय" (faithful) है।

यह एक बड़ी बात क्यों है?

इस पेपर ने चार कठिन एटाari (Atari) गेम्स पर इसका परीक्षण किया। यहाँ उन्होंने क्या पाया:

  • बेहतर सटीकता: Montezuma's Revenge गेम में, पिछली विधियाँ अगली चाल की भविष्यवाणी करने में केवल 0.3% बार सही थीं। Mind-Studio 48.7% बार सही था। यह "लगभग कभी नहीं" से "लगभग आधी बार" तक का एक बड़ा उछाल है।
  • पहेलियों को सुलझाना: क्योंकि सिमुलेशन इतना अच्छा है, AI प्लानर गेम के अधिक हिस्सों को हल कर सका। Montezuma में, इसने सफलतापूर्वक 8 प्रमुख चेकपॉइंट्स (सबगोल्स) में से 5 तक पहुँच प्राप्त की, जबकि अन्य तरीके संघर्ष कर रहे थे।
  • यह इंसान की तरह काम करता है: यह सिस्टम इस तरह काम करता है जैसे कोई इंसान नया गेम सीखता है:
    1. दुनिया का अवलोकन करना।
    2. नियमों (कोड) को समझना।
    3. अपने दिमाग में उन नियमों का परीक्षण करना (सिमुलेशन)।
    4. एक चाल चलना।

निष्कर्ष

Mind-Studio एक वीडियो गेम को एक चलने योग्य स्क्रिप्ट में बदल देता है। केवल यह अनुमान लगाने के बजाय कि आगे क्या होगा, यह दुनिया का एक छोटा, चालू संस्करण बनाता है, परिणामों को देखने के लिए एक सिमुलेशन चलाता है, और फिर निर्णय लेता है। इसने साबित कर दिया है कि आप AI को केवल उसे खेलते हुए देखकर और उसे नियमों के रूप में एक कंप्यूटर प्रोग्राम लिखने के लिए कहकर, गेम के "भौतिकी" (physics) को समझने में मदद कर सकते हैं।

नोट: पेपर स्वीकार करता है कि यह अभी भी पूर्ण नहीं है। यह बहुत जटिल, यादृच्छिक घटनाओं (जैसे अचानक दुश्मनों का प्रकट होना) या कठिन ज्यामिति (जैसे खोपड़ी से बचते हुए रस्सी चढ़ना) के साथ संघर्ष करता है। लेकिन यह दिखाता है कि एक "रननेबल वर्ल्ड मॉडल" बनाना AI को आगे की योजना बनाने में मदद करने का एक शक्तिशाली तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →