← नवीनतम पेपर
💻 computer science

ActSWM: Action-Sensitive World Models for Long-Horizon Planning in Open-World Games

यह शोध पत्र ActSWM को प्रस्तुत करता है, जो एक एक्शन-सेंसिटिव लेटेंट वर्ल्ड मॉडल है जो एक ट्रांजिशन-सेपरेशन सिद्धांत को लागू करके "कॉन्टेक्स्ट कोलैप्स" विफलता मोड को संबोधित करता है ताकि यह सुनिश्चित किया जा सके कि विभिन्न एक्शन सीक्वेंसों के बीच लॉन्ग-होरिज़न रोलआउट्स अलग-अलग पहचाने जा सकें, जिससे ओपन-वर्ल्ड गेम्स में प्लानिंग प्रदर्शन में सुधार होता है और ऑफलाइन वीडियो से एक्शन रिकवरी सक्षम होती है।

मूल लेखक: Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng, Yeke Song, Yongyi Tang, Xueqian Wang

प्रकाशित 2026-07-30
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng, Yeke Song, Yongyi Tang, Xueqian Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना सिखाने की कोशिश कर रहे हैं, लेकिन आप उसे हर एक चाल के लिए कंट्रोलर छूने की अनुमति नहीं दे सकते। इसके बजाय, आप चाहते हैं कि रोबोट अपने दिमाग में गेम का एक "सपना" (dream) बनाए। वह स्क्रीन को देखता है, कल्पना करता है कि अगर वह कूदा तो क्या होगा, फिर कल्पना करता है कि अगर वह दौड़ा तो क्या होगा, और फिर आगे बढ़ने के लिए सबसे अच्छे रास्ते को चुनता है, बिना वास्तव में किसी दीवार से टकराए। यह वर्ल्ड मॉडल्स (World Models) की दुनिया है, जो आर्टिफिशियल इंटेलिजेंस की एक शाखा है जहाँ मशीनें एक संकुचित, गणितीय "स्वप्न स्थान" (dream space) के भीतर सिम्युलेशन चलाकर भविष्य की भविष्यवाणी करना सीखती हैं।

इसके काम करने के लिए, रोबोट के सपने उसके विकल्पों के प्रति संवेदनशील होने चाहिए। यदि रोबोट कूदने की कल्पना करता है, तो सपने में उसे ऊपर उड़ते हुए दिखना चाहिए। यदि वह दौड़ने की कल्पना करता है, तो उसे तेजी से आगे बढ़ते हुए दिखना चाहिए। बड़ी समस्या जो वैज्ञानिक झेल रहे थे, वह यह है कि इनके सपने अक्सर "आलसी" हो जाते हैं। रोबोट एक ऐसा भविष्य देख सकता है जो एकदम सही दिखता है, लेकिन वह वास्तव में इस बात पर निर्भर नहीं करता कि रोबोट ने क्या निर्णय लिया है। यह एक ऐसी फिल्म देखने जैसा है जहाँ कहानी पहले से लिखी जा चुकी है; चाहे पात्र कितना भी बाएं मुड़ने की कोशिश करे, कैमरा बस दाएं ही घूमता रहता है। यह शोध पत्र विशेष रूप से इसी गड़बड़ी को संबोधित करता है, और पूछता है: क्या हम एक रोबोट को ऐसा सपना देखना सिखा सकते हैं जहाँ भविष्य वास्तव में उसके कार्यों को सुनता हो?


"आलसी सपना" (Lazy Dream) की समस्या

मिलिए ActSWM से, जो एक नए प्रकार का AI मस्तिष्क है जिसे रोबोटों को "आलसी सपने" देखने से रोकने के लिए डिज़ाइन किया गया है। ओपन-वर्ल्ड गेम्स जैसे Minecraft की दुनिया में, एजेंटों (रोबोटों) को भविष्य की लंबी योजना बनाने की आवश्यकता होती है। उन्हें यह समझना होगा, "यदि मैं अभी इस पत्थर को खोदता हूँ, तो क्या मैं बाद में घर बना पाऊँगा?" इसे करने के लिए, वे एक लेटेंट वर्ल्ड मॉडल (Latent World Model) का उपयोग करते हैं। इस मॉडल को एक सुपर-फास्ट सिम्युलेटर के रूप में समझें जो बैकग्राउंड में चलता है। गेम स्क्रीन के हर पिक्सेल को प्रोसेस करने के बजाय, यह दुनिया को एक सरल "लेटेंट" कोड में संकुचित कर देता है—जो एक मानसिक संक्षिप्त रूप (mental shorthand) है।

लक्ष्य यह है कि एजेंट कुछ ही सेकंड में हजारों मानसिक सिमुलेशन चला सके ताकि सबसे अच्छी चाल मिल सके। लेकिन यहाँ एक पेच है: कई मौजूदा सिम्युलेटर एक बग से ग्रस्त होते हैं जिसे लेखक कॉन्टेक्स्ट कोलैप्स (Context Collapse) कहते हैं।

कल्पना कीजिए कि आप अपने दोस्त को एक कहानी सुना रहे हैं। यदि आप कहते हैं, "मैं पार्क गया था," तो आपका दोस्त एक धूप वाले दिन की कल्पना कर सकता है। यदि आप कहते हैं, "मैं पार्क गया था और बारिश हुई," तो वे एक गीले दिन की कल्पना करेंगे। यह अच्छा है। लेकिन कॉन्टेक्स्ट कोलैप्स एक ऐसे दोस्त की तरह है जो, आप कुछ भी कहें, हमेशा एक ही धूप वाले दिन की कल्पना करता है। वे "पार्क" के सामान्य विचार पर इतने केंद्रित हैं कि वे बारिश के बारे में आपके विशिष्ट विवरणों को सुनना बंद कर देते हैं। AI की दुनिया में, इसका अर्थ है कि सिम्युलेटर एक संभावित भविष्य (एक धूप वाला पार्क) तो दिखाता है, लेकिन रोबोट द्वारा लिए गए विशिष्ट कार्यों के आधार पर अपनी भविष्यवाणी बदलने में विफल रहता है। रोबोट सोचता है, "मैं कूद सकता हूँ या मैं दौड़ सकता हूँ, और भविष्य दोनों ही स्थितियों में एक जैसा ही दिखता है," जो योजना बनाना असंभव बना देता है।

समाधान: एक जमा हुआ "एक्शन डिटेक्टिव" (Action Detective)

लेखक इस समस्या को ठीक करने के लिए ActSM (Action-Sensitive World Model) का प्रस्ताव देते हैं। उनका गुप्त मंत्र एक सिद्धांत है जिसे वे ट्रांज़िशन सेपरेशन (Transition Separation) कहते हैं। वे यह सुनिश्चित करना चाहते हैं कि यदि रोबोट दो अलग-अलग रास्ते चुनता है, तो परिणामी सपने अलग दिखने चाहिए।

इसे लागू करने के लिए, वे एक चतुर तकनीक पेश करते हैं: एक फिक्स्ड एक्शन रीडआउट (Fixed Action Readout)। कल्पना कीजिए कि आपके पास एक जासूस है जिसका काम दृश्य को देखना और यह अनुमान लगाना है कि अभी कौन सा एक्शन हुआ है। आमतौर पर, यदि जासूस दृश्य के साथ सीख रहा है, तो वह धोखाधड़ी कर सकता है। यदि दो अलग-अलग क्रियाओं के लिए दृश्य बहुत समान दिखता है, तो जासूस दृश्य को अलग करने के बजाय, "कूदने" की अपनी परिभाषा को ही बदल सकता है ताकि वह दृश्य से मेल खा सके।

ActSWM इस धोखाधड़ी को रोकने के लिए डिटेक्टिव को फ्रीज (स्थिर) कर देता है। वे AI को एक ऐसा जासूस देते हैं जिसके पास एक निश्चित, अपरिवलाध्य नियम पुस्तिका है। इसके बाद AI को अपने "सपनों" (लेटेंट ट्रांज़िशन) को इतना विशिष्ट बनाने के लिए मजबूर किया जाता है कि यह स्थिर जासूस उन्हें स्पष्ट रूप से पहचान सके। यदि AI "कूदने" के सपने और "दौड़ने" के सपने को एक जैसा बनाने की कोशिश करता है, तो स्थिर जासूस एक्शन का सही अनुमान नहीं लगा पाएगा, और AI को दंडित किया जाएगा। यह AI को अपने भविष्य के अनुमानों को हर विशिष्ट बटन प्रेस के प्रति सटीक और उत्तरदायी बनाए रखने के लिए मजबूर करता है।

उन्होंने क्या पाया

टीम ने इस नए मस्तिष्क का परीक्षण Minecraft की अराजक दुनिया और तीन अन्य खेलों (Counter-Strike 2, GTA V, और Apex Legends) में किया।

1. कोलैप्स को रोकना:
जब उन्होंने ActSWM की तुलना पुराने मॉडलों से की, तो अंतर स्पष्ट था। एक परीक्षण में जहाँ उनसे वास्तविक क्रियाओं वाले भविष्य की कल्पना करने के लिए कहा गया बनाम एक भविष्य जहाँ रोबोट ने कुछ नहीं किया (शून्य क्रियाएं), पुराने मॉडलों ने लगभग एक जैसे भविष्य दिखाए। हालाँकि, नए ActSWM ने एक बड़ा अंतर पैदा किया। लेखकों ने इस "एक्शन गैप" को मापा और पाया कि ActSWM ने पिछले सबसे मजबूत बेसलाइन की तुलना में लगभग 380 गुना अधिक अलगाव पैदा किया। रोबोट के सपने आखिरकार कंट्रोलर की बात सुनने लगे थे।

2. बेहतर योजना बनाना:
चूँकि सपने अधिक सटीक थे, इसलिए रोबोट खेलने में बेहतर हो गया। Minecraft में, टॉर्च रखने, पत्थर का ब्लॉक खोदने या पिलर (pillar) बनाने जैसे कार्यों को करने के लिए पूछे जाने पर, ActSWM ने सफलता दर में उल्लेखनीय सुधार किया। उदाहरण के लिए, इसने बेसलाइन की तुलना में पत्थर का ब्लॉक खोदने की सफलता दर में 90.0% और पिलर बनाने में 54.5% का सुधार किया। रोबोट अब भरोसेमंद तरीके से उस रास्ते और उस रास्ते के बीच अंतर कर सकता था जो घर की ओर ले जाता है और जो एक खाई की ओर ले जाता है।

3. वीडियो से मन को पढ़ना:
अंत में, उन्होंने परीक्षण किया कि क्या AI एक इंसान के खेलने के वीडियो को देखकर यह अनुमान लगा सकता है कि वे कौन से बटन दबा रहे हैं। यह एक फिल्म देखते हुए अभिनेता की चालों का अनुमान लगाने जैसा है। क्रॉस-एंट्रॉपी मिनिमाइजेशन (CEM) नामक विधि का उपयोग करके, ActSм ऑफलाइन वीडियो से सही क्रियाओं को रैंडम अनुमान लगाने की तुलना में बहुत बेहतर तरीके से रिकवर करने में सक्षम था। GTA V में, इसने रैंडम सर्च की तुलना में सही एक्शन खोजने की "लागत" (cost) में 252.38 का सुधार किया, और इसने सक्रिय की-प्रेस (जैसे जब खिलाड़ी वास्तव में बटन दबाता है) को 0.711 तक की सटीकता वृद्धि के साथ सही ढंग से पहचाना।

निष्कर्ष

यह शोध पत्र सुझाव देता है कि AI एजेंटों के लिए जटिल, ओपन-एंडेड गेम में महारत हासिल करने के लिए, उन्हें केवल भविष्य के सटीक अनुमानों की ही नहीं, बल्कि ऐसे अनुमानों की आवश्यकता है जो एक्शन के प्रति संवेदनशील (sensitive to action) हों। यदि आप अपना विचार बदलते हैं और भविष्य नहीं बदलता, तो आप योजना नहीं बना सकते। एक साधारण "एक्शन डिटेक्टिव" को फ्रीज करके और AI को अपने भविष्य के परिदृश्यों को अलग रखने के लिए मजबूर करके, ActSWM यह सिद्ध करता है कि हम ऐसे वर्ल्ड मॉडल्स बना सकते हैं जो केवल दिवास्वप्न (daydream) नहीं देखते, बल्कि वास्तव में खिलाड़ी की बात सुनते हैं। यह केवल एक छोटा सा बदलाव नहीं है; यह हमें यह सिखाने के तरीके में एक मौलिक बदलाव है कि मशीनें अपने स्वयं के निर्णयों के परिणामों की कल्पना कैसे करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →