← नवीनतम पेपर
💻 computer science

SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models

यह शोध पत्र SCOPE को प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो ट्रांसफार्मर ब्लॉक्स में एक कंडीशनिंग मॉड्यूल को एकीकृत करके फर्स्ट-पर्सन शूटर वर्ल्ड मॉडल्स को उन्नत करता है ताकि बिना सेगमेंटेशन लेबल के स्थानिक रूप से चयनात्मक एक्शन रिस्पॉन्स प्राप्त किया जा सके, साथ ही क्रॉसFPS डेटासेट को भी पेश करता है, जो कई गेम शीर्षकों में सुदृढ़ ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) को सक्षम बनाता है।

मूल लेखक: Zizhao Tong, Hongfeng Lai, Zeqing Wang, Zhaohu Xing, Kexu Cheng, Haoran Xu, Zhao Pu, Shangwen Zhu, Ruili Feng, Jian Zhao, Yan Zhang, Hao Tang, Yeying Jin, Ling Shao

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zizhao Tong, Hongfeng Lai, Zeqing Wang, Zhaohu Xing, Kexu Cheng, Haoran Xu, Zhao Pu, Shangwen Zhu, Ruili Feng, Jian Zhao, Yan Zhang, Hao Tang, Yeying Jin, Ling Shao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फर्स्ट-पर्सन शूटर (FPS) वीडियो गेम देख रहे हैं, जैसे कि Call of Duty या Halo। इन खेलों में, आपका पात्र लगातार हिल रहा है, इधर-उधर देख रहा है और गोली चला रहा है।

अब, कल्पना कीजिए कि आप कंप्यूटर को यह सिखाने की कोशिश कर रहे हैं कि आपके कंट्रोलर इनपुट के आधार पर खेल में आगे ठीक क्या होने वाला है। यह वही है जिसे पेपर में "वर्ल्ड मॉडल" (World Model) कहा गया है।

समस्या: "स्प्रे एंड प्रे" (Spray and Pray) की गलती

कंप्यूटर को यह कौशल सिखाने के पिछले प्रयास एक अनाड़ी चित्रकार की तरह थे, जो जब एक कैनवास पर एक अकेला फूल पेंट करने के लिए कहा जाता है, तो गलती से पूरे चित्र पर पेंट छिड़क देता है।

तकनीकी शब्दों में, पुराने मॉडलों ने स्क्रीन के हर हिस्से के साथ एक जैसा व्यवहार किया। यदि आपने "फायर" बटन दबाया, तो मॉडल पूरी स्क्रीन को अपडेट करने की कोशिश करता था, यहाँ तक कि आकाश, दूर के पहाड़ों और आपके पीछे की दीवारों को भी। इस कारण वीडियो ग्लिच (glitch), विकृत या फ्रीज हो जाता था क्योंकि कंप्यूटर यह नहीं समझ पाता था कि केवल बंदूक और सामने के लक्ष्य वाले क्षेत्र को ही बदलना चाहिए जबकि बाकी दुनिया स्थिर रहनी चाहिए।

समाधान: SCOPE (द "स्मार्ट स्पॉटलाइट")

लेखकों ने SCOPE (सिमुलेटिंग क्रॉस-गेम ऑपरेशंस इन प्लेएबल एनवायरनमेंट्स) नामक एक नया सिस्टम बनाया।

SCOPE को एक स्मार्ट स्पॉटलाइट के रूप में समझें जो जानता है कि रोशनी कहाँ लगानी है।

  • द स्कोप (इन-स्कोप): जब आप गोली चलाते हैं, रीलोड करते हैं, या कूदते हैं, तो SCOPE केवल हथियार और उसके ठीक सामने के क्षेत्र पर एक स्पॉटलाइट लगा देता है। इसे पता होता है, "ठीक है, विस्फोट यहाँ होने वाला है; चलिए बस इसी हिस्से को एनिमेट करते हैं।"
  • द रेस्ट (आउट-ऑफ-स्कोप): बाकी सब कुछ—आकाश, फर्श, दूर की इमारतें—को बिना छेड़े या स्थिर छोड़ दिया जाता है, ठीक वैसे ही जैसे एक स्थिर कमरे में कैमरा पैन करता है।

जादू यह है कि SCOPE को किसी इंसान द्वारा यह बताने की ज़रूरत नहीं है कि बंदूक कहाँ है। यह विजुअल संकेतों को देखकर खुद ही यह सीख लेता है। यह समझ जाता है, "ओह, यहाँ एक बंदूक है, इसलिए यदि खिलाड़ी 'फायर' दबाता है, तो केवल इस पिक्सेल को प्रतिक्रिया देने की आवश्यकता है।"

ट्रेनिंग डेटा: द "क्रॉसFPS" (CrossFPS) डेटासेट

इस सिस्टम को सिखाने के लिए, शोधकर्ताओं को केवल एक गेम का उपयोग करने की आवश्यकता नहीं थी। उन्हें कंप्यूटर को शूटिंग के सार्वभौमिक नियमों को सिखाने के लिए अलग-अलग खेलों के एक विशाल पुस्तकालय की आवश्यकता थी, न कि केवल Call of Duty के विशिष्ट नियमों के लिए।

उन्होंने CrossFPS बनाया, जिसमें 7 अलग-अलग खेलों के 69,000 वीडियो क्लिप्स शामिल हैं।

  • उन्होंने "गेमी" रणनीतियों (जैसे हमेशा एक ही दुश्मन पर गोली चलाना) को हटा दिया ताकि कंप्यूटर खेल की फिजिक्स (जैसे, "यदि मैं स्टिक को बाईं ओर घुमाता हूँ, तो दुनिया दाईं ओर चलती है") को सीख सके, न कि केवल विशिष्ट स्तरों को याद कर सके।
  • उन्होंने वीडियो को सटीक कंट्रोलर मूवमेंट (10 अलग-अलग बटन और स्टिक्स) के साथ सिंक्रोनाइज़ किया ताकि कंप्यूटर कारण-और-प्रभाव के संबंध को पूरी तरह से देख सके।

यह कैसे काम करता है (द "शेफ" एनालॉजी)

कल्प dáng करें कि एक मुख्य शेफ (मुख्य AI मॉडल) है जो एक मानक भोजन बनाने में माहिर है।

  • पुराना तरीका: सहायक शेफ (एक्शन इनपुट) चिल्लाता है "नमक डालें!" और मुख्य शेफ नमक को चूल्हे पर रखे हर एक बर्तन में डाल देता है, जिससे सूप, सलाद और स्टेक सब खराब हो जाते हैं।
  • SCOPE तरीका: सहायक शेफ चिल्लाता है "नमक डालें!" लेकिन रसोई अब एक स्मार्ट डिलीवरी सिस्टम से लैस है। सिस्टम देखता है कि किस बर्तन में सूप है और नमक केवल उसी बर्तन में पहुँचाता है। सलाद और स्टेक अछूते रहते हैं।

पेपर में, यह "स्मार्ट डिलीवरी सिस्टम" AI के मस्तिष्क में डाला गया एक विशेष मॉड्यूल है जो हर एक पिक्सेल को व्यक्तिगत रूप से प्रोसेस करता है ताकि यह तय किया जा सके: "क्या मैं एक्शन ज़ोन का हिस्सा हूँ? हाँ? तो मैं प्रतिक्रिया दूँगा। नहीं? तो मैं शांत रहूँगा।"

परिणाम

जब उन्होंने SCOPE का परीक्षण किया:

  1. इसने अराजकता को संभाला: यह बिना वीडियो को धुंधला बनाए तेजी से फायरिंग, कूदने और मुड़ने को एक साथ संभाल सका।
  2. यह सामान्यीकरण (Generalization) कर सका: उन्होंने इसे एक ऐसा गेम दिखाया जिसे इसने पहले कभी नहीं देखा था (नए गेम वर्ल्ड की AI-जनरेटेड छवियों का उपयोग करके), और फिर भी यह सही ढंग से प्रतिक्रिया करना जानता था। इसे फिर से प्रशिक्षित करने की आवश्यकता नहीं थी; इसने बस 7 खेलों से सीखे गए नियमों को नए गेम पर लागू कर दिया।
  3. यह सटीक था: बैकग्राउंड स्थिर रहा जबकि एक्शन ठीक वहीं हुआ जहाँ उसे होना चाहिए था।

सारांश

यह पेपर AI को वीडियो गेम समझने का एक नया तरीका प्रस्तुत करता है। पूरी स्क्रीन को एक बड़े ढेर के रूप में देखने के बजाय जो एक साथ बदल जाता है, SCOPE AI को एक सटीक सर्जन बनना सिखाता है, जो केवल वहीं सूक्ष्म और सटीक बदलाव करता है जहाँ खिलाड़ी की क्रियाएं होती हैं, जबकि बाकी दुनिया को स्थिर रखता है। यह वास्तविक, इंटरैक्टिव गेम सिमुलेशन की अनुमति देता है जो हर बार शून्य से सिखाए बिना विभिन्न प्रकार के खेलों में काम कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →