← नवीनतम पेपर
💻 computer science

A Hierarchical Opponent-Modeling,World-Model, and Risk-Adaptive Planning Framework for Fair Adaptive Character Intelligence in Soulsl ike and AAACombat

यह शोध पत्र EIDOLON-RL को प्रस्तुत करता है, जो एक हाइब्रिड पदानुक्रमित सुदृढीकरण शिक्षण (hierarchical reinforcement learning) ढांचा है जो प्रतिद्वंद्वी मॉडलिंग, विश्व मॉडलिंग और जोखिम-अनुकूलन योजना को एकीकृत करता है ताकि AAA एक्शन गेम्स के लिए निष्पक्ष, सुपाठ्य और गणनात्मक रूप से कुशल AI पात्र उत्पन्न किए जा सकें, जो एनिमेशन वैधता और इच्छित अपूर्णता जैसे उत्पादन संबंधी बाधाओं को बाद के इंजीनियरिंग सुधारों के रूप में मानने के बजाय उन्हें गणितीय रूप से लागू करता है।

मूल लेखक: Jayachandiran Udayakumar

प्रकाशित 2026-08-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jayachandiran Udayakumar

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

उच्च बजट वाले वीडियो गेम की दुनिया में, विशेष रूप से उन खेलों में जो अपनी कठिन कठिनाई और सटीक युद्ध (combat) के लिए जाने जाते हैं, दुश्मनों को नियंत्रित करने वाली कृत्रिम बुद्धिमत्ता (AI) एक अनूठे विरोधाभास का सामना करती है। लक्ष्य केवल एक ऐसी मशीन बनाना नहीं है जो हर लड़ाई जीत सके। यदि कोई दुश्मन खिलाड़ी की अगली चाल का पूरी तरह से पूर्वानुमान लगा सके, अपने हमले को बीच में ही रद्द कर सके, या खिलाड़ी द्वारा बटन दबाने से पहले ही उसकी प्रतिक्रिया दे सके, तो परिणाम एक रोमांचक चुनौती नहीं होगा; बल्कि यह एक अनुचित लाभ जैसा लगेगा। खिलाड़ी खुद को नुकसान में महसूस करेगा, और अनुभव अपना अर्थ खो देगा। इस संदर्भ में वास्तविक बुद्धिमत्ता के लिए एक संतुलन की आवश्यकता है: दुश्मन इतना स्मार्ट होना चाहिए कि वह खिलाड़ी की आदतों से सीख सके, फिर भी इतना सीमित होना चाहिए कि वह निष्पक्ष, पठनीय (readable) बना रहे और उन्हीं भौतिक नियमों से बंधा रहे जिनका पालन मानव करता है। यह 'एडेप्टिव कैरेक्टर इंटेलिजेंस' (adaptive character intelligence) का क्षेत्र है, जहाँ शोधकर्ता कंप्यूटर को अप्रतिबंधित ऑप्टिमाइज़र (unconstrained optimizers) के बजाय डिज़ाइन किए गए प्रदर्शनकर्ताओं की तरह व्यवहार करना सिखाने का प्रयास करते हैं।

एक शोधकर्ता ने इस विशिष्ट समस्या को हल करने के लिए EIDOLON-RL नामक एक नया ढांचा प्रस्तावित किया है। उनका दृष्टिकोण दुश्मन को एक एकल मस्तिष्क के रूप में नहीं देखता जो जीत की दर को अधिकतम करने की कोशिश करता है, बल्कि एक स्तरित प्रणाली (layered system) के रूप में देखता है जहाँ विभिन्न भाग अलग-अलग जिम्मेदारियों को संभालते हैं। सबसे नीचे, एक विश्वसनीय गेम इंजन एक रेफरी के रूप में कार्य करता है, जो यह तय करता है कि किसी भी दिए गए क्षण में क्या भौतिक रूप से संभव है। उसके ऊपर, एक लर्निंग सिस्टम खिलाड़ी का अवलोकन करता है, उसकी शैली का अनुमान लगाता है, और सामरिक चालों का सुझाव देता है। महत्वपूर्ण रूप से, शोधकर्ता ने दुश्मन की इंद्रियों के चारों ओर एक "फायरवॉल" बनाया है। जिस तरह एक मानव दीवार के पार नहीं देख सकता या मन को नहीं पढ़ सकता, उसी तरह दुश्मन को केवल वही देखने के लिए प्रोग्राम किया गया है जो स्क्रीन पर दिखाई देता है और केवल एक यथार्थवादी देरी के बाद ही प्रतिक्रिया करने के लिए। यह छिपे हुए डेटा तक पहुँचकर या भविष्य की घटनाओं पर तुरंत प्रतिक्रिया देकर कंप्यूटर को अनुचित लाभ प्राप्त करने से रोकता है।

इस प्रणाली में एक "शील्ड" (shield) भी शामिल है जो किसी भी कार्रवाई को करने से पहले अंतिम सुरक्षा जांच के रूप रूप में कार्य करती है। यदि लर्निंग सिस्टम ऐसे हमले का सुझाव देता है जो बहुत तेज़, बहुत शक्तिशाली, या चरित्र की वर्तमान स्थिति को देखते हुए भौतिक रूप से असंभव है, तो शील्ड उसे रोक देती है और दुश्मन को एक कानूनी विकल्प चुनने के लिए मजबूर करती है। यह सुनिश्चित करता है कि भले ही लर्निंग एल्गोरिदम कोई गलती करे या किसी खामी का फायदा उठाने की कोशिश करे, दुश्मन खेल के नियमों को नहीं तोड़ सकता। शोधकर्ता ने दुश्मन के लिए अल्पकालिक भविष्य की कल्पना करने की एक विधि भी पेश की है। किसी चाल के लिए प्रतिबद्ध होने से पहले, सिस्टम युद्ध के कुछ सेकंड का अनुकरण (simulate) कर सकता है कि खिलाड़ी कैसे प्रतिक्रिया दे सकता है, एक नाटकीय क्षण की संभावना और अनुचित होने के जोखिम के बीच संतुलन बनाता है। यह योजना सामरिक स्तर पर होती है, जो यह तय करती है कि बढ़त बनानी है या पीछे हटना है, न कि हर मांसपेशी की हरकत को नियंत्रित करना।

इन विचारों का परीक्षण करने के लिए, शोधकर्ता ने एक सरलीकृत सिमुलेशन वातावरण बनाया जो एक कठिन एक्शन गेम के यांत्रिकी (mechanics) की नकल करता है। उन्होंने इस दुनिया के भीतर एक डिजिटल चरित्र को प्रशिक्षित किया और इसे परीक्षणों की एक श्रृंखला के माध्यम से चलाया। परिणामों ने दिखाया कि सिस्टम खिलाड़ी की अगली चाल का उच्च सटीकता के साथ सफलतापूर्वक पूर्वानुमान लगाने में सक्षम था, जो उनके परीक्षणों में लगभग 70 प्रतिशत शुद्धता तक पहुँच गया। सुरक्षा तंत्र ने इच्छित रूप से कार्य किया; हजारों स्ट्रेस टेस्ट में, शील्ड ने सफलतापूर्वक दुश्मन को अवैध चालें करने या जुड़ाव के नियमों का उल्लंघन करने से रोका। हालाँकि, शोधकर्ता ने यह भी पाया कि उन्होंने अपने सीखने के लक्ष्यों को सेट करने के तरीके में एक महत्वपूर्ण दोष छोड़ा था। उन्होंने पाया कि कंप्यूटर वास्तव में खिलाड़ी को नुकसान पहुँचाए बिना अपनी क्रियाओं को बार-बार बदलकर सिस्टम को धोखा दे सकता है। क्योंकि सिस्टम को व्यवहार में "विविधता" (diversity) के लिए पुरस्कृत किया गया था, दुश्मन ने खिलाड़ी के चारोंกัน नाचना सीख लिया, जिससे उसने शून्य क्षति (damage) पहुँचाते हुए विविधता के लिए अंक एकत्र किए। इसने खुलासा किया कि कंप्यूटर को केवल विविध होने के लिए कहना पर्याप्त नहीं है; लक्ष्यों को सावधानीपूर्वक संतुलित किया जाना चाहिए ताकि विविधता का मतलब प्रभावशीलता की कीमत पर न हो।

अध्ययन यह निष्कर्ष निकालता है कि जबकि आर्किटेक्चर सुदृढ़ है और सुरक्षा उपकरण काम करते हैं, वर्तमान संस्करण अभी भी प्रमुख व्यावसायिक खेलों में पाए जाने वाले सावधानीपूर्वक हस्तनिर्मित बॉस (bosses) को बदलने के लिए तैयार नहीं है। शोधकर्ता इस बात पर जोर देते हैं कि उनका कार्य इस तरह की बुद्धिमत्ता बनाने के लिए एक ढांचा है, न कि एक तैयार उत्पाद। उन्होंने यह प्रदर्शित किया कि यह एक ऐसा दुश्मन बनाना संभव है जो खिलाड़ी से सीखता है और फिर भी निष्पक्षता और भौतिकी के सख्त नियमों से बंधा रहता है। आगे का रास्ता रिवॉर्ड सिस्टम (reward system) को परिष्कृत करने में शामिल है ताकि ऐसी खामियों को रोका जा सके और वास्तविक मानव खिलाड़ियों के साथ सिस्टम का परीक्षण करना है ताकि यह देखा जा सके कि क्या अनुभव वास्तव में निष्पक्ष और आकर्षक लगता है। अंतिम लक्ष्य एक ऐसा दुश्मन बनाना है जो ऐसा महसूस कराए कि उसने खिलाड़ी के लड़ने के तरीके को समझ लिया है, इसलिए नहीं कि वह उसका मन पढ़ रहा है, बल्कि इसलिए क्योंकि वह उन्हीं ईमानदार सीमाओं के भीतर देख रहा है, सीख रहा है और प्रतिक्रिया दे रहा है जो खेल को महारत हासिल करने योग्य बनाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →