Coachable agents for interactive gameplay
यह शोध पत्र एक ऐसे ढांचे को प्रस्तुत करता है जो सार्वभौमिक मूल्य फलन सन्निकटों (universal value function approximators) को विशिष्ट प्रशिक्षण तकनीकों के साथ जोड़ता है ताकि वीडियो गेम और रोबोटिक्स जैसे विविध डोमेन में सुदृढीकरण शिक्षण (reinforcement learning) एजेंटों के लिए वास्तविक समय में, उपयोगकर्ता-नियंत्रित "शैली" संशोधनों को सक्षम किया जा सके, जिससे यह सुनिश्चित हो सके कि वे विशिष्ट व्यवहार संबंधी प्राथमिकताओं के अनुकूल होते हुए भी कार्य प्रदर्शन बनाए रखते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक शानदार, अत्यंत बुद्धिमान वीडियो गेम कैरेक्टर या एक रोबोट है जिसे जीतने के लिए प्रशिक्षित किया गया है। आमतौर पर, ये AI सिस्टम उन विशिष्ट एलीट एथलीटों की तरह होते हैं जिन्होंने जीतने का एक विशिष्ट तरीका महारत हासिल कर लिया है: सबसे तेज़, सबसे कुशल, "परफेक्ट" तरीका। यदि आप उनसे कमरा साफ करने के लिए कहते हैं, तो वे इसे सबसे कुशल पथ पर करते हैं। यदि वे रेस कार चलाते हैं, तो वे हर बार एक परफेक्ट रेसिंग लाइन लेते हैं।
लेकिन क्या होगा अगर आप "परफेक्ट" नहीं चाहते? क्या होगा अगर आप चाहते हैं कि वे एक लापरवाह स्टंटबाज की तरह गाड़ी चलाएं, या बच्चा सो रहा है इसलिए कमरे को शांति से साफ करें, या केवल एक विशिष्ट प्रकार के जादू का उपयोग करके वीडियो गेम बॉस से लड़ें?
यह शोध पत्र पेश करता है कि कैसे AI एजेंटों को प्रशिक्षित करने का एक नया तरीका है ताकि उन्हें बिना दोबारा प्रशिक्षित किए, चलते-फिरते अपना स्टाइल बदलने के लिए "कोच" (coach) किया जा सके।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं का उपयोग करते हुए:
1. समस्या: "एक ही आकार के सभी के लिए" वाला एथलीट (The "One-Size-Fits-All" Athlete)
एक मानक AI एजेंट को एक फॉर्मूला 1 ड्राइवर के रूप में सोचें जिसने एक परफेक्ट लैप को याद कर लिया है। वे अविश्वसनीय रूप से तेज़ हैं, लेकिन यदि आप उनसे कहें कि "पर्यटक की तरह गाड़ी चलाएं" या "आक्रामक होकर गाड़ी चलाएं," तो उन्हें नहीं पता कि कैसे करना है। वे केवल जीतने के एक ही इष्टतम तरीके को जानते हैं। वास्तविक दुनिया में, उपयोगकर्ताओं को अक्सर इस बात से फर्क पड़ता है कि कार्य कैसे किया जाता है, न कि केवल इस बात से कि वह हो गया है।
2. समाधान: "स्टाइल कोच" (The "Style Coach")
शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जहाँ AI एक एकल व्यवहार के बजाय पूरे व्यवहारों के परिवार को सीखता है। वे इसे "स्टाइल-कंडीशन्ड" (Style-Conditioned) लर्निंग कहते हैं।
एक मानव कोच की कल्पना करें जो एक एथलीट से बात कर रहा है। केवल यह कहने के बजाय कि "तेज़ दौड़ो," कोच कहता है, "तेज़ दौड़ो, लेकिन अपने हाथ नीचे रखो," या "तेज़ दौड़ो, लेकिन चौड़े मोड़ लो।" एथलीट मुख्य कार्य (दौड़ना) करना सीखता है लेकिन अपने माध्यमिक आंदोलनों (स्टाइल) को कोच के निर्देशों के आधार पर समायोजित करता है।
इस शोध पत्र में, "कोच" निर्देशों का एक सेट है जो खेल शुरू करते समय AI को दिया जाता है। AI के पास एक "कंट्रोल नॉब" (जिसे स्टाइल वेक्टर कहा जाता है) होता है जिसे उपयोगकर्ता व्यवहार को तुरंत बदलने के लिए घुमा सकता है।
3. उन्होंने AI को कैसे सिखाया (द ट्रेनिंग जिम)
AI को ये शैलियाँ सिखाने के लिए, उन्होंने इसे केवल सामान्य रूप से खेलने नहीं दिया। उन्होंने विशेष प्रशिक्षण परिदृश्य बनाए:
- रिवॉर्ड सिस्टम (इनाम प्रणाली): उन्होंने AI को दो प्रकार के अंक दिए।
- टास्क पॉइंट्स (कार्य अंक): दौड़ जीतने, दुश्मन को हराने या आगे बढ़ने के लिए अंक।
- स्टाइल पॉइंट्स (शैली अंक): इस बात के लिए अंक कि काम एक निश्चित तरीके से किया जाए। उदाहरण के लिए, "यदि आप अग्नि बाणों (fire arrows) का उपयोग करते हैं, तो अतिरिक्त अंक प्राप्त करें," या "यदि आप ईंधन बचाने के लिए धीरे गाड़ी चलाते हैं, तो अतिरिक्त अंक प्राप्त करें।"
- "यूनिवर्सल" मस्तिष्क: उन्होंने एक विशेष प्रकार के AI मस्तिष्क (जिसे UVFA कहा जाता है) का उपयोग किया जो समझ सकता है कि "जीतना" लक्ष्य है, लेकिन "आप कैसे जीतते हैं" बदल सकता है। यह एक ऐसे शेफ की तरह है जो जानता है कि एक बेहतरीन स्टेक (मुख्य कार्य) कैसे बनाया जाए, लेकिन ग्राहक के पूछने पर तुरंत नमक, काली मिर्च या ट्रफल ऑयल के साथ उसका स्वाद बदलने में सक्षम है (स्टाइल)।
4. तीन टेस्ट ड्राइव
टीम ने यह साबित करने के लिए कि यह हर जगह काम करता है, तीन बहुत अलग दुनियाओं में इस "कोचेबल एजेंट" फ्रेमवर्क का परीक्षण किया:
रेस कार (ग्रैन टूरिस्मो 7):
उन्होंने एक AI को रेस कार चलाने के लिए प्रशिक्षित किया। आमतौर पर, AI सबसे तेज़ समय जीतने के लिए गाड़ी चलाता है। इस नए सिस्टम के साथ, वे AI को बता सकते हैं: "ईंधन बचाने के लिए गाड़ी चलाएं" या "टायर बचाने के लिए गाड़ी चलाएं।"- परिणाम: AI ने ईंधन की रेंज को 60% तक बढ़ाने के लिए धीरे और सावधानी से गाड़ी चलाना सीखा, या स्टाइल के लिए कोनों पर ड्रिफ्ट करना सीखा, जबकि वह अभी भी रेस पूरी कर रहा था। वे केवल एक डायल घुमाकर इसे "आक्रामक रूप से गाड़ी चलाएं" या "रूढ़िवादी तरीके से गाड़ी चलाएं" भी कह सकते थे।
वीडियो गेम हीरो (होराइजन फॉरबिडन वेस्ट):
यह सबसे बड़ा परीक्षण था। AI एक हीरो के रूप में खेल रहा था जो विशाल रोबोट जानवरों से लड़ रहा है। इस गेम में कई हथियार, जाल और तत्व संबंधी शक्तियां (आग, बर्फ, बिजली) हैं।- परिणाम: शोधकर्ता AI को बता सकते थे, "केवल जालों का उपयोग करके लड़ें," या "केवल अग्नि हथियारों का उपयोग करें," या "अपने सबसे शक्तिशाली हथियार का उपयोग न करें।"
- AI ने केवल अंधाधुंध आज्ञा का पालन नहीं किया; वह स्मार्ट हो गया। यदि उसे "बर्फ" (Ice) का उपयोग करने के लिए कहा गया, तो वह दुश्मन को जमाने के लिए एक कमजोर बर्फ वाले हथियार को चुनेगा, फिर उन्हें जमाने के बाद खत्म करने के लिए एक शक्तिशाली हथियार पर स्विच करेगा। उसने शैलियों को संयोजित करना सीखा, जैसे एक विशिष्ट हथियार और एक विशिष्ट तत्व प्रभाव को एक साथ उपयोग करना।
रोबोट वॉकर (ह्यूमनॉइड):
उन्होंने एक डिजिटल रोबोट को फर्श पर चलने के लिए प्रशिक्षित किया।- परिणाम: वे रोबोट को "छोटे कदम" या "लंबे कदम" के साथ चलने के लिए कह सकते थे, और यहाँ तक कि उसके हाथ की मुद्रा (जैसे ट्रे पकड़ना या हाथ हिलाना) को भी बदल सकते थे। रोबोट संतुलन बनाए रखते हुए तुरंत अपनी चलने की शैली बदल सकता था।
5. "रनटाइम" नियंत्रण का जादू
इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा यह है कि उपयोगकर्ता को AI को नया स्टाइल सीखने के लिए प्रतीक्षा करने की आवश्यकता नहीं है। AI प्रशिक्षण के दौरान ही सभी शैलियों को सीख लेता है।
जब उपयोगकर्ता वास्तव में खेल रहा होता है या रोबोट का उपयोग कर रहा होता है, तो वह रियल-टाइम (वास्तविक समय) में स्टाइल चुन सकता है।
- उपमा: एक म्यूजिक प्लेयर की कल्पना करें। आमतौर पर, आपको अलग जॉनर सुनने के लिए एक नया गाना डाउनलोड करना पड़ता है। इस सिस्टम के साथ, AI एक DJ की तरह है जिसके पास हर जॉनर उसके दिमाग में है। आप एक बटन दबा सकते हैं, और वह संगीत को रोके बिना तुरंत "जैज़" (शांत, सुरक्षित ड्राइविंग) से "रॉक" (तेज़, आक्रामक ड्राइविंग) में स्विच कर सकता है।
सारांश
यह शोध पत्र दिखाता है कि हम AI एजेंटों को लचीला बनाना सिखा सकते हैं। एक कठोर रोबोट होने के बजाय जो केवल एक तरीका जानता है, ये "कोचेबल एजेंट" चलते-फिरते अपने व्यक्तित्व और रणनीति को अनुकूलित कर सकते हैं। चाहे वह ईंधन बचाने वाली रेस कार हो, विशिष्ट हथियारों का उपयोग करने वाला वीडियो गेम हीरो हो, या विशिष्ट चाल के साथ चलने वाला रोबोट हो, उपयोगकर्ता यह तय करता है कि काम कैसे किया जाए, न कि केवल यह कि काम हो जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।