← नवीनतम पेपर
🤖 AI

Coachable agents for interactive gameplay

यह शोध पत्र एक ऐसे ढांचे को प्रस्तुत करता है जो सार्वभौमिक मूल्य फलन सन्निकटों (universal value function approximators) को विशिष्ट प्रशिक्षण तकनीकों के साथ जोड़ता है ताकि वीडियो गेम और रोबोटिक्स जैसे विविध डोमेन में सुदृढीकरण शिक्षण (reinforcement learning) एजेंटों के लिए वास्तविक समय में, उपयोगकर्ता-नियंत्रित "शैली" संशोधनों को सक्षम किया जा सके, जिससे यह सुनिश्चित हो सके कि वे विशिष्ट व्यवहार संबंधी प्राथमिकताओं के अनुकूल होते हुए भी कार्य प्रदर्शन बनाए रखते हैं।

मूल लेखक: Roberto Capobianco (Sony AI, Zurich, Switzerland), Harm van Seijen (Sony AI, North America, various locations), Nolan D. Bard (Sony AI, North America, various locations), Neil Burch (Sony AI, North Am
प्रकाशित 2026-07-02
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Roberto Capobianco (Sony AI, Zurich, Switzerland), Harm van Seijen (Sony AI, North America, various locations), Nolan D. Bard (Sony AI, North America, various locations), Neil Burch (Sony AI, North America, various locations), Fatima Davelouis (Sony AI, North America, various locations), Josh Davidson (Sony AI, North America, various locations), Alisa Devlic (Sony AI, Zurich, Switzerland), Yunshu Du (Sony AI, North America, various locations), Ishan Durugkar (Sony AI, North America, various locations), Siddhant Gangapurwala (Sony AI, North America, various locations), Daniel Hernandez (Sony AI, North America, various locations), G. Zacharias Holland (Sony AI, North America, various locations), Sahil Jain (Sony AI, North America, various locations), Kenta Kawamoto (Sony AI, Tokyo, Japan), Raksha Kumaraswamy (Sony AI, North America, various locations), Patrick MacAlpine (Sony AI, North America, various locations), Dustin R. Morrill (Sony AI, North America, various locations), Declan Oller (Sony AI, North America, various locations), Francesco Riccio (Sony AI, Zurich, Switzerland), Akanksha Saran (Sony AI, North America, various locations), Craig Sherstan (Sony AI, Tokyo, Japan), Kaushik Subramanian (Sony AI, Zurich, Switzerland), Thomas J. Walsh (Sony AI, North America, various locations), Samuel Barrett (Sony AI, North America, various locations), Kizza N. Frisbee (Sony AI, North America, various locations), Mady Govil (Sony AI, North America, various locations), Johannes Günther (Sony AI, North America, various locations), Varun R. Kompella (Sony AI, North America, various locations), James A. MacGlashan (Sony AI, North America, various locations), Maxwell Svetlik (Sony AI, North America, various locations), Michael D. Thomure (Sony AI, North America, various locations), Jaden B. Travnik (Sony AI, North America, various locations), Kevin Waugh (Sony AI, North America, various locations), Elahe Aghapour (Sony AI, North America, various locations), Florian Fuchs (Sony AI, Zurich, Switzerland), Andreanne Lemay (Sony AI, North America, various locations), Shruti Mishra (Sony AI, Zurich, Switzerland), Takuma Seno (Sony AI, Tokyo, Japan), Peter Stone (Sony AI, North America, various locations), Michael Spranger (Sony AI, Tokyo, Japan), Peter R. Wurman (Sony AI, North America, various locations)

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, अत्यंत बुद्धिमान वीडियो गेम कैरेक्टर या एक रोबोट है जिसे जीतने के लिए प्रशिक्षित किया गया है। आमतौर पर, ये AI सिस्टम उन विशिष्ट एलीट एथलीटों की तरह होते हैं जिन्होंने जीतने का एक विशिष्ट तरीका महारत हासिल कर लिया है: सबसे तेज़, सबसे कुशल, "परफेक्ट" तरीका। यदि आप उनसे कमरा साफ करने के लिए कहते हैं, तो वे इसे सबसे कुशल पथ पर करते हैं। यदि वे रेस कार चलाते हैं, तो वे हर बार एक परफेक्ट रेसिंग लाइन लेते हैं।

लेकिन क्या होगा अगर आप "परफेक्ट" नहीं चाहते? क्या होगा अगर आप चाहते हैं कि वे एक लापरवाह स्टंटबाज की तरह गाड़ी चलाएं, या बच्चा सो रहा है इसलिए कमरे को शांति से साफ करें, या केवल एक विशिष्ट प्रकार के जादू का उपयोग करके वीडियो गेम बॉस से लड़ें?

यह शोध पत्र पेश करता है कि कैसे AI एजेंटों को प्रशिक्षित करने का एक नया तरीका है ताकि उन्हें बिना दोबारा प्रशिक्षित किए, चलते-फिरते अपना स्टाइल बदलने के लिए "कोच" (coach) किया जा सके।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "एक ही आकार के सभी के लिए" वाला एथलीट (The "One-Size-Fits-All" Athlete)

एक मानक AI एजेंट को एक फॉर्मूला 1 ड्राइवर के रूप में सोचें जिसने एक परफेक्ट लैप को याद कर लिया है। वे अविश्वसनीय रूप से तेज़ हैं, लेकिन यदि आप उनसे कहें कि "पर्यटक की तरह गाड़ी चलाएं" या "आक्रामक होकर गाड़ी चलाएं," तो उन्हें नहीं पता कि कैसे करना है। वे केवल जीतने के एक ही इष्टतम तरीके को जानते हैं। वास्तविक दुनिया में, उपयोगकर्ताओं को अक्सर इस बात से फर्क पड़ता है कि कार्य कैसे किया जाता है, न कि केवल इस बात से कि वह हो गया है।

2. समाधान: "स्टाइल कोच" (The "Style Coach")

शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जहाँ AI एक एकल व्यवहार के बजाय पूरे व्यवहारों के परिवार को सीखता है। वे इसे "स्टाइल-कंडीशन्ड" (Style-Conditioned) लर्निंग कहते हैं।

एक मानव कोच की कल्पना करें जो एक एथलीट से बात कर रहा है। केवल यह कहने के बजाय कि "तेज़ दौड़ो," कोच कहता है, "तेज़ दौड़ो, लेकिन अपने हाथ नीचे रखो," या "तेज़ दौड़ो, लेकिन चौड़े मोड़ लो।" एथलीट मुख्य कार्य (दौड़ना) करना सीखता है लेकिन अपने माध्यमिक आंदोलनों (स्टाइल) को कोच के निर्देशों के आधार पर समायोजित करता है।

इस शोध पत्र में, "कोच" निर्देशों का एक सेट है जो खेल शुरू करते समय AI को दिया जाता है। AI के पास एक "कंट्रोल नॉब" (जिसे स्टाइल वेक्टर कहा जाता है) होता है जिसे उपयोगकर्ता व्यवहार को तुरंत बदलने के लिए घुमा सकता है।

3. उन्होंने AI को कैसे सिखाया (द ट्रेनिंग जिम)

AI को ये शैलियाँ सिखाने के लिए, उन्होंने इसे केवल सामान्य रूप से खेलने नहीं दिया। उन्होंने विशेष प्रशिक्षण परिदृश्य बनाए:

  • रिवॉर्ड सिस्टम (इनाम प्रणाली): उन्होंने AI को दो प्रकार के अंक दिए।
    1. टास्क पॉइंट्स (कार्य अंक): दौड़ जीतने, दुश्मन को हराने या आगे बढ़ने के लिए अंक।
    2. स्टाइल पॉइंट्स (शैली अंक): इस बात के लिए अंक कि काम एक निश्चित तरीके से किया जाए। उदाहरण के लिए, "यदि आप अग्नि बाणों (fire arrows) का उपयोग करते हैं, तो अतिरिक्त अंक प्राप्त करें," या "यदि आप ईंधन बचाने के लिए धीरे गाड़ी चलाते हैं, तो अतिरिक्त अंक प्राप्त करें।"
  • "यूनिवर्सल" मस्तिष्क: उन्होंने एक विशेष प्रकार के AI मस्तिष्क (जिसे UVFA कहा जाता है) का उपयोग किया जो समझ सकता है कि "जीतना" लक्ष्य है, लेकिन "आप कैसे जीतते हैं" बदल सकता है। यह एक ऐसे शेफ की तरह है जो जानता है कि एक बेहतरीन स्टेक (मुख्य कार्य) कैसे बनाया जाए, लेकिन ग्राहक के पूछने पर तुरंत नमक, काली मिर्च या ट्रफल ऑयल के साथ उसका स्वाद बदलने में सक्षम है (स्टाइल)।

4. तीन टेस्ट ड्राइव

टीम ने यह साबित करने के लिए कि यह हर जगह काम करता है, तीन बहुत अलग दुनियाओं में इस "कोचेबल एजेंट" फ्रेमवर्क का परीक्षण किया:

  • रेस कार (ग्रैन टूरिस्मो 7):
    उन्होंने एक AI को रेस कार चलाने के लिए प्रशिक्षित किया। आमतौर पर, AI सबसे तेज़ समय जीतने के लिए गाड़ी चलाता है। इस नए सिस्टम के साथ, वे AI को बता सकते हैं: "ईंधन बचाने के लिए गाड़ी चलाएं" या "टायर बचाने के लिए गाड़ी चलाएं।"

    • परिणाम: AI ने ईंधन की रेंज को 60% तक बढ़ाने के लिए धीरे और सावधानी से गाड़ी चलाना सीखा, या स्टाइल के लिए कोनों पर ड्रिफ्ट करना सीखा, जबकि वह अभी भी रेस पूरी कर रहा था। वे केवल एक डायल घुमाकर इसे "आक्रामक रूप से गाड़ी चलाएं" या "रूढ़िवादी तरीके से गाड़ी चलाएं" भी कह सकते थे।
  • वीडियो गेम हीरो (होराइजन फॉरबिडन वेस्ट):
    यह सबसे बड़ा परीक्षण था। AI एक हीरो के रूप में खेल रहा था जो विशाल रोबोट जानवरों से लड़ रहा है। इस गेम में कई हथियार, जाल और तत्व संबंधी शक्तियां (आग, बर्फ, बिजली) हैं।

    • परिणाम: शोधकर्ता AI को बता सकते थे, "केवल जालों का उपयोग करके लड़ें," या "केवल अग्नि हथियारों का उपयोग करें," या "अपने सबसे शक्तिशाली हथियार का उपयोग न करें।"
    • AI ने केवल अंधाधुंध आज्ञा का पालन नहीं किया; वह स्मार्ट हो गया। यदि उसे "बर्फ" (Ice) का उपयोग करने के लिए कहा गया, तो वह दुश्मन को जमाने के लिए एक कमजोर बर्फ वाले हथियार को चुनेगा, फिर उन्हें जमाने के बाद खत्म करने के लिए एक शक्तिशाली हथियार पर स्विच करेगा। उसने शैलियों को संयोजित करना सीखा, जैसे एक विशिष्ट हथियार और एक विशिष्ट तत्व प्रभाव को एक साथ उपयोग करना।
  • रोबोट वॉकर (ह्यूमनॉइड):
    उन्होंने एक डिजिटल रोबोट को फर्श पर चलने के लिए प्रशिक्षित किया।

    • परिणाम: वे रोबोट को "छोटे कदम" या "लंबे कदम" के साथ चलने के लिए कह सकते थे, और यहाँ तक कि उसके हाथ की मुद्रा (जैसे ट्रे पकड़ना या हाथ हिलाना) को भी बदल सकते थे। रोबोट संतुलन बनाए रखते हुए तुरंत अपनी चलने की शैली बदल सकता था।

5. "रनटाइम" नियंत्रण का जादू

इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा यह है कि उपयोगकर्ता को AI को नया स्टाइल सीखने के लिए प्रतीक्षा करने की आवश्यकता नहीं है। AI प्रशिक्षण के दौरान ही सभी शैलियों को सीख लेता है।

जब उपयोगकर्ता वास्तव में खेल रहा होता है या रोबोट का उपयोग कर रहा होता है, तो वह रियल-टाइम (वास्तविक समय) में स्टाइल चुन सकता है।

  • उपमा: एक म्यूजिक प्लेयर की कल्पना करें। आमतौर पर, आपको अलग जॉनर सुनने के लिए एक नया गाना डाउनलोड करना पड़ता है। इस सिस्टम के साथ, AI एक DJ की तरह है जिसके पास हर जॉनर उसके दिमाग में है। आप एक बटन दबा सकते हैं, और वह संगीत को रोके बिना तुरंत "जैज़" (शांत, सुरक्षित ड्राइविंग) से "रॉक" (तेज़, आक्रामक ड्राइविंग) में स्विच कर सकता है।

सारांश

यह शोध पत्र दिखाता है कि हम AI एजेंटों को लचीला बनाना सिखा सकते हैं। एक कठोर रोबोट होने के बजाय जो केवल एक तरीका जानता है, ये "कोचेबल एजेंट" चलते-फिरते अपने व्यक्तित्व और रणनीति को अनुकूलित कर सकते हैं। चाहे वह ईंधन बचाने वाली रेस कार हो, विशिष्ट हथियारों का उपयोग करने वाला वीडियो गेम हीरो हो, या विशिष्ट चाल के साथ चलने वाला रोबोट हो, उपयोगकर्ता यह तय करता है कि काम कैसे किया जाए, न कि केवल यह कि काम हो जाए

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →