← नवीनतम पेपर
🤖 machine learning

Feedback Attribution and Representation Geometry: Metrics for Comparing Individual and Shared Rewards in MARL

यह शोध पत्र कम-ओवरहेड मेट्रिक्स, EffRank/nn और DactD_\text{act}, प्रस्तावित करता है ताकि यह प्रदर्शित किया जा सके कि सहकारी मल्टी-एजेंट आरएल (RL) में, सीखे गए रिप्रजेंटेशन की ज्यामिति मुख्य रूप से रिवॉर्ड एट्रिब्यूशन के बजाय प्रेक्षित भूमिका (role) जानकारी द्वारा निर्धारित होती है, जबकि रिवॉर्ड एट्रिब्यूशन मुख्य रूप से व्यवहारिक अंतरों में प्रकट होता है।

मूल लेखक: Tasha Pais, Richard Higgins

प्रकाशित 2026-07-21
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tasha Pais, Richard Higgins

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ दोस्तों का एक समूह मिलकर एक विशाल पहेली को सुलझाने की कोशिश कर रहा है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग (MARL) कहा जाता है। इसे ऐसे समझें जैसे रोबोटों के एक झुंड को फुटबॉल खेलना सिखाना या डिजिटल पात्रों की एक टीम को ड्रैगन से लड़ना सिखाना। पेचीदा हिस्सा उन्हें "फीडबैक" (प्रतिक्रिया) देने का तरीका तय करना है। पुराने दिनों में, यदि टीम जीत जाती थी, तो सभी को एक 'गोल्ड स्टार' मिलता था, चाहे उन्होंने वास्तव में गेंद को किक किया हो या वे बस खड़े रहे हों। इसे "शेयर्ड रिवॉर्ड" (साझा पुरस्कार) कहा जाता है। लेकिन क्या होगा अगर हम गोल्ड स्टार केवल उस रोबोट को दें जिसने वास्तव में गोल किया है? यह एक "इंडिविजुअल रिवॉर्ड" (व्यक्तिगत पुरस्कार) है।

वैज्ञानिक लंबे समय से सोचते आए हैं: क्या यह मायने रखता है कि हम ये गोल्ड स्टार कैसे बांटते हैं? क्या सभी को एक जैसा इनाम देने से रोबोट के दिमाग (उनके आंतरिक "रिप्रेजेंटेशन") एक उबाऊ, एक समान ढेर बन जाते हैं जहाँ हर कोई एक जैसा सोचता है? या क्या व्यक्तिगत श्रेय देना उनके दिमाग को विशिष्ट और विशेष बनाए रखने के लिए मजबूर करता है? यह शोध पत्र इसी प्रश्न की गहराई में जाता है, यह पूछता है कि क्या एक टीम को दिए जाने वाले पुरस्कार का तरीका उनके AI दिमाग की संरचना पर एक दृश्य छाप छोड़ता है, या यह केवल उनके काम करने के तरीके को बदलता है।

द ग्रेट रिवॉर्ड एक्सपेरिमेंट (महान पुरस्कार प्रयोग)

शोधकर्ताओं ने SMACv2 नामक एक वीडियो गेम में AI योद्धाओं की एक टीम के साथ जासूसी करने का निर्णय लिया। एक युद्धक्षेत्र की कल्पना करें जहाँ पाँच मित्रवत इकाइयाँ (आइए उन्हें "प्रोटोस" कहें) पाँच दुश्मनों से लड़ रही हैं। प्रत्येक मित्रवत इकाई का एक विशिष्ट कार्य है: कुछ तेज़ स्काउट (जासूस) हैं, कुछ भारी हमलावर हैं, और कुछ विशाल टैंक हैं। खेल में, AI देख सकता है कि वह वास्तव में किस प्रकार की इकाई है।

टीम ने इन AI एजेंटों को MAPPO नामक एक स्मार्ट लर्निंग एल्गोरिदम का उपयोग करके प्रशिक्षित किया। उन्होंने दो मुख्य प्रयोग चलाए:

  1. "टीम प्लेयर" मोड: प्रत्येक एजेंट को टीम के जीतने या हारने के आधार पर बिल्कुल एक ही इनाम मिला, चाहे उन्होंने कुछ भी किया हो।
  2. "स्टार प्लेयर" मोड: प्रत्येक एजेंट को केवल उस नुकसान (damage) के आधार पर इनाम मिला जो उन्होंने व्यक्तिगत रूप से पहुँचाया था।

बड़ा सवाल यह था: यदि हम "स्टार प्लेयर" से "टीम प्लेयर" पर स्विच करते हैं, तो क्या AI का आंतरिक मस्तिष्क मानचित्र ढह जाएगा? क्या स्काउट का दिमाग टैंक के दिमाग जैसा दिखने लगेगा क्योंकि वे सभी एक ही कुकी प्राप्त कर रहे हैं?

आश्चर्य: ब्रेन मैप नहीं बदला

यहाँ वह मोड़ आया जो शोधकर्ताओं ने पाया। शोधकर्ताओं को उम्मीद थी कि "टीम प्लेयर" मोड AI के दिमाग को उबाऊ और एक जैसा बना देगा। वे गलत थे।

उन्होंने EffRank/n नामक एक फैंसी गणितीय उपकरण का उपयोग करके AI के दिमाग के "आकार" को मापा (जो मूल रूप से यह जाँचता है कि दिमाग कितने अलग-अलग दिशाओं में सोच रहा है) और एक प्रोब (एक सरल परीक्षण यह देखने के लिए कि क्या आप केवल मस्तिष्क गतिविधि को देखकर किसी इकाई के काम का अनुमान लगा सकते हैं) का उपयोग किया।

परिणाम आश्चर्यजनक थे:

  • व्यक्तिगत पुरस्कारों के साथ: AI के दिमाग अलग थे। स्काउट, टैंक और भारी हमलावर मस्तिष्क मानचित्र के अलग-अलग "पड़ोसों" में रहते थे। प्रोब ने इकाई के काम का सही अनुमान लगभग 73% बार लगाया (जो रैंडम अनुमान लगाने के 33% के मुकाबले बहुत बेहतर है)।
  • साझा पुरस्कारों के साथ: AI के दिमाग लगभग एक जैसे ही दिखे। प्रोब ने अभी भी काम का सही अनुमान 75% बार लगाया। मस्तिष्क का "आकार" बिल्कुल भी नहीं सिमटा।

इसलिए, जिस तरह से वे गोल्ड स्टार बांट रहे थे, उसने AI के मस्तिष्क की संरचना को नहीं बदला। ज्यामिति (geometry) वैसी ही रही।

असली अपराधी: जो वे देख सकते थे

यदि पुरस्कार ने मस्तिष्क के आकार को नहीं बदला, तो किस चीज़ ने बदला? शोधकर्ताओं ने महसूस किया कि उत्तर उनकी आँखों के सामने छिपा था: अवलोकन (observation)

खेल में, प्रत्येक AI एजेंट को शुरू से ही बताया गया था, "आप एक स्काउट हैं" या "आप एक टैंक हैं।" यह ऐसा था जैसे अपनी नौकरी लिखी हुई वर्दी पहनना। क्योंकि AI अपने स्वयं के रोल (भूमिका) को देख सकता था, इसलिए उसका दिमाग स्वाभाविक रूप से उस विशिष्ट कार्य को संभालने के लिए खुद को व्यवस्थित करने लगा, भले ही सभी को एक ही पुरस्कार मिल रहा हो।

इसे साबित करने के लिए, शोधकर्ताओं ने एक चाल चली। उन्होंने अवलोकन को "मास्क" (छिपा) दिया, जिसका अर्थ था कि उन्होंने AI को बताया, "आप एक स्काउट हैं," लेकिन फिर उन्होंने स्क्रीन के उस हिस्से को ढक दिया जो AI को दिखाता था कि वह किस प्रकार की इकाई है। उन्होंने AI को यह नहीं बताया कि वह क्या है; उन्होंने बस उसे युद्ध की अराजकता से खुद को समझने दिया।

परिणाम नाटकीय था।

  • जब उन्होंने इकाई के प्रकार को छिपा दिया, तो प्रोब की सटीकता ~74% से गिरकर 49% (जो रैंडम अनुमान लगाने से मुश्किल से बेहतर है) हो गई।
  • मस्तिष्क मानचित्र में अलग-अलग "पड़ोस" एक एकल, बिखरे हुए ढेर में बदल गए।
  • यह "टीम प्लेयर" और "स्टार प्लेयर" दोनों समूहों के लिए हुआ।

इससे यह सिद्ध हुआ कि स्पष्ट, संगठित मस्तिष्क संरचना पुरस्कार प्रणाली के कारण नहीं थी। यह इसलिए थी क्योंकि AI अपनी भूमिका देख सकता था। एक बार जब आपने दृश्य संकेत हटा दिए, तो पुरस्कार प्रणाली अकेले एक विशिष्ट मस्तिष्क बनाने में सक्षम नहीं थी।

व्यवहार बनाम मस्तिष्क संरचना

तो, क्या पुरस्कार प्रणाली ने कुछ भी नहीं किया? पूरी तरह से नहीं। जबकि मस्तिष्क की संरचना वैसी ही रही, व्यवहार बदल गया।

जब एजेंटों को व्यक्तिगत पुरस्कार मिले ( "स्टार प्लेयर" मोड), तो वे एक-दूसरे से अधिक भिन्न रूप से कार्य करते थे। शोधकर्ताओं ने इसे Dact नामक एक मीट्रिक के साथ मापा, जो यह जाँचता है कि एजेंटों की हरकतें कितनी अलग हैं।

  • व्यक्तिगत पुरस्कार: एजेंटों के कार्यों में अधिक विविधता थी (Dact स्केल पर 1.23)।
  • साझा पुरस्कार: एजेंटों के कार्य थोड़े अधिक समान थे (Dact स्केल पर 1.07)।

संक्षेप में, व्यक्तिगत पुरस्कार देने से एजेंट अधिक रचनात्मक और अलग तरह से खेलते थे, लेकिन इसने उनके दिमाग को नए आकार में पुनर्गठित करने के लिए मजबूर नहीं किया। आकार पहले से ही वहां था क्योंकि वे देख सकते थे कि वे क्या होने के लिए बने हैं।

निष्कर्ष (The Takeaway)

शोध पत्र निष्कर्ष निकालता है कि यदि आप जानना चाहते हैं कि क्या एक AI टीम वास्तव में विशेषज्ञता हासिल कर रही है, तो आप केवल यह नहीं देख सकते कि उनके दिमाग कैसे व्यवस्थित हैं यदि वे "वर्दी" (अपनी भूमिका देखना) पहने हुए हैं। संगठन केवल उस चीज़ का प्रतिबिंब हो सकता है जो वे देख सकते हैं, न कि इस बात का कि उन्हें कैसे पुरस्कृत किया जा रहा है।

वास्तव में यह परीक्षण करने के लिए कि क्या एक पुरस्कार प्रणाली विशेष भूमिकाएँ बनाती है, आपको दृश्य संकेतों को हटाना होगा। इस विशिष्ट खेल में, पुरस्कार प्रणाली ने टीम के खेलने के तरीके (व्यवहार) को बदला, लेकिन उनके दिमाग की संरचना उस जानकारी द्वारा निर्धारित थी जो उन्हें देखने के लिए दी गई थी। शोधकर्ता सुझाव देते हैं कि भविष्य के परीक्षणों में "छिपी हुई भूमिकाओं" (hidden roles) का उपयोग किया जाना चाहिए—जहाँ AI को अपना काम नहीं पता होता—ताकी यह वास्तव में देखा जा सके कि क्या पुरस्कार शून्य से विशिष्ट मस्तिष्क बना सकते हैं।

उन्होंने "ट्राइबल विलेज" नामक एक अलग, बड़े खेल का भी परीक्षण किया जिसमें 48 एजेंट थे, और समान परिणाम पाए: मीट्रिक एजेंटों की क्षमता को माप सकते थे, लेकिन पुरस्कार के प्रकार ने मस्तिष्क की ज्यामिति में कोई स्पष्ट अंतर पैदा नहीं किया। उनके द्वारा बनाए गए उपकरण (EffRank/n और Dact) तेज़ और उपयोग में आसान हैं, जो 5% से भी कम अतिरिक्त कार्य जोड़ते हैं, जिससे वे यह जाँचने के लिए बेहतरीन हैं कि क्या AI टीमें वास्तव में मिलकर काम करना सीख रही हैं या केवल अपनी वर्दी को याद कर रही हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →