← नवीनतम पेपर
🤖 machine learning

Strategy, Not Payoffs: A Behavioural Embedding of Normal-Form Games

यह शोध पत्र नैश इक्विलिब्रियम एंट्रॉपी (Nash equilibrium entropy) और रिस्पॉन्स सेंसिटिविटी (response sensitivity) पर आधारित एक हल्का व्यवहार संबंधी एम्बेडिंग (behavioural embedding) प्रस्तावित करता है, जो सफलतापूर्वक यह भविष्यवाणी करता है कि विशिष्ट नॉर्म-फॉर्म गेम्स (normal-form games) पर फाइन-ट्यूनिंग करने से बड़े भाषा मॉडलों (large language models) में रणनीतिक क्षमताएं अनदेखे गेम्स में कैसे स्थानांतरित होती हैं, और यह उन मौजूदा स्ट्रक्चरल एम्बेडिंग्स से बेहतर प्रदर्शन करता है जो केवल गेम की पहचान को याद रखते हैं।

मूल लेखक: Joshua Caiata, Sreepriya Pulyassary, Xiang Li, Kate Larson

प्रकाशित 2026-07-31
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Joshua Caiata, Sreepriya Pulyassary, Xiang Li, Kate Larson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वीडियो गेम खेलना सिखा रहे हैं। आप सोच सकते हैं कि यदि आप उसे शतरंज (Chess) का उस्ताद बना देते हैं, तो वह अपने आप चेकर्स (Checkers) में भी बेहतर हो जाएगा क्योंकि दोनों में रणनीति शामिल है। लेकिन क्या होगा यदि शतरंज सिखाने से वह चेकर्स में और भी खराब हो जाए? यह वही पहेली है जिसे वैज्ञानिक आर्टिफिशियल इंटेलिजेंस (AI) के माध्यम से सुलझाने की कोशिश कर रहे हैं। विशेष रूप से, वे "लार्ज लैंग्वेज मॉडल्स" (LLMs) पर ध्यान केंद्रित कर रहे हैं—जो चैटबॉट्स के पीछे के अति-बुद्धिमान कंप्यूटर मस्तिष्क हैं। इन मॉडल्स को रणनीतिक खिलाड़ी के रूप में प्रशिक्षित किया जा रहा है जो सौदेबाजी, सहयोग और प्रतिस्पर्धा कर सकें। बड़ा सवाल यह है: क्या एक खेल सीखना मॉडल की दूसरे बिल्कुल अलग खेल खेलने की क्षमता में मदद करता है या उसे नुकसान पहुँचाता है?

इसे समझने के लिए, हमें कुछ बातें जाननी होंगी। पहला, गेम थ्योरी (खेल सिद्धांत) में, एक "नॉर्मल-फॉर्म गेम" (Normal-Form Game) केवल एक ऐसे स्थिति का शानदार नाम है जहाँ दो लोग एक ही समय में चुनाव करते हैं, और परिणाम इस बात पर निर्भर करता है कि उन दोनों ने क्या चुना (जैसे रॉक-पेपर-सिज़र्स)। दूसरा, "नैश इक्विलिब्रियम" (Nash Equilibrium) नामक एक अवधारणा है, जो मूल रूप से एक "परफेक्ट प्ले" रणनीति है जहाँ कोई भी व्यक्ति अपनी चाल बदलना नहीं चाहता यदि उसे पता हो कि दूसरा व्यक्ति क्या कर रहा है। अंत में, "फाइन-ट्यूनिंग" (Fine-tuning) एक सामान्य AI को किसी विशिष्ट कार्य के लिए गहन प्रशिक्षण देने की प्रक्रिया है। शोधकर्ता यह जानना चाहते थे: क्या खेल का "आकार" (नियम और प्रतिफल/payoffs) सीखने के लिए महत्वपूर्ण है, या यह खेल द्वारा आवश्यक व्यवहार के बारे में कुछ गहरा है?


रणनीति, स्कोरबोर्ड नहीं

इस अध्ययन में, यूनिवर्सिटी ऑफ वाटरलू के शोधकर्ताओं की एक टीम ने इन AI मॉडल्स के साथ एक बहुत ही सख्त स्कूल के छात्रों जैसा व्यवहार करने का निर्णय लिया। उन्होंने 49 अलग-अलग छोटे AI मॉडल्स लिए और उन्हें 15 क्लासिक खेलों का एक गहन प्रशिक्षण दिया, जिसमें प्रसिद्ध "प्रिजनर्स डिलेमा" (Prisoner's Dilemma) से लेकर "रॉक-पेपर-सिज़र्स" तक शामिल थे। लक्ष्य केवल यह देखना नहीं था कि क्या AI खेल सकता है; बल्कि यह देखना था कि क्या गेम A को सीखना AI को गेम B में बेहतर बनाता है या बदतर।

शोधकर्ताओं को संदेह था कि इस "ट्रांसफर" (स्थानांतरण) की भविष्यवाणी करने के पिछले तरीके मुख्य बिंदु को मिस कर रहे थे। कल्पना कीजिए कि आप यह अनुमान लगाने की कोशिश कर रहे हैं कि क्या गणित में अच्छा छात्र भौतिकी में भी अच्छा होगा। एक सरल तरीका बस यह कह सकता है, "ओह, वे दोनों विज्ञान की कक्षाएं हैं, इसलिए हाँ!" लेकिन यह बहुत अस्पष्ट है। शोधकर्ता एक बेहतर मानचित्र चाहते थे। उन्होंने एक नया तरीका प्रस्तावित किया जिससे एक खेल को केवल दो सरल संख्याओं का उपयोग करके वर्णित किया जा सकता है, जिसे उन्होंने ENT-SW कहा।

ENT (एंट्रॉपी/Entropy) को भ्रम (confusion) के माप के रूप में समझें।

  • यदि किसी खेल में एक स्पष्ट, स्पष्ट सर्वोत्तम चाल होती है (जैसे प्रिजनर्स डिलेमा में हमेशा "डिफेक्ट" चुनना), तो "भ्रम" कम होता है। रणनीति ठोस और स्थिर होती है।
  • यदि किसी खेल में आपको अप्रत्याशित रहने के लिए अपनी चालों को मिलाना (randomly mix up) पड़ता है (जैसे रॉक-पेपर-सिज़र्स), तो "भ्रम" अधिक होता है। रणनीति तरल और परिवर्तनशील होती है।

SW (स्विचिंग/Switching) को प्रतिक्रियाशीलता (reactivity) के माप के रूप में समझें।

  • कुछ खेलों में, आपकी सर्वोत्तम चाल वही रहती है चाहे आपका प्रतिद्वंद्वी कुछ भी करे। आपको प्रतिक्रिया देने की आवश्यकता नहीं है; आपको बस अपनी योजना पर टिके रहना है।
  • अन्य खेलों में, आपकी सर्वोत्तम चाल पूरी तरह से बदल जाती है यदि आपके प्रतिद्वंद्वी की चाल बदल जाए। यदि वे रॉक खेलते हैं, तो आप पेपर खेलते हैं। यदि वे सिज़र्स खेलते हैं, तो आप रॉक खेलते हैं। आपको एक गिरगिट की तरह होना पड़ता है, जो लगातार अपनी रणनीति बदलता रहता है।

टीम ने एक सरल मानचित्र बनाया जहाँ प्रत्येक खेल इन दो संख्याओं के आधार पर एक बिंदु है: रणनीति कितनी भ्रमित करने वाली है, और आपको अपनी चालें कितनी बार बदलनी पड़ती हैं।

महान प्रयोग

यह परीक्षण करने के लिए कि क्या यह मानचित्र काम करता है, शोधकर्ताओं ने एक विशाल सिमुलेशन चलाया। उन्होंने अपने 49 AI मॉडल्स को लिया और प्रत्येक को एक विशिष्ट खेल (स्रोत/Source) पर प्रशिक्षित किया। फिर, उन्होंने उसी प्रशिक्षित मॉडल का परीक्षण अन्य सभी खेलों (लक्ष्य/Targets) पर किया। उन्होंने मापा कि मॉडल में कितना सुधार हुआ या वह कितना खराब हुआ।

उन्होंने अपने नए ENT-SW मानचित्र की तुलना दो अन्य अनुमान विधियों से की:

  1. "आइडेंटिटी" बेसलाइन (The "Identity" Baseline): यह यह कहने जैसा है कि, "हम जानते हैं कि गेम A और गेम B क्या हैं, इसलिए आइए हम इतिहास को याद कर लें कि वे कैसे इंटरैक्ट करते हैं।" यह एक 'चीट कोड' है जो मानता है कि आपने पहले ही हर संभावित जोड़ी को देख लिया है।
  2. पुराने गेम थ्योरी मैप्स (Old Game Theory Maps): ये खेलों के जटिल, गणितीय विवरण हैं जिनका उपयोग वैज्ञानिक वर्षों से कर रहे हैं।

यहाँ मोड़ यह है: शोधकर्ताओं ने एक बहुत ही सख्त परीक्षण का उपयोग किया जिसे "लीव-वन-गेम-आउट" (Leave-One-Game-Out) कहा जाता है। इसका मतलब है कि उन्होंने मॉडल को 14 खेलों पर प्रशिक्षित किया और फिर उस 15वें खेल पर क्या होगा, इसकी भविष्यवाणी करने के लिए पूछा जिसे उसने पहले कभी नहीं देखा था। यह एक छात्र को 14 विषयों को पढ़ाने और फिर उन्हें एक बिल्कुल नए विषय पर टेस्ट करने जैसा है, बिना उन्हें उत्तर कुंजी देखने देने के।

आश्चर्यजनक परिणाम

परिणाम स्पष्ट और काफी आश्चर्यजनक थे।

1. पुराने मानचित्र विफल रहे: खेलों के जटिल, पारंपरिक गणितीय मानचित्र (जो प्रतिफल के कच्चे नंबरों को देखते हैं) उस खेल पर परीक्षण किए जाने पर बुरी तरह विफल रहे जिसे AI ने पहले कभी नहीं देखा था। वे अनुमान लगाने के समान ही अच्छे थे, या कभी-कभी उससे भी बदतर। वे केवल खेलों के विशिष्ट नामों को याद कर रहे थे बजाय इसके कि वे अंतर्निहित तर्क को समझें।

2. "आइडेंटिटी" चीट कोड: जैसा कि अपेक्षित था, यदि आप केवल खेलों की विशिष्ट जोड़ी (जैसे, "प्रिजनर्स डिलेमा से स्टैग हंट") को याद कर लेते, तो आप परिणाम की बहुत अच्छी भविष्यवाणी कर सकते थे। लेकिन यह आपको नए खेलों के साथ मदद नहीं करता है।

3. ENT-SW की विजय: सरल दो-संख्या वाला मानचित्र (भ्रम + प्रतिक्रियाशीलता) एकमात्र तरीका था जिसने सफलतापूर्वक भविष्यवाणी की कि एक पूरी तरह से नए, अनदेखे खेल पर AI कैसा प्रदर्शन करेगा। इसने "आइडेंटिटी" बेसलाइन को भी पछाड़ दिया।

शोधकर्ताओं ने पाया कि दो खेलों की विशिष्ट जोड़ी सबसे अधिक मायने रखती थी। वास्तव में, गेम पेयर की संरचना ने परिणामों का 77.1% समझाया, जबकि केवल विशिष्ट AI मॉडल ने केवल 2.8% समझाया। इसका अर्थ यह है कि आप कौन सा AI उपयोग करते हैं इससे कोई फर्क नहीं पड़ता; जो मायने रखता है वह है खेलों द्वारा आवश्यक रणनीति का "आकार"।

"हारमनी" का जाल (The "Harmony" Trap)

मानचित्र में एक दिलचस्प जाल था। शोधकर्ताओं ने पाया कि "हारमनी" (Harmony) गेम और "प्रिजनर्स डिलेमा" (Prisoner's Dilemma) ENT-SW मानचित्र पर लगभग एक जैसे दिखते थे। दोनों में कम भ्रम (एक स्पष्ट सर्वोत्तम चाल) और कम स्विचिंग (आपको प्रतिक्रिया देने की आवश्यकता नहीं है) थी।

हालाँकि, वे व्यवहारिक रूप से विपरीत थे!

  • हारमनी में, सबसे अच्छी चाल सहयोग (cooperate) करना है।
  • प्रिजनर्स डिलेमा में, सबसे अच्छी चाल स्वार्थी रूप से डिफेक्ट (selfishly defect) करना है।

यदि आप एक AI को प्रिजनर्स डिलेमा पर "स्वार्थी डिफैक्टर" बनने के लिए प्रशिक्षित करते हैं, तो वह हारमनी खेलते समय बुरी तरह विफल हो जाएगा, भले ही मानचित्र कहता हो कि दोनों गेम एक जैसे हैं। मानचित्र ने निर्णय के आकार को पकड़ लिया (यह एक सीधी रेखा है, स्विचिंग नहीं), लेकिन यह नहीं देख सका कि रेखा किस दिशा में इशारा करती है (दयालुता या स्वार्थ की ओर)। इस सीमा के बावजूद, ENT-SW मानचित्र अभी भी सबसे अच्छा भविष्यवक्ता था जो शोधकर्ता खोज सके, जिससे सिद्ध हुआ कि निर्णय लेने की प्रक्रिया की संरचना स्कोरबोर्ड पर दिए गए कच्चे नंबरों से अधिक महत्वपूर्ण है।

इसका क्या अर्थ है

यह अध्ययन बताता है कि जब AI खेल खेलना सीखता है, तो वह केवल नियमों या अंकों को याद नहीं कर रहा होता है। वह स्थिति की व्यवहार संबंधी मांगों (behavioral demands) को सीख रहा होता है। क्या स्थिति ऐसी है जहाँ आपको स्थिर और आत्मविश्वासी होने की आवश्यकता है? या क्या यह ऐसी स्थिति है जहाँ आपको प्रतिक्रियाशील और लचीला होने की आवश्यकता है?

शोधकर्ता सुझाव देते हैं कि यदि हम ऐसे स्मार्ट AI बनाना चाहते हैं जो एक कार्य से दूसरे कार्य में अपने कौशल को स्थानांतरित कर सके, तो हमें केवल खेल के नियमों या प्रतिफलों को नहीं देखना चाहिए। हमें आवश्यक रणनीति के "व्यक्तित्व" को समझने की आवश्यकता है। "भ्रम" और "स्विचिंग" के एक सरल दो-विशेषता वाले मानचित्र का उपयोग करके, हम यह भविष्यवाणी कर सकते हैं कि एक AI एक नए, अनदेखे चैलेंज को कैसे संभालेगा, भले ही उसने उस चैलेंज को पहले कभी न देखा हो।

हालाँकि यह अध्ययन 15 खेलों और छोटे AI मॉडल्स तक सीमित था, लेकिन इसके निष्कर्ष मशीनों के सीखने के तरीके के बारे में सोचने का एक नया तरीका प्रदान करते हैं। यह पता चलता है कि रणनीति की दुनिया में, यह स्कोर के बारे में नहीं है; यह खेल के आकार के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →