← नवीनतम पेपर
🤖 AI

InfoChess: A Game of Adversarial Inference and a Laboratory for Quantifiable Information Control

यह शोध पत्र InfoChess प्रस्तुत करता है, जो एक नवीन प्रतिकूल खेल (adversarial game) है जिसे आंशिक दृश्यता (partial observability) के तहत मल्टी-एजेंट अनुमान का अध्ययन करने के लिए एक टेस्टबेड के रूप में डिज़ाइन किया गया है, जिसमें मोहरे की कैप्चरिंग को राजा के स्थान पर आधारित संभाव्य स्कोरिंग से प्रतिस्थापित किया गया है, और यह रणनीतिक सूचना नियंत्रण के विश्लेषण के लिए नए सूचना-सैद्धांतिक मेट्रिक्स के साथ सुदृढीकरण शिक्षण (reinforcement learning) एजेंटों की प्रभावशीलता को प्रदर्शित करता है।

मूल लेखक: Kieran A. Murphy

प्रकाशित 2026-04-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kieran A. Murphy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए शतरंज के एक खेल की, लेकिन एक ट्विस्ट के साथ: कोई भी मोहरा काट नहीं सकता। आप प्रतिद्वंद्वी के प्यादों, घोड़ों या यहाँ तक कि उनके राजा को भी नहीं खा सकते। वास्तव में, "जीतने" का तरीका भी चेकमेट करना नहीं है, बल्कि यह अनुमान लगाना है कि प्रतिद्वंद्वी का राजा कहाँ छिपा हुआ है।

यह InfoChess है, एक नया खेल जिसे शोधकर्ताओं ने यह अध्ययन करने के लिए बनाया है कि कैसे बुद्धिमान एजेंट (जैसे AI) एक-दूसरे पर जासूसी करना सीखते हैं जबकि वे अपने स्वयं के रहस्यों को छिपाते हैं।

यहाँ इस पेपर का सरल उपमाओं के साथ विवरण दिया गया है:

1. खेल: "हॉट और कोल्ड" का एक खेल

साधारण शतरंज में, लक्ष्य दुश्मन को नष्ट करना होता है। InfoChess में, लक्ष्य सूचना (Information) है।

  • सेटअप: यह एक मानक 8x8 बोर्ड पर खेला जाता है। दुश्मन का राजा चार गुप्त स्थानों में से एक में शुरू होता है।
  • नियम: आप अपने मोहरे चलते हैं। कुछ मोहरे टॉर्च (Flashlights) की तरह काम करते हैं (हाथी और ऊँट), जो एक लंबी रेखा वाले खानों को उजागर करते हैं। अन्य दीवारों (Walls) की तरह काम करते हैं (प्यादे), जो दुश्मन के दृश्य को रोकते हैं।
  • चुनौती: आप कभी भी पूरा बोर्ड नहीं देख पाते। आप केवल वही देखते हैं जो आपके मोहरे "देख" सकते हैं।
  • स्कोर: हर टर्न के अंत में, आपको इस आधार पर अंक मिलते हैं कि आप दुश्मन के राजा के स्थान के बारे में कितने आश्वस्त हैं। यदि आपको लगता है कि 90% संभावना है कि राजा वर्ग A पर है, और राजा वास्तव में वहीं है, तो आपको उच्च स्कोर मिलता है। यदि आपका अनुमान गलत निकलता है, तो आपको कुछ नहीं मिलता।

उपमा: कल्पना कीजिए कि आप "बैटलशिप" खेल रहे हैं, लेकिन जहाजों को डुबोने के बजाय, आप यह अनुमान लगाने की कोशिश कर रहे हैं कि दुश्मन का एडमिरल कहाँ खड़ा है। हर बार जब आप एक मोहरा चलते हैं, तो आप या तो एक नए क्षेत्र पर रोशनी डालते हैं या अपने एडमिरल को छिपाने के लिए एक दीवार खड़ी करते हैं।

2. खिलाड़ी: "अनजान" से "मास्टर जासूस" तक

शोधकर्ताओं ने केवल खेल ही नहीं खेला; उन्होंने अलग-अलग "दिमागी शक्ति" वाले AI एजेंटों की एक टीम बनाई ताकि यह देखा जा सके कि वे कैसे खेलेंगे।

  • रैंडम प्लेयर (Random Player): यह डार्ट फेंकते हुए एक बच्चे की तरह मोहरे चलता है। यह पासे (dice) फेंककर राजा के स्थान का अनुमान लगाता है।
  • "टॉर्च" प्लेयर (Visimax): इसे केवल अधिक से अधिक लाइटें जलाने की परवाह है। इसे इस बात की परवाह नहीं है कि रोशनी कहाँ इशारा कर रही है, बस यह कि वे चालू हैं। यह एक कमरे में टॉर्च घुमाने वाले व्यक्ति की तरह है, जो उम्मीद करता है कि वह गलती से राजा से टकरा जाएगा।
  • "डिटेक्टिव" प्लेयर (BeliefMax): यह एजेंट एक मानसिक मानचित्र बनाता है। यह याद रखता है कि पिछला टर्न होने पर राजा कहाँ था और गणना करता है कि अब राजा के कहाँ होने की संभावना है। यह सबसे संभावित छिपे हुए स्थानों की जाँच करने के लिए अपने मोहरों को चलाता है।
  • "छिपाने वाला" प्लेयर (Hiding Player): यह एजेंट रक्षा के मामले में स्मार्ट है। यह अपने राजा को बोर्ड के सबसे अंधेरे कोने में ले जाता है ताकि देखा न जा सके।
  • "सुपर स्पाई" (Reinforcement Learning Agent): यह वह AI है जिसने खुद के और दूसरों के खिलाफ हजारों गेम खेलकर सीखा। इसने केवल नियमों का पालन नहीं किया; इसने नई रणनीतियाँ खोजीं जो इंसानों और सरल AI ने नहीं सोची थीं।

3. गुप्त हथियार: "एन्ट्रॉपी" (भ्रम का माप)

यह पेपर "एन्ट्रॉपी" और "क्रॉस-एन्ट्रॉपी" जैसे कुछ भारी गणितीय शब्दों का उपयोग करता है, लेकिन इन्हें कन्फ्यूजन स्कोर (Confusion Scores) के रूप में समझें।

  • बलीफ एन्ट्रॉपी (Belief Entropy): खिलाड़ी कितना भ्रमित है? यदि उन्हें लगता है कि राजा कहीं भी हो सकता है, तो उनका कन्फ्यूजन (भ्रम) अधिक है। यदि वे आश्वस्त हैं कि राजा एक ही स्थान पर है, तो उनका कन्फ्यूजन कम है।
  • लक्ष्य: एक अच्छा खिलाड़ी दुश्मन के बारे में कम कन्फ्यूजन चाहता है (वे जानते हैं कि दुश्मन कहाँ है) लेकिन दुश्मन के लिए उच्च कन्फ्यूजन चाहता है (दुश्मन पूरी तरह से खोया हुआ महसूस करे)।

शोधकर्ताओं ने पाया कि "सुपर स्पाई" AI ने इन स्कोर को किसी भी अन्य की तुलना में बेहतर तरीके से नियंत्रित करना सीख लिया। वह जानता था कि कब रोशनी कब जलानी है और कब खुद को अंधेरे में छिपाना है ताकि प्रतिद्वंद्वी को अनुमान लगाने से रोका जा सके।

4. उन्होंने क्या सीखा?

अध्ययन ने तीन बड़ी बातें बताईं:

  1. दुश्मन का मॉडल बनाना मायने रखता है: वे एजेंट जिन्होंने यह समझने की कोशिश की कि प्रतिद्वंद्वी कैसे सोचता है ("डिटेक्टिव" और "सुपर स्पाई"), वे केवल रैंडम या अंधे होकर चलने वालों की तुलना में बहुत अधिक बार जीते।
  2. आक्रमण और रक्षा जुड़े हुए हैं: सर्वश्रेष्ठ खिलाड़ियों ने केवल दुश्मन को नहीं खोजा; उन्होंने सक्रिय रूप रूप से अपने राजा को भी छिपाया। "सुपर स्पाई" ने दुश्मन पर रोशनी डालने और साथ ही अपने चारों ओर एक दीवार बनाने के बीच संतुलन बनाना सीख लिया।
  3. AI नई तकनीकें खोजता है: AI ने एक अजीब पैटर्न पाया: इसने अपने हाथी (Rooks) (जो आमतौर पर लंबी दूरी के मोहरे होते हैं) को ऊँट (Bishops) की तुलना में अधिक बार चलाना शुरू कर दिया, एक ऐसी रणनीति जिसे सरल "डिटेक्टिव" एजेंटों ने कभी इस्तेमाल नहीं किया। यह दर्शाता है कि जब आप AI को शुद्ध सूचना लक्ष्य देते हैं, तो वह सूचनात्मक समाधान खोजने के ऐसे रचनात्मक तरीके ढूंढ लेता है जो शायद इंसान भी मिस कर दें।

यह क्यों महत्वपूर्ण है?

आप पूछ सकते हैं, "एक अजीब शतरंज के खेल की परवाह कौन करेगा?"

शोधकर्ता कहते हैं कि यह एक प्रयोगशाला (Laboratory) है। वास्तविक दुनिया की समस्याएँ—जैसे साइबर सुरक्षा, सैन्य रणनीति, या यहाँ तक कि व्यापारिक सौदे करना—अक्सर आंशिक सूचना (Partial Information) के बारे में होती हैं। आप नहीं जानते कि दूसरा व्यक्ति क्या सोच रहा है, और आप नहीं चाहते कि उन्हें पता चले कि आप क्या योजना बना रहे हैं।

InfoChess वास्तविक जीवन के शोर-शराबे वाले हिस्सों (जैसे पैसा या शारीरिक हिंसा) को हटा देता है और मूल समस्या को अलग करता है: मैं अपने स्वयं के रहस्यों को सुरक्षित रखते हुए सच्चाई को कैसे सीखूँ? इस खेल को खेलकर AI का अध्ययन करके, हम सुरक्षित संचार, स्वायत्त ड्रोन और रणनीतिक निर्णय लेने के लिए बेहतर सिस्टम बना सकते हैं।

संक्षेप में: InfoChess एक ऐसा मैदान है जहाँ AI "परफेक्ट ब्लफ" (पूर्ण धोखा) और "परफेक्ट गेस" (पूर्ण अनुमान) की कला सीखता है, जिससे हमें उस दुनिया में नेविगेट करने में मदद मिलती है जहाँ हमारे पास कभी भी पूरी तस्वीर नहीं होती।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →