← नवीनतम पेपर
🤖 AI

Calculating Mutual Information between a Reward Maximizer and its Environment

यह शोधपत्र सिद्ध करता है कि nn अवस्थाओं और mm क्रियाओं वाले एक नियंत्रित मार्कोव प्रक्रिया (Controlled Markov Process) के लिए, एक इष्टतम नियतात्मक नीति (optimal deterministic policy) का अवलोकन करने से अंतर्निहित वातावरण के बारे में ठीक nlogmn \log m बिट्स की जानकारी प्राप्त होती है, जिससे विभिन्न पुरस्कार अधिकतमकरण उद्देश्यों (reward maximization objectives) में इष्टतमता के लिए आवश्यक अंतर्निहित विश्व मॉडल (implicit world model) पर एक सटीक सूचना-सैद्धांतिक निचली सीमा (information-theoretic lower bound) स्थापित होती है।

मूल लेखक: Alfred Harwood, Jose Faustino, Alex Altair

प्रकाशित 2026-07-15
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alfred Harwood, Jose Faustino, Alex Altair

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

पूर्ण खिलाड़ियों की गुप्त भाषा

कल्पना कीजिए कि आप एक मास्टर शतरंज खिलाड़ी को देख रहे हैं। आप बोर्ड के नियम नहीं जानते, आप यह नहीं जानते कि मोहरे कहाँ से शुरू हुए थे, और आप यह भी नहीं जानते कि प्रतिद्वंद्वी रैंडमली खेल रहा है या किसी बड़ी योजना के साथ। फिर भी, जैसे-जैसे मास्टर एक के बाद एक चाल चलता है, आपको कुछ गहरा अहसास होने लगता है: उनकी पूर्ण रणनीति में खेल का एक छिपा हुआ मानचित्र (map) अवश्य होगा। यदि वे जानते हैं कि कौन सी चाल जीत दिलाएगी, तो उन्हें यह भी पता होना चाहिए कि मोहरे कैसे चलते हैं और बोर्ड कैसे व्यवस्थित है। यह आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया के एक बड़े सवाल का केंद्र है: क्या एक स्मार्ट एजेंट को अच्छा काम करने के लिए उस दुनिया को "समझने" की आवश्यकता है जिसमें वह रहता है, या क्या वह केवल सफलता तक पहुँचने के लिए अनुमान लगा सकता है?

इसका उत्तर देने के लिए, वैज्ञानिक म्युचुअल इंफॉर्मेशन (Mutual Information) नामक एक अवधारणा का उपयोग करते हैं। इसे इस तरह समझें कि यह एक माप है कि दो चीजें एक-दूसरे के बारे में कितना "बताती" हैं। यदि आप मौसम जानते हैं, तो आप बहुत कुछ जानते हैं कि लोग छतरी लेकर निकलेंगे या नहीं; दोनों के बीच उच्च म्युचुअल इंफॉर्मेशन है। यदि आप किसी के जूते का आकार जानते हैं, तो आप लगभग कुछ भी नहीं जानते कि उन्होंने नाश्ते में क्या खाया था; म्युचुअल इंफॉर्मेशन कम है। AI में, शोधकर्ता जानना चाहते हैं: यदि हम एक AI को पूर्ण रूप से कार्य करते देखते हैं, तो उसका व्यवहार उसकी दुनिया के छिपे हुए नियमों के बारे में कितना खुलासा करता है? क्या AI को अपने मस्तिष्क में एक विशाल, विस्तृत "वर्ल्ड मॉडल" (विश्व मॉडल) रखने की आवश्यकता है, या एक छोटा सा, अस्पष्ट संकेत ही पर्याप्त है? यह शोध पत्र उस प्रश्न की गहराई में जाता है, जो AI की पूर्ण रणनीति को एक बंद बक्से की तरह मानता है जिसे खोलने पर उसके अंदर मौजूद दुनिया के बारे में सटीक मात्रा में गुप्त डेटा प्रकट होता है।

शोध का बड़ा निष्कर्ष: पूर्ण मानचित्र

इस नए अध्ययन में, Dovetail Research और University of Sao Paulo के शोधकर्ताओं की एक टीम ने "रिवर्स इंजीनियरिंग" का खेल खेलने का निर्णय लिया। उन्होंने एक सरल लेकिन पेचीदा सवाल पूछा: यदि हम एक AI एजेंट को एक पूर्ण रिवॉर्ड मैक्सिमाइज़र (यानी वह हमेशा सबसे अच्छा संभव स्कोर प्राप्त करता है) के रूप में देखते हैं, तो उसके व्यवहार के भीतर उसके वातावरण के बारे में कितनी जानकारी छिपी हुई है?

इसे समझने के लिए, उन्होंने एक ऐसी दुनिया की कल्पना की जो एक विशाल, बहु-कक्षीय भूलभुलैया (maze) की तरह है। इस भूलभुलैया में nn अलग-अलग कमरे (states) हैं और प्रत्येक कमरे में एजेंट द्वारा चुने जाने वाले mm अलग-अलग दरवाजे (actions) हैं। मोड़ यह है कि शोधकर्ताओं ने "अधिकतम अज्ञानता" से शुरुआत की। वे नहीं जानते थे कि कौन सा दरवाजा कहाँ ले जाता है। दरवाजों के जुड़ने का हर संभव तरीका समान रूप से संभावित था, जैसे ताश की एक गड्डी जहाँ हर शफल एक अलग संभावित दुनिया है।

फिर, उन्होंने AI को देखा। उन्होंने देखा कि AI ने एक विशिष्ट, नियत (deterministic) योजना खोज ली थी: "यदि मैं कमरे 1 में हूँ, तो दरवाजा A खोलें। यदि मैं कमरे 2 में हूँ, तो दरवाजा B खोलें," इत्यादि। महत्वपूर्ण बात यह है कि यह योजना एक विशिष्ट लक्ष्य (जैसे सबसे अधिक सोने के सिक्के एकत्र करना) के लिए उच्चतम स्कोर प्राप्त करने का एकमात्र तरीका था।

टीम ने एक आश्चर्यजनक गणितीय तथ्य सिद्ध किया: जिस क्षण आप यह जान लेते हैं कि यह विशिष्ट योजना ही पूर्ण (perfect) है, आप तुरंत भूलभुलैया के बारे में ठीक nlogmn \log m बिट्स की जानकारी जान जाते हैं।

आइए इसे एक मनोरंजक उपमा के साथ समझते हैं। कल्पना कीजिए कि भूलभुलैया एक विशाल पुस्तकालय है जिसमें nn अलमारियाँ हैं। प्रत्येक अलमारी पर, mm अलग-अलग किताबें हैं जिन्हें आप निकाल सकते हैं। "पूर्ण योजना" एक ऐसे लाइब्रेरियन की तरह है जो जानता है कि हर अलमारी से कौन सी किताब निकालनी है ताकि सबसे अच्छी कहानी मिल सके। शोधकर्ताओं ने दिखाया कि लाइब्रेरियन के विकल्पों की वह विशिष्ट सूची एक चाबी की तरह कार्य करती है। यह आपको केवल एक चीज़ नहीं बताती; यह आपको पुस्तकालय के कनेक्शनों के बारे में इतना बताती है कि संभावनाओं को सूचना के एक विशिष्ट आयतन (volume) तक सीमित किया जा सके।

संख्या nlogmn \log m उस रहस्य का "आकार" है।

  • nn उन स्थानों की संख्या है जहाँ आप हो सकते हैं।
  • mm उन विकल्पों की संख्या है जो आपके पास प्रत्येक स्थान पर हैं।
  • logm\log m mm विकल्पों में से एक को चुनने के लिए आवश्यक सूचना की मात्रा है।

तो, यदि आपके पास 3 कमरे और प्रत्येक में 2 दरवाजे हैं, तो पूर्ण रणनीति में 3×log(2)3 \times \log(2) बिट्स की जानकारी है। यदि आपके पास 100 कमरे और 10 दरवाजे हैं, तो रणनीति में 100×log(10)100 \times \log(10) बिट्स की जानकारी है। यह शोध पत्र सिद्ध करता है कि अधिकांश मामलों के लिए यह संख्या सटीक है, जो पॉलिसी में निहित सूचना का एक सटीक निचला स्तर (lower bound) दर्शाती है।

यह क्यों महत्वपूर्ण है (और यह क्या खारिज करता है)

यह निष्कर्ष एक बड़ी बात है क्योंकि यह एक पूर्ण एजेंट के पास कितनी "विश्व जानकारी" होनी चाहिए, इसकी एक सख्त सीमा निर्धारित करता है। यह सुझाव देता है कि आप एक पूर्ण रिवॉर्ड-मैक्सिमाइज़र बने बिना यह नहीं जान सकते कि आपकी दुनिया कैसे काम करती है।

शोध पत्र इस बारे में भी बहुत सावधान है कि वह क्या नहीं कहता है। यह दावा नहीं करता कि AI के सिर में दुनिया का एक विशाल, मानव जैसा 3D मॉडल है। यह यह नहीं कहता कि AI चित्रों में "सोचता" है। इसके बजाय, यह कहता है कि AI के व्यवहार में दुनिया के मॉडल के बराबर जानकारी निहित है। जानकारी वहां मौजूद है, चाहे वह एक जटिल न्यूरल नेटवर्क में संग्रहीत हो, एक साधारण लुकअप टेबल में, या यहाँ तक कि एक जादुई ब्लैक बॉक्स में भी। शोध पत्र सिद्ध करता है कि सूचना की सामग्री (content) nlogmn \log m बिट्स पर स्थिर है, चाहे AI को कैसे भी बनाया गया हो।

शोधकर्ताओं ने विभिन्न प्रकार के "खेलों" में भी इस विचार का परीक्षण किया। उन्होंने देखा:

  1. लघु खेल (Short games): जहाँ एजेंट तय चरणों में सर्वोत्तम स्कोर प्राप्त करने का प्रयास करता है।
  2. लंबे खेल (Long games): जहाँ एजेंट अनंत काल तक खेलता है लेकिन तत्काल पुरस्कारों (discounted rewards) पर अधिक ध्यान देता है।
  3. अनंत खेल (Endless games): जहाँ एजेंट अनंत काल तक खेलता है और समय के साथ औसत स्कोर पर ध्यान देता है।

इन सभी मामलों में, गणित सटीक रहा। जब तक लक्ष्य एजेंट के स्थान के आधार पर (न कि किसी अजीब, रैंडम नियम के आधार पर) सर्वोत्तम स्कोर प्राप्त करना है, तब तक पूर्ण रणनीति हमेशा भूलभुलैया के रहस्यों के बारे में ठीक nlogmn \log m बिट्स का खुलासा करती है, सिवाय कुछ अत्यंत छोटे, गणितीय रूप से नगण्य अपवादों के।

"समान आयतन" का रहस्य

उन्होंने इसे कैसे सिद्ध किया? उन्होंने एक चतुर ज्यामितीय युक्ति का उपयोग किया। कल्पना कीजिए कि सभी संभावित भूलभलैयाओं के स्थान को एक विशाल, बहु-आयामी पिंड (blob) के रूप में देखा जा सकता है। शोधकर्ताओं ने दिखाया कि यदि वे इस पिंड को इस आधार पर काटते हैं कि कौन सी रणनीति सबसे अच्छी है, तो प्रत्येक रणनीति को पिंड का ठीक एक समान आकार का हिस्सा मिलता है।

इसे एक विशाल पिज्जा की तरह सोचें जिसे mnm^n स्लाइस में काटा गया है (क्योंकि प्रत्येक nn कमरे के लिए mm विकल्प हैं)। यदि आप एक रैंडम पिज्जा चुनते हैं, तो कोई भी विशिष्ट स्लाइस किसी भी अन्य स्लाइस की तुलना में "सर्वश्रेष्ठ" होने के लिए उतना ही संभावित है। चूंकि प्रत्येक स्लाइस का आकार समान है, इसलिए यह जानना कि आप किस स्लाइस में हैं (पूर्ण रणनीति को देखकर), आपकी अनिश्चितता को एक सटीक मात्रा तक कम कर देता है: स्लाइस की संख्या का लघुगणक (logarithm)। यह गणना सीधे nlogmn \log m के परिणाम की ओर ले जाती है।

शोध पत्र इस मामले में कठोर है। उन्होंने सिद्ध किया कि लगभग हर संभव भूलभुलैया के लिए (उन विचित्र किनारे के मामलों को छोड़कर जहाँ कई रणनीतियाँ पूरी तरह से बराबरी पर होती हैं), एक ही पूर्ण रणनीति होती है। और क्योंकि "सर्वश्रेष्ठ" रणनीति किसी भी अन्य संभावित रणनीति के समान ही संभावित है, इसलिए सूचना प्राप्ति (information gain) स्थिर और गणनीय है।

आगे क्या है?

लेखक अपने कार्य की सीमाओं के प्रति ईमानदार हैं। उन्होंने केवल उन एजेंटों को देखा जो अपनी वर्तमान स्थिति के आधार पर एक निर्णय लेते हैं (नियत, स्मृतिहीन नीतियां)। उन्होंने उन एजेंटों को नहीं देखा जो निर्णय लेने के लिए सिक्का उछालते हैं (randomized policies) या वे एजेंट जो अपने पूरे इतिहास को याद रखते हैं। उन्होंने उन एजेंटों को भी नहीं देखा जो पूरी दुनिया को नहीं देख सकते (partially observable environments)।

हालाँकि, उनके द्वारा अध्ययन किए गए विशिष्ट प्रकार के पूर्ण, स्पष्ट-दृष्टि वाले एजेंट के लिए, उत्तर स्पष्ट है: पूर्ण होने के लिए, आपको दुनिया के रहस्यों के ठीक nlogmn \log m बिट्स को अपने पास रखना होगा। यह एक सटीक, गणितीय प्रमाण है कि एक अच्छा प्रदर्शन केवल भाग्य नहीं है; यह एक छिपे हुए मानचित्र का प्रतिबिंब है, और अब हम ठीक से माप सकते हैं कि वह मानचित्र कितना बड़ा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →