From Optimal Actions to World Models: Identifiability of Transition Kernels in Discounted MDPs
यह शोध पत्र केवल इष्टतम कार्यों (optimal actions) से डिस्काउंटेड मार्कोव निर्णय प्रक्रियाओं (discounted Markov decision processes) में ट्रांज़िशन कर्नेल की पहचान क्षमता (identifiability) को अभिलक्षित करता है, यह प्रदर्शित करते हुए कि जबकि अवस्था-कार्य पुरस्कार (state-action rewards) एक उच्च-आयामी अविभेद्य गतिकी (high-dimensional family of indistinguishable dynamics) छोड़ते हैं, अगली अवस्था पर निर्भर पुरस्कार (rewards depending on the next state) आमतौर पर ट्रांज़िशन कर्नेल की पूर्ण रिकवरी की अनुमति देते हैं, जबकि केवल अवस्था-आधारित पुरस्कार (state-only rewards) और भी कम जानकारी प्रदान करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को भूलभुलैया (maze) में रास्ता खोजना सिखाने की कोशिश कर रहे हैं। आप उसे नक्शा नहीं दिखाते; इसके बजाय, आप बस यह देखते हैं कि अलग-अलग लक्ष्यों के मिलने पर वह क्या करता है। शायद आप उसे कहते हैं, "पनीर ढूँढो," और वह बाईं ओर भागता है। फिर आप कहते हैं, "बैटरी ढूँढो," और वह दाईं ओर भागता है। यह रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) की दुनिया है, जो आर्टिफिशियल इंटेलिजेंस की एक शाखा है जहाँ एजेंट "इनाम" (reward) को अधिकतम करने के लिए प्रयास और त्रुटि (trial and error) से सीखते हैं।
इस दुनिया में, दो मुख्य चीजें हैं जिन्हें एजेंट को जानना आवश्यक है: क्या करना है (रणनीति/strategy) और आगे क्या होगा (दुनिया का भौतिक विज्ञान/physics)। "क्या करना है" वाला हिस्सा देखना आसान है: आप बस रोबोट के विकल्पों को देखते हैं। "आगे क्या होगा" वाला हिस्सा ट्रांजिशन मॉडल (transition model) है—यह संभावनाओं का एक गुप्त नक्शा है जो कहता है, "यदि मैं यहाँ यह बटन दबाता हूँ, तो 70% संभावना है कि मैं गड्ढे में गिर जाऊँगा और 30% संभावना है कि मुझे खजाना मिल जाएगा।" आमतौर पर, हम यह मान लेते हैं कि यदि हमें हर संभावित लक्ष्य के लिए रोबोट की सटीक रणनीति पता हो, तो हम उसके गुप्त नक्शे को रिवर्स-इंजीनियर कर सकते हैं। लेकिन क्या होगा अगर रोबोट अपने काम में इतना अच्छा है कि वह नक्शा हमसे छिपा लेता है? क्या होगा अगर दो पूरी तरह से अलग नक्शे, एक ही तरह के सटीक विकल्प प्रस्तुत करते हों? यह शोध एक पेचीदा सवाल पूछता है: क्या हम विजेता की चालों को देखकर खेल के वास्तविक नियमों को कभी जान सकते हैं?
महान नक्शा रहस्य (The Great Map Mystery)
कल्पना कीजिए कि आप एक जासूस हैं जो यह समझने की कोशिश कर रहे हैं कि एक वीडियो गेम कैसे काम करता है, लेकिन आप उसके कोड को नहीं देख सकते। आप केवल एक 'स्पीडरनर' (speedrunner) को पूरी तरह से गेम खेलते हुए देख सकते हैं। स्पीडरनर जानता है कि उच्चतम स्कोर प्राप्त करने के लिए हर क्षण कौन सा बटन दबाना है।
शोध यह पूछता है: यदि आप हर संभव इनाम परिदृश्य (सिक्का ढूँढना, लावा से बचना, चाबी इकट्ठा करना) के लिए इस स्पीडरनर को खेलते हुए देखते हैं, तो क्या आप गेम के भौतिक विज्ञान (physics) को समझ सकते हैं? क्या आप निश्चित रूप से जान सकते हैं कि "जंप" दबाने से चरित्र 5 फीट ऊपर जाता है या 10 फीट?
इसका उत्तर, इस शोध के अनुसार, एक आश्चर्यजनक "नहीं, हमेशा नहीं" है।
लेखक, नील बत्रा (Neal Batra), यह सिद्ध करते हैं कि आपके पास दो पूरी तरह से अलग गेम इंजन (दो अलग "ट्रांजिशन कर्नेल", या दुनिया कैसे काम करती है इसके नक्शे) हो सकते हैं जो हर एक कल्पना योग्य इनाम के लिए बिल्कुल समान सटीक चालें उत्पन्न करते हैं। यह दो अलग-अलग भूलभुलैया होने जैसा है जहाँ निकास का रास्ता एक जैसा दिखता है, भले ही दीवारें और जाल अलग तरह से व्यवस्थित हों।
सुरागों के तीन प्रकार
पेपर रोबोट को इनाम देने के तीन अलग-अलग तरीकों का परीक्षण करता है, और प्रत्येक सुराग सत्य का अलग स्तर प्रकट करता है।
1. "एक्शन" सुराग (State-Action Rewards)
यह सबसे सामान्य परिदृश्य है। आप रोबोट को बताते हैं, "यदि आप रसोई में हैं और आप चम्मच उठाते हैं, तो आपको 10 अंक मिलते हैं।"
पेपर पाता है कि भले ही आप हर कमरे में हर चम्मच, कांटे और चाकू के लिए रोबोट के सटीक चुनाव को जानते हों, फिर भी आप सटीक नक्शा निर्धारित नहीं कर सकते। ऐसे अलग-अलग नक्शों का एक पूरा परिवार मौजूद है जो रोबोट के लिए समान दिखते हैं।
- जादुई ट्रिक: लेखक दिखाते हैं कि ये अलग-अलग नक्शे एक गणितीय "जादुई लेंस" (एक मैट्रिक्स जिसे L कहा जाता है) द्वारा जुड़े हुए हैं। यदि आप इस लेंस के माध्यम से दुनिया को देखते हैं, तो संभावनाएँ बदल जाती हैं, लेकिन रोबोट के सर्वोत्तम विकल्प बिल्कुल वही रहते हैं।
- रहस्य का पैमाना: यदि रोबोट के पास अलग-अलग स्थान हैं, तो छिपे हुए नक्शों का एक विशाल, सुचारू परिवार मौजूद है—विशेष रूप से, विभिन्न आयामों की स्वतंत्रता वाला एक परिवार। यह ऐसा है जैसे यह कहना कि कमरे की दीवारों को पेंट करने के अनगिनत तरीके हैं, जब तक कि आप दरवाजे को उसी स्थान पर रखते हैं। रोबोट के पास जितने अधिक विकल्प (actions) होंगे, सच को छिपाना उतना ही कठिन होगा, लेकिन फिर भी इसे छिपाना संभव है।
2. "अगला-कदम" सुराग (Transition-Dependent Rewards)
अब, कल्पना कीजिए कि आप रोबोट को इस आधार पर इनाम दे सकते हैं कि वह कहाँ पहुँचता है। "यदि आप बटन दबाते हैं और लाल टाइल पर उतरते हैं, तो आपको 100 अंक मिलते हैं।"
यह एक बहुत अधिक शक्तिशाली सुराग है। क्योंकि आप सीधे गंतव्य को इनाम दे सकते हैं, इसलिए आप गेम के भौतिक विज्ञान का अधिक सख्ती से परीक्षण कर सकते हैं।
- परिणाम: यदि रोबोट के पास एक कमरे में कम से कम दो विकल्प हैं, तो आप आमतौर पर सटीक नक्शा पता लगा सकते हैं। एकमात्र समय जब आप ऐसा नहीं कर सकते, वह तब है जब रोबोट एक ऐसे कमरे में हो जहाँ केवल एक ही संभावित चाल है। उस स्थिति में, रोबोट के पास कोई विकल्प नहीं होता, इसलिए आप यह परीक्षण नहीं कर सकते कि भौतिक विज्ञान अलग है या नहीं। लेकिन जैसे ही कोई विकल्प आता है, "अगला-कदम" वाले सुराग आमतौर पर वास्तविक नक्शे को प्रकट कर देते हैं, जब तक कि गेम किसी बहुत ही विशिष्ट, दुर्लभ तरीके से हेरफेर न किया गया हो।
3. "स्टेट" सुराग (State Rewards)
अंत में, कल्पना कीजिए कि आप केवल कह सकते हैं, "यदि आप रसोई में हैं, तो आपको 10 अंक मिलते हैं," चाहे आप कुछ भी करें।
यह सबसे कमजोर सुराग है। यह ऐसा है जैसे रोबोट को कहना, "यदि तुम रसोई में हो तो खुश रहो," लेकिन यह न कहना कि कौन सा बटन दबाना है।
- परिणाम: यह सबसे कम जानकारी प्रकट करता है। दो पूरी तरह से अलग नक्शे इन नियमों के तहत रोबोट के लिए समान दिख सकते हैं। पेपर सिद्ध करता है कि इन सरल पुरस्कारों के लिए रोबोट के विकल्पों को जानना कई अलग-अलग दुनियाओं के बीच अंतर करने के लिए पर्याप्त नहीं है।
सत्य का पदानुक्रम (The Hierarchy of Truth)
यह शोध अपने निष्कर्षों को ज्ञान की एक स्पष्ट सीढ़ी में व्यवस्थित करता है:
- ट्रांजिशन रिवार्ड्स (गंतव्य को पुरस्कृत करना) सबसे मजबूत हैं। वे आमतौर पर सटीक नक्शा प्रकट कर सकते हैं।
- एक्शन रिवार्ड्स (विकल्प को पुरस्कृत करना) बीच में हैं। वे बताते हैं कि क्रियाएं एक-दूसरे के साथ कैसे तुलना करती हैं, लेकिन वे कई संभावित नक्शों का एक "कोहरा" छोड़ देते हैं।
- स्टेट रिवार्ड्स (स्थान को पुरस्कृत करना) सबसे कमजोर हैं। वे सबसे अधिक कोहरा छोड़ते हैं, जिससे कई अलग-अलग नक्शे एक जैसे दिखते हैं।
यह क्यों महत्वपूर्ण है
आप सोच सकते हैं, "तो क्या हुआ? यदि रोबोट सही चालें चलता है, तो हमें नक्शे की चिंता क्यों करनी चाहिए?"
पेपर तर्क देता है कि नक्शा केवल जीतने के अलावा अन्य चीजों के लिए भी महत्वपूर्ण है। यदि आप भविष्यवाणी करना चाहते हैं कि आगे क्या होगा, किसी आपदा का अनुकरण (simulate) करना चाहते हैं, या पूछना चाहते हैं "क्या होता यदि मैंने कुछ अलग किया होता?" (counterfactuals), तो आपको वास्तविक नक्शे की आवश्यकता होती है, न कि केवल उस एक की जो वर्तमान खेल के लिए अच्छा दिखता है।
अध्ययन सिद्ध करता है कि सर्वश्रेष्ठ चालों को जानना यह गारंटी नहीं देता कि आप दुनिया के नियमों को जानते हैं। आपके पास एक ऐसा एजेंट हो सकता है जो एक जीनियस की तरह व्यवहार करता है, जबकि उसकी वास्तविकता की आंतरिक समझ पूरी तरह से गलत हो सकती है। यह एक याद दिलाता है कि AI की दुनिया में, सही काम करने का मतलब हमेशा यह नहीं होता कि आप समझते हैं कि वह क्यों सही है, या सतह के नीचे वास्तव में दुनिया कैसी दिखती है।
लेखक केवल अनुमान नहीं लगाते; वे एक गणितीय प्रमाण प्रदान करते हैं। वे दिखाते हैं कि इन "नकली" नक्शों को कैसे बनाया जाए जो रोबोट को मूर्ख बना दें, और वे गणना करते हैं कि ऐसे कितने नकली नक्शे मौजूद हैं। यह एक ठोस, प्रमाणित तथ्य है: खजाने का रास्ता एक ही हो सकता है, लेकिन आपके पैरों के नीचे का भूभाग कुछ भी हो सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।