Epistemic Monte Carlo Tree Search
यह शोध पत्र एपिस्टेमिक एमसीटीएस (EMCTS) प्रस्तुत करता है, जो एक ऐसी विधि है जो स्पार्स-रिवॉर्ड (sparse-reward) वातावरणों में मानक अल्फाज़ीरो/म्यूज़ीरो (AlphaZero/MuZero) दृष्टिकोणों की तुलना में सैंपल दक्षता और अन्वेषण क्षमताओं में महत्वपूर्ण सुधार करने के लिए मोंटे कार्लो ट्री सर्च (Monte Carlo Tree Search) में एपिस्टेमिक अनसर्टेन्टी (epistemic uncertainty) को एकीकृत करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करके "एपिस्टेमिक मोंटे कार्लो ट्री सर्च" (Epistemic Monte Carlo Tree Search) पेपर की व्याख्या दी गई है।
बड़ी तस्वीर: "आत्मविश्वासी खोजकर्ता" की समस्या
कल्प_ना कीजिए कि आप एक रोबोट को एक बहुत ही कठिन खेल सिखा रहे हैं, जैसे कि शून्य से कंप्यूटर प्रोग्राम लिखना या एक विशाल, अंधेरी भूलभुलैया में रास्ता खोजना। यह खेल कठिन है क्योंकि इनाम (rewards) बहुत दुर्लभ हैं। आपको एक "अच्छा" कदम खोजने के लिए हजारों कदम उठाने पड़ सकते हैं जो जीत की ओर ले जाए।
इन खेलों के लिए वर्तमान अत्याधुनिक AI को AlphaZero/MuZero कहा जाता है। इन AI को प्रतिभाशाली शतरंज खिलाड़ियों के रूप में सोचें जो अपनी रणनीति बनाने के लिए कई चालें आगे देख सकते हैं। वे मोंटे कार्लो ट्री सर्च (MCTS) नामक तकनीक का उपयोग करते हैं, जो उनके दिमाग में एक विशाल "चुनें-अपना-स्वयं का-साहसिक-कार्य" (choose-your-own-adventure) वाली किताब बनाने जैसा है ताकि वे विभिन्न भविष्य की स्थितियों का अनुकरण कर सकें।
समस्या:
ये AI खेल खेलकर और दुनिया कैसे काम करती है, इसका एक "मानसिक मॉडल" बनाकर सीखते हैं। लेकिन क्योंकि उन्होंने अभी तक सब कुछ नहीं देखा है, उनके मानसिक मॉडल में कमियाँ हैं।
- एपिस्टेमिक अनिश्चितता (Epistemic Uncertainty): यह कहने का एक फैंसी तरीका है कि, "मुझे यह नहीं पता क्योंकि मैंने इसे पहले कभी नहीं देखा है।"
- दोष: मानक AlphaZero एल्गोरिदम योजना बनाने में बेहतरीन है, लेकिन यह अपने स्वयं के मानसिक मॉडल को ऐसे मानता है जैसे कि वह 100% पूर्ण सत्य हो। इसे यह एहसास नहीं होता कि, "हे, मैं यहाँ केवल अनुमान लगा रहा हूँ क्योंकि मैं इस भूलभुलैया के इस हिस्से में कभी नहीं आया हूँ।" क्योंकि इसे यह नहीं पता कि यह अनुमान लगा रहा है, इसलिए इसे उन अज्ञात क्षेत्रों की खोज करने की आवश्यकता महसूस नहीं होती। यह उन चीजों को करने के चक्र में फंस जाता है जिन्हें यह पहले से जानता है, और अंधेरे में छिपे दुर्लभ इनामों को मिस कर देता है।
समाधान: एपिस्टेमिक MCTS (EMCTS)
लेखक एपिस्टेमिक मोंटे कार्लो ट्री सर्च (EMCTS) नामक एक नई विधि प्रस्तावित करते हैं।
उपमा: लाल पेन वाला मानचित्रकार (Mapmaker)
कल्पना कीजिए कि AI एक नए द्वीप का मानचित्र बना रहा है।
- मानक AlphaZero: जो उसने देखा है उसके आधार पर मानचित्र बनाता है। यदि वह एक जंगल देखता है, तो वह जंगल बनाता है। यदि उसने द्वीप के दूसरी ओर नहीं देखा है, तो वह बस उसे खाली छोड़ देता है या अनुमान लगा लेता है कि वह जंगल जैसा ही दिखेगा। वह मान लेता है कि उसका चित्रण पूर्ण है।
- EMCTS: भी मानचित्र बनाता है, लेकिन वह अपने साथ एक अनिश्चितता का लाल पेन (Red Pen of Uncertainty) रखता है।
- जब वह द्वीप के उस हिस्से को चित्रित करता है जहाँ वह कई बार गया है, तो रेखाएँ काली और ठोस होती हैं।
- जब वह उस हिस्से को चित्रित करता है जिसे उसने कभी नहीं देखा है, तो वह उसे धुंधली, कांपती हुई लाल रेखाओं में खींचता है और बड़े अक्षरों में लिखता है "मुझे इसके बारे में यकीन नहीं है"।
- महत्वपूर्ण रूप से, जब AI अपने अगले कदम की योजना बनाता है, तो वह केवल काली रेखाओं को नहीं देखता है। वह कांपती हुई लाल रेखाओं को देखता है और सोचता है, "यह क्षेत्र अनिश्चित है। शायद यहाँ कोई खजाना हो! मुझे इसे जाकर देखना चाहिए।"
अपने स्वयं के अनुमानों के बारे में वह कितना अनिश्चित है, इसे स्पष्ट रूप से ट्रैक करके, AI अनिश्चित क्षेत्रों की खोज करने के लिए प्रेरित होता है, जिससे दुर्लभ इनामों की खोज तेजी से होती है।
यह कैसे काम करता है (तंत्र)
पेपर इस प्रक्रिया को संभव बनाने के लिए तीन मुख्य तरकीबें पेश करता है:
- "आशावादी" स्कोर: केवल यह पूछने के बजाय कि, "यहाँ औसत इनाम क्या है?" AI पूछता है, "यहाँ सबसे अच्छा संभावित इनाम क्या हो सकता है, यह देखते हुए कि मैं गलत भी हो सकता हूँ?" यह उन चालों के स्कोर में बोनस जोड़ता है जो अनिश्चित क्षेत्रों की ओर ले जाती हैं। यह एक खजाना खोजने वाले की तरह है जो कहता है, "मैंने यहाँ अभी तक सोना नहीं पाया है, लेकिन चूंकि मुझे नहीं पता कि वहाँ क्या है, इसलिए मैं मान लेता हूँ कि यह सोने से भरा है जब तक कि यह साबित न हो जाए।"
- संदेह का प्रसार: जब AI भविष्य के पथ का अनुकरण करता है (वृक्ष में एक शाखा), तो वह केवल इनाम की गणना नहीं करता है। वह यह भी गणना करता है कि उस पथ के हर चरण पर कितना "संदेह" (अनिश्चितता) मौजूद है। यदि AI पहले कदम के बारे में अनिश्चित है, तो वह संदेह आगे की रेखा में प्रवाहित होता है, जिससे पूरा पथ "अनिश्चित" दिखता है और इसलिए "खोजने के लिए दिलचस्प" बन जाता है।
- समानांतर सोच (Parallel Thinking): लेखकों ने इस प्रणाली का एक तेज़, समानांतर संस्करण बनाया है (JAX नामक टूल का उपयोग करके) ताकि AI एक ही समय में कई "क्या होगा अगर" परिदृश्यों को चला सके, जिससे यह जल्दी से पता चल सके कि कौन से पथों की खोज करना सार्थक है।
परिणाम: क्या यह काम आया?
लेखकों ने इस नई विधि का परीक्षण दो बहुत कठिन वातावरणों में किया जहाँ इनाम अत्यंत दुर्लभ हैं:
1. "कोड राइटर" (Subleq)
- कार्य: AI को गणित की समस्याओं को हल करने के लिए "Subleq" नामक एक बहुत ही आदिम, एक-निर्देश असेंबली भाषा में एक प्रोग्राम लिखना था।
- परिणाम: मानक AlphaZero संघर्ष करता रहा, और एक काम करने वाला प्रोग्राम खोजने में उसे बहुत अधिक प्रयास लगे। नया EMCTS संस्करण बहुत तेज़ी से सही कोड ढूंढ लेता है। यह ऐसा था जैसे मानक AI बेतरतीब ढंग से अक्षर टाइप कर रहा था, जबकि EMCTS AI उन अनिश्चित संयोजनों को व्यवस्थित रूप से जाँच रहा था जिनके काम करने की संभावना सबसे अधिक थी।
2. "डीप सी" (Deep Sea Benchmark)
- कार्य: एक ग्रिड की कल्पना करें जहाँ आप ऊपर बाईं ओर से शुरू करते हैं और नीचे दाईं ओर पहुँचने की कोशिश करते हैं। अंत में एक इनाम है, लेकिन आपके द्वारा लिया गया हर कदम एक छोटी सी "पेनल्टी" (नकारात्मक स्कोर) देता है। इनाम तक पहुँचने का रास्ता एक विशिष्ट रेखा है। यदि आप भटक जाते हैं, तो आपको कुछ नहीं मिलता।
- परिणाम: यह "भूसे के ढेर में सुई" खोजने जैसी क्लासिक समस्या है। मानक AlphaZero और समान विधियाँ इसे उचित समय के भीतर हल करने में विफल रहीं क्योंकि वे यह नहीं समझ पाए कि उन्हें गहराई से खोज करने की आवश्यकता है। हालाँकि, EMCTS एजेंटों ने ग्रिड में सफलतापूर्वक रास्ता बनाया, भले ही इनाम यादृच्छिक और शोर (noisy) से भरा था। उन्होंने साबित किया कि खोज के लिए इस उद्देश्य का उपयोग करके, वे छिपे हुए पथ को कहीं अधिक कुशलता से खोज सकते हैं।
निचोड़
पेपर का दावा है कि AI को यह पहचानने की शिक्षा देकर कि वह क्या नहीं जानता (एपिस्टेमिक अनिश्चितता) और इस "न जानने" की भावना का उपयोग अपनी योजना बनाने (खोज) के लिए करके, हम ऐसे एजेंट बना सकते हैं जो कठिन, दुर्लभ-इनाम वाले वातावरण में बेहतर खोज करने में सक्षम हों।
यह AI को एक आत्मविश्वासी लेकिन अंधे योजनाकार से बदलकर एक जिज्ञासु खोजकर्ता बना देता है जो ठीक जानता है कि अगली बार कहाँ देखना है क्योंकि वह जानता है कि उसका मानचित्र कहाँ अधूरा है। यह एल्गोरिदम डिजाइन या अज्ञात दुनिया में नेविगेट करने जैसे जटिल कार्यों में समाधान खोजने के लिए इसे काफी कुशल बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।