Learning to Search and Searching to Learn for Generalization in Planning
यह शोध पत्र एक स्व-सुधार (self-improving) ढांचे का प्रस्ताव करता है जो एक रिलेशनल ग्राफ न्यूरल नेटवर्क को सर्च के साथ एकीकृत करता है ताकि डीप रिइन्फोर्समेंट लर्निंग एजेंटों को स्पार्स-रिवॉर्ड प्लानिंग डोमेन में मजबूत ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) प्राप्त करने में सक्षम बनाया जा सके, जिससे वे बिना सर्च या विशेषज्ञ प्रदर्शन (expert demonstrations) के काफी बड़े समस्या इंस्टेंस को हल कर सकें।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल पहेली हल करना सिखाने की कोशिश कर रहे हैं, जैसे कि सोकोबन (Sokoban) का एक विशाल खेल (जहाँ आप बक्सों को विशिष्ट स्थानों पर धकेलते हैं) या ब्लॉकवर्ल्ड (Blocksworld) (जहाँ आप ब्लॉकों को एक निश्चित क्रम में रखते हैं)।
सबसे बड़ी चुनौती केवल एक पहेली को हल करना नहीं है; बल्कि रोबोट को उस पहेली के किसी भी संस्करण को हल करना सिखाना है, भले ही वह पहेली उसने पहले कभी न देखी हो, जिसमें अधिक बक्से हों, अलग शुरुआती स्थितियाँ हों, या बड़े लक्ष्य हों। इसे जनरलाइजेशन (Generalization) कहा जाता है।
यहाँ बताया गया है कि "लर्निंग टू सर्च एंड सर्चिंग टू लर्न" (Learning to Search and Searching to Learn) नामक शोध पत्र इस समस्या को कैसे हल करता है, इसे सरल भाषा में समझाया गया है:
1. समस्या: भूलभुलैया में खो जाना
मानक AI प्रशिक्षण (डीप रिइन्फोर्समेंट लर्निंग) में, रोबोट आमतौर पर एक कदम उठाने, यह देखने कि क्या हुआ, और फिर दूसरा कदम उठाने से सीखता है। यह अंधेरी भूलभुलैया में हाथ से दीवार को छूते हुए चलने जैसा है।
- समस्या: इन प्लानिंग पहेलियों में, "रिवॉर्ड्स" (समाधान खोजना) बहुत दुर्लभ होते हैं। यदि रोबोट बस बेतरतीब ढंग से भटकता रहता है, तो उसे बाहर निकलने का रास्ता खोजने में लाखों साल लग सकते हैं। वह डेड एंड (बंद रास्तों) या लूप में फंस जाता है।
- पुराना तरीका: कुछ तरीके रोबोट को पहले समाधान दिखाते हैं (जैसे कि शिक्षक उत्तर कुंजी दिखाते हैं), लेकिन यह नकल करना है। अन्य तरीके लक्ष्य से पीछे की ओर चलते हुए सीखने की कोशिश करते हैं, जो इन विशिष्ट प्रकार के तर्क वाले पहेलियों के लिए हमेशा काम नहीं करता है।
2. समाधान: "स्मार्ट मैप" और "सेल्फ-इंप्रूविंग लूप"
लेखक एक नई विधि प्रस्तावित करते हैं जिसे GSP (जेनरालाइज्ड सर्च फॉर प्लानिंग) कहा जाता है। अंधेरे में भटकने के बजाय, वे रोबोट को दो सुपरपावर देते हैं जो एक-दूसरे की मदद करते हैं:
A. "स्मार्ट मैप" (द ह्यूरिस्टिक)
सोचिए कि रोबोट के पास एक जादुई नक्शा (एक न्यूरल नेटवर्क) है जो वर्तमान पहेली को देखता है और अनुमान लगाता है: "अगर मैं इस बक्से को यहाँ धकेलता हूँ, तो क्या मैं फिनिश लाइन के करीब पहुँच जाऊँगा?"
- यह नक्शा केवल अनुमान नहीं लगाता; यह अनुभव से सीखता है।
- महत्वपूर्ण रूप से, यह नक्शा रिलेशनल ग्राफ न्यूरल नेटवर्क्स (Relational Graph Neural Networks) का उपयोग करके बनाया गया है। कल्पना करें कि पहेली के टुकड़े (ब्लॉक, बॉक्स) एक कहानी के पात्र हैं। नक्शा उनके बीच के संबंधों को समझता है (जैसे, "बॉक्स A, बॉक्स B के ऊपर है") न कि उन्हें केवल पिक्सल के रूप में देखता है। यह नक्शे को नियमों को समझने की अनुमति देता है, भले ही पहेली कितनी भी बड़ी क्यों न हो जाए।
B. "स्मार्ट सर्च" (द एक्सप्लोरर)
एक समय में एक कदम उठाने के बजाय, रोबोट बेस्ट-फर्स्ट सर्च (विशेष रूप से WA* नामक एल्गोरिदम) का उपयोग करता है।
- उपमा: कल्पना कीजिए कि आप जंगल में एक खोए हुए कुत्ते को खोज रहे हैं।
- मानक RL (रियल-टाइम सर्च): आप एक रैंडम रास्ता चुनते हैं, 10 कदम चलते हैं, और देखते हैं कि क्या कुत्ता वहाँ है। यदि नहीं, तो आप वापस जाते हैं और दूसरा रैंडम रास्ता आज़माते हैं। आप बहुत सारी ऊर्जा बर्बाद करते हैं।
- GSP (बेस्ट-फर्स्ट सर्च): आप अपने स्मार्ट मैप को देखते हैं। वह आपको 5 सबसे आशाजनक रास्ते दिखाता है। आप उन रास्तों को अपने दिमाग में एक साथ एक्सप्लोर करते हैं, यह देखते हुए कि कौन सा सबसे अच्छा लग रहा है। आप केवल उसी रास्ते पर आगे बढ़ते हैं जिसके बारे में नक्शा कहता है कि कुत्ते के मिलने की सबसे अधिक संभावना है।
3. जादुई लूप: "लर्निंग टू सर्च, सर्चिंग टू लर्न"
ऊपर दिए गए दोनों हिस्से एक चक्र में एक-दूसरे को फीड करते हैं:
- सर्च टू लर्न (सीखने के लिए खोज): रोबोट अपने वर्तमान, अपूर्ण स्मार्ट मैप का उपयोग करके एक पहेली पर स्मार्ट सर्च चलाता है। वह एक समाधान ढूंढता है (या उसके करीब पहुँचता है)।
- डेटा: सर्च प्रक्रिया डेटा का एक खजाना बनाती है: "जब मैं इस स्थिति में था, तो उस क्रिया को करने से एक समाधान मिला।"
- लर्न टू सर्च (खोजने के लिए सीखना): रोबel इस नए डेटा का उपयोग स्मार्ट मैप को अपडेट और बेहतर बनाने के लिए करता है। नक्शा यह अनुमान लगाने में बेहतर होता जाता है कि कौन से मूव अच्छे हैं।
- दोहराना: अब, एक बेहतर नक्शे के साथ, रोबोट और भी कठिन पहेलियों को अधिक कुशलता से खोज सकता है। सर्च बेहतर डेटा पाता है, जिससे नक्शा और भी स्मार्ट बनता है।
यह एक आत्म-सुधार चक्र है: सर्च मैप को सिखाता है, और मैप सर्च का मार्गदर्शन करता है।
4. परिणाम: असंभव को हल करना
लेखक ने कुछ बहुत कठिन बेंचमार्क पर इसका परीक्षण किया:
- ब्लॉकवर्ल्ड (Blocksworld): रोबोट को 30 से कम ब्लॉकों वाली पहेलियों पर प्रशिक्षित किया गया था। जब इसका परीक्षण 488 ब्लॉकों वाली पहेली (आकार में एक बड़ी छलांग) पर किया गया, तो इसने बिना किसी खोज की आवश्यकता के इसे हल कर दिया। इसने बस नक्शे को देखा और बिल्कुल जान लिया कि क्या करना है। इसे "जीरो-शॉट जनरलाइजेशन" कहा जाता है।
- सोकोबन (Sokoban) और द विटनेस (The Witness): इसने लगभग 100% जटिल पहेलियों को हल किया, और अक्सर अन्य शीर्ष AI तरीकों की तुलना में बहुत तेज़ी से (कम स्टेप्स में) समाधान खोजा।
- पुशवर्ल्ड (PushWorld): इसने उन नए, कठिन स्तरों को संभाला जिन्हें इसने पहले कभी नहीं देखा था, और मानक AI से बेहतर प्रदर्शन किया जो रैंडम एक्सप्लोरेशन पर निर्भर करता है।
सारांश
यह शोध पत्र पेश करता है कि कैसे एक AI एक स्मार्ट, लर्निंग-आधारित मैप का उपयोग करके एक व्यवस्थित खोज (सिस्टमैटिक सर्च) को निर्देशित करके तर्क पहेलियों को हल करना सीखता है।
- अंधेरे में भटकने के बजाय, यह सबसे अच्छे रास्तों को चुनने के लिए मैप का उपयोग करता है।
- केवल एक पहेली को याद करने के बजाय, यह वस्तुओं के बीच के संबंधों को सीखता है ताकि यह किसी भी आकार की पहेली को हल कर सके।
- सर्च और लर्निंग एक-दूसरे को बढ़ावा देते हैं, जिससे एक ऐसा रोबोट बनता है जो पुरानी पहेलियों पर अभ्यास करके नए, अनदेखे समस्याओं को हल करने में बेहतर होता जाता है।
संक्षेप में: उन्होंने AI को अंदाज़ा लगाना बंद करने और प्लानिंग (योजना बनाना) शुरू करने के लिए सिखाया, और फिर उस प्लानर को अपने स्वयं के प्लानिंग से सीखना सिखाया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।