Learning Bilevel Policies over Symbolic World Models for Long-Horizon Planning
यह शोधपत्र BISON को प्रस्तुत करता है, जो एक ऐसा सिस्टम है जो लंबी अवधि की योजना बनाने वाले कार्यों (long-horizon planning tasks) को बड़ी संख्या में वस्तुओं के साथ कुशलतापूर्वक हल करने में सक्षम बाईलवल पॉलिसियों (bilevel policies) को बनाने के लिए लो-लेवल न्यूरल इमिटेशन लर्निंग को हाई-लेवल सिम्बोलिक एब्स्ट्रैक्शंस के साथ जोड़ता है, जो स्केलेबिलिटी और दक्षता में मौजूदा एंड-टू-एंड विधियों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कमरा साफ करना सिखाने की कोशिश कर रहे हैं। यदि आप केवल रोबोट को किसी व्यक्ति के सफाई करने का वीडियो दिखाते हैं, तो वह एक विशिष्ट मोज़े को उठाने या एक विशिष्ट शर्ट को तह करने का तरीका सीख सकता है। लेकिन यदि आप उससे 100 अलग-अलग वस्तुओं वाला कमरा साफ करने के लिए कहते हैं, या यदि काम करते समय वस्तुएं इधर-उधर हिल जाती हैं, तो यह सरल "नकल करने वाला" (copycat) दृष्टिकोण अक्सर विफल हो जाता है। वह अभिभूत हो जाता है।
यह पेपर BISON नामक एक नया तरीका पेश करता है जिससे रोबोट को सिखाया जाता है। BISON को एक "मैनेजर और वर्कर" (प्रबंधक और कार्यकर्ता) प्रणाली के रूप में समझें जो दो अलग-अलग शिक्षण शैलियों के सर्वश्रेष्ठ गुणों को जोड़ती है।
दो-टीमों वाला दृष्टिकोण
लेखकों ने महसूस किया कि रोबोटों को काम करने के लिए दो अलग-अलग प्रकार के "मस्तिष्क" की आवश्यकता होती है जो एक साथ काम करें:
- वर्कर (लो-लेवल पॉलिसी): यह मांसपेशियों की स्मृति (muscle memory) है। यह एक अत्यधिक कुशल नर्तक की तरह है जो जानता है कि कप को गिराए बिना उसे पकड़ने के लिए अपने हाथों और उंगलियों को ठीक से कैसे चलाना है। रोबोट यह सीखता है जब वह लोगों को शारीरिक कार्य करते हुए देखते हुए कई वीडियो (डेमोंस्ट्रेशन) देखता है। इस पेपर में, यह एक न्यूरल नेटवर्क है जो वास्तविक दुनिया के जटिल और निरंतर विवरणों को संभालता है।
- मैनेजर (हाई-लेवल पॉलिसी): यह एक रणनीतिक योजनाकार है। इसे इस बात की परवाह नहीं है कि उंगलियों को कैसे हिलाना है; इसे इस बात की परवाह है कि आगे क्या करना है। यह प्रतीकों और तर्क (logic) में सोचता है, जैसे कि एक शतरंज खिलाड़ी या एक प्रोजेक्ट मैनेजर। यह कहता है, "पहले, लाल ब्लॉक उठाओ। फिर, मेज की ओर बढ़ो। फिर, इसे वहां रखो।"
समस्या: आमतौर पर, ये दोनों आपस में ठीक से संवाद नहीं कर पाते। "वर्कर" लंबी योजना बनाने के लिए बहुत कम समझ रखता है, और "मैनेजर" इतना अमूर्त (abstract) होता है कि उसे वास्तव में रोबोट के हाथ को कैसे हिलाना है, इसकी जानकारी नहीं होती।
BISON का समाधान: BISON मैनेजर को वर्कर की पिछली सफलताओं को देखकर सिखाता है। यह रोबोट द्वारा चीजों को हिलाने वाले अव्यवस्थित वीडियो को लेता है, उन्हें एक सरल, प्रतीकात्मक कहानी (जैसे कि एक कॉमिक स्ट्रिप) में बदल देता है, और फिर मैनेजर को उस कहानी के आधार पर एक स्क्रिप्ट लिखना सिखाता है।
यह कैसे काम करता है: "रेसिपी" की उपमा
कल्पना कीजिए कि आप एक रोबोट को केक बनाना सिखाना चाहते हैं, लेकिन आपके पास केवल एक मानव बेकर द्वारा केक बनाने के वीडियो हैं।
- वीडियो देखना (लो-लेवल डेटा): आप बेकर को मिश्रण बनाने, डालने और बेक करने का रिकॉर्ड करते हैं। यह "लो-लेवल" डेटा है।
- कहानी का सारांश बनाना (एब्स्ट्रैक्शन): BISON वीडियो को देखता है और छोटे विवरणों (जैसे व्हिस्क की सटीक गति) को अनदेखा कर देता है। इसके बजाय, यह एक सारांश बनाता है: "चरण 1: सामग्री मिलाएं। चरण 2: पैन में डालें। चरण 3: बेक करें।" यह "हाई-लेवल" कहानी है।
- नियम सीखना (गोल रिग्रेशन): सिस्टम लक्ष्य ("हमें केक चाहिए") को देखता है और पीछे की ओर काम करता है। यह पूछता है, "केक पाने के लिए, हमें बेक करने की आवश्यकता थी। बेक करने के लिए, हमें डालने की आवश्यकता थी।" यह पीछे की ओर सोचने को सरल "If-Then" (यदि-तो) नियमों के सेट में बदल देता है।
- नियम: "यदि हमारे पास बैटर है AND एक खाली पैन है, तो डालें।"
- नियम: "यदि पैन ओवन में है, तो प्रतीक्षा करें।"
- सामान्यीकरण (जादुई ट्रिक): यह पेपर का सबसे बड़ा दावा है। अधिकांश रोबोट विफल हो जाते हैं यदि आप उन्हें 1 केक की रेसिपी देते हैं और फिर उन्हें 100 केक बनाने के लिए कहते हैं। BISON के नियम "वेरिएबल्स" (जैसे "यदि हमारे पास कोई भी बैटर है...") के साथ लिखे गए हैं। इसका मतलब है कि मैनेजर 1 केक, 10 केक, या यहाँ तक कि 10,000 केक भी बिना किसी नए प्रशिक्षण के संभाल सकता है। यह एक ऐसी रेसिपी होने जैसा है जो कहती है "आटा डालें" बजाय इसके कि "इस विशिष्ट कटोरे के लिए 2 कप आटा डालें।"
यह प्रतिस्पर्धा में बेहतर क्यों है
पेपर ने अन्य तरीकों के खिलाफ BISON का परीक्षण किया, जिसमें शामिल हैं:
- VLA (विज़न-लैंग्वेज-एक्शन) मॉडल: ये विशाल AI चैटबॉट्स की तरह हैं जो दुनिया को देखने और कार्य करने की कोशिश करते हैं। पेपर में पाया गया कि वे लंबे कार्यों के साथ बुरी तरह संघर्ष करते हैं और आसानी से भ्रमित हो जाते हैं।
- एंड-टू-एंड न्यूरल नेटवर्क: ये सब कुछ एक साथ सीखने की कोशिश करते हैं। ये एक ऐसे छात्र की तरह हैं जो 100 पन्नों की किताब के हर एक कदम को रटने की कोशिश कर रहा है। वे छोटे कार्यों के लिए ठीक काम करते हैं लेकिन जब कार्य लंबा हो जाता है या वस्तुओं की संख्या बढ़ जाती है, तो वे विफल हो जाते हैं।
- पारंपरिक सिम्बोलिक प्लानर्स: ये बहुत तार्किक होते हैं लेकिन वास्तविक दुनिया (जैसे कि अचानक एक ब्लॉक का गिर जाना) को संभालने में सक्षम नहीं होते।
BISON की जीत:
- लंबे कार्य: यह दूसरों की तुलना में बहुत आगे की योजना बना सकता है।
- अधिक वस्तुएं: जबकि अन्य तरीके तब विफल हो जाते हैं जब वस्तुओं की संख्या 6 या 10 से ऊपर जाती है, BISON कई अधिक वस्तुओं वाले वातावरण को संभालता है।
- गति: BISON का "मैनेजर" हिस्सा इतना कुशल है कि, यदि आप रोबोट के हाथ को हिलाने में लगने वाले समय को छोड़ दें, तो यह एक मिनट से कम समय में 10,000 वस्तुओं वाली योजना समस्या को हल कर सकता है। यह 10,000 मेहमानों के लिए तुरंत शादी की योजना बनाने जैसा है।
"ओपन वर्ल्ड" का लाभ
पेपर यह भी उजागर करता है कि BISON "ओपन वर्ल्ड" में काम करता है। कल्पना कीजिए कि एक कमरे में एक रोबोट है जहाँ नई वस्तुएं अचानक प्रकट हो सकती हैं, या वस्तुएं टेलीपोर्ट हो सकती हैं।
- पुराने तरीके अक्सर इसलिए टूट जाते हैं क्योंकि उन्हें वस्तुओं के एक विशिष्ट सेट पर प्रशिक्षित किया गया था।
- BISON अपने प्रतीकात्मक "If-Then" नियमों का उपयोग करता है। यदि कोई नई वस्तु दिखाई देती है, तो मैनेजर बस यह जाँचता है: "क्या इस वस्तु के लिए कोई नियम है?" यदि नियम कहता है "यदि एक लाल ब्लॉक है, तो उसे उठाओ," तो रोबोट उस नए लाल ब्लॉक को तुरंत उठा लेगा, भले ही उसने पहले कभी उस विशिष्ट ब्लॉक को न देखा हो।
सारांश
सरल शब्दों में, BISON एक ऐसा सिस्टम है जो एक रोबोट को एक कुशल कार्यकर्ता और एक स्मार्ट मैनेजर दोनों बनने के लिए सिखाता है। यह वर्कर को काम करते हुए देखता है, काम को सरल तार्किक नियमों में सारांशित करता है, और फिर उन नियमों का उपयोग करके किसी भी आकार के कार्यों के लिए आगे की योजना बनाता है। यह वर्तमान तरीकों की तुलना में तेज़, स्मार्ट और अधिक लचीला है, जिससे रोबोट बिना भटके कई हिस्सों वाले जटिल, दीर्घकालिक लक्ष्यों को संभाल सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।