Neuro-Symbolic Skill Discovery for Conditional Multi-Level Planning
यह शोध पत्र एक नवीन न्यूरो-सिम्बोलिक आर्किटेक्चर प्रस्तुत करता है जो विरल, बिना लेबल वाले प्रदर्शनों (demonstrations) से सामान्यीकरण योग्य उच्च-स्तरीय सिम्बोलिक कौशल और निम्न-स्तरीय नियंत्रकों को सीखता है, जिससे रोबोटों को न्यूरल नेटवर्क, विजुअल लैंग्वेज मॉडल्स और ग्रेडिएंट-आधारित प्लानिंग के एकीकरण के माध्यम से अनदेखे और अव्यवस्थित वातावरण में जटिल, दीर्घ-अवधि के कार्यों की योजना बनाने और उन्हें निष्पादित करने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखाने की कोशिश कर रहे हैं। यदि आप केवल रोबोट को एक इंसान द्वारा सैंडविच बनाने का वीडियो दिखाते हैं, तो रोबोट घबरा जाता है। वह मांसपेशियों की हज़ारों सूक्ष्म हलचलें, हाथ का सटीक कोण, स्लाइस की गति और ब्रेड की बनावट को देख लेता है। यह कार चलाने सीखने के लिए हर पेडल पर दबाव और हर पहिये के बोल्ट के घुमाव को याद करने जैसा है। यह बहुत अधिक डेटा है, और रोबोट "बड़ी तस्वीर" के नियमों को समझ नहीं पाता।
यह पेपर एक चतुर समाधान प्रस्तावित करता है: रोबोट को "अक्षरों" के बजाय "अध्यायों" में सोचना सिखाएं।
यहाँ बताया गया है कि उनका सिस्टम कैसे काम करता, जिसे सरल अवधारणाओं में विभाजित किया गया है:
1. समस्या: "अक्षर" बनाम "शब्द"
अधिकांश रोबोट अपने हाथों को हिलाने (अक्षरों) में माहिर होते हैं, लेकिन पूरे दिन की योजना बनाने (शब्दों और वाक्यों) में कच्चे होते हैं।
- लो-लेवल डेटा: टमाटर उठाने के लिए रोबोटिक हाथ की अव्यवस्थित, निरंतर गति।
- हाई-लेवल लॉजिक: "टमाटर उठाओ" की अवधारणा।
लेखक इस अंतर को पाटना चाहते हैं। वे चाहते हैं कि रोबोट बिना लेबल वाले, बिना निर्देशों वाले, केवल कच्चे फुटेज वाले रोबोट मूवमेंट के वीडियो के ढेर को देखे और यह पता लगाए: "ओह, यह गति का हिस्सा 'दराज खोलना' है, और यह हिस्सा 'कॉफी डालना' है।"
2. समाधान: "न्यूरो-सिम्बोलिक" शेफ
लेखों ने एक ऐसा सिस्टम बनाया है जो एक स्मार्ट सहायक शेफ (sous-chef) की तरह काम करता है जो देखकर सीखता है।
चरण 1: पैटर्न खोजने वाला (न्यूरल नेटवर्क)
कल्पना कीजिए कि आप रोबोट को किसी का दराज खोलने के 100 वीडियो दिखाते हैं। कभी कोई इसे तेज़ी से खींचता है, कभी धीरे, कभी बाईं ओर से, तो कभी दाईं ओर से। रोबोट का "दिमाग" (एक न्यूरल नेटवर्क) इन सभी अव्यवस्थित वीडियो को देखता है और महसूस करता है, "रुको, भले ही हरकतें अलग हों, लेकिन उन सभी का परिणाम दराज खुलना ही है।"
रोबोट इन समान गतिविधियों को एक साथ समूह में रखता है और उन्हें एक गुप्त कोड (एक "सिंबल") देता है। उसे अभी तक "दराज" शब्द का पता नहीं है; वह बस जानता है कि "कोड A" का अर्थ है "दराज खोलना"। वह हर उस कौशल के लिए ऐसा करता है जो वह देखता है, जिससे अव्यवस्थित वीडियो एक व्यवस्थित कोड की सूची में बदल जाते हैं।चरण 2: अनुवादक (AI चैटबॉट)
अब रोबोट के पास कोड की एक सूची (कोड A, कोड B, कोड C) है, लेकिन एक मानव प्लानर को नहीं पता कि उनका क्या अर्थ है। इसलिए, सिस्टम उस चीज़ का एक स्नैपशॉट लेता है जो रोबोट ने तब किया था जब उसने "कोड A" का उपयोग किया था और उसे एक सुपर-स्मार्ट AI (जैसे कि एक लार्ज लैंग्वेज मॉडल) को दिखाता है।
AI उस तस्वीर को देखता है और कहता है, "आह, मैं समझ गया! कोड A 'टमाटर उठाना' है और कोड B 'पानी डालना' है।"
अचानक, रोबट के पास एक शब्दकोश है। अब वह मानव भाषा का उपयोग करके एक हाई-लेवल प्लानर से बात कर सकता है।चरण 3: मास्टर प्लानर (दिमाग)
अब, आप रोबोट को एक बड़ा लक्ष्य देते हैं: "मेरे लिए सलाद बनाओ।"
हाई-लेवल प्लानर (जो "दिमाग" है) शब्दकोश का उपयोग करके एक टू-डू लिस्ट बनाता है:
- टमाटर उठाओ।
- सलाद पत्ता (lettuce) उठाओ।
- उन्हें कटोरे में डालो।
यह हाई-लेवल प्लान है। यह सरल और तार्किक है।
- चरण 4: मसल मेमोरी (निष्पादन/Execution)
यही असली जादू है। जब रोबोट को वास्तव में चरण 1 ("टमाटर उठाओ") करना होता है, तो वह केवल अनुमान नहीं लगाता। वह उस विशिष्ट "कोड A" को याद करता है जिसे उसने पहले सीखा था। लेकिन चूंकि टमाटर प्रशिक्षण वीडियो की तुलना में थोड़ी अलग जगह पर है, इसलिए रोबोट अपनी गति को थोड़ा बदलने के लिए एक गणितीय ट्रिक (ग्रेडिएंट-बेस्ड प्लानिंग) का उपयोग करता है।
यह एक पियानो वादक की तरह है जो "चॉपस्टिक्स" गीत जानता है। यदि पियानो को दूसरे कमरे में ले जाया जाता है, तो पियानो वादक गाना फिर से नहीं सीखता; वह बस सही चाबियों को छूने के लिए अपनी हाथ की स्थिति को थोड़ा समायोजित करता है। रोबोट नए टमाटर की स्थिति के अनुकूल होने के लिए अपने "कोड A" को एडजस्ट करता है।
3. यह एक बड़ी बात क्यों है
आमतौर पर, रोबोट को नया करतब सिखाने के लिए, आपको एक इंसान द्वारा सैकड़ों आदर्श उदाहरण रिकॉर्ड करने और उनमें से प्रत्येक को लेबल करने ("यह उठाना है", "यह रखना है") की आवश्यकता होती है। इसमें बहुत समय लगता है।
यह सिस्टम विशेष है क्योंकि:
- यह "अव्यवस्थित" डेटा से सीखता है: यह बिना लेबल वाले कुछ वीडियो को देखकर खुद ही कौशल पहचान सकता है।
- यह नई जगहों पर काम करता है: यदि आप इसे मेज के बाईं ओर से कप उठाने के लिए सिखाते हैं, तो यह बिना नए प्रशिक्षण के दाईं ओर से इसे कैसे उठाना है, यह समझ सकता है।
- यह लंबे कार्यों को संभालता है: यह इन सरल "कोडों" को जोड़कर जटिल अनुक्रमों (जैसे "कॉफी बनाओ, फिर कप धोओ, फिर उसे सुखाओ") की योजना बना सकता है।
उपमा: भाषा सीखना
सोचिए कि रोबोट की कच्ची हरकतें ध्वनियों (जैसे एक बच्चे की बड़बड़ाहट) की तरह हैं।
- पुराना तरीका: आपको हर विशिष्ट स्थिति के लिए रोबोट को हर विशिष्ट ध्वनि सिखानी होगी।
- इस पेपर का तरीका: रोबोट बड़बड़ाहट को सुनता है, यह पता लगाता है कि कुछ ध्वनियाँ मिलकर "शब्द" (कौशल) बनाती हैं, और फिर उन शब्दों को एक वाक्य (योजना) में अनुवाद करने के लिए एक शब्दकोश (AI) का उपयोग करता है। एक बार जब वह शब्द जान जाता है, तो वह ऐसे नए वाक्य बोल सकता है जो उसने पहले कभी नहीं सुने।
परिणाम
अपने परीक्षणों में, यह रोबोट एक ऐसे किचन में जा सका जिसे उसने पहले कभी नहीं देखा था, काउंटर पर बिखरी हुई चीजों को देखा और सफलतापूर्वक कॉफी बना सका या डिशवॉशर लोड कर सका, भले ही कप और प्लेट अजीब जगहों पर थे। उसने यह सब प्रत्येक क्रिया के कुछ उदाहरणों को देखने के बाद किया।
संक्षेप में: उन्होंने रोबोट को हर एक मांसपेशी की हरकत को याद करने के बजाय "क्रियाओं" में सोचना सिखाया, जिससे वह एक कठोर, प्री-प्रोग्राम्ड मशीन के बजाय एक लचीला, स्मार्ट सहायक बन गया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।