← नवीनतम पेपर
🤖 AI

Neuro-Symbolic Skill Discovery for Conditional Multi-Level Planning

यह शोध पत्र एक नवीन न्यूरो-सिम्बोलिक आर्किटेक्चर प्रस्तुत करता है जो विरल, बिना लेबल वाले प्रदर्शनों (demonstrations) से सामान्यीकरण योग्य उच्च-स्तरीय सिम्बोलिक कौशल और निम्न-स्तरीय नियंत्रकों को सीखता है, जिससे रोबोटों को न्यूरल नेटवर्क, विजुअल लैंग्वेज मॉडल्स और ग्रेडिएंट-आधारित प्लानिंग के एकीकरण के माध्यम से अनदेखे और अव्यवस्थित वातावरण में जटिल, दीर्घ-अवधि के कार्यों की योजना बनाने और उन्हें निष्पादित करने में सक्षम बनाया जा सके।

मूल लेखक: Hakan Aktas, Yigit Yildirim, Ahmet Firat Gamsiz, Deniz Bilge Akkoc, Erhan Oztop, Emre Ugur

प्रकाशित 2026-03-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hakan Aktas, Yigit Yildirim, Ahmet Firat Gamsiz, Deniz Bilge Akkoc, Erhan Oztop, Emre Ugur

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखाने की कोशिश कर रहे हैं। यदि आप केवल रोबोट को एक इंसान द्वारा सैंडविच बनाने का वीडियो दिखाते हैं, तो रोबोट घबरा जाता है। वह मांसपेशियों की हज़ारों सूक्ष्म हलचलें, हाथ का सटीक कोण, स्लाइस की गति और ब्रेड की बनावट को देख लेता है। यह कार चलाने सीखने के लिए हर पेडल पर दबाव और हर पहिये के बोल्ट के घुमाव को याद करने जैसा है। यह बहुत अधिक डेटा है, और रोबोट "बड़ी तस्वीर" के नियमों को समझ नहीं पाता।

यह पेपर एक चतुर समाधान प्रस्तावित करता है: रोबोट को "अक्षरों" के बजाय "अध्यायों" में सोचना सिखाएं।

यहाँ बताया गया है कि उनका सिस्टम कैसे काम करता, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "अक्षर" बनाम "शब्द"

अधिकांश रोबोट अपने हाथों को हिलाने (अक्षरों) में माहिर होते हैं, लेकिन पूरे दिन की योजना बनाने (शब्दों और वाक्यों) में कच्चे होते हैं।

  • लो-लेवल डेटा: टमाटर उठाने के लिए रोबोटिक हाथ की अव्यवस्थित, निरंतर गति।
  • हाई-लेवल लॉजिक: "टमाटर उठाओ" की अवधारणा।

लेखक इस अंतर को पाटना चाहते हैं। वे चाहते हैं कि रोबोट बिना लेबल वाले, बिना निर्देशों वाले, केवल कच्चे फुटेज वाले रोबोट मूवमेंट के वीडियो के ढेर को देखे और यह पता लगाए: "ओह, यह गति का हिस्सा 'दराज खोलना' है, और यह हिस्सा 'कॉफी डालना' है।"

2. समाधान: "न्यूरो-सिम्बोलिक" शेफ

लेखों ने एक ऐसा सिस्टम बनाया है जो एक स्मार्ट सहायक शेफ (sous-chef) की तरह काम करता है जो देखकर सीखता है।

  • चरण 1: पैटर्न खोजने वाला (न्यूरल नेटवर्क)
    कल्पना कीजिए कि आप रोबोट को किसी का दराज खोलने के 100 वीडियो दिखाते हैं। कभी कोई इसे तेज़ी से खींचता है, कभी धीरे, कभी बाईं ओर से, तो कभी दाईं ओर से। रोबोट का "दिमाग" (एक न्यूरल नेटवर्क) इन सभी अव्यवस्थित वीडियो को देखता है और महसूस करता है, "रुको, भले ही हरकतें अलग हों, लेकिन उन सभी का परिणाम दराज खुलना ही है।"
    रोबोट इन समान गतिविधियों को एक साथ समूह में रखता है और उन्हें एक गुप्त कोड (एक "सिंबल") देता है। उसे अभी तक "दराज" शब्द का पता नहीं है; वह बस जानता है कि "कोड A" का अर्थ है "दराज खोलना"। वह हर उस कौशल के लिए ऐसा करता है जो वह देखता है, जिससे अव्यवस्थित वीडियो एक व्यवस्थित कोड की सूची में बदल जाते हैं।

  • चरण 2: अनुवादक (AI चैटबॉट)
    अब रोबोट के पास कोड की एक सूची (कोड A, कोड B, कोड C) है, लेकिन एक मानव प्लानर को नहीं पता कि उनका क्या अर्थ है। इसलिए, सिस्टम उस चीज़ का एक स्नैपशॉट लेता है जो रोबोट ने तब किया था जब उसने "कोड A" का उपयोग किया था और उसे एक सुपर-स्मार्ट AI (जैसे कि एक लार्ज लैंग्वेज मॉडल) को दिखाता है।
    AI उस तस्वीर को देखता है और कहता है, "आह, मैं समझ गया! कोड A 'टमाटर उठाना' है और कोड B 'पानी डालना' है।"
    अचानक, रोबट के पास एक शब्दकोश है। अब वह मानव भाषा का उपयोग करके एक हाई-लेवल प्लानर से बात कर सकता है।

  • चरण 3: मास्टर प्लानर (दिमाग)
    अब, आप रोबोट को एक बड़ा लक्ष्य देते हैं: "मेरे लिए सलाद बनाओ।"
    हाई-लेवल प्लानर (जो "दिमाग" है) शब्दकोश का उपयोग करके एक टू-डू लिस्ट बनाता है:

  1. टमाटर उठाओ।
  2. सलाद पत्ता (lettuce) उठाओ।
  3. उन्हें कटोरे में डालो।

यह हाई-लेवल प्लान है। यह सरल और तार्किक है।

  • चरण 4: मसल मेमोरी (निष्पादन/Execution)
    यही असली जादू है। जब रोबोट को वास्तव में चरण 1 ("टमाटर उठाओ") करना होता है, तो वह केवल अनुमान नहीं लगाता। वह उस विशिष्ट "कोड A" को याद करता है जिसे उसने पहले सीखा था। लेकिन चूंकि टमाटर प्रशिक्षण वीडियो की तुलना में थोड़ी अलग जगह पर है, इसलिए रोबोट अपनी गति को थोड़ा बदलने के लिए एक गणितीय ट्रिक (ग्रेडिएंट-बेस्ड प्लानिंग) का उपयोग करता है।
    यह एक पियानो वादक की तरह है जो "चॉपस्टिक्स" गीत जानता है। यदि पियानो को दूसरे कमरे में ले जाया जाता है, तो पियानो वादक गाना फिर से नहीं सीखता; वह बस सही चाबियों को छूने के लिए अपनी हाथ की स्थिति को थोड़ा समायोजित करता है। रोबोट नए टमाटर की स्थिति के अनुकूल होने के लिए अपने "कोड A" को एडजस्ट करता है।

3. यह एक बड़ी बात क्यों है

आमतौर पर, रोबोट को नया करतब सिखाने के लिए, आपको एक इंसान द्वारा सैकड़ों आदर्श उदाहरण रिकॉर्ड करने और उनमें से प्रत्येक को लेबल करने ("यह उठाना है", "यह रखना है") की आवश्यकता होती है। इसमें बहुत समय लगता है।

यह सिस्टम विशेष है क्योंकि:

  • यह "अव्यवस्थित" डेटा से सीखता है: यह बिना लेबल वाले कुछ वीडियो को देखकर खुद ही कौशल पहचान सकता है।
  • यह नई जगहों पर काम करता है: यदि आप इसे मेज के बाईं ओर से कप उठाने के लिए सिखाते हैं, तो यह बिना नए प्रशिक्षण के दाईं ओर से इसे कैसे उठाना है, यह समझ सकता है।
  • यह लंबे कार्यों को संभालता है: यह इन सरल "कोडों" को जोड़कर जटिल अनुक्रमों (जैसे "कॉफी बनाओ, फिर कप धोओ, फिर उसे सुखाओ") की योजना बना सकता है।

उपमा: भाषा सीखना

सोचिए कि रोबोट की कच्ची हरकतें ध्वनियों (जैसे एक बच्चे की बड़बड़ाहट) की तरह हैं।

  • पुराना तरीका: आपको हर विशिष्ट स्थिति के लिए रोबोट को हर विशिष्ट ध्वनि सिखानी होगी।
  • इस पेपर का तरीका: रोबोट बड़बड़ाहट को सुनता है, यह पता लगाता है कि कुछ ध्वनियाँ मिलकर "शब्द" (कौशल) बनाती हैं, और फिर उन शब्दों को एक वाक्य (योजना) में अनुवाद करने के लिए एक शब्दकोश (AI) का उपयोग करता है। एक बार जब वह शब्द जान जाता है, तो वह ऐसे नए वाक्य बोल सकता है जो उसने पहले कभी नहीं सुने।

परिणाम

अपने परीक्षणों में, यह रोबोट एक ऐसे किचन में जा सका जिसे उसने पहले कभी नहीं देखा था, काउंटर पर बिखरी हुई चीजों को देखा और सफलतापूर्वक कॉफी बना सका या डिशवॉशर लोड कर सका, भले ही कप और प्लेट अजीब जगहों पर थे। उसने यह सब प्रत्येक क्रिया के कुछ उदाहरणों को देखने के बाद किया।

संक्षेप में: उन्होंने रोबोट को हर एक मांसपेशी की हरकत को याद करने के बजाय "क्रियाओं" में सोचना सिखाया, जिससे वह एक कठोर, प्री-प्रोग्राम्ड मशीन के बजाय एक लचीला, स्मार्ट सहायक बन गया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →