← नवीनतम पेपर
💻 computer science

Learning Compositional Symbolic Task Rules from Demonstrations with Inductive Logic Programming

यह शोध पत्र 'लर्निंग फ्रॉम डिमॉन्स्ट्रेशन' (प्रदर्शन से सीखना) के लिए एक विखंडित इंडक्टिव लॉजिक प्रोग्रामिंग दृष्टिकोण प्रस्तावित करता है जो कई अमूर्त स्तरों में व्याख्या योग्य, पुन: प्रयोज्य प्रतीकात्मक कार्य नियमों का अनुमान लगाता है, जो एक सिंथेटिक ब्लॉक-असेंबली वातावरण में जटिल, अनदेखे परिदृश्यों के प्रति मजबूत सामान्यीकरण प्रदर्शित करता है।

मूल लेखक: Oleh Borys, Karla Stepanova

प्रकाशित 2026-05-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Oleh Borys, Karla Stepanova

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को ब्लॉक्स से एक टावर बनाना सिखा रहे हैं। आज के अधिकांश रोबोट तोते की तरह हैं: आप उन्हें एक वीडियो दिखाते हैं जिसमें आप एक लाल ब्लॉक रखते हैं, फिर एक नीला, और वे उन्हीं सटीक गतिविधियों की नकल करने की कोशिश करते हैं। लेकिन यदि आप उन्हें एक हरा ब्लॉक देते हैं या उनसे एक लंबा टावर बनाने के लिए कहते हैं, तो वे भ्रमित हो जाते हैं क्योंकि उन्होंने केवल हलचल (movements) को याद किया है, नियमों को नहीं।

यह शोध पत्र एक अलग दृष्टिकोण प्रस्तावित करता है। रोबोट को यह सिखाने के बजाय कि उसके हाथ को कैसे हिलाना है, लेखक उसे यह सिखाते हैं कि खेल के नियम क्या हैं, जिसे इंडक्टिव लॉजिक प्रोग्रामिंग (ILP) कहा जाता है। इसे इस तरह समझें जैसे आप रोबोट को कार्य का "लहजा (accent)" नहीं, बल्कि उसका "व्याकरण (grammar)" सिखा रहे हैं।

यहाँ बताया गया है कि उनका सिस्टम कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. "लेगो मास्टर" की उपमा

कल्पना कीजिए कि आप एक बच्चे को एक विशिष्ट प्रकार का टावर बनाना सिखाना चाहते हैं।

  • पुराना तरीका (मानक शिक्षण): आप बच्चे का हाथ पकड़ते हैं और ब्लॉक्स को स्टैक करने के लिए उसकी उंगलियों को हिलाते हैं। वह मांसपेशियों की स्मृति (muscle memory) सीखता है। यदि आप ब्लॉक्स बदल देते हैं, तो वह विफल हो सकता है।
  • इस शोध पत्र का तरीका (ILP): आप बच्चे को पास बिठाते हैं और नियम समझाते हैं: "लाल ब्लॉक्स नीचे जाएंगे, नीले बीच में, और हरे ऊपर। आप केवल केंद्र के स्थान के बगल में ही टावर बना सकते हैं।" एक बार जब बच्चा इन नियमों को समझ लेता है, तो वह किसी भी ब्लॉक के साथ, किसी भी स्थान पर, टावर बना सकता है, जब तक कि वह तर्क (logic) का पालन करता है।

2. एक बड़े कार्य को छोटे पहेलियों में तोड़ना

लेखकों ने महसूस किया कि एक साथ सभी नियमों को सिखाने की कोशिश करना एक विशाल जिग्सॉ पहेली को एक ही बार में देखने जैसा है—यह बहुत अधिक भारी (overwhelming) हो जाता है।

इसके बजाय, वे कार्य को तीन छोटे, आसान पहेलियों (अमूर्तता के स्तरों) में तोड़ देते हैं:

  • स्तर 1 (सामग्री): सबसे पहले, रोबोट सीखता है कि कौन सी सामग्री कहाँ जाएगी। "पत्थर नीचे जाएगा, ईंट बीच में।" वह यह नियम उदाहरणों से सीखता है।
  • स्तर 2 (संरचना): इसके बाद, रोबोट अभी सीखे गए नियम का उपयोग यह समझने के लिए करता है कि वास्तव में एक "टावर" क्या है। वह सीखता है कि एक टावर वास्तव में ब्लॉक्स की एक सूची है जो एक के ऊपर एक रखे गए हैं।
  • स्तर 3 (स्थान): अंत में, रोबोट सीखता है कि वह कहाँ निर्माण करने के लिए स्वतंत्र है। "आप केंद्र के बगल में बना सकते हैं, लेकिन विकर्ण (diagonal) पर नहीं।"

3. "चीट शीट" का प्रभाव

यही सबसे चतुर हिस्सा है: एक बार जब रोबोट स्तर 1 (सामग्री) के लिए नियम सीख लेता है, तो वह उस नियम को लिख लेता है और उसे अपनी "चीट शीट" (पृष्ठभूमि ज्ञान) में जोड़ देता है। जब वह स्तर 2 पर जाता है, तो उसे सामग्री के बारे में फिर से सीखने की आवश्यकता नहीं होती; वह बस चीट शीट का उपयोग करता है।

यह एक छात्र के गणित सीखने जैसा है: पहले, वे जोड़ (addition) सीखते हैं। फिर, जब वे गुणा (multiplication) सीखते हैं, तो वे जोड़ को एक आधार के रूप में उपयोग करते हैं। उन्हें हर बार गुणा की समस्या हल करने के लिए "2 + 2" क्या है, यह फिर से सीखने की आवश्यकता नहीं होती। यह सीखने की प्रक्रिया को तेज़ बनाता है और अंतिम परिणाम को बहुत अधिक स्मार्ट बनाता है।

4. परिणाम: सामान्यीकरण (Generalization)

शोधकर्ताओं ने ब्लॉक्स के साथ एक कंप्यूटर सिमुलेशन में इसका परीक्षण किया।

  • प्रशिक्षण: उन्होंने रोबोट को ऊंचाई 2 और 3 के टावर बनाना सिखाया।
  • परीक्षण: फिर उन्होंने रोबोट को एक कठिन चुनौती दी: लकड़ी के एक नए प्रकार के ब्लॉक का उपयोग करके ऊंचाई 4 का टावर बनाएं जिसे उसने पहले कभी नहीं देखा था, और एक नए स्थान पर जो प्रशिक्षण के दौरान अवरुद्ध (blocked off) था।

क्योंकि रोब सहित केवल गतिविधियों की नकल करने के बजाय तर्क (नियम) सीखा था, इसलिए वह सफल रहा। उसने समझ लिया, "ओह, नियम कहता है कि 'लकड़ी ऊपर जाएगी,' और नियम कहता है कि 'मैं केंद्र के बगल में बना सकता हूँ,' इसलिए मैं यह नया टावर बना सकता हूँ।"

5. यह क्यों महत्वपूर्ण है (और इसकी सीमाएं)

अच्छी खबर:

  • मानव-पठनीय (Human-Readable): रोबोट जो नियम सीखता है वे सरल "If-Then" वाक्यों की तरह दिखते हैं (जैसे, "यदि ब्लॉक पत्थर है, तो स्तर 1 पर रखें")। मनुष्य उन्हें पढ़ सकते हैं और समझ सकते हैं कि रोबोट ने निर्णय क्यों लिया।
  • कुशल (Efficient): इसे सीखने के लिए कम उदाहरणों की आवश्यकता होती है क्योंकि यह जो पहले से जानता है उसी पर निर्माण करता है।

चुनौती:

  • मैनुअल सेटअप: अभी भी, मनुष्यों को बहुत अधिक मेहनत करनी पड़ती है। एक इंसान को यह बताना होगा कि रोबोट किन नियमों को खोजे और ब्लॉक्स का वर्णन कैसे करे। रोबोट अभी पूरी तरह से स्वायत्त (autonomous) नहीं है; इसे मंच तैयार करने के लिए एक इंसान की आवश्यकता होती है।
  • सरल दुनिया: यह ब्लॉक्स को छाँटने या खिलौनों को जोड़ने जैसे स्पष्ट कार्यों के लिए बहुत अच्छा काम करता है। यह उन अस्त-व्यस्त, वास्तविक दुनिया की चीजों के लिए संघर्ष करता है जहाँ चीजें स्पष्ट रूप से परिभाषित नहीं होती हैं (जैसे, एक गीली, फिसलन भरी मेज)।

सारांश

यह शोध पत्र रोबोट को कार्य के पीछे के तर्क को खोजने में मदद करके उन्हें सिखाने का एक तरीका प्रस्तुत करता है, न कि केवल क्रियाओं को याद करने के माध्यम से। कार्य को छोटे, तार्किक चरणों में तोड़कर और रोबोट को एक चरण से सीखी गई बातों का उपयोग अगले चरण में मदद के लिए करने देकर, रोबोट उन नई, कठिन स्थितियों को संभालने में बहुत बेहतर हो जाता है जिन्हें उसने पहले नहीं देखा है। यह रोबोट को उसके पैर हिलाकर नृत्य सिखाने बनाम उसे लय और कदम सिखाने के बीच का अंतर है ताकि वह किसी भी गाने पर नाच सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →