← नवीनतम पेपर
🤖 AI

Missing Bridges: Composition-Aware Active Imitation Learning

यह शोध पत्र AALT को प्रस्तुत करता है, जो एक संरचना-जागरूक (composition-aware) सक्रिय अनुकरण शिक्षण (active imitation learning) ढांचा है जो मल्टी-टास्क डोमेन में टास्क कनेक्टिविटी को अधिकतम करने के लिए रणनीतिक रूप से "ब्रिज" प्रदर्शनों (bridge demonstrations) का अनुरोध करके विशेषज्ञ प्रयास को न्यूनतम करता है, और मौजूदा बेसलाइन की तुलना में काफी कम प्रदर्शनों और ट्रांज़िशन के साथ 72 रोबोट कार्यों पर 100% सफलता प्राप्त करता है।

मूल लेखक: Maxwell J. Jacobson, Ahmed H Qureshi, Yexiang Xue

प्रकाशित 2026-09-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maxwell J. Jacobson, Ahmed H Qureshi, Yexiang Xue

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट जटिल कार्यों को करने में तेजी से सक्षम हो रहे हैं, जैसे कि कार के पुर्जों को असेंबल करना या अलमारियों को व्यवस्थित करना। हालाँकि, एक रोबोट को कुछ नया सिखाने के लिए आमतौर पर एक मानव विशेषज्ञ को गतिविधियों के पूरे क्रम का प्रदर्शन करने की आवश्यकता होती है, जो एक धीमी, श्रमसाध्य और कठिन प्रक्रिया है। यदि किसी रोबोट को मेज से एक लाल कप उठाने का काम सीखना है, तो एक इंसान को उसे उस विशिष्ट कार्य को करने का सटीक तरीका दिखाना पड़ सकता है। यदि मेज थोड़ी बदल जाती है, या यदि रोबोट को नीले कप को उठाने की आवश्यकता होती है, तो अक्सर मानव विशेषज्ञ को फिर से शुरुआत से प्रदर्शन करना पड़ता है। यह एक बाधा उत्पन्न करता है: रोबोट को जितने अधिक कार्य सीखने की आवश्यकता होगी, विशेषज्ञों को उसे सिखाने में उतना ही अधिक समय बिताना होगा। शोधकर्ता अब मशीनों को सिखाने का एक स्मार्ट तरीका खोज रहे हैं, जहाँ रोबोट स्वयं तय करता है कि उसे आगे क्या सीखने की आवश्यकता है। निष्क्रिय रूप से निर्देश प्राप्त करने के बजाय, एक सक्रिय शिक्षार्थी (active learner) उन विशिष्ट प्रदर्शनों के लिए पूछता है जो कम से कम प्रयास के साथ सबसे अधिक समस्याओं को हल करने में उसकी मदद करेंगे।

पर्ड्यू यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए AALT नामक एक नई विधि विकसित की है, जिसका अर्थ है 'एडेप्टिव एजेंट्स वाया लेटेंट टोपोलॉजीज' (Adaptive Agents via Latals Topologies)। उनका काम रोबिमोटिक्स की एक विशिष्ट चुनौती पर केंद्रित है: एक रोबोट को केवल कुछ उदाहरणों के आधार पर बहुत सारी अलग-अलग स्थितियों को संभालने के लिए कैसे सिखाया जाए। कल्पना कीजिए कि एक रोबोटिक हाथ को एक शेल्फ से तीन विशिष्ट रंग के कैनिस्टर (डिब्बे) निकालने और उन्हें एक विशिष्ट क्रम में रखने का कार्य दिया गया है। शेल्फ कई अलग-अलग तरीकों से व्यवस्थित हो सकती है, और कैनिस्टर का क्रम हर नए वर्क ऑर्डर के साथ बदल सकता है। जबकि शुरुआती स्थितियों और लक्ष्यों के दर्जनों संभावित संयोजन हो सकते हैं, शोधकर्ताओं ने पाया कि रोबोट को हर एक के लिए अद्वितीय प्रदर्शन की आवश्यकता नहीं है। इसके बजाय, कई कार्यों में साझा मध्यवर्ती चरण (common middle steps) होते हैं। एक ऐसी गतिविधि जो शेल्फ के बाईं ओर का रास्ता साफ करती है, वह लाल, नीले या हरे कैनिस्टर को प्राप्त करने के लिए उपयोगी हो सकती है, जो इस पर निर्भर करता है कि उससे पहले या बाद में क्या होता है।

शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो इन साझा गतिविधियों को 'बिल्डिंग ब्लॉक्स' (निर्माण खंडों) के रूप में मानता है। वे पहले रोबोट को प्रदर्शनों का एक छोटा सेट सिखाते हैं, जिसे सिस्टम "हब" अवस्थाओं (hub states) के मानचित्र में व्यवस्थित करता है। ये हब एक शहर के प्रमुख चौराहों की तरह हैं जहाँ विभिन्न पथ मिलते हैं या अलग होते हैं। उदाहरण के लिए, एक हब ऐसी स्थिति का प्रतिनिधित्व कर सकता है जहाँ शेल्फ को आंशिक रूप से साफ कर दिया गया है, जिससे कई वस्तुओं तक पहुँचना संभव हो जाता है। सिस्टम फिर इन हबों के बीच गायब कड़ियों, या "ब्रिज" (पुलों) की तलाश करता है। यदि रोबोट जानता है कि एक साफ की गई शेल्फ तक कैसे पहुँचना है और साफ की गई शेल्फ से सामान कैसे उठाना है, लेकिन वह यह नहीं जानता कि सबसे पहले शेल्फ को कैसे साफ किया जाए, तो सिस्टम उस गायब कड़ी को पहचानने के लिए उपयोग करता है जिसे सीखना सबसे मूल्यवान है। वह मानव विशेषज्ञ से पूरे कार्य का शुरू से अंत तक प्रदर्शन करने के बजाय, केवल उस विशिष्ट 'ब्रिज' का प्रदर्शन करने के लिए कहता है।

यह दृष्टिकोण पुराने तरीकों के विपरीत है जो विशेषज्ञ के व्यवहार की सामान्य समझ में सुधार करने के आधार पर प्रदर्शनों की मांग करते हैं। वे पुराने तरीके अक्सर लंबे, पूर्ण प्रदर्शनों की मांग करते हैं जो केवल एक विशिष्ट समस्या को हल करते हैं, भले ही रोबोट एक छोटा सा जोड़ने वाला कदम सीखकर कई अन्य समस्याओं को हल कर सकता था। नई विधि, AALT, विशेष रूप से उन छोटे प्रदर्शनों की तलाश करती है जो सबसे अधिक नई संभावनाओं को खोल देते हैं। एक सिम्युलेटेड वातावरण में UR5e रोबोटिक आर्म का उपयोग करके, शोधकर्ताओं ने 72 अलग-अलग स्टार्ट-एंड-गोल संयोजनों वाले कार्य के साथ इस विचार का परीक्षण किया। रोबोट 24 प्रदर्शनों के डेटासेट के साथ शुरू हुआ जिसने केवल कुछ कार्यों को कवर किया था। अपने इस नए तरीके का उपयोग करते हुए, रोबोट ने केवल तीन अतिरिक्त प्रदर्शनों के लिए पूछा, जो कुल मिलाकर केवल पांच छोटी गतिविधियाँ थीं। ये तीन अनुरोध मौजूदा ज्ञान के ब्लॉकों को जोड़ने के लिए पर्याप्त थे, जिससे रोबोट सभी 72 कार्यों को सफलतापूर्वक हल करने में सक्षम हुआ।

उसी सिमुलेशन में परीक्षण किए गए सबसे मजबूत मौजूदा तरीकों की तुलना में, जिन्हें लगभग 89 प्रतिशत की सफलता दर प्राप्त करने के लिए 20 प्रदर्शनों (लगभग 100 गतिविधियों) की आवश्यकता थी, यह नया तरीका सफल रहा। पुराने तरीके इसलिए विफल रहे क्योंकि उन्होंने बहुत लंबे या बहुत विशिष्ट प्रदर्शन मांगे, जिससे व्यवहारों को संयोजित करने की रोबोट की क्षमता में अंतराल रह गया। नया तरीका सफल रहा क्योंकि इसने समस्या की संरचना पर ध्यान केंद्रित किया, जिससे उन सटीक लुप्त कड़ियों की पहचान हुई जो रोबोट को उन कार्यों के लिए अपने स्वयं के समाधान बनाने में सक्षम बनाती हैं जिन्हें उसने पहले कभी नहीं देखा था। शोधकर्ताओं ने पाया कि रोबोट द्वारा अनुरोधित तीन 'ब्रिज' का उपयोग कई अलग-अलग अंतिम समाधानों में किया गया था, जिससे यह सिद्ध हुआ कि एक एकल छोटा प्रदर्शन भविष्य के कार्यों की एक विस्तृत श्रृंखला को सक्षम कर सकता है। यह सुझाव देता है कि सही प्रश्न पूछकर, एक रोबोट पहले की तुलना में बहुत कम मानवीय सहायता के साथ एक जटिल दुनिया में नेविगेट करना सीख सकता है।

यह अध्ययन पूरी तरह से एक सिम्युलेटेड वातावरण में किया गया था, जिसका अर्थ है कि परिणाम एक रोबोट और एक शेल्फ के कंप्यूटर मॉडल पर देखे गए, न कि भौतिक हार्डवेयर पर। हालांकि सिमुलेशन कठोर था और परिणाम कई परीक्षणों में सुसंगत रहे, शोधकर्ता स्वीकार करते हैं कि वास्तविक दुनिया की स्थितियाँ, जैसे कि भौतिक घर्षण या अप्रत्याशित बाधाएं, नई चुनौतियाँ पेश कर सकती हैं। वे यह भी नोट करते हैं कि उनकी विधि तब सबसे अच्छा काम करती है जब कार्यों में सार्थक मध्यवर्ती चरण साझा होते हैं; यदि कार्यों के सेट में कोई साझा आधार नहीं है, तो यह दृष्टिकोण उतना प्रभावी नहीं होगा। फिर भी, निष्कर्ष रोबोट को अधिक कुशल शिक्षक बनाने के लिए एक स्पष्ट मार्ग प्रदान करते हैं। पूरे कार्यों को याद करने के बजाय व्यवहारों को जोड़ने की समझ पर ध्यान केंद्रित करके, यह कार्य प्रदर्शित करता है कि रोबोट बहुत कम प्रशिक्षण डेटा के साथ बहुत अधिक अनुकूलन योग्य बन सकते हैं, जिससे कुछ सरल प्रदर्शनों को क्षमताओं के एक विशाल पुस्तकालय में बदला जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →