DISEIL: Demonstration Distillation for Sample-Efficient Imitation Learning
DISEIL एक सैंपल-एफिशिएंट इंटरैक्टिव इमिटेशन लर्निंग फ्रेमवर्क है जो स्वायत्त रूप से बार-बार होने वाले फेलियर मोड्स की पहचान करता है, लक्षित एक्सपर्ट डेमोंस्ट्रेशन रिक्वेस्ट जेनरेट करने के लिए विजन-लैंग्वेज मॉडल्स का उपयोग करता है, और न्यूनतम एक्सपर्ट समय के साथ सफलता दर को अधिकतम करने के लिए इन रिक्वेस्ट्स को टास्क कंस्ट्रेंट्स के विरुद्ध वैलिडेट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक रोबोट को नया कार्य करना सिखाना अक्सर एक बच्चे को साइकिल चलाना सिखाने जैसा लगता है। आप उन्हें संतुलन बनाना सिखाते हैं, वे प्रयास करते हैं, वे डगमगाते हैं, और वे गिर जाते हैं। यदि आप केवल हर एक डगमगाहट और गिरने को रिकॉर्ड करते हैं और रोबोट को उन सटीक क्षणों को याद करने के लिए मजबूर करते हैं, तो वह अंततः उन विशिष्ट स्थानों पर गिरने से बचने के लिए सीख जाएगा, लेकिन जैसे ही वह किसी थोड़े अलग उभार या हवा के नए झोंके का सामना करेगा, वह असहाय हो जाएगा। यह रोबोटिक्स में एक मौलिक समस्या है जिसे "कोवेरिएट शिफ्ट" (covariate shift) के रूप में जाना जाता है। रोबोट उस पथ पर नेविगेट करना सीख जाता है जो उसे दिखाया गया था, लेकिन जैसे ही वह एक छोटी सी गलती करता है, वह ऐसी स्थिति में चला जाता है जिसे उसने पहले कभी नहीं देखा है, जहाँ उसका प्रशिक्षण कोई मार्गदर्शन नहीं देता, जिससे आगे की गलतियों का एक सिलसिला शुरू हो जाता है।
इसे ठीक करने के लिए, शोधकर्ता "इंटरैक्टिव इमिटेशन लर्निंग" नामक एक विधि का उपयोग करते हैं। केवल वीडियो देखने के बजाय, रोबोट कार्य करने का प्रयास करता है, और जब वह गलत होने लगता है, तो एक मानव विशेषज्ञ या एक सटीक कंप्यूटर प्रोग्राम हस्तक्षेप करता है और सही चाल दिखाता है। फिर रोबोट पुन: अभ्यास करता है। हालाँकि, इस दृष्टिकोण की एक छिपी हुई लागत है: विशेषज्ञ का समय सबसे दुर्लभ संसाधन है। एक मानव शिक्षक हमेशा उपलब्ध नहीं रह सकता, और यहाँ तक कि एक सटीक कंप्यूटर प्रोग्राम को भी प्रदर्शन (demonstration) उत्पन्न करने में समय लगता है। महत्वपूर्ण प्रश्न केवल यह नहीं है कि कितनी बार मदद मांगनी है, बल्कि यह है कि वास्तव में क्या मांगना है। यदि आप हर बार मदद मांगते हैं जब रोबोट लड़खड़ाता है, तो आप बार-बार एक ही सुधार मांगते हुए समाप्त हो सकते हैं, जिससे उस समस्या पर कीमती समय बर्बाद होगा जिसे रोबोट पहले ही हल कर चुका है, जबकि एक अलग, अधिक खतरनाक गलती को अनदेखा किया जा रहा है, जो वह बार-बार कर रहा है।
ऑस्ट्रेलिया में डिकिन यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने इस सीमित संसाधन को प्रबंधित करने का एक नया तरीका प्रस्तावित किया है, जिसे वे DISEIL नाम देते हैं। उनके काम, जिसका परीक्षण कंप्यूटर सिमुलेशन की एक श्रृंखला में किया गया था, से पता चलता है कि कुशल सीखने की कुंजी केवल विफलता पर प्रतिक्रिया देना नहीं है, बल्कि उसके पीछे के पैटर्न को समझना है। प्रत्येक विफलता को एक अद्वितीय घटना के रूप में मानने के बजाय, DISEIL विफलताओं के एक समूह (batch) को देखता है और उन्हें इस आधार पर श्रेणियों में वर्गीकृत करता है कि वे कैसे और कहाँ गलत हुईं। यह विशेषज्ञ से एक ऐसा प्रदर्शन दिखाने के लिए कहता है जो विशेष रूप से विफलता की सबसे सामान्य या सबसे खतरनाक श्रेणी को लक्षित करता है, न कि केवल उस एकल गलती को ठीक करता है जो अभी-अभी हुई है।
प्रक्रिया तब शुरू होती है जब रोबोट एक कार्य करने का प्रयास करता है और विफल हो जाता है। सिस्टम तुरंत मदद के लिए कॉल नहीं करता है। इसके बजाय, यह तब तक प्रतीक्षा करता है जब तक कि रोबोट विफल प्रयासों का एक छोटा सेट एकत्र नहीं कर लेता। फिर यह इन विफलताओं का विश्लेषण करता है ताकि एक सामान्य सूत्र खोजा जा सके। कल्पना कीजिए कि एक रोबोट मेज पर एक ब्लॉक को धकेलने का प्रयास कर रहा है। वह इसलिए विफल हो सकता है क्योंकि वह बहुत जोर से धकेलता है, क्योंकि वह अपनी पकड़ खो देता है, या क्योंकि वह गलत कोण से शुरू करता है। DISEIL विफलता शुरू होने के समय रोबोट की स्थिति और वस्तु की स्थिति के गणितीय विवरण का उपयोग इन गलतियों को समूहों में वर्गीकृत करने के लिए करता है। यह पा सकता है कि आधे विफलताएं इसलिए हुईं क्योंकि रोबोट ने ब्लॉक के साथ संपर्क खो दिया, जबकि अन्य आधे विफलताएं इसलिए हुईं क्योंकि ब्लॉक को मेज से बाहर धकेल दिया गया।
एक बार जब विफलताओं को समूहीकृत कर दिया जाता है, तो सिस्टम को यह तय करना होता है कि पहले किसे ठीक किया जाए। यह उस समूह को देखता है जो सबसे अधिक बार दिखाई देता है या सबसे गंभीर त्रुटियां पैदा करता है। फिर यह एक लार्ज लैंग्वेज मॉडल (LLM), जो टेक्स्ट और छवियों को समझने में सक्षम कृत्रिम बुद्धिमत्ता का एक प्रकार है, का उपयोग करता है ताकि उस समूह की विफलताओं के विवरण को पढ़ सके। मॉडल plain language (साधारण भाषा) में वर्णन करता है कि क्या गलत हुआ, जैसे कि "रोबोट परिवहन के दौरान ब्लॉक के साथ संपर्क खो देता है।" यह विवरण सिस्टम को समस्या की प्रकृति समझने में मदद करता है।
सबसे अभिनव चरण इसके बाद आता है: यह तय करना कि विशेषज्ञ को नया प्रदर्शन कहाँ से शुरू करना चाहिए। पारंपरिक तरीकों में, विशेषज्ञ को तभी बुलाया जाता है जब रोबोट विफल होता है, और प्रदर्शन उसी सटीक बिंदु से शुरू होता है जहाँ विफलता हुई थी। इसका अर्थ अक्सर यह होता है कि विशेषज्ञ को उस गड़बड़ी से उबरने का तरीका दिखाना पड़ता है जो पहले ही हो चुकी है। हालाँकि, DISEIL विशेषज्ञ से थोड़ा पहले, एक ऐसी स्थिति से प्रदर्शन शुरू करने के लिए कहता है जहाँ रोबro अभी भी सही रास्ते पर है लेकिन वह उस विशिष्ट प्रकार की गलती करने वाला है जिसे वह बार-बार दोहरा रहा है। यह एक ड्राइविंग इंस्ट्रक्टर की तरह है जो कार के फुटपाथ से टकराने का इंतजार नहीं करता, बल्कि तब हस्तक्षेप करता है जब ड्राइवर लेन में जाने ही वाला होता है, ताकि उसे त्रुटि होने से पहले सही रास्ते पर रहने का तरीका दिखाया जा सके।
यह सुनिश्चित करने के लिए कि अनुरोध व्यावहारिक है, सिस्टम भौतिक दुनिया के नियमों के एक सेट की जाँच करता है। यह सत्यापित करता है कि विशेषज्ञ को दिखाने के लिए कहा गया शुरुआती स्थान वास्तव में रोबोट द्वारा सुलभ (reachable) है और लक्ष्य तक का मार्ग स्पष्ट है। यदि अनुरोध असंभव है, तो यह इसे तब तक संशोधित करता है जब रूप से व्यवहार्य (feasible) हो जाए। उसके बाद ही यह विशेषज्ञ से प्रदर्शन के लिए कहता है। विश्लेषण, समूहीकरण और योजना बनाने की यह पूरी प्रक्रिया विशेषज्ञ को बुलाने से पहले ही हो जाती है, जिससे यह सुनिश्चित होता है कि विशेषज्ञ के हर मिनट का उपयोग सबसे मूल्यवान सबक पर किया जाए।
शोधकर्ताओं ने पांच अलग-अलग सिम्युलेटेड कार्यों में इस दृष्टिकोण का परीक्षण किया, जिसमें एक सरल ग्रिड नेविगेशन गेम से लेकर जटिल रोबोटिक आर्म मूवमेंट जैसे कि क्यूब उठाना, सतह पोंछना या दरवाजा खोलना शामिल है। उन्होंने DISEIL की तुलना कई मौजूदा विधियों से की जो मदद मांगने का निर्णय लेती हैं। हर एक परीक्षण में, नई विधि के परिणामस्वरूप रोबोट की सफलता दर समान संख्या में प्रदर्शनों के बाद अधिक रही। यह लाभ तब सबसे अधिक स्पष्ट था जब अनुमत प्रदर्शनों की संख्या कम थी। केवल दस प्रदर्शनों के कड़े बजट के साथ, DISEIL ने अगले सबसे अच्छे तरीके से लगभग नौ प्रतिशत अंक अधिक प्रदर्शन किया। जैसे-जैसे बजट बड़ा होता गया, अंतर कम होता गया, लेकिन नई विधि सबसे प्रभावी बनी रही।
अध्ययन ने यह भी खुलासा किया कि सिस्टम के कौन से हिस्से मुख्य कार्य कर रहे थे। शोधकर्ताओं ने एक-एक करके DISEIL के विभिन्न घटकों को हटाकर परीक्षण किए। उन्होंने पाया कि सबसे महत्वपूर्ण हिस्सा विफलताओं को आवर्ती मोड (recurring modes) में समूहित करने की क्षमता थी। जब उन्होंने इस समूहीकरण चरण को हटा दिया और केवल सबसे खराब एकल विफलता को ठीक करने का चयन किया, तो रोबोट का प्रदर्शन काफी गिर गया। वे भाषा मॉडल जो विफलताओं का वर्णन करते थे और अनुरोध लिखते थे, सहायक थे, लेकिन वे सफलता के प्राथमिक चालक नहीं थे। वास्तविक सफलता रणनीति यह थी कि सीमित प्रदर्शनों को रोबोट द्वारा की जा रही गलतियों के विभिन्न प्रकारों में वितरित किया गया, बजाय इसके कि रोबोट को बार-बार एक ही त्रुटि को ठीक करने में फंसा दिया जाए।
यह कार्य वर्तमान में कंप्यूटर सिमुलेशन तक सीमित है। शोधकर्ताओं ने शिक्षकों के रूप में मानव विशेषज्ञों, स्क्रिप्टेड कंप्यूटर प्रोग्रामों और सीखे गए कंप्यूटर नीतियों के मिश्रण का उपयोग किया है। वास्तविक दुनिया में, एक मानव शिक्षक थका हुआ, असंगत या कार्य को पूरी तरह से करने में असमर्थ हो सकता है, और भौतिक रोबोट को कैमरों और सेंसरों का उपयोग करके अपनी स्थिति का अनुमान लगाना होगा, जो ऐसी त्रुटियां पेश करता है जो सिमुलेशन में नहीं थीं। शोधकर्ता स्वीकार करते हैं कि एक आदर्श डिजिटल दुनिया से एक अस्त-व्यस्त भौतिक दुनिया में जाना एक महत्वपूर्ण चुनौती है। वे यह भी नोट करते हैं कि उनका सिस्टम वर्तमान में एक बार में अभ्यास के एक दौर पर ध्यान केंद्रित करता है और अभी तक महीनों या वर्षों की लंबी अवधि में रोबोट ने क्या सीखा है, इसका पता नहीं लगाता है।
इन सीमाओं के बावजूद, निष्कर्ष रोबोटों को अधिक कुशल शिक्षार्थी बनाने के लिए एक स्पष्ट मार्ग प्रदान करते हैं। मूल विचार यह है कि पर्यवेक्षण (supervision) एक डिज़ाइन विकल्प है, न कि केवल विफलता की प्रतिक्रिया। विफलता को सावधानीपूर्वक चुनने और पाठ कहाँ से शुरू करना है, यह तय करके, हम रोबोट को कम में अधिक सिखा सकते हैं। एक ऐसी दुनिया में जहाँ विशेषज्ञ का समय महंगा है और डेटा प्रचुर मात्रा में है, सही समय पर सही प्रश्न पूछने की क्षमता एक ऐसे रोबोट और एक ऐसे रोबोट के बीच का अंतर हो सकती है जो धीरे सीखता है और जो तेजी से सीखता है। अध्ययन बताता है कि रोबोट लर्निंग का भविष्य अधिक डेटा एकत्र करने में नहीं, बल्कि बुद्धिमानी से डेटा को क्यूरेट करने में है, यह सुनिश्चित करते हुए कि प्रत्येक प्रदर्शन मायने रखे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।