← नवीनतम पेपर
🤖 AI

CLAM: Continuous Latent Action Models for Robot Learning from Unlabeled Demonstrations

यह शोधपत्र CLAM को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो रोबोटों को स्व-पर्यवेक्षित गतिकी भविष्यवाणी (self-supervised dynamics prediction) के माध्यम से निरंतर लेटेंट क्रियाओं (continuous latent actions) का अनुमान लगाकर और उन्हें कार्य-अज्ञेय खेल डेटा (task-agnostic play data) के साथ ग्राउंड करके, बिना महंगी एक्शन-लेबल वाली प्रदर्शनों की आवश्यकता के, विशेषज्ञ लेबल वाले बिहेवियर क्लोनिंग के तुलनीय प्रदर्शन प्राप्त करते हुए, बिना लेबल वाली अवलोकन अनुक्रमों से प्रभावी नियंत्रण नीतियों को सीखने में सक्षम बनाता है।

मूल लेखक: Anthony Liang, Pavel Czempin, Matthew M. Hong, Yutai Zhou, Jingzhen Wang, Erdem Biyik, Stephen Tu

प्रकाशित 2026-07-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anthony Liang, Pavel Czempin, Matthew M. Hong, Yutai Zhou, Jingzhen Wang, Erdem Biyik, Stephen Tu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कुछ करना सिखाने की कोशिश कर रहे हैं, जैसे ब्लॉक्स को एक के ऊपर एक रखना या कोई पेय डालना। आमतौर पर, रोबोट को सिखाने का सबसे अच्छा तरीका उसे यह दिखाना है कि वास्तव में क्या करना है, चरण-दर-चरण, जबकि आप उसका हाथ थामे रखते हैं और उसके मोटर्स की हर छोटी हरकत को रिकॉर्ड करते हैं। यह एक छात्र को एक ऐसी पाठ्यपुस्तक देने जैसा है जिसके पीछे उत्तर लिखे हुए हैं। लेकिन यहाँ एक पेच है: उन मोटर मूवमेंट्स को रिकॉर्ड करना अविश्वसनीय रूप से कठिन, महंगा और उबाऊ है। इसके लिए एक मानव विशेषज्ञ को घंटों तक भौतिक रूप से रोबोट को नियंत्रित करना पड़ता है, जो धीमा और खर्चीला है।

अब, एक अलग तरह के शिक्षक की कल्पना करें। इस शिक्षक के पास कोई रोबोट नहीं है; उनके पास बस एक वीडियो कैमरा है। वे खुद कोई काम करते हुए वीडियो फिल्माते हैं, या इंटरनेट पर लोगों के काम करने के वीडियो ढूँढ लेते हैं। रोबोट देख सकता है कि क्या हो रहा है—ब्लॉक्स हिल रहे हैं, कप भर रहा है—लेकिन उसे यह पता नहीं होता कि उस बदलाव को करने के लिए इंसान ने अपने हाथ को कैसे हिलाया। "मोटर सिग्नल" गायब हैं। यह वह पहेली है जिसे रोबلة के क्षेत्र के वैज्ञानिक हल करने की कोशिश कर रहे हैं: एक रोबोट केवल वीडियो देखकर खुद कैसे चलना सीख सकता है, जहाँ "कैसे करें" के निर्देश छिपे हुए हैं? यह शोध पत्र ठीक इसी समस्या को संबोधित करता है, जिसका लक्ष्य रोबोट को महंगे, हाथ से नियंत्रित प्रशिक्षण सत्रों के बिना, सस्ते और आसानी से एकत्र किए जा सकने वाले वीडियो से सीखने में सक्षम बनाना है।

इस शोध के पीछे के शोधकर्ताओं ने, एंथनी लियांग और उनकी टीम ने, CLAM (कंटीन्यूअस लेटेंट एक्शन मॉडल्स) नामक एक नई विधि पेश की है। CLAM को एक सुपर-स्मार्ट जासूस के रूप में समझें जो वीडियो के दो लगातार फ्रेमों को देख सकता है और उस "अदृश्य बल" का अनुमान लगा सकता है जिसने परिवर्तन किया है। यदि आप देखते हैं कि एक कप मेज के बाईं ओर से दाईं ओर जाता है, तो CLAM उस विशिष्ट, निरंतर गति का पता लगाने की कोशिश करता है जो बीच में हुई थी, भले ही उसने कभी उस हाथ को नहीं देखा जिसने उसे हिलाया।

यहाँ जादू कैसे होता है। सबसे पहले, रोबोट अनलेबल (बिना लेबल वाले) वीडियो के एक विशाल ढेर को देखता है (केवल अवलोकन, कोई निर्देश नहीं)। वह वर्तमान फ्रेम और एक "अनुमान" के आधार पर यह भविष्यवाणी करने की कोशिश करता है कि अगला फ्रेम कैसा दिखेगा। यदि अनुमान गलत है, तो भविष्यवाणी विफल हो जाती है, और रोबोट अपने अनुमान को सुधारना सीखता है। समय के साथ, वह इन "छिपे हुए कार्यों" की एक लाइब्रेरी बनाता है जो दुनिया को समझने योग्य बनाती है। लेकिन एक अड़चन है: ये छिपे हुए कार्य केवल रोबोट के दिमाग में मौजूद नंबर हैं; वे अभी वास्तविक मोटर कमांड नहीं हैं।

इसे ठीक करने के लिए, टीम एक दूसरे, छोटे डेटा सेट का उपयोग करती है: "प्ले" (खेलने वाला) डेटा। यह केवल रोबोट का इधर-उधर घूमना, चीजों से टकराना और बेतरतीब ढंग से अपने हाथ हिलाना है, लेकिन इस बार, कंप्यूटर वास्तव में मोटर कमांड रिकॉर्ड करता है। यह रोबोट के मिट्टी के साथ खेलने जैसा है जिसका कोई लक्ष्य नहीं है, लेकिन वह अपनी उंगलियों के हिलने का एक डायरी रखता है। CLAM इस "डायरी" का उपयोग यह सिखाने के लिए करता है कि अपने "छिपे हुए कार्यों" के अनुमानों को वास्तविक, भौतिक गतिविधियों में कैसे अनुवादित किया जाए। यहाँ मुख्य नवाचार यह है कि वे "अनुमान लगाने" वाले हिस्से और "अनुवाद करने" वाले हिस्से को एक साथ प्रशिक्षित करते हैं। यह सुनिश्चित करता है कि अनुमान सरल और उपयोगी बने रहें, न कि एक अराजक ढेर बन जाएं जिसे रोबोट वास्तव में निष्पादित न कर सके।

इसके परिणाम काफी प्रभावशाली हैं। टीम ने CLAM का परीक्षण दो तरीकों से किया: कंप्यूटर सिमुलेशन में (एक वीडियो गेम की दुनिया की तरह) और एक वास्तविक भौतिक रोबोटिक हाथ, 'विडोएक्स' (WidowX) पर। उन्होंने पाया कि CLAM जटिल कार्यों को हल करने में, जैसे पुर्जों को जोड़ना या वस्तुओं को उठाना, पिछले उन तरीकों की तुलना में 2 से 3 गुना अधिक सफलता दर के साथ सीख सकता है जिन्होंने समान कार्य करने की कोशिश की थी। कई मामलों में, रोबोट ने लगभग उतना ही प्रदर्शन करने में महारत हासिल कर ली जितना कि यदि उसे महंगे, सटीक "मोटर कमांड" डेटा के साथ प्रशिक्षित किया गया होता, भले ही उसने वह डेटा वास्तव में कभी नहीं देखा।

महत्वपूर्ण रूप से, यह शोध पत्र दिखाता है कि यह दृष्टिकोण तब सबसे अच्छा काम करता है जब "छिपे हुए कार्य" निरंतर (सुचारू और तरल) होते हैं, न कि छोटे, अलग-अलग चरणों में टूटे हुए, और जब रोबोट उस थोड़े से "प्ले" डेटा का उपयोग करके इन कार्यों को अनुवादित करना सीखता है। यदि वे कार्यों को एक कठोर, चरण-दर-चरण प्रारूप में डालने की कोशिश करते, या यदि वे अनुवाद भाग को अलग से प्रशिक्षित करने का प्रयास करते, तो रोबोट संघर्ष करता। यह शोध पत्र प्रदर्शित करता है कि इस स्व-निर्देशित जासूसी कार्य को थोड़े से अव्यवस्थित, अनलेबल प्ले डेटा के साथ जोड़कर, हम रोबोट को नए कौशल सिखा सकते हैं, जिसके लिए हमें महंगे, विशेषज्ञ-नेतृत्व वाले टेलीऑपरेशन की आवश्यकता नहीं है। यह रोबोट को इंटरनेट पर पहले से उपलब्ध वीडियो सामग्री से सीखने में सक्षम बनाने की दिशा में एक बड़ा कदम है, बजाय इसके कि हमें हर एक चाल को मैन्युअल रूप से रिकॉर्ड करना पड़े।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →