Scalable Behavior Cloning with Open Data, Training, and Evaluation
यह शोध पत्र ABC को प्रस्तुत करता है, जो रोबोटिक मैनिपुलेशन के लिए बिहेवियर क्लोनिंग हेतु एक पूर्णतः ओपन-सोर्स स्टैक है, जिसमें अब तक का सबसे बड़ा टेलीऑपरेशन डेटासेट (ABC-130K), को-ट्रेनिंग रेसिपीज़ के साथ एक पुनरुत्पादक हार्डवेयर और सिमुलेशन पाइपलाइन, और जटिल डेक्सट्रस कार्यों पर डिफ्यूजन ट्रांसफॉर्मर एवं विजन-लैंग्वेज-एक्शन आर्किटेक्चर का व्यापक मूल्यांकन शामिल है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को जटिल काम करना सिखाना चाहते हैं, जैसे कार्डबोर्ड का डिब्बा मोड़ना, लेगो (LEGO) के टुकड़ों को छाँटना, या यहाँ तक कि एक तंग वॉलेट से क्रेडिट कार्ड बाहर निकालना। अतीत में, रोबोट को सिखाना किसी बच्चे को किसी कार्य की केवल एक धुंधली तस्वीर दिखाकर उसे समझाने जैसा था और यह उम्मीद करना कि वह खुद ही सब समझ जाएगा। यह महंगा, धीमा और अक्सर ऐसा होता था कि रोबोट हार मान लेता था।
यह पेपर ABC को पेश करता है, जो रोबोटों को इंसानों को देखकर सीखने के लिए एक विशाल, ओपन-सोर्स "स्टार्टर किट" है। इसे रोबोट प्रशिक्षण का "विकिपीडिया" या "यूट्यूब" समझें, लेकिन केवल वीडियो के बजाय, इसमें वास्तविक रेसिपी, रसोई के उपकरण और टेस्ट किचन भी शामिल है ताकि कोई भी इसे आज़मा सके।
यहाँ उनके "ABC स्टैक" का सरल उपमाओं (analogies) के साथ विवरण दिया गया है:
1. लाइब्रेरी: ABC-130K (द "कुकबुक")
एक ऐसी लाइब्रेरी की कल्पना करें जिसमें केवल एक या दो रेसिपी नहीं, बल्कि इंसानों द्वारा किए गए 130,000 अलग-अलग कार्यों के 3,500 घंटों के वीडियो फुटेज हों।
- इसके अंदर क्या है: इंसान दो रोबोटिक भुजाओं (arms) का उपयोग करके साधारण "उठाने और रखने" के कामों से लेकर कागज़ के हवाई जहाज़ मोड़ने या चाबी से बॉक्स खोलने जैसे बेहद कठिन कार्यों तक सब कुछ कर रहे हैं।
- यह क्यों महत्वपूर्ण है: इससे पहले, अधिकांश रोबोट डेटा या तो बहुत छोटा था, या इकट्ठा करने में बहुत महंगा था, या बड़ी कंपनियों के गुप्त तहखानों में बंद था। यह अपने प्रकार का सबसे बड़ा खुला संग्रह है, जिसे लगभग $8,000 के रोबोट पर बनाया गया है (जो एक रोबोट के लिए सस्ता है), जिससे यह केवल बड़े टेक दिग्गजों के लिए नहीं, बल्कि सामान्य शोधकर्ताओं के लिए भी सुलभ बन जाता है।
2. मस्तिष्क: ABC-Models (द "स्टूडेंट्स")
लेखकों ने केवल डेटा ही नहीं डाला; उन्होंने सीखने के विभिन्न तरीकों को समझने के लिए दो अलग-अलग प्रकार के "छात्र" रोबोट बनाए और परीक्षण किया कि कौन सी सीखने की शैली सबसे अच्छा काम करती है।
- "डिफ्यूजन ट्रांसफॉर्मर" (DiT): इसे एक ऐसे छात्र के रूप में सोचें जो किसी तस्वीर को देखने और अगले कदम का अनुमान लगाने में बहुत अच्छा है, जैसे क्रॉसवर्ड पहेली को चरण-दर-चरण भरना।
- "विज़न-लैंग्वेज-एक्शन" (VLA): इसे एक ऐसे छात्र के रूप में सोचें जो निर्देशों को पढ़ सकता है, तस्वीर देख सकता है और एक साथ संदर्भ (context) को समझ सकता है।
- प्रयोग: उन्होंने इन छात्रों का विभिन्न "शिक्षकों" (विभिन्न कैमरा व्यू और भाषा इनपुट) के साथ परीक्षण किया। उन्होंने पाया कि VLA छात्र अधिक कंप्यूटिंग पावर मिलने पर तेज़ी से सीखता है, जबकि DiT छात्र कम पावर के साथ अधिक कुशल था। उन्होंने "ग्रेजुएटेड" दिमाग (मॉडल वेट्स) जारी कर दिए ताकि कोई भी इनका उपयोग कर सके।
3. सिम्युलेटर: ABC-Sim (द "फ्लाइट सिम्युलेटर")
आमतौर पर, यह देखने के लिए कि क्या कोई रोबोट स्मार्ट है, आपको उसे वास्तविक दुनिया में कार्य करने देना पड़ता है। यदि वह विफल होता है, तो वह कुछ तोड़ सकता है या उसे रीसेट करने में घंटों लग सकते हैं।
- समाधान: लेखकों ने रोबोटों के लिए एक वर्चुअल रियलिटी "फ्लाइट सिम्युलेटर" बनाया। उन्होंने कंप्यूटर गेम के भीतर इंसानों द्वारा रोबोट को टेलीऑपरेट करते हुए 400 घंटों का डेटा बनाया।
- जादू: उन्होंने साबित किया कि यदि कोई रोबोट इस वीडियो गेम में अच्छा प्रदर्शन करता है, तो वह वास्तविक दुनिया में भी अच्छा प्रदर्शन करेगा। यह कहने जैसा है कि, "यदि आप इस सिम्युलेटर में विमान उड़ा सकते हैं, तो आप शायद असली आसमान के लिए तैयार हैं।" यह शोधकर्ताओं को भौतिक रोबोट की आवश्यकता के बिना या नुकसान के जोखिम के बिना अपने विचारों का परीक्षण करने की अनुमति देता है।
4. टेस्ट ड्राइव: ABC-Eval (द "ड्राइविंग टेस्ट")
उन्होंने केवल यह नहीं कहा कि "यह काम करता है"; उन्होंने वास्तव में रोबोटों को कार्यों की एक कठिन श्रृंखला (gauntlet) के माध्यम से चलाया।
- परिणाम: रोबोटों ने सफलतापूर्वक बॉक्स मोड़ने, वस्तुओं को छाँटने और चाबी को ताले में डालने जैसे नाजुक कार्य करने के लिए सीखा।
- "DAgger" ट्रिक: सबसे कठिन कार्य (बॉक्स मोड़ना) के लिए, रोबोट बार-बार विफल हो रहा था। लेखकों ने DAgger नामक तकनीक का उपयोग किया। कल्पना कीजिए कि एक ड्राइविंग इंस्ट्रक्टर एक छात्र को गाड़ी चलाने देता है, लेकिन जैसे ही छात्र दुर्घटनाग्रस्त होने लगता है, इंस्ट्रक्टर उसे ठीक करने के लिए स्टीयरिंग व्हील थाम लेता है, और फिर छात्र को फिर से कोशिश करने देता है। इन "ठीक करने वाले" क्षणों को इकट्ठा करके, रोबोट ने अपनी गलतियों से उबरना सीखा और अंततः बॉक्स फोल्डिंग में महारत हासिल की।
बड़ी तस्वीर (The Big Picture)
लेखक कह रहे हैं: "हमने रोबोट लर्निंग के लिए पूरा स्कूल सिस्टम बनाया है। हमारे पास किताबें (डेटा), शिक्षक (मॉडेल्स), अभ्यास परीक्षा (सिमुलेशन), और अंतिम परीक्षण (वास्तविक दुनिया के परिणाम) हैं। हम यह सब मुफ्त में दे रहे हैं।"
उनका लक्ष्य रोबोट लर्निंग को अमीर कंपनियों के गुप्त क्लब से रोकना और एक सामुदायिक प्रयास बनाना है जहाँ हर कोई मिलकर रोबोट सिखाने के "ABC" सीख सके। वे यह वादा नहीं कर रहे हैं कि कल ही रोबोट आपके कपड़े धो देंगे, लेकिन वे आधार प्रदान कर रहे हैं ताकि शोधकर्ता अंततः उन्हें बनाना शुरू कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।