← नवीनतम पेपर
💻 computer science

Scalable Behavior Cloning with Open Data, Training, and Evaluation

यह शोध पत्र ABC को प्रस्तुत करता है, जो रोबोटिक मैनिपुलेशन के लिए बिहेवियर क्लोनिंग हेतु एक पूर्णतः ओपन-सोर्स स्टैक है, जिसमें अब तक का सबसे बड़ा टेलीऑपरेशन डेटासेट (ABC-130K), को-ट्रेनिंग रेसिपीज़ के साथ एक पुनरुत्पादक हार्डवेयर और सिमुलेशन पाइपलाइन, और जटिल डेक्सट्रस कार्यों पर डिफ्यूजन ट्रांसफॉर्मर एवं विजन-लैंग्वेज-एक्शन आर्किटेक्चर का व्यापक मूल्यांकन शामिल है।

मूल लेखक: Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Mali
प्रकाशित 2026-06-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Arthur Allshire, Himanshu Gaurav Singh, Ritvik Singh, Adam Rashid, Hongsuk Choi, David McAllister, Justin Yu, Yiyuan Chen, Huang Huang, Pieter Abbeel, Xi Chen, Rocky Duan, Phillip Isola, Jitendra Malik, Fred Shentu, Guanya Shi, Philipp Wu, Angjoo Kanazawa

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को जटिल काम करना सिखाना चाहते हैं, जैसे कार्डबोर्ड का डिब्बा मोड़ना, लेगो (LEGO) के टुकड़ों को छाँटना, या यहाँ तक कि एक तंग वॉलेट से क्रेडिट कार्ड बाहर निकालना। अतीत में, रोबोट को सिखाना किसी बच्चे को किसी कार्य की केवल एक धुंधली तस्वीर दिखाकर उसे समझाने जैसा था और यह उम्मीद करना कि वह खुद ही सब समझ जाएगा। यह महंगा, धीमा और अक्सर ऐसा होता था कि रोबोट हार मान लेता था।

यह पेपर ABC को पेश करता है, जो रोबोटों को इंसानों को देखकर सीखने के लिए एक विशाल, ओपन-सोर्स "स्टार्टर किट" है। इसे रोबोट प्रशिक्षण का "विकिपीडिया" या "यूट्यूब" समझें, लेकिन केवल वीडियो के बजाय, इसमें वास्तविक रेसिपी, रसोई के उपकरण और टेस्ट किचन भी शामिल है ताकि कोई भी इसे आज़मा सके।

यहाँ उनके "ABC स्टैक" का सरल उपमाओं (analogies) के साथ विवरण दिया गया है:

1. लाइब्रेरी: ABC-130K (द "कुकबुक")

एक ऐसी लाइब्रेरी की कल्पना करें जिसमें केवल एक या दो रेसिपी नहीं, बल्कि इंसानों द्वारा किए गए 130,000 अलग-अलग कार्यों के 3,500 घंटों के वीडियो फुटेज हों।

  • इसके अंदर क्या है: इंसान दो रोबोटिक भुजाओं (arms) का उपयोग करके साधारण "उठाने और रखने" के कामों से लेकर कागज़ के हवाई जहाज़ मोड़ने या चाबी से बॉक्स खोलने जैसे बेहद कठिन कार्यों तक सब कुछ कर रहे हैं।
  • यह क्यों महत्वपूर्ण है: इससे पहले, अधिकांश रोबोट डेटा या तो बहुत छोटा था, या इकट्ठा करने में बहुत महंगा था, या बड़ी कंपनियों के गुप्त तहखानों में बंद था। यह अपने प्रकार का सबसे बड़ा खुला संग्रह है, जिसे लगभग $8,000 के रोबोट पर बनाया गया है (जो एक रोबोट के लिए सस्ता है), जिससे यह केवल बड़े टेक दिग्गजों के लिए नहीं, बल्कि सामान्य शोधकर्ताओं के लिए भी सुलभ बन जाता है।

2. मस्तिष्क: ABC-Models (द "स्टूडेंट्स")

लेखकों ने केवल डेटा ही नहीं डाला; उन्होंने सीखने के विभिन्न तरीकों को समझने के लिए दो अलग-अलग प्रकार के "छात्र" रोबोट बनाए और परीक्षण किया कि कौन सी सीखने की शैली सबसे अच्छा काम करती है।

  • "डिफ्यूजन ट्रांसफॉर्मर" (DiT): इसे एक ऐसे छात्र के रूप में सोचें जो किसी तस्वीर को देखने और अगले कदम का अनुमान लगाने में बहुत अच्छा है, जैसे क्रॉसवर्ड पहेली को चरण-दर-चरण भरना।
  • "विज़न-लैंग्वेज-एक्शन" (VLA): इसे एक ऐसे छात्र के रूप में सोचें जो निर्देशों को पढ़ सकता है, तस्वीर देख सकता है और एक साथ संदर्भ (context) को समझ सकता है।
  • प्रयोग: उन्होंने इन छात्रों का विभिन्न "शिक्षकों" (विभिन्न कैमरा व्यू और भाषा इनपुट) के साथ परीक्षण किया। उन्होंने पाया कि VLA छात्र अधिक कंप्यूटिंग पावर मिलने पर तेज़ी से सीखता है, जबकि DiT छात्र कम पावर के साथ अधिक कुशल था। उन्होंने "ग्रेजुएटेड" दिमाग (मॉडल वेट्स) जारी कर दिए ताकि कोई भी इनका उपयोग कर सके।

3. सिम्युलेटर: ABC-Sim (द "फ्लाइट सिम्युलेटर")

आमतौर पर, यह देखने के लिए कि क्या कोई रोबोट स्मार्ट है, आपको उसे वास्तविक दुनिया में कार्य करने देना पड़ता है। यदि वह विफल होता है, तो वह कुछ तोड़ सकता है या उसे रीसेट करने में घंटों लग सकते हैं।

  • समाधान: लेखकों ने रोबोटों के लिए एक वर्चुअल रियलिटी "फ्लाइट सिम्युलेटर" बनाया। उन्होंने कंप्यूटर गेम के भीतर इंसानों द्वारा रोबोट को टेलीऑपरेट करते हुए 400 घंटों का डेटा बनाया।
  • जादू: उन्होंने साबित किया कि यदि कोई रोबोट इस वीडियो गेम में अच्छा प्रदर्शन करता है, तो वह वास्तविक दुनिया में भी अच्छा प्रदर्शन करेगा। यह कहने जैसा है कि, "यदि आप इस सिम्युलेटर में विमान उड़ा सकते हैं, तो आप शायद असली आसमान के लिए तैयार हैं।" यह शोधकर्ताओं को भौतिक रोबोट की आवश्यकता के बिना या नुकसान के जोखिम के बिना अपने विचारों का परीक्षण करने की अनुमति देता है।

4. टेस्ट ड्राइव: ABC-Eval (द "ड्राइविंग टेस्ट")

उन्होंने केवल यह नहीं कहा कि "यह काम करता है"; उन्होंने वास्तव में रोबोटों को कार्यों की एक कठिन श्रृंखला (gauntlet) के माध्यम से चलाया।

  • परिणाम: रोबोटों ने सफलतापूर्वक बॉक्स मोड़ने, वस्तुओं को छाँटने और चाबी को ताले में डालने जैसे नाजुक कार्य करने के लिए सीखा।
  • "DAgger" ट्रिक: सबसे कठिन कार्य (बॉक्स मोड़ना) के लिए, रोबोट बार-बार विफल हो रहा था। लेखकों ने DAgger नामक तकनीक का उपयोग किया। कल्पना कीजिए कि एक ड्राइविंग इंस्ट्रक्टर एक छात्र को गाड़ी चलाने देता है, लेकिन जैसे ही छात्र दुर्घटनाग्रस्त होने लगता है, इंस्ट्रक्टर उसे ठीक करने के लिए स्टीयरिंग व्हील थाम लेता है, और फिर छात्र को फिर से कोशिश करने देता है। इन "ठीक करने वाले" क्षणों को इकट्ठा करके, रोबोट ने अपनी गलतियों से उबरना सीखा और अंततः बॉक्स फोल्डिंग में महारत हासिल की।

बड़ी तस्वीर (The Big Picture)

लेखक कह रहे हैं: "हमने रोबोट लर्निंग के लिए पूरा स्कूल सिस्टम बनाया है। हमारे पास किताबें (डेटा), शिक्षक (मॉडेल्स), अभ्यास परीक्षा (सिमुलेशन), और अंतिम परीक्षण (वास्तविक दुनिया के परिणाम) हैं। हम यह सब मुफ्त में दे रहे हैं।"

उनका लक्ष्य रोबोट लर्निंग को अमीर कंपनियों के गुप्त क्लब से रोकना और एक सामुदायिक प्रयास बनाना है जहाँ हर कोई मिलकर रोबोट सिखाने के "ABC" सीख सके। वे यह वादा नहीं कर रहे हैं कि कल ही रोबोट आपके कपड़े धो देंगे, लेकिन वे आधार प्रदान कर रहे हैं ताकि शोधकर्ता अंततः उन्हें बनाना शुरू कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →