Habilis-: A Fast-Motion and Long-Lasting On-Device Vision-Language-Action Model
यह शोध पत्र Habilis- को प्रस्तुत करता है, जो एक तेज़-गति वाला और लंबे समय तक चलने वाला ऑन-डिवाइस विजन-लैंग्वेज-एक्शन मॉडल है, जो उत्पादकता-विश्वसनीयता तल (Productivity-Reliability Plane) का मूल्यांकन के लिए लाभ उठाने और भाषा-मुक्त प्री-ट्रेनिंग, चक्रीय कार्य पोस्ट-ट्रेनिंग और उन्नत मोशन शेपिंग तकनीकों को एकीकृत करने के माध्यम से उत्कृष्ट निरंतर-रन प्रदर्शन और RoboTwin 2.0 लीडरबोर्ड पर अत्याधुनिक परिणाम प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक व्यस्त गोदाम में काम करने के लिए एक नया रोबोट सहायक किराए पर ले रहे हैं। आप केवल ऐसा रोबोट नहीं चाहते जो आपके द्वारा सेटअप किए जाने पर एक बार बॉक्स उठा सके। आप एक ऐसा रोबोट चाहते जो आठ घंटे लगातार काम कर सके, जब सुरक्षित हो तो तेज़ी से चले, जब काम कठिन हो तो धीमा हो जाए, और जिसे आपको हर पाँच मिनट में आकर उसे ठीक करने की ज़रूरत न पड़े।
वर्तमान अधिकांश रोबोट मस्तिष्क (जिन्हें विज़न-लैंग्वेज-एक्शन मॉडल कहा जाता है) अत्यधिक सतर्क छात्रों की तरह हैं। वे बहुत धीरे चलते हैं, हर चीज़ को दोबारा जांचते हैं, और यदि वे एक छोटी सी गलती करते हैं, तो वे रुक जाते हैं और किसी मानव शिक्षक द्वारा दृश्य को रीसेट करने का इंतज़ार करते हैं। वे एक बार परीक्षा देने में तो बहुत अच्छे हैं, लेकिन एक पूरी शिफ्ट काम करने में बहुत खराब हैं।
यह पेपर Habilis-β पेश करता है, जो एक नया रोबोट मस्तिष्क है जिसे एक कठोर परिश्रमी, तेज़ गति वाले फैक्ट्री अनुभवी (factory veteran) के रूप में डिज़ाइन किया गया है। यह कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है:
1. समस्या: "परफेक्ट टेस्ट" बनाम "असली शिफ्ट"
वर्तमान रोबोटों का मूल्यांकन एक छात्र द्वारा एक एकल परीक्षा देने की तरह किया जाता है। यदि वे पास हो जाते हैं, तो उन्हें 'A' ग्रेड मिलता है। लेकिन वास्तविक दुनिया में, रोबोट एक परीक्षा नहीं देते; वे एक के बाद एक हज़ारों परीक्षण देते हैं।
- समस्या: यदि रोबोट बहुत धीरे चलता है, तो वह कुछ भी हासिल नहीं कर पाता (कम उत्पादकता)। यदि वह बिना सोचे-समझे बहुत तेज़ चलता है, तो वह टकरा जाता है और उसे किसी इंसान द्वारा रीसेट करने की आवश्यकता होती है (कम विश्वसनीयता)।
- नया मीट्रिक: लेखकों ने एक "प्रोडक्टिविटी-रिलायबिलिटी प्लेन" बनाया है। इसे दो नंबरों वाले एक स्कोरकार्ड के रूप में सोचें:
- TPH (टास्क प्रति घंटा): आपने कितने बॉक्स हिलाए? (गति)
- MTBI (हस्तक्षेप के बीच का औसत समय): आपको मदद के लिए इंसान को बुलाने से पहले आपने कितनी देर काम किया? (विश्वसनीयता)
- लक्ष्य: आप उच्च गति AND मदद के लिए कॉल के बीच लंबा समय चाहते हैं।
2. समाधान: Habilis-β कैसे सीखता है
Habilis-β तीन विशिष्ट चरणों में सीखता है, जैसे एक छात्र किंडरगार्टन से मास्टर क्राफ्ट्समैन तक जाता है।
चरण 1: "प्लेग्राउंड" चरण (चलना सीखना)
विशिष्ट कार्य सीखने से पहले, रोबोट को असंरचित "खेल" डेटा (unstructured "play" data) दिया जाता है।
- उपमा: कल्पना करें कि एक बच्चा ब्लॉक के साथ खेल रहा है, उन्हें गिरा रहा है, उठा रहा है और बिना किसी शिक्षक के निर्देश के उन्हें बेतरतीब ढंग से एक के ऊपर एक रख रहा है।
- यह कैसे मदद करता है: रोबोट चीज़ों को हिलाने के भौतिक विज्ञान (physics) को सीखता है। यह सीखता है कि यदि वह एक ब्लॉक गिरा देता है तो कैसे संभले या किसी चीज़ को अजीब तरीके से कैसे पकड़े। इससे उसे वस्तुओं के व्यवहार के बारे में एक "अंतर्ज्ञान (gut feeling)" मिलता है, ताकि चीज़ें थोड़ी गलत होने पर वह घबराए नहीं।
चरण 2: "पुनरावृत्ति" चरण (सहनशक्ति सीखना)
अधिकांश रोबोट "सफलता फिर रुकना" वाले वीडियो पर प्रशिक्षित होते हैं। Habilis-β चक्रीय डेटा (cyclic data) पर प्रशिक्षित है।
- उपमा: केवल एक वीडियो देखने के बजाय जिसमें कोई एक सैंडविच बनाकर रुक जाता है, Habilis-β एक ऐसे वीडियो को देखता है जिसमें कोई व्यक्ति लगातार 10 घंटों तक सैंडविच बना रहा है। वह देखता है कि ब्रेड बासी हो रही है, मेज गंदी हो रही है, और व्यक्ति थक रहा है।
- यह कैसे मदद करता है: यह ड्रिफ्ट (drift) को संभालने के लिए सीखता है। वास्तविक दुनिया में, चीज़ें हर बार बिल्कुल सही जगह पर नहीं होतीं। यह प्रशिक्षण रोबोट को तब भी चलते रहने के लिए सिखाता है जब शुरुआती स्थिति थोड़ी अलग हो, जिससे उसे मानव रीसेट की आवश्यकता नहीं पड़ती।
चरण 3: "स्पीड शेपिंग" चरण (ESPADA)
गति के लिए यही असली राज है। रोबोट ESPADA (स्पेशियली अवेयर डाउनसैंपलिंग) नामक तकनीक का उपयोग करता है।
- उपमा: कल्पना करें कि एक व्यक्ति कमरे के पार चल रहा है।
- खाली कमरे में चलना: रोबोट इस हिस्से को फास्ट-फॉरवर्ड करना सीखता है। उसे हर कदम देखने की ज़रूरत नहीं है; उसे बस इतना जानना है कि "मैं वहाँ जा रहा हूँ।"
- एक नाजुक अंडा उठाना: रोबोट सटीक होने के लिए स्लो-मोशन में धीमा हो जाता है। उसे हर सूक्ष्म हलचल को देखने की आवश्यकता होती।
- यह कैसे मदद करता है: यह रोबोट को तब धीमा और उबाऊ होने से रोकता है जब वह तेज़ होने के लिए सुरक्षित हो। यह आंदोलन के "उबाऊ" हिस्सों को संकुचित (compress) कर देता है ताकि रोबोट कमरे में तेज़ी से दौड़ सके और केवल कठिन हिस्सों पर ध्यान केंद्रित कर सके।
3. हार्डवेयर: "ऑन-डिवाइस" मस्तिष्क
कई रोबोट क्लाउड (इंटरनेट) पर निर्भर रहते हैं। यदि इंटरनेट धीमा होता है, तो रोबोट भी धीमा हो जाता है।
- उपमा: Habilis-β एक शक्तिशाली प्रोसेसर वाले स्मार्टफोन की तरह है जो सारा गणित सीधे आपकी जेब में करता है। इसे मदद के लिए सिरी या गूगल से पूछने की ज़रूरत नहीं है।
- यह कैसे मदद करता है: क्योंकि यह स्थानीय रूप से सोचता है, यह तुरंत प्रतिक्रिया दे सकता है। यह मिलीसेकंड में निर्णय ले सकता है, जिससे यह गलतियों को आपदा बनने से पहले ही सुधार सकता है।
4. "वॉल्यूम नॉब" (CFG)
अंत में, सिस्टम में एक डिप्लॉयमेंट-टाइम नॉब है जिसे क्लासिफायर-फ्री गाइडेंस (CFG) कहा जाता है।
- उपमा: इसे निर्देशों के लिए वॉल्यूम नॉब के रूप में सोचें।
- कम वॉल्यूम: रोबोट सुचारू रूप से चलते रहने के लिए अपने स्वयं के "अंतर्ज्ञान" (प्ले डेटा) पर अधिक भरोसा करता है।
- उच्च वॉल्यूम: रोबोट मानव के विशिष्ट निर्देशों का बहुत सख्ती से पालन करता है, भले ही इसके लिए उसे अधिक आक्रामक रूप से चलना पड़े।
- यह कैसे मदद करता है: आप काम के आधार पर रोबोट को ट्यून कर सकते हैं। यदि आपको बहुत सटीक होने की आवश्यकता है, तो आप नॉब को ऊपर घुमाते हैं। यदि आपको इसे तेज़ और लचीला बनाने की आवश्यकता है, तो आप इसे नीचे घुमाते हैं।
परिणाम: "फैक्ट्री वर्कर"
अन्य शीर्ष रोबोटों ( और GR00T) के मुकाबले परीक्षण करने पर:
- सिमुलेशन में: Habilis-β ने 572 कार्य प्रति घंटा किए, जबकि अन्य ने लगभग 120 किए। इसने मानव द्वारा ठीक किए जाने से पहले बहुत अधिक समय भी लिया।
- वास्तविक दुनिया में: एक वास्तविक ह्यूमनॉइड रोबोट पर लॉजिस्टिक्स का काम करते हुए, Habilis-β ने 124 कार्य प्रति घंटा पूरे किए (अन्य के 19 की तुलना में) और मदद की आवश्यकता से पहले 137 सेकंड तक चला (अन्य के 46 सेकंड की तुलना में)।
सारांश
Habilis-β एक ऐसा रोबोट मस्तिष्क है जो एक घबराए हुए छात्र की तरह एक एकल परीक्षा देने के बजाय एक अनुभवी कार्यकर्ता की तरह काम करना बंद कर देता है। यह खेलकर सीखता है, यह लंबी शिफ्ट काम करके सीखता है, यह सुरक्षित होने पर तेज़ होता है, और यह अपनी गलतियों को पकड़ने के लिए पर्याप्त तेज़ी से सोचता है। इसे न केवल "स्मार्ट" होने के लिए, बल्कि वास्तविक दुनिया में उत्पादक और विश्वसनीय होने के लिए डिज़ाइन किया गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।