← नवीनतम पेपर
🤖 AI

DexHiL: A Human-in-the-Loop Framework for Vision-Language-Action Model Post-Training in Dexterous Manipulation

DexHiL पहला एकीकृत मानव-इन-द-लूप फ्रेमवर्क है जो डेक्सट्रस विजन-लैंग्वेज-एक्शन मॉडल्स के लिए समन्वित आर्म-हैंड टेलीऑपरेशन को इंटरवेंशन-अवेयर डेटा सैंपलिंग के साथ जोड़ता है, जिससे जटिल मैनिपुलेशन कार्यों में पोस्ट-ट्रेनिंग प्रदर्शन और विश्वसनीयता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Yifan Han, Zhongxi Chen, Yuxuan Zhao, Congsheng Xu, Yanming Shao, Yichuan Peng, Yao Mu, Wenzhao Lian

प्रकाशित 2026-03-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yifan Han, Zhongxi Chen, Yuxuan Zhao, Congsheng Xu, Yanming Shao, Yichuan Peng, Yao Mu, Wenzhao Lian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन अनाड़ी रोबोटिक हाथ को एक टेडी बियर उठाने या बॉक्स से एक टिश्यू निकालने जैसे नाजुक काम करना सिखाने की कोशिश कर रहे हैं।

आप पहले ही एक विशाल वीडियो लाइब्रेरी (यह एक "विज़न-लैंग्वेज-एक्शन" या VLA मॉडल है) का उपयोग करके रोबोट को बुनियादी बातें सिखा चुके हैं। वह जानता है कि टिश्यू क्या है और "खींचना" (pulling) क्या होता है। लेकिन जब आप उसे वास्तविक दुनिया में रखते हैं, तो वह थोड़ा वैसा ही होता है जैसे कोई बच्चा चलना सीख रहा हो: वह लड़खड़ाता है, चीजें गिरा देता है, और अजीब स्थितियों में फंस जाता है।

समस्या:
पारंपरिक तरीके इसे ठीक करने के लिए रोबोट को किसी काम को पूरी तरह से करने वाले लोगों के और अधिक वीडियो दिखाने की कोशिश करते हैं। लेकिन जटिल, कई उंगलियों वाले हाथों के लिए, यह केवल एक कॉन्सर्ट देखकर पियानो बजाना सीखने जैसा है। आप उन सूक्ष्म, महत्वपूर्ण क्षणों को चूक जाते हैं जहाँ उंगलियां फिसलती हैं या पकड़ मजबूत होती है। रोबोट एक ही गलती बार-बार करता रहता है क्योंकि उसे कभी भी अपनी गलती से उबरने (recover करने) का अभ्यास करने का मौका नहीं मिलता।

साथ ही, 20 से अधिक जोड़ों वाले रोबोटिक हाथ को नियंत्रित करना अविश्वसनीय रूप से कठिन है। यदि आप इसे एक साधारण जॉयस्टिक या दस्ताने से नियंत्रित करने की कोशिश करते हैं जो पूरी तरह से फिट नहीं बैठता, तो रोबोट का हाथ झटकेदार और अप्राकृतिक तरीके से चलता है।

समाधान: DexHiL (एक "को-पायलट" दृष्टिकोण)
लेखकों ने DexHiL बनाया है, जिसका अर्थ है "डेक्सट्रस ह्यूमन-इन-द-लूप" (Dexterous Human-in-the-Loop)। इसे एक शिक्षक के लेक्चर देने के रूप में न देखें, बल्कि यह एक फ्लाइट सिम्युलेटर के साथ एक को-पायलट की तरह है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:

1. "मैजिक क्यूब" कंट्रोलर (इंटरफेस)

एक जटिल दस्ताने के बजाय जो एक जकड़न जैसा महसूस होता है, ऑपरेटर एक छोटा क्यूब पकड़ता है जिस पर एक मार्कर (जैसे QR कोड) लगा होता है।

  • उपमा: कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं जहाँ आप एक छड़ी (wand) पकड़े हुए हैं। जब आप छड़ी हिलाते हैं, तो रोबोट का हाथ और अंगुलियां आपके आंदोलनों की सटीक नकल करती हैं।
  • जादू: सिस्टम इतना स्मार्ट है कि वह आपके मानव हाथों के आकार को रोबोट के जटिल उंगली के जोड़ों में बदल देता है। यह एक अनुवादक की तरह है जो तुरंत आपके "मानव इशारों" को "रोबोट उंगली कमांड" में बदल देता है, जिससे यह सुनिश्चित होता है कि रोबोट पूरे हाथ से टिश्यू को दबाने की कोशिश न करे।

2. "को-पायलट" हस्तक्षेप (Human-in-the-Loop)

यही मुख्य नवाचार है। रोबोट अपने आप कार्य करने की कोशिश करता है।

  • परिदृश्य: रोबोट टिश्यू की ओर बढ़ता है, लेकिन उसकी उंगलियां एक-दूसरे से थोड़ी ज्यादा दूर हैं। वह असफल होने ही वाला है।
  • हस्तक्षेप: एक इंसान स्क्रीन देखता है। जैसे ही उसे दिखता है कि रोबोध असफल होने वाला है, वह एक बटन दबाता है और नियंत्रण (को-पायलट मोड) ले लेता है। वह धीरे से रोबोट के हाथ को सही स्थिति में लाता है, टिश्यू को पकड़ता है, और उसे बाहर खींचता है।
  • सीखना: रोबोट केवल देखता नहीं है; वह उस विशिष्ट सुधार के क्षण से सीखता है। उसे समझ आता है, "ओह, मैं बहुत चौड़ा था! अगली बार, मुझे अपनी उंगलियां जल्दी बंद करनी होंगी।"

3. "हाइलाइट रील" रणनीति (Intervention-Aware Sampling)

यह असली सीक्रेट सॉस है। आमतौर पर, जब आप एक रोबोट को प्रशिक्षित करते हैं, तो आप उसे सफल प्रयासों के हजारों वीडियो दिखाते हैं और कुछ विफलताओं को दिखाते हैं। रोबोट ऊब जाता है और विफलताओं को अनदेखा कर देता है।

  • DexHiL की ट्रिक: सिस्टम जानता है कि सबसे कीमती डेटा वह सुधार (correction) है। यह मानव के "बचाव" को एक हाइलाइट रील की तरह मानता है।
  • उपमा: एक स्पोर्ट्स कोच की कल्पना करें। खिलाड़ी को गोल करने के 100 क्लिप दिखाने के बजाय, कोच पूरी तरह से उन 5 क्लिपों पर ध्यान केंद्रित करता है जहाँ खिलाड़ी लगभग चूक गया था लेकिन उसने गेंद को बचा लिया। कोच कहता है, "इसे देखो! यह वह जगह है जहाँ तुमने सही चाल चलकर खेल बचाया।"
  • परिणाम: रोबोट बहुत तेज़ी से सीखता है क्योंकि वह उन "महत्वपूर्ण क्षणों" पर ध्यान केंद्रित करता है जहाँ वह विफल होने वाला था और उसे कैसे ठीक किया जाए।

यह एक बड़ी बात क्यों है?

  • गति: अपने प्रयोगों में, DexHiL का उपयोग करने वाले रोबोट ने केवल कुछ राउंड के अभ्यास के बाद बॉक्स से टिश्यू निकालने में 95% सफलता प्राप्त की। केवल पुराने वीडियो (ऑफलाइन विधि) पर प्रशिक्षित रोबोट समान डेटा के बावजूद केवल लगभग 75% सफलता तक ही पहुँच पाया।
  • दक्षता: रोबोट को सफलता तक पहुँचाने के लिए इंसान को मार्गदर्शन देने में उतना ही समय लगा जितना कि घंटों के परफेक्ट वीडियो रिकॉर्ड करने में लगता।
  • तालमेल: इसने "दो बाएं पैरों" (बेमेल समन्वय) की समस्या को हल कर दिया। रोबोट का हाथ और बांह अब एक साथ सुचारू रूप से काम करते हैं, न कि ऐसा कि बांह तेजी से चलती है और हाथ लड़खड़ाता है।

सारांश में:
DexHiL एक पर्सनल ट्रेनर देने जैसा है जो ठीक उसी समय हस्तक्षेप करता है जब रोबोट ठोकर खाने वाला होता है, उसे फिनिश लाइन तक ले जाता है, और फिर रोबोट को उस बचाव के विशिष्ट क्षण का बार-बार अध्ययन करने के लिए कहता है। यह एक अनाड़ी रोबोट को पारंपरिक तरीकों की तुलना में बहुत तेज़ी से एक कुशल विशेषज्ञ में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →