← नवीनतम पेपर
🤖 AI

HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface

HIL-UMI एक रोबोट-मुक्त, ह्यूमन-इन-द-लूप फ्रेमवर्क पेश करता है जो पोस्ट-ट्रेनिंग विजन-लैंग्वेज-एक्शन मॉडल्स के लिए एक हैंडहेल्ड यूनिवर्सल मैनिपुलेशन इंटरफेस और एक पॉलिसी-गाइडेड एनर्जी स्कोर का लाभ उठाता है ताकि लक्षित डेटा को कुशलतापूर्वक एकत्र किया जा सके और एडवांटेज एस्टिमेटर्स को परिष्कृत किया जा सके, जिससे स्टेटिक सुपरवाइज्ड फाइन-ट्यूनिंग की सीमाओं को दूर किया जा सके और भौतिक रोबोट तैनाती के बिना स्केलेबल, इटरेटिव सुधार को सक्षम बनाया जा सके।

मूल लेखक: Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong

प्रकाशित 2026-09-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट दृष्टि और भाषा के माध्यम से दुनिया को समझने में तेजी से सक्षम हो रहे हैं, जो जटिल कार्यों को करने के लिए विशाल डेटा से सीखते हैं। हालांकि, एक महत्वपूर्ण अंतर बना हुआ है कि ये आर्टिफिशियल इंटेलिजेंस सिस्टम सामान्य रूप से क्या सीखते हैं और वे वास्तव में एक विशिष्ट रसोई, कार्यशाला या कारखाने में क्या कर सकते हैं। जब एक रोबोट को वास्तविक वातावरण में तैनात किया जाता है, तो वह अक्सर ऐसी स्थितियों का सामना करता है जो उसने पहले कभी नहीं देखी होती हैं, जिससे गलतियाँ हो सकती हैं जो तब तक बढ़ती रहती हैं जब तक कि कार्य विफल न हो जाए। इसे ठीक करने के लिए, शोधकर्ता पारंपरिक रूप से "सुपरवाइज्ड फाइन-ट्यूनिंग" (supervised fine-tuning) पर निर्भर करते हैं, जो एक ऐसी प्रक्रिया है जहाँ मनुष्य रोबोट पर ही सही क्रियाओं का प्रदर्शन करते हैं, और मशीन उन्हें दोहराना सीखती है। हालांकि यह मदद करता है, लेकिन यह धीमा, महंगा है, और अक्सर उन विशिष्ट क्षणों को छोड़ देता है जहाँ रोबोट के विफल होने की सबसे अधिक संभावना होती है, क्योंकि रोबोट केवल उन्हीं उदाहरणों से सीखता है जो उसे दिए गए थे, न कि उन गलतियों से जो वह समस्या को हल करने की कोशिश करते समय करता है।

शोधकर्ताओं की एक टीम ने HIL-UMI नामक एक नया दृष्टिकोण विकसित किया है जो यह बदल देता है कि रोबोट मनुष्यों से कैसे सीखते हैं, जिससे प्रशिक्षण चरण के दौरान रोबोट की उपस्थिति की आवश्यकता समाप्त हो जाती है। रोबोट को संघर्ष करते हुए देखने और फिर उसे सुधारने के बजाय, यह विधि एक पोर्टेबल, हैंडहेल्ड डिवाइस का उपयोग करती है जो एक रोबोटिक ग्रिपर जैसा दिखता है लेकिन इसे एक मानव ऑपरेटर द्वारा पकड़ा जाता है। ऑपरेटर इस उपकरण के साथ कार्य को करता है जबकि एक कंप्यूटर प्रोग्राम, जो रोबोट के वर्तमान "मस्तिष्क" को चला रहा है, उसी वीडियो फीड को देखता है और अनुमान लगाने की कोशिश करता है कि मनुष्य आगे क्या करेगा। सिस्टम रोबोट को हिलाता नहीं है; यह केवल मनुष्य की वास्तविक गतिविधियों की तुलना अपनी भविष्यवाणियों से करता है। जब मनुष्य कुछ ऐसा करता है जिसकी कंप्यूटर ने अपेक्षा नहीं की थी, तो सिस्टम उस क्षण को सीखने के अवसर के रूप में चिह्नित करता है और उसे रिकॉर्ड करता है। यह रोबोट को अपनी कमियों (blind spots) से सीखने की अनुमति देता है, बिना कार्य को शारीरिक रूप से करने और विफलता का जोखिम उठाए।

इस पद्धति का मूल विचार अवलोकन और परिशोधन का एक निरंतर चक्र है। जैसे-जैसे मनुष्य कार्य का प्रदर्शन करता है, कंप्यूटर लगातार यह जांचता है कि क्या उसके अनुमान मनुष्य की क्रियाओं से मेल खाते हैं। यदि कंप्यूटर का अनुमान मनुष्य के कार्य से बहुत अलग है, तो सिस्टम जानता है कि वह एक "ब्लाइंड स्पॉट" में है—एक ऐसी स्थिति जिसे रोबroट अच्छी तरह से नहीं समझता है। उस बिंदु पर, मनुष्य को प्रदर्शन जारी रखने के लिए प्रेरित किया जाता है, और सिस्टम इस विशिष्ट डेटा खंड को सहेज लेता है। शोधकर्ताओं ने इसमें बुद्धिमत्ता की एक दूसरी परत भी जोड़ी है: यह आंकने का एक तरीका कि कार्य कितनी अच्छी तरह से आगे बढ़ रहा है। यदि सिस्टम को लगता है कि कार्य खराब चल रहा है, भले ही मनुष्य सही ढंग से कार्य कर रहा हो, तो यह उस क्षण को रिकॉर्ड करता है ताकि कंप्यूटर यह सीख सके कि सफलता का बेहतर आकलन कैसे किया जाए। इन दो प्रकार के डेटा को जोड़कर, रोबोट न केवल यह सीखता है कि क्या करना है, बल्कि यह भी कि कौन सी क्रियाएं काम पूरा करने के लिए सबसे उपयोगी हैं।

इस विचार का परीक्षण करने के लिए, शोधकर्ताओं ने एक मानक रोबोटिक आर्म का उपयोग करके चार अलग-अलग वास्तविक दुनिया के कार्यों पर इसे लागू किया। कार्य तौलिए को मोड़ने और मेज साफ करने से लेकर क्यूब्स को स्टैक करने और कागज के टुकड़े पर उच्च सटीकता के साथ स्टैम्प लगाने तक फैले हुए थे। हर मामले में, रोबोट ने बुनियादी निर्देशों के एक सेट के साथ शुरुआत की और फिर हैंडहेल्ड विधि का उपयोग करके प्रशिक्षण के कई दौर पूरे किए। परिणामों ने पारंपरिक तरीकों की तुलना में स्पष्ट सुधार दिखाया। जहाँ मानक प्रशिक्षण तकनीकें अक्सर एक ऐसी सीमा तक पहुँच जाती हैं जहाँ अधिक डेटा जोड़ने से कोई लाभ नहीं होता, वहीं नई विधि ने रोबोट को प्रत्येक प्रशिक्षण दौर के साथ लगातार बेहतर होने की अनुमति दी। रोबोट ने पहले की तुलना में लंबे, जटिल क्रिया क्रमों और नाजुक, सटीक गतिविधियों को अधिक प्रभावी ढंग से संभालना सीखा।

सबसे आश्चर्यजनक निष्कर्षों में से एक इस बात की गति थी कि यह नई विधि कितनी तेजी से उपयोगी जानकारी एकत्र करती है। पारंपरिक तरीकों के लिए, जिनमें रोबोट को शारीरिक रूप से हिलने और मनुष्य द्वारा सुधारा जाने की आवश्यकता होती है, बहुत समय लगता है और उन्हें स्केल करना कठिन होता है। इसके विपरीत, हैंडहेल्ड दृष्टिकोण को आवश्यक डेटा एकत्र करने में पांच गुना से अधिक तेज़ पाया गया। ऐसा इसलिए है क्योंकि मानव ऑपरेटर रोबोट के रीसेट होने या किसी भारी मशीन में मानवीय हस्तक्षेप का इंतजार किए बिना डिवाइस को स्वतंत्र रूप से घुमा सकता है। सिस्टम ने सफलतापूर्वक उन सटीक क्षणों की पहचान की जहाँ रोबोट को मदद की आवश्यकता थी, जिससे प्रशिक्षण का ध्यान उन हिस्सों पर केंद्रित हुआ जो सबसे कठिन थे, बजाय उन हिस्सों पर जो रोबोट पहले से ही समझता था।

अध्ययन सुझाव देता है कि यह दृष्टिकोण विभिन्न स्थानों और विभिन्न लोगों द्वारा रोबोट को नए कौशल सिखाने के लिए एक स्केलेबल मार्ग प्रदान करता है। चूंकि प्रशिक्षण एक हैंडहेल्ड डिवाइस पर होता है, इसलिए कई ऑपरेटर संभावित रूप से अलग-अलग स्थानों पर एक साथ डेटा एकत्र कर सकते हैं, जो सभी एक ही रोबोट की सीखने की प्रक्रिया में योगदान दे सकते हैं। शोधकर्ताओं ने पाया कि रोबोट के ज्ञान के विशिष्ट अंतराल पर ध्यान केंद्रित करके और एक ऐसी प्रणाली का उपयोग करके जो प्रगति को पुरस्कृत करती है, वे एक ऐसा रोबोट बना सकते हैं जो अधिक विश्वसनीय और कुशल हो। यह कार्य एक ऐसे भविष्य की ओर संकेत करता है जहाँ रोबोट को बार-बार, महंगी और समय लेने वाली भौतिक परीक्षणों की आवश्यकता के बिना, नए वातावरण में जल्दी और सुरक्षित रूप से अनुकूलित किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →