← नवीनतम पेपर
💻 computer science

ViBe: Visual Behavior Adaptation for Perceptive Humanoid Whole-Body Control

ViBe एक पैरामीटर-कुशल, पोस्ट-ट्रेनिंग फ्रेमवर्क है जो लो-रैंक एडेप्टर्स के माध्यम से कार्य-प्रासंगिक विजुअल फीडबैक को ग्राफ्ट करके मोशन ट्रैकर्स को बोधगम्य ह्यूमनॉइड होल-बॉडी कंट्रोल के लिए अनुकूलित करता है, जिससे विविध लोकोमोशन और मैनिपुलेशन कार्यों में सुदृढ़ ज़ीरो-शॉट सिम-टू-रियल ट्रांसफर सक्षम होता है।

मूल लेखक: Lokesh Krishna, Sarvesh Venkatesan, An Zhang, Quan Nguyen

प्रकाशित 2026-09-10
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lokesh Krishna, Sarvesh Venkatesan, An Zhang, Quan Nguyen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट जो मनुष्यों की तरह चलते और हिलते-डुलते हैं, लंबे समय से इंजीनियरिंग का एक लक्ष्य रहे हैं, लेकिन उन्हें वास्तविक दुनिया में ऐसा करने के लिए सिखाना दो अलग-अलग हिस्सों की एक पहेली है। पहला, मानव गति की नकल करने की क्षमता, एक ऐसा कौशल जिसे शोधकर्ताओं ने मशीनों को मानव गति के विशाल पुस्तकालयों की नकल करने के लिए प्रशिक्षित करके सिद्ध कर लिया है। ये "ट्रैकर्स" एक स्क्रिप्ट का पालन करने में उत्कृष्ट हैं, जो समतल, अनुमानित जमीन पर अपने अंगों को स्वाभाविक और सहज तरीके से हिलाते हैं। हालांकि, उन्हें जानबूझकर अपने परिवेश के प्रति अंधा बनाया गया है; वे फुटपाथ, गेंद या बॉक्स को नहीं देखते हैं। दूसरा, दुनिया को समझने और उस पर प्रतिक्रिया देने की क्षमता। पारंपरिक रूप से, इंजीनियरों ने इसे एक अलग सिस्टम बनाकर हल किया है जो एक 'प्लानर' (योजनाकार) के रूप से कार्य करता है: यह वातावरण को देखता है, निर्णय लेता है कि रोबोट को क्या करना चाहिए, और फिर अंधे ट्रैकर को उस योजना को निष्पादित करने के लिए निर्देश देता है। यह अलगाव काम तो करता है, लेकिन यह एक अंतर पैदा करता है। ट्रैकर छोटे, तात्कालिक समायोजन नहीं कर सकता, जैसे कि किसी पत्थर से बचने के लिए पैर बदलना या आने वाली वस्तु से बचना, क्योंकि वह ऊपर से निर्देशों की प्रतीक्षा कर रहा होता है। इसमें उन दृश्य प्रतिवर्तों (विजुअल रिफ्लेक्सिस) की कमी होती है जो एक मनुष्य को बिना सोचे-समझे लड़खड़ाने और खुद को संभालने की अनुमति देते हैं।

दक्षिणी कैलिफोर्निया विश्वविद्यालय के शोधकर्ताओं ने इस अंतर को पाटने का एक नया तरीका विकसित किया है, जिससे एक रोबोट को चलते समय सीधे देखने और प्रतिक्रिया करने की क्षमता मिलती है। वे अपने सिस्टम को ViBe कहते हैं, एक ऐसी विधि जो एक ऐसे रोबोट को लेती है जो पहले से ही मानव की तरह चलना सीख चुका है और उसे यह क्षमता देती है कि वह जो कुछ भी देखता है उसके आधार पर अपनी गतिविधियों को अनुकूलित कर सके, बिना शून्य से दोबारा चलना सीखे। एक नया मस्तिष्क या एक नया प्लानर बनाने के बजाय, उन्होंने रोबोट की आँखों और उसकी मांसपेशियों के बीच एक छोटा, कुशल इंटरफेस डाला। यह इंटरफेस किसी कार्य के लिए महत्वपूर्ण विशिष्ट दृश्य विवरणों को चुनना सीखता है—जैसे कि फुटपाथ का किनारा या गेंद की स्थिति—और उस जानकारी को सीधे रोबोट की गति प्रणाली में फीड करता है। इसका परिणाम एक ऐसी मशीन है जो वास्तविक दुनिया में जटिल, गतिशील कार्य कर सकती है, जैसे कि ऊबड़-खाबड़ जमीन पर पार्कौर करना, फेंकी गई गेंद से बचना, या अपने हाथ में रखे क्यूब को पुनर्गठित करना, और यह सब करते हुए उस स्वाभाविक, मानव जैसी गति को बनाए रखना जो उसे मूल रूप से सिखाई गई थी।

शोधकर्ताओं ने एक ऐसे रोबोट से शुरुआत की जो पहले से ही समतल जमीन पर मानव गति को पूरी तरह से ट्रैक करना सीख चुका था। यह रोबोट "अंधा" था इस अर्थ में कि वह अपने कदमों को निर्देशित करने के लिए कैमरा छवियों का उपयोग नहीं करता था; वह केवल गतिविधियों के एक पूर्व-निर्धारित क्रम का पालन करता था। इसे दृष्टि देने के लिए, टीम ने एक पूर्व-प्रशिक्षित विजुअल सिस्टम जोड़ा, जिसने लाखों छवियों से वस्तुओं और दृश्यों को पहचानना पहले से ही सीख लिया था। हालांकि, केवल रोबोट को कैमरा फीड दिखाना पर्याप्त नहीं था; रोबोट को यह जानने की आवश्यकता थी कि छवि के कौन से हिस्से महत्वपूर्ण हैं। पिक्सेल की एक दीवार में बहुत अधिक जानकारी होती है, और इसमें से अधिकांश चलने या बचने के कार्य के लिए अप्रासंगिक होती है। टीम ने एक छोटा मॉड्यूल, एक 'एक्सट्रैक्टर' (निकालने वाला), डिजाइन किया जो एक फिल्टर की तरह कार्य करता है। यह रोबोट की वर्तमान शारीरिक स्थिति और उस कार्य को देखता है जिसे वह करने की कोशिश कर रहा है, और फिर उस संदर्भ का उपयोग करके कैमरा इमेज को स्कैन करता है और केवल सबसे उपयोगी दृश्य संकेतों का चयन करता है। यदि रोबोट फुटपाथ के ऊपर से कूदने की कोशिश कर रहा है, तो एक्सट्रैक्टर फुटपाथ के किनारे पर ध्यान केंद्रित करता है। यदि वह गेंद को पकड़ने की कोशिश कर रहा है, तो वह गेंद के प्रक्षेपवक्र (ट्रैजेक्टरी) पर ध्यान केंद्रित करता है।

इस चयनित दृश्य जानकारी को एक ऐसी तकनीक के माध्यम से रोबोट की गति प्रणाली में इंजेक्ट किया जाता है जो रोबोट की आंतरिक सेटिंग्स के केवल एक बहुत छोटे अंश को बदलती है। शोधकर्ताओं ने मूल मोशन ट्रैकर को स्थिर रखा, जिससे उसकी स्वाभाविक, मानव जैसी चाल सुरक्षित रही, और केवल उन छोटे रास्तों को समायोजित किया जो नए दृश्य डेटा को ले जाते थे। इस दृष्टिकोण ने उन्हें 'रीइन्फोर्समेंट लर्निंग' (सुदृढीकरण शिक्षण) नामक पद्धति का उपयोग करके विशिष्ट कार्यों के लिए रोबोट को प्रशिक्षित करने की अनुमति दी, जहाँ रोबोट परीक्षण और त्रुटि (ट्रायल एंड एरर) के माध्यम से सीखता है, और सफल कार्यों के लिए पुरस्कार प्राप्त करता है। उन्होंने इस सिस्टम का परीक्षण चार बहुत अलग चुनौतियों पर किया। एक में, रोबोट को फुटपाथों और असमान इलाकों पर चलना और दौड़ना था, जहाँ उसे टकराने से बचने के लिए वास्तविक समय में अपने पैर रखने की जगह को समायोजित करना था। दूसरे में, उसे पार्कौर करना था, जिसमें अंतराल (गैप्स) को पार करना और संकीखी सतहों पर उतरना शामिल था। तीसरे कार्य में बड़ी वस्तुओं को हिलाना शामिल था, जहाँ रोबोट को सूटकेस या कचरे के डिब्बे को ले जाते समय अपने संतुलन और पकड़ को समायोजित करना था। अंतिम चुनौती 'डॉजबॉल' थी, जहाँ रोबोट को स्थिर खड़ा होना था, अपनी ओर आती गेंद को देखना था, और गिरने बिना अपने शरीर को रास्ते से हटाना था।

परिणामों ने दिखाया कि यह विधि उल्लेखनीय रूप से अच्छी तरह से काम करती है। वास्तविक दुनिया में परीक्षण किए जाने पर, रोबोट ने इन कार्यों को उच्च सफलता दर के साथ पूरा किया, जो अक्सर उन सिस्टम के प्रदर्शन के बराबर था जिन्हें पर्यावरण के बारे में पूर्ण, विशेषाधिकार प्राप्त जानकारी दी गई थी जो वास्तविक रोबोटों के पास नहीं हो सकती। उदाहरण के लिए, पार्कौर कार्य में, रोबोट ने उन बाधाओं को सफलतापूर्वक पार किया जिनके कारण उसी के अंधे संस्करण के टकराने और गिरने की संभावना थी। डॉजबॉल परिदृश्य में, रोबोट ने गेंद से बचते हुए अपना संतुलन बनाए रखा, एक ऐसा कार्य जिसके लिए उसे अपने मानक खड़े होने के पोज से नियंत्रित, प्रतिक्रियात्मक तरीके से विचलित होने की आवश्यकता थी। शोधकर्ताओं ने यह भी पाया कि सिस्टम मजबूत था; यह तेज धूप से लेकर मंद रोशनी वाले इनडोर वातावरण तक, प्रकाश परिवर्तन या वस्तुओं के रंगों के बदलने पर भी अच्छी तरह से काम करता रहा। यह सुझाव देता है कि रोबnya ने केवल विशिष्ट रंगों या बनावटों को याद करने के बजाय चीजों के आकार और स्थिति को समझना सीख लिया है।

यह साबित करने के लिए कि रोबोट वास्तव में देख कर प्रतिक्रिया दे रहा था, शोधकर्ताओं ने अपने सिस्टम की तुलना एक ऐसे संस्करण से की जो देख नहीं सकता था। अंधा रोबोट, उसी अंतर्निहित गति प्रशिक्षण के बावजूद, फुटपाथों को पार करने या बाधाओं से बचने में विफल रहा, और अक्सर अपने मार्ग से भटक गया या वस्तुओं से टकरा गया। विजन (दृष्टि) वाले संस्करण ने अपनी गति में सटीक, स्थानीय सुधार किए। इसने फुटपाथ पर पैर रखने के लिए अपने पैर की स्थिति को समायोजित किया, भारी वस्तु उठाने के लिए अपना वजन बदला, और गेंद से बचने के लिए अपने शरीर को हिलाया। ये बड़े, पूर्व-नियोजित पैंतरे नहीं थे बल्कि छोटे, तत्काल समायोजन थे जो रोबोट के चलते समय हुए। टीम ने यह भी प्रदर्शित किया कि इस दृश्य अनुकूलन को एक सरल, उच्च-स्तरीय प्लानर के साथ जोड़ा जा सकता है। एक कार्य में जहाँ रोबोट को एक क्यूब को पुनर्गठित करना था ताकि एक विशिष्ट रंग वाला चेहरा ऊपर रहे, एक बहुत ही बुनियादी प्लानर ने केवल गतिविधियों के एक क्रम को चुना। रोबोट के विजुअल सिस्टम ने फिर क्यूब को खोजने, उसे पकड़ने और उसकी पकड़ को समायोजित करने का कठिन कार्य संभाला, जिससे यह सुनिश्चित हुआ कि यदि क्यूब उम्मीद से थोड़ी अलग स्थिति में भी हो, तो भी चाल सफल हो।

यह अध्ययन इस बात पर प्रकाश डालता है कि रोबोटों को दुनिया के साथ बातचीत करने के लिए कैसे सिखाया जा सकता है। हर नए कार्य के लिए रोबोट को शुरू से प्रशिक्षित करने, या जटिल, अलग प्लानिंग सिस्टम पर निर्भर रहने के बजाय, यह संभव है कि एक ऐसे रोबोट को लिया जाए जो पहले से ही जानता है कि कैसे चलना है और उसे देखने और प्रतिक्रिया करने की क्षमता दी जाए। शोधकर्ताओं ने दिखाया कि कोर मूवमेंट स्किल्स को बरकरार रखते हुए और केवल दृष्टि और क्रिया के बीच के छोटे संबंध को प्रशिक्षित करके, वे एक ऐसा रोबोट बना सकते हैं जो अपनी गति में स्वाभाविक है और वास्तविक दुनिया की अनिश्चितताओं को संभालने में सक्षम है। हालांकि यह सिस्टम पूर्ण नहीं है और कभी-कभी तेजी से चलती वस्तुओं या असामान्य दृश्य विकर्षणों से भ्रमित हो सकता है, फिर भी यह एक शक्तिशाली कदम है। यह प्रदर्शित करता है कि रोबोट को शुरुआत से सब कुछ सिखाने की आवश्यकता नहीं है; वह केवल यह सीखकर कि उसे क्या देखना है, अपनी मौजूदा क्षमताओं को नई स्थितियों के अनुकूल बनाना सीख सकता है। यह दृष्टिकोण मानव सदृश रोबोट बनाने के लिए एक व्यावहारिक मार्ग प्रदान करता है जो हमारी दुनिया में उसी सहजता और अनुकूलन क्षमता के साथ चल सकें जिसकी हम अपेक्षा करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →