← नवीनतम पेपर
💻 computer science

Perceptive Behavior Foundation Model: Adapting Human Motion Priors to Robot-Centric Terrain

यह शोध पत्र 'परसेप्टिव बिहेवियर फाउंडेशन मॉडल' (Perceptive Behavior Foundation Model) को प्रस्तुत करता है, जो एक टेरेन-अवेयर (terrain-aware) ह्यूमनॉइड कंट्रोल फ्रेमवर्क है, जो विविध रोबोटिक वातावरणों में मानव गति के पूर्व अनुभवों (human motion priors) को अनुकूलित करने के लिए टेरेन-संगत संदर्भों (terrain-consistent references) को संश्लेषित करता है और एक टीचर-स्टूडेंट प्रशिक्षण रणनीति का उपयोग करता है ताकि एक रॉ-रेफरेंस स्टूडेंट (raw-reference student) वैश्विक गति ट्रैकिंग को बनाए रखते हुए स्थानीयकृत, टेरेन-विशिष्ट सुधार करने में सक्षम हो सके।

मूल लेखक: Zifan Wang, Yizhao Li, Teli Ma, Qiang Zhang, Yudong Fan, Hao Xu, Shuo Yang, Junwei Liang

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zifan Wang, Yizhao Li, Teli Ma, Qiang Zhang, Yudong Fan, Hao Xu, Shuo Yang, Junwei Liang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को डांस करना सिखा रहे हैं। आप उसे एक चिकने, समतल डांस फ्लोर पर एक इंसान द्वारा शानदार बैकफ्लिप (backflip) करने का वीडियो दिखाते हैं। रोबोट उस वीडियो को देखता है, मूव्स सीखता है, और उन्हें पूरी तरह से कॉपी करने की कोशिश करता है।

समस्या:
अब, कल्पना कीजिए कि आप उसी रोबोट को लेकर एक असली पार्क में चले जाते हैं जहाँ ऊबड़-खाबड़ पत्थर, सीढ़ियाँ और गड्ढे हैं। यदि रोबोट उसी बैकफ्लिप को करने की कोशिश करता है जो उसने चिकने फर्श पर सीखा था, तो वह संभवतः लड़खड़ा जाएगा, गिर जाएगा, या किसी पत्थर से टकरा जाएगा। मानव डांसर को पत्थरों की चिंता करने की आवश्यकता नहीं पड़ी क्योंकि उनके पैरों ने स्वाभाविक रूप से जमीन को ढूंढ लिया था, लेकिन रोबोट इस बात के प्रति "अंधा" है कि जमीन बदल गई है। वह एक ऐसे स्क्रिप्ट का पालन करने की कोशिश कर रहा है जो उस स्टेज के लिए लिखी गई थी जो अब अस्तित्व में ही नहीं है।

समाधान: "परसेप्टिव बिहेवियर फाउंडेशन मॉडल" (Perceptive Behavior Foundation Model)
इस पेपर के पीछे के शोधकर्ताओं ने एक नए प्रकार का रोबोटिक मस्तिष्क बनाया है जिसे Perceptive BFM कहा जाता है। इसे एक ऐसे रोबोट के रूप में सोचें जो केवल एक डांस मूव को याद नहीं करता; बल्कि वह मूव के इरादे (intent) को समझता है और फिर यह पता लगाता है कि वह जिस भी जमीन पर खड़ा है, उस पर सुरक्षित रूप से कैसे किया जाए।

यह तीन सरल चरणों में इस प्रकार काम करता है:

1. "रिहर्सल" (TCRS)

इससे पहले कि रोबोट कभी असली जमीन पर कदम रखे, शोधकर्ता एक विशाल, ऑफलाइन सिमुलेशन चलाते हैं। वे मानव डांस मूव्स और पथरीले इलाके के मैप को लेते हैं और एक "रिहर्सल" चलाते हैं।

  • क्या होता है: यह सिस्टम एक स्मार्ट कोरियोग्राफर की तरह काम करता है। यह मानव के मूव को देखता है और कहता है, "ठीक है, इंसान यहाँ कूदने वाला है, लेकिन यहाँ एक पत्थर है। चलिए पैर रखने की जगह को थोड़ा एडजस्ट करते हैं ताकि पत्थर से बचा जा सके, गड्ढे से बचने के लिए पैर को थोड़ा ऊपर उठाते हैं, और संतुलन बनाए रखने के लिए शरीर का वजन बदलते हैं।"
  • परिणाम: यह डांस का एक "परफेक्ट प्रैक्टिस वर्जन" बनाता है जो विशेष रूप से उस पथरीले इलाके के लिए तैयार किया गया है। रोबोट इस परफेक्ट वर्जन से सीखता है।

2. "टीचर और स्टूडेंट" का खेल

प्रशिक्षण एक चतुर दो-चरणीय प्रक्रिया का उपयोग करता है, जैसे एक मास्टर टीचर और एक स्टूडेंट:

  • ब्लाइंड टीचर (Blind Teacher): यह रोबोट "परफेक्ट प्रैक्टिस वर्जन" (वह जो पत्थरों के हिसाब से एडजस्ट किया गया है) की नकल करना सीखता है। इसे ठीक पता होता है कि अपने पैर कहाँ रखने हैं क्योंकि इसे एडजस्ट किए गए डेटा पर प्रशिक्षित किया गया था।
  • विज़न स्टूडेंट (Vision Student): यह वह रोबोट है जिसे आप वास्तव में तैनात करते हैं। यह "परफेक्ट प्रैक्टिस वर्जन" को नहीं देखता। यह केवल मूल, अन-एडजस्टेड मानव डांस मूव (जो फ्लैट फ्लोर पर था) और पथरीली जमीन का लाइव कैमरा फीड देखता है।
  • जादुई ट्रिक: स्टूडेंट टीचर को देखता है और एक विशेष नियम सीखता है: "जब मैं देखता हूँ कि टीचर अपने पैर को पत्थर से बचने के लिए हिला रहा है, लेकिन मुझे अपने पैर को फ्लैट-फ्लोर वाली जगह पर ले जाने के लिए कहा जा रहा है, तो मुझे एक छोटा सा करेक्शन (सुधार) जोड़ना चाहिए।"
  • सेफ्टी नेट (Safety Net): स्टूडेंट को एक "कॉपीकैट" होने के लिए डिज़ाइन किया गया है। यह बिल्कुल वैसा ही करने की कोशिश करता है जैसा कि मानव कमांड कहता है। यह अपने "आंखों" (टेरेन सेंसर) का उपयोग केवल तभी करता है जब जमीन खतरनाक हो, ताकि छोटे और आवश्यक बदलाव किए जा सकें। यह सुनिश्चित करता है कि रोबोट डांस करना न भूल जाए; यह बस कदमों को अनुकूलित (adapt) करता है।

3. परिणाम: एक रोबोट, कोई भी टेरेन

यह पेपर दिखाता है कि यह एकल रोबोट "बैकफ्लिप करो" या "साइडवेज चलो" जैसे कमांड ले सकता है और कई अलग-अलग स्थितियों में सफलतापूर्वक प्रदर्शन कर सकता है:

  • सीढ़ियाँ चढ़ते हुए चलना।
  • ऊबड़-खाबड़ जमीन पर डांस करना।
  • बाधाओं के ऊपर हाथ लहराते हुए दौड़ना।
  • यहाँ तक कि ऊंचे ब्लॉक्स पर कलाबाजियां (acrobatic flips) करना।

मुख्य निष्कर्ष (Key Takeaway)
सबसे महत्वपूर्ण बात यह है कि आपको कमांड बदलने की आवश्यकता नहीं है। आप अभी भी रोबोट को "बैकफ्लिप करो" कह सकते हैं, ठीक वैसे ही जैसे आप फ्लैट फ्लोर पर कहेंगे। रोबोट का मस्तिष्क यह समझने का कठिन काम संभाल लेता है कि सीढ़ियों या पत्थरों के ढेर पर वह बैकफ्लिप कैसे किया जाए।

यह पेपर क्या दावा नहीं करता (What the Paper does NOT Claim)

  • यह दावा नहीं करता कि रोबोट नरम रेत, कीचड़ या फिसलन भरी बर्फ पर चल सकता है (यह मानता है कि जमीन ठोस और दृश्यमान है)।
  • यह दावा नहीं करता कि यह मानव कमांड के खतरनाक होने पर (जैसे, यदि इंसान अपना हाथ दीवार में मार देता है) अपने ऊपरी शरीर को ठीक कर सकता है (क्योंकि यह केवल पैरों और टांगों को एडजस्ट करता है)।
  • यह एक सिमुलेशन और रियल-रोबोट टेस्ट है, अभी कोई मेडिकल या इंडस्ट्रियल टूल नहीं है।

संक्षेप में, यह पेपर रोबोट को अनुकूलनशील डांसर (adaptable dancers) बनना सिखाता है जो मानव के नेतृत्व का पालन कर सकते हैं, भले ही स्टेज कितना भी खराब क्यों न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →