← नवीनतम पेपर
💻 computer science

PFM-HR: Pose Flow Matching for Humanoid Robots

यह शोध पत्र पोज़ फ्लो मैचिंग फॉर ह्यूमनॉइड रोबोट्स (PFM-HR) को प्रस्तुत करता है, जो बड़े पैमाने पर अव्यवस्थित पोज़ डेटा पर प्रशिक्षित एक पुन: प्रयोज्य प्रायर (reusable prior) है, जो ट्रैकिंग रिवॉर्ड्स को मॉड्युलेट करने के लिए एक नवीन पोज़ ज्योमेट्री स्कोर का उपयोग करता है, जिससे एकल और सामान्य मोशन ट्रैकिंग कार्यों दोनों के लिए सुदृढीकरण शिक्षण (reinforcement learning) प्रदर्शन में सुधार होता है।

मूल लेखक: Yukang Gao, Yi Gu, Yangchen Zhou, Xingyu Chen, Zhaorui Wang, Fanghai Zhang, Hanyang Cao, Zhengyang Shen, Ji Ma, Runhan Zhang, Lei Han, Renjing Xu

प्रकाशित 2026-08-05
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yukang Gao, Yi Gu, Yangchen Zhou, Xingyu Chen, Zhaorui Wang, Fanghai Zhang, Hanyang Cao, Zhengyang Shen, Ji Ma, Runhan Zhang, Lei Han, Renjing Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को नृत्य करना सिखाने की कोशिश कर रहे हैं। आप केवल उसके पैरों को हिलने के लिए नहीं कह सकते; आपको उसके मस्तिष्क को यह सिखाना होगा कि सैकड़ों सूक्ष्म मांसपेशियों को कैसे समन्वित किया जाए ताकि वह अपने ही पैरों में उलझकर गिर न जाए। यह रीइन्फोर्समेंट लर्निंग (reinforcement learning) की दुनिया है, जहाँ रोबोट प्रयास और त्रुटि (trial and error) से सीखते हैं, ठीक वैसे ही जैसे एक बच्चा चलना सीखता है। लेकिन यहाँ एक पेंच है: यदि आप केवल एक रोबोट को इंसान के नृत्य की नकल करने के लिए छोड़ देते हैं, तो वह हिलने का ऐसा तरीका खोज सकता है जो शारीरिक रूप से संभव तो है लेकिन किसी ग्लिच वाले वीडियो गेम के पात्र जैसा दिखता है, या इससे भी बुरा, वह गिर सकता है क्योंकि वह यह नहीं समझता कि मानव जोड़ स्वाभाविक रूप से एक-दूसरे से कैसे "बात" करते हैं। इसे ठीक करने के लिए, वैज्ञानिक मोशन प्रायर्स (motion priors) का उपयोग करते हैं—मूल रूप से, मानव शरीर आमतौर पर कैसे हिलता है, इसके बारे में "अच्छे विचारों" का एक पुस्तकालय। इसे एक नियम पुस्तिका के रूप में सोचें जो रोबोट को प्राकृतिक गति के बारे में बताती है ताकि उसे गुरुत्वाकर्षण या संतुलन को शून्य से फिर से खोजने की आवश्यकता न पड़े। बड़ा सवाल हमेशा से यह रहा है: हम रोबोट को यह नियम पुस्तिका कैसे दें बिना उसे बहुत अधिक कठोर बनाए या उसे नए करतब सीखने में धीमा किए?

यहाँ PFM-HR (ह्यूमनॉइड रोबोट्स के लिए पोज़ फ्लो मैचिंग) आता है, जो एक नए तरीके के रूप में काम करता है जो रोबोट के लिए एक सुपर-स्मार्ट, अदृश्य डांस कोच की तरह है। रोबोट को किसी विशिष्ट क्रम को याद करने के लिए मजबूर करने के बजाय (जैसे कि एक कोरियोग्राफर चिल्लाकर कहता है "कदम, कदम, कूदो!"), PFM-HR रोबोट को गति के ज्यामिति (geometry) को सिखाता है। कल्पना कीजिए कि सभी संभावित मानव मुद्राओं (poses) का एक विशाल, अदृश्य बादल है। PFM-HR इस बादल के आकार को सीखता है। जब रोबोट एक नया मूव आज़माता है, तो सिस्टम जाँच करता है: "क्या यह गति इस बादल का हिस्सा महसूस होती है?" यदि रोबोट अपने घुटने को इस तरह से मरोड़ने की कोशिश करता है जो मानव शरीर रचना के विरुद्ध है, तो सिस्टम कहता है, "नहीं, यह बादल के बाहर है।" लेकिन यदि रोबोट एक शानदार, गतिशील स्पिन (spin) करने की कोशिश करता है जो मानव जोड़ों के प्राकृतिक प्रवाह में फिट बैठता है, तो सिस्टम उसे उच्च स्कोर और इनाम देता है।

शोधकर्ताओं ने पाया कि यह दृष्टिकोण एक गेम-चेंजर है, विशेष रूप से बैकफ्लिप या कार्टव्हील जैसे जंगली, कलाबाजी वाले मूव्स के लिए। फ्लो मैचिंग (Flow Matching) नामक तकनीक का उपयोग करके, उन्होंने अपने सिस्टम को 6 करोड़ मानव मुद्राओं के एक विशाल, अव्यवस्थित संग्रह पर प्रशिक्षित किया—जैसे कि लोगों की अलग-अलग स्थितियों में ली गई अरबों रैंडम तस्वीरों को देखना, न कि एक एकल फिल्म देखना। इसने उन्हें एक "फ्रोजन" (frozen) प्रायर बनाने की अनुमति दी (एक ऐसी नियम पुस्तिका जो रोबोट के सीखने के दौरान नहीं बदलती) जो अविश्वसनीय रूप से कुशल है। अपने परीक्षणों में, PFM-HR का उपयोग करने वाले रोबोटों ने पुराने तरीकों की तुलना में जटिल गतियों को तेजी से और कम गलतियों के साथ सीखा। उदाहरण के लिए, वास्तविक दुनिया के परीक्षणों में, एक भौतिक रोबोट पर, इस नई विधि ने एक "स्पिंकिक" (spinkick) में महारत हासिल करने के लिए आवश्यक प्रशिक्षण समय को पिछले तकनीकों की तुलना में लगभग 25% कम कर दिया। पेपर सुझाव देता है कि केवल एक क्षण में जोड़ एक साथ कैसे बदलते हैं, इस पर ध्यान केंद्रित करके, रोबोट अधिक स्वाभाविक रूप से हिलना सीख सकते हैं और गतिशील, उच्च-ऊर्जा वाले कार्यों को बहुत बेहतर तरीके से संभाल सकते हैं।

मूल विचार: "पोज़ क्लाउड" और "ज्यामिति स्कोर"

यह समझने के लिए कि PFM-HR कैसे काम करता है, गणित को एक तरफ छोड़ दें और एक डांस फ्लोर के बारे में सोचें।

अतीत में, एक रोबोट को नृत्य करना सिखाना एक स्क्रिप्ट देने जैसा था। इसे फ्रेमों के एक विशिष्ट क्रम का पालन करना होता था: फ्रेम 1, फ्रेम 2, फ्रेम 3। यदि रोबोट एक कदम चूक जाता, तो उसे वापस जाना पड़ता और फिर से प्रयास करना पड़ता। पुराने तरीके यही करते थे; वे टेम्पोरल प्रायर्स (temporal priors) पर निर्भर थे, जो एक डांसर का वीडियो देखने और फ्रेम-दर-फ्रेम वीडियो की नकल करने जैसा है। समस्या यह है कि वीडियो कठोर होते हैं। यदि रोबोट को फिसलन भरे फर्श या अचानक धक्का देने के अनुकूल होना पड़ता है, तो वीडियो स्क्रिप्ट काम नहीं आती।

अन्य तरीकों ने पोज़ प्रायर्स (pose priors) का उपयोग करने की कोशिश की, जो एक फोटो एल्बम की तरह हैं। वे रोबोट को बताते हैं, "यह मुद्रा अच्छी है, वह मुद्रा बुरी है।" लेकिन उनकी एक कमी है: उन्हें इस बात से फर्क नहीं पड़ता कि आप वहाँ कैसे पहुँचे। वे कह सकते हैं, "हैंडस्टैंड में होना ठीक है," लेकिन वे आपको यह नहीं बताते कि क्या खड़े होने की स्थिति से हैंडस्टैंड में कूदना ठीक है। वे जोड़ों के बीच के संबंध को मिस कर देते हैं।

PFM-HR इस अंतर को पाटता है। इसे तस्वीरों के क्रम की परवाह नहीं है, और न ही यह केवल तस्वीरों को देखता है। इसके बजाय, यह डांस फ्लोर की स्थानीय ज्यामिति (local geometry) को सीखता है।

कल्पना कीजिए कि रोबोट एक ट्रैम्पोलिन पर खड़ा है। "पोज़ ज्योमेट्री स्कोर" (PGS) एक सेंसर की तरह है जो स्प्रिंग्स के तनाव को मापता है।

  1. प्रशिक्षण: सिस्टम मानव मुद्राओं की 6 करोड़ रैंडम तस्वीरों को देखता है। इसे इस बात से फर्क नहीं पड़ता कि वे क्रम में हैं या नहीं। यह बस यह सीखता है कि मानव जोड़ कहाँ रहना पसंद करते हैं।
  2. जादुई गणित: सिस्टम यह पता लगाने के लिए एक गणितीय ट्रिक (फ्लो मैचिंग) का उपयोग करता है कि जोड़ एक साथ कैसे हिलना पसंद करते हैं। यह एक "जैकोबियन" (Jacobian) की गणना करता है, जो एक मानचित्र (map) के लिए एक फैंसी शब्द है जो दिखाता है कि एक जोड़ में छोटा सा बदलाव अन्य सभी को कैसे प्रभावित करता है।
  3. स्कोर: जब रोबोट हिलने की कोशिश करता है, तो सिस्टम पूछता है: "यदि मैं रोबोट के जोड़ों को इस दिशा में धकेलता हूँ, तो क्या यह ऐसा महसूस होता है जैसे यह मानव शरीर के प्राकृतिक वक्रों (curves) के साथ फिसल रहा है?"
    • यदि रोबोट अपने हाथ और पैर को उस तरह से हिलाने की कोशिश करता है जैसा इंसान कभी नहीं करते, तो स्कोर कम होता है। रोबोट को "थम्स डाउन" मिलता है।
    • यदि रोबोट उस तरह से हिलता है जो मानव जोड़ों के प्राकृतिक "प्रवाह" के अनुरूप है, तो स्कोर अधिक होता है। रोबोट को "थम्स अप" और इनाम मिलता है।

यह क्यों महत्वपूर्ण है: "फ्रोजन" कोच

PFM-HR के बारे में सबसे कूल चीज़ यह है कि "कोच" (प्रायर) फ्रोजन (frozen) है। एक बार जब सिस्टम 6 करोड़ मुद्राओं से मानव गति की ज्यामिति सीख लेता है, तो यह बदलता नहीं है। जब रोबट नृत्य सीख रहा होता है, तब भी यह स्थिर रहता है।

इसे एक संगीत शिक्षक के रूप में सोचें जिसने सद्भाव (harmony) के नियमों को याद कर लिया है। शिक्षक यह नहीं बदलता कि एक "अच्छा कॉर्ड" कैसा लगता है, सिर्फ इसलिए क्योंकि छात्र एक नया गाना सीख रहा है। शिक्षक सुसंगत रहता है, एक स्थिर मार्गदर्शक प्रदान करता है। यह सिस्टम को पुन: प्रयोज्य (reusable) बनाता है। आप इसी फ्रोजन कोच को अलग-अलग रोबोटों या अलग-अलग कार्यों (जैसे चलना, दौड़ना या फ्लिप करना) पर बिना पूरी चीज़ को फिर से प्रशिक्षित किए लगा सकते हैं।

परिणाम: तेज़ फ्लिप और वास्तविक रोबोट

शोधकर्ताओं ने सरल चलने से लेकर बैकफ्लिप और "डबल कॉन्ग" वॉल्ट जैसी पागल कर देने वाली कलाबाजियों तक विभिन्न कार्यों पर इसका परीक्षण किया।

  • डेटा: उन्होंने सिस्टम को BONES-SEED नामक डेटासेट पर प्रशिक्षित किया, जिसमें 6 करोड़ तक मुद्राएं थीं। उन्होंने पाया कि उन्होंने जितना अधिक डेटा उपयोग किया, रोबोट का प्रदर्शन उतना ही बेहतर हुआ। 6 करोड़ मुद्राओं वाला संस्करण सबसे मजबूत था।
  • दक्षता: सिमुलेशन में, PFM-HR का उपयोग करने वाले रोबोटों ने कम प्रयासों में जटिल गतियों को ट्रैक करना सीखा। उदाहरण के लिए, "बैकफ्लिप" सीखने के लिए, पुराने तरीकों (जिन्हें "वैनिला ADD" कहा जाता है) पूरी तरह विफल रहे। PFM-HR के साथ वाला तरीका सफल रहा और इसने अन्य उन्नत तरीकों की तुलना में इसे तेजी से किया।
  • वास्तविक दुनिया की सफलता: वे केवल कंप्यूटर सिमुलेशन तक ही सीमित नहीं रहे। उन्होंने इसे एक वास्तविक ह्यूमनॉइड रोबोट पर लगाया। उन्होंने चार गतिशील कौशलों का परीक्षण किया: स्पिंकिक (spinkick), किक कॉम्बो (kick combo), कार्टव्हील (cartwheel), और बैकफ्लिप (backflip)।
    • स्पिंकिक के लिए, PFM-HR के साथ रोबोट को 80% सफलता दर तक पहुँचने के लिए 251.425 मिलियन सिमुलेशन सैंपल की आवश्यकता थी।
    • PFM-HR के बिना, रोबोट को 331.776 मिलियन सैंपल की आवश्यकता थी।
    • इसका मतलब है कि PFM-HR ने उस विशिष्ट मूव के लिए प्रशिक्षण समय को लगभग 25% कम कर दिया।

पेपर नोट करता है कि जबकि यह सिस्टम एक ही क्षण में जोड़ एक साथ कैसे हिलते हैं, इसे पकड़ने में महान है, यह समय के क्रम को नहीं जानता। यह नहीं बता सकता कि कोई मूव समय में आगे हो रहा है या पीछे। हालाँकि, स्वाभाविक रूप से और गतिशील रूप से हिलने के उद्देश्य के लिए, इस "स्नैपशॉट" दृष्टिकोण ने अविश्वसनीय रूप से शक्तिशाली साबित हुआ।

निष्कर्ष

PFM-HR रोबोट को एक कठोर स्क्रिप्ट देने के बजाय उन्हें मानव शरीर की ज्यामिति की गहरी समझ देकर सिखाने का एक नया तरीका है। एक विशाल अव्यवस्थित मुद्राओं के पुस्तकालय और एक चतुर स्कोरिंग सिस्टम का उपयोग करके, जो यह जाँचता है कि क्या कोई मूव "सही महसूस" होता है, यह रोबोट को बैकफ्लिप जैसे जटिल, गतिशील कौशल बहुत तेज़ी से और अधिक विश्वसनीय रूप से सीखने में मदद करता है। यह सुझाव देता है कि कभी-कभी, रोबोट को नृत्य सिखाने के लिए, आपको उसे पूरा नृत्य दिखाने की आवश्यकता नहीं होती; आपको बस उसे डांस फ्लोर का आकार दिखाने की आवश्यकता होती।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →