← नवीनतम पेपर
💻 computer science

LooperMuscle: Fast and Stable Learning of Humanoid Whole-Body Tracking via Structured Mixture-of-Experts

LooperMuscle एक संरचित मिक्सचर-ऑफ-एक्सपर्ट्स फ्रेमवर्क पेश करता है जो लगभग 45 मिनट के प्रशिक्षण में PPO के करीब सटीकता प्राप्त करके ह्यूमनॉइड होल-बॉडी ट्रैकिंग में स्पीड-परफॉर्मेंस गैप को प्रभावी ढंग से पाटता है, जो FastSAC जैसे तेज़ तरीकों से काफी बेहतर प्रदर्शन करते हुए मानक PPO की तुलना में कहीं अधिक कुशल है।

मूल लेखक: Boyi Liu, Qijin Li, Tianqi Yu, Qinrui Yan, Xingxing Zuo

प्रकाशित 2026-08-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Boyi Liu, Qijin Li, Tianqi Yu, Qinrui Yan, Xingxing Zuo

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को नाचना सिखाने की कोशिश कर रहे हैं। आप नहीं चाहते कि वह बस स्थिर खड़ा रहे; आप चाहते हैं कि वह बिल्कुल एक इंसान की तरह पैर चलाए, घूमे और कूदे, और अपने सभी जोड़ों का एक साथ उपयोग करे। यह सुदृढीकरण शिक्षण (Reinforcement Learning - RL) की दुनिया है, जो आर्टिफिशियल इंटेलिजेंस की एक शाखा है जहाँ एक कंप्यूटर 'प्रयास और त्रुटि' (trial and error) के माध्यम से सीखता है, ठीक वैसे ही जैसे एक पिल्ला करतब सीखना सीखता है। जब रोबोट सही ढंग से चलता है तो उसे एक "पुरस्कार" (एक डिजिटल ट्रीट) मिलता है और जब वह लड़खड़ाता है तो उसे "सजा" मिलती है।

लंबे समय तक, इन रोबोटों को सिखाना अविश्वसनीय रूप से धीमा था। एक एकल चाल सीखने में कंप्यूटर का घंटों का समय लग सकता था, और रोबोट अक्सर अनाड़ी होता था। फिर, वैज्ञानिकों ने उन्हें प्रशिक्षित करने का एक तेज़ तरीका खोज निकाला, जिससे समय घटकर केवल मिनटों में रह गया। हालाँकि, इसमें एक पेंच था: तेज़ तरीकों ने रोबोट को तेज़ी से तो चलाया, लेकिन धीमी और सावधानीपूर्वक विधियों की तुलना में उनकी हरकतें सख्त और गलत थीं। यह एक क्लासिक समझौता था: गति बनाम गुणवत्ता। बड़ा सवाल यह था: क्या हमारे पास एक ऐसा रोबट हो सकता है जो तेज़ भी सीखे और बेहतरीन तरीके से नाचे भी?

यही वह चीज़ है जिसे पेपर LooperMuscle हल करता है। शोधकर्ताओं ने एक नया प्रशिक्षण सिस्टम बनाया है जो एक अत्यधिक संगठित, सुपर-कुशल डांस क्रू की तरह काम करता है। रोबोट के पूरे शरीर को एक साथ नियंत्रित करने के लिए एक विशाल मस्तिष्क लगाने के बजाय, उन्होंने काम को विशेषज्ञ "विशेषज्ञों" की एक टीम में विभाजित कर दिया है। इसे एक स्पोर्ट्स टीम की तरह समझें जहाँ आपके पास एक गोलकीपर, एक स्ट्राइकर और एक डिफेंडर होता है, जिनमें से प्रत्येक अपनी विशिष्ट भूमिका पर ध्यान केंद्रित करता है, न कि एक खिलाड़ी जो सब कुछ करने की कोशिश करता है।

यह पेपर एक ढांचा पेश करता है जिसे LooperMuscle कहा जाता है जो गति-गुणवत्ता के अंतर को ठीक करने के लिए तीन चतुर तरकीबों को जोड़ता है। पहला, यह एक Mixture-of-Experts एक्टर का उपयोग करता है। एक ऐसे कंडक्टर की कल्पना करें जो एक बैंड का नेतृत्व कर रहा है जहाँ संगीत के आधार पर अलग-अलग संगीतकार (विशेषज्ञ) नेतृत्व करते हैं। यदि रोबोट को एक पैर पर संतुलन बनाने की आवश्यकता है, तो "लोअर-बॉडी एक्सपर्ट" कमान संभालता है। यदि उसे अपने हाथ हिलाने की आवश्यकता है, तो "अपर-बॉडी एक्सपर्ट" सामने आता है। यह रोबोट को एक साथ बहुत सारी चीजें करने की कोशिश में भ्रमित होने से रोकता है।

दूसिला, सिस्टम एक विशेष क्रिटिक (वह जज जो पुरस्कार देता है) का उपयोग करता है जो इस टीम संरचना को समझता है। केवल पूरे रोबोट को "अच्छा काम किया" या "बुरा काम किया" कहने के बजाय, यह जज बिल्कुल बता सकता है कि किस विशेषज्ञ ने अच्छा किया और किसे अभ्यास की आवश्यकता है। इससे रोबोट तेज़ी से सीखता है क्योंकि उसे पता होता है कि वास्तव में क्या सुधारना है।

तीसरा, उन्होंने रोबोट के अभ्यास करने के तरीके को बदल दिया। अतीत में, रोबोट बार-बार एक ही आसान चालों का अभ्यास करता था, कठिन चालों को अनदेखा कर देता था। LooperMuscle एक Quota-Routed Replay सिस्टम का उपयोग करता है। यह एक कोच की तरह है जो यह सुनिश्चित करता है कि रोबोट हर सत्र में विशिष्ट संख्या में कठिन चालों (जैसे गिरना और उठना) का अभ्यास करे, जिससे यह सुनिश्चित हो सके कि कोई भी कौशल पीछे न छूटे। वे एक "डिफर्ड शेड्यूलिंग" (deferred scheduling) तकनीक का भी उपयोग करते हैं, जहाँ सबसे कठिन चालों को प्रशिक्षण सत्र के बाद के लिए सुरक्षित रखा जाता है ताकि शुरुआत में रोबोट अभिभूत न हो जाए।

परिणाम प्रभावशाली हैं। उनके सिमुलेशन में, पुराने तेज़ तरीके (FastSAC) को प्रशिक्षित करने में लगभग 15 मिनट लगे लेकिन उसने अनाड़ी हरकतें पैदा कीं। पुराने धीमे तरीके (PPO) को बेहतरीन हरकतें पैदा करने में 6 घंटे लगे। LooperMuscle ने केवल 45 मिनट में 6-घंटे वाले तरीके के लगभग बराबर प्रदर्शन किया। इसने पुराने तेज़ तरीके की तुलना में रोबोट की बॉडी ट्रैकिंग त्रुटि को 34% कम कर दिया, जिससे उसकी हरकतें बहुत अधिक सुचारू और मानव जैसी हो गईं।

शोधकर्ताओं ने वास्तविक दुनिया में एक वास्तविक रोबोट, Unitree G1 पर भी इसका परीक्षण किया। भले ही रोबोट कंप्यूटर सिमुलेशन की तरह "परफेक्ट" स्थितियों को देख नहीं सकता था, लेकिन LooperMuscle द्वारा प्रशिक्षित पॉलिसी ने स्थिर संतुलन के साथ जटिल लड़ाई और नृत्य के अनुक्रमों को सफलतापूर्वक निष्पादित किया। यह सुझाव देता है कि यह तरीका केवल एक कंप्यूटर ट्रिक नहीं है; यह वास्तव में भौतिक हार्डवेयर पर काम करता है।

संक्षेप में, LooperMuscle सुझाव देता है कि रोबोट के सीखने को विशेषज्ञों की एक टीम में व्यवस्थित करके और यह प्रबंधित करके कि वे क्या अभ्यास करते हैं, हम रोबोट को पहले की तुलना में बहुत कम समय में मानव जैसी गरिमा के साथ हिलना-डुलना सिखा सकते हैं। यह "तेज़ लेकिन अनाड़ी" और "धीमा लेकिन पूर्ण" के बीच के अंतर को पाटता है, जो रोबोटों को वास्तविक दुनिया के कार्यों के लिए बहुत तेज़ी से तैयार करने का एक व्यावहारिक तरीका प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →