← नवीनतम पेपर
💻 computer science

Humanoid-DART: Humanoid Loco-Manipulation using Diffusion-guided Augmentation through Relabeling and Tracking

Humanoid-DART एक स्व-पर्यवेक्षित (self-supervised) फ्रेमवर्क है जो डिफ्यूजन-आधारित प्रक्षेपवक्र (trajectory) पीढ़ी को सुदृढीकरण शिक्षण (reinforcement learning) के साथ जोड़ता है ताकि ह्यूमनॉइड रोबोटों को न्यूनतम विशेषज्ञ पर्यवेक्षण के साथ लक्ष्य स्थान का स्वचालित रूप से अन्वेषण करके विरल प्रदर्शनों (sparse demonstrations) से विविध लोको-मैनिपुलेशन कौशल सीखने में सक्षम बनाया जा सके।

मूल लेखक: Pranav Debbad, Kanish Thiagarajan, Victor Dhédin, Shafeef Omar, Majid Khadiv

प्रकाशित 2026-06-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pranav Debbad, Kanish Thiagarajan, Victor Dhédin, Shafeef Omar, Majid Khadiv

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ह्युमनॉइड रोबोट को जटिल काम करना सिखा रहे हैं, जैसे कि एक डिब्बे को उठाना और उसे किसी विशिष्ट स्थान पर ले जाना, या गेंद को किक मारना। आमतौर पर, रोबोट को ये काम सिखाने के लिए, आपको इंसानों द्वारा इन कार्यों को पूरी तरह से करने के सैकड़ों घंटों के रिकॉर्ड की आवश्यकता होती है। लेकिन यह महंगा, धीमा है और हर संभव बदलाव के लिए करना कठिन है (क्या होगा अगर डिब्बा भारी हो? क्या होगा अगर लक्ष्य और दूर हो?)।

यह पेपर Humanoid-DART पेश करता है, जो एक चतुर सिस्टम है जो एक रोबोट को केवल कुछ ही उदाहरणों (जितने चार) के साथ इन कार्यों में महारत हासिल करने के लिए सिखाता है। यह ऐसा इसलिए करता है क्योंकि यह एक रचनात्मक कोच की तरह काम करता है जो केवल वही नहीं दोहराता जो उसने देखा है, बल्कि नए तरीके भी सोचता है और फिर उन्हें तब तक अभ्यास करता है जब तक कि वे काम न करने लगें।

यह सिस्टम कैसे काम करता है, इसे सरल भागों में यहाँ दिया गया है:

1. दो-टीम रणनीति (The Two-Team Strategy)

रोबोट को एक विशाल मस्तिष्क में सब कुछ सिखाने के बजाय, Humanoid-DART काम को दो विशिष्ट टीमों में विभाजित करता है जो एक-दूसरे की मदद करती हैं:

  • "द ड्रीमर" (डिफ्यूजन मॉडल - The Dreamer): यह रचनात्मक योजनाकार है। इसका काम रोबोट के लिए एक रास्ता सोचना है। यह उपलब्ध कुछ उदाहरणों को देखता है और नए लक्ष्यों तक पहुँचने के लिए नए, थोड़े अलग रास्ते "सपनों में" बुनना शुरू करता है। इसे एक कलाकार की तरह समझें जो मानचित्र पर नए मार्ग स्केच कर रहा है। शुरुआत में, ये स्केच शारीरिक रूप से असंभव हो सकते हैं (जैसे दीवार के माध्यम से चलना या फर्श पर फिसलना), लेकिन वे इस बात को समझने में महान हैं कि रोबोट कहाँ जा सकता है।
  • "द एथलीट" (रीइन्फोर्समेंट लर्निंग पॉलिसी - The Athlete): यह शारीरिक निष्पादक है। इसका काम "ड्रीमर" के स्केच को लेना और वास्तव में रोबट पर उसे चलाना है। यह एक सख्त कोच की तरह कार्य करता है। यदि ड्रीमर एक ऐसा रास्ता बनाता है जहाँ रोबोट का पैर फिसलता है या वह गिर जाता है, तो एथलीट कहता है, "नहीं, यह काम नहीं करेगा," और गति को शारीरिक रूप से संभव बनाने के लिए उसे ठीक करता है।

2. "प्रैक्टिस लूप" (द करिकुलम - The Practice Loop)

जादू इस बात में है कि ये दोनों टीमें समय के साथ एक-दूसरे से कैसे बात करती हैं। सिस्टम चक्रों में चलता है, जैसे कि एक ट्रेनिंग कैंप:

  1. लक्ष्य चुनें: सिस्टम एक लक्ष्य चुनता है (जैसे, "इस डिब्बे को इस नए स्थान पर ले जाओ")।
  2. सपना देखें (Dream): "ड्रीमर" वहाँ पहुँचने के लिए एक मोटा खाका तैयार करता है।
  3. परीक्षण करें (Test): "एथलीट" एक भौतिक सिम्युलेटर में उस योजना को निष्पादित करने का प्रयास करता है।
  4. फ़िल्टर और रीलेबल करें (Filter & Relabel):
    • यदि रोबोट गिर जाता है या विफल हो जाता है, तो योजना को हटा दिया जाता है।
    • सीक्रेट सॉस: यदि रोबोट लगभग सफल होने वाला होता है (एक "नियर मिस"), तो सिस्टम इसे विफलता नहीं मानता। इसके बजाय, यह कहता है, "ठीक है, आपने इच्छित स्थान तक तो नहीं पहुँचा, लेकिन आपने इस स्थान तक सफलतापूर्वक पहुँच लिया है।" यह प्रयास को उस नए स्थान के लिए एक सफलता के रूप में रीलेबल करता है जिसे वह वास्तव में प्राप्त कर चुका है।
  5. सीखें (Learn): "ड्रीमर" उन सफल (या लगभग सफल) प्रयासों से सीखता है ताकि उन विशिष्ट स्थानों के लिए बेहतर योजनाएँ बना सके। "एथलीट" उन्हें निष्पादित करने में बेहतर होता जाता है।
  6. दोहराएं (Repeat): सिस्टम जो अभी सीखा है उसके आधार पर नए, थोड़े कठिन लक्ष्य चुनता है, जिससे उसके कौशल एक ढलान से लुढ़कते हुए हिमखंड (snowball) की तरह बढ़ते जाते हैं।

3. "डुअल-ब्रेन" आर्किटेक्चर (The Dual-Brain Architecture)

"ड्रीमर" को चलने और वस्तु पकड़ने दोनों को संभालने में वास्तव में कुशल बनाने के लिए, पेपर इसे एक विशेष दो-भाग वाला मस्तिष्क संरचना देता है:

  • नेविगेटर (The Navigator): बड़े चित्र पर ध्यान केंद्रित करता है (रोबोट के पैर कहाँ जा रहे हैं)।
  • लोकलाइज़र (The Localizer): विवरणों पर ध्यान केंद्रित करता है (वस्तु के सापेक्ष हाथ और जोड़ों की गति कैसे होती है)।
    इन दोनों को अलग करके, रोबोट पूरे शरीर का समन्वय करना सीखता है बिना भ्रमित हुए, यह सुनिश्चित करते हुए कि जब वह डिब्बे की ओर चलता है, तो उसका हाथ उसे पकड़ने के लिए तैयार रहता है।

4. परिणाम (The Results)

शोधकर्ताओं ने एक वास्तविक रोबोट (Unitree G1) और सिमुलेशन में इसका परीक्षण किया। उन्होंने केवल चार बुनियादी उदाहरणों के साथ शुरुआत की जिसमें रोबोट को धक्का देना, किक मारना, हैंड-ऑफ करना या डिब्बा उठाना सिखाया गया था।

  • परिणाम: सिस्टम ने केवल उन चार उदाहरणों की नकल नहीं की। इसने उन लक्ष्यों के लिए कार्य करना सीखा जो मूल उदाहरणों की तुलना में 4 से 5 गुना अधिक दूर थे।
  • कवरेज: "पिक-एंड-प्लेस" कार्य के लिए, रोबोट ने सभी संभावित लक्ष्य क्षेत्रों में से 96% को कवर करना सीखा, जबकि अन्य तरीकों ने केवल एक बहुत छोटे हिस्से को कवर किया।

सारांश

Humanoid-DART एक ऐसे छात्र की तरह है जो कुछ पाठ्यपुस्तकीय उदाहरणों से शुरू करता है लेकिन हजारों नई समस्याओं को हल करना सीखता है:

  1. नए समाधानों की कल्पना करके।
  2. उन्हें आजमाकर और यह देखकर कि वास्तव में क्या काम करता है।
  3. "नियर मिस" को सीखने के नए अवसरों के रूप में मनाकर।
  4. बिना किसी इंसान द्वारा हर बदलाव को रिकॉर्ड किए, धीरे-धीरे एक विशाल कौशल लाइब्रेरी बनाकर।

पेपर निष्कर्ष निकालता है कि यह दृष्टिकोण रोबोटों को बहुत कम डेटा से जटिल, पूर्ण-शरीर कार्यों को सीखने की अनुमति देता है, जिससे रोबोट सिखाने की प्रक्रिया पहले की तुलना में बहुत तेज़ और अधिक कुशल हो जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →