← नवीनतम पेपर
💻 computer science

Toward Hardware-Agnostic Quadrupedal World Models via Morphology Conditioning

यह शोध पत्र एक मॉर्फोलॉजी-कंडीशन्ड क्वाड्रुपेडल वर्ल्ड मॉडल (QWM) प्रस्तुत करता है जो जनरेटिव डायनेमिक्स को रोबोट इंजीनियरिंग विशिष्टताओं पर स्पष्ट रूप से कंडिशन करता है न कि उन्हें अंतर्निहित रूप से अनुमानित करता है, जिससे बिना पुनप्रशिक्षण के विविध क्वाड्रुपेडल एम्बॉडिमेंट्स में ज़ीरो-शॉट सामान्यीकरण और सुरक्षित नियंत्रण सक्षम होता है।

मूल लेखक: Mohamad H. Danesh, Chenhao Li, Amin Abyaneh, Anas Houssaini, Kirsty Ellis, Glen Berseth, Marco Hutter, Hsiu-Chin Lin

प्रकाशित 2026-04-13
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohamad H. Danesh, Chenhao Li, Amin Abyaneh, Anas Houssaini, Kirsty Ellis, Glen Berseth, Marco Hutter, Hsiu-Chin Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कुत्ते को फेच (fetch) करना सिखा रहे हैं। आप एक गोल्डन रिट्रीवर को प्रशिक्षित कर सकते हैं, और वह गेंद के पीछे दौड़ना, कूदना और उसे पकड़ना पूरी तरह से सीख जाता है। लेकिन यदि आप अचानक उस कुत्ते को एक चिहुआहुआ (Chihuahua) से बदल देते हैं और उम्मीद करते हैं कि वही कमांड तुरंत काम करेंगे, तो चिहुआहुआ अपने ही पंजों में उलझ सकता है या भ्रमित हो सकता है। उसके पैरों की लंबाई अलग है, उसका गुरुत्वाकर्षण केंद्र (center of gravity) अलग है, और उसके चलने का तरीका भी अलग है।

रोबोटिक्स की दुनिया में, यह ठीक वही समस्या है जिसका सामना शोधकर्ता करते हैं। आमतौर पर, यदि आप एक रोबोट (जैसे बोस्टन डायनेमिक्स स्पॉट) को चलना सिखाते हैं, तो यदि आप किसी दूसरे रोबोट (जैसे यूनिट्री Go1) को नियंत्रित करना चाहते हैं, तो आपको शून्य से शुरुआत करनी पड़ती है। पहले रोबोट का "दिमाग" बहुत अधिक विशिष्ट (specialized) होता है; यह एक ऐसे शेफ की तरह है जो केवल स्टेक बनाना जानता है और उसे केक बनाना नहीं आता।

यह पेपर QWM (Quadrupedal World Model) नामक एक नया फ्रेमवर्क पेश करता है जो इस समस्या को हल करता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

1. समस्या: "हार्डवेयर लॉटरी" (The Hardware Lottery)

वर्तमान में, रोबोट के दिमाग "हार्डवेयर-लॉक्ड" होते हैं। यदि आप रोबोट के पैर, मोटर या वजन बदलते हैं, तो पुराना दिमाग काम करना बंद कर देता है। इसे ठीक करने के लिए, इंजीनियरों को आमतौर पर लाखों नए डेटा पॉइंट्स एकत्र करने होते हैं और रोबोट को शून्य से फिर से प्रशिक्षित करना पड़ता है। यह एक इंसान को चंद्रमा पर चलने के लिए सिखाने जैसा है, जहाँ हर बार नए जूते पहनने पर उसे पृथ्वी पर चलने का तरीका फिर से सीखना पड़ता है।

2. समाधान: "यूनिवर्सल ट्रांसलेटर" दिमाग

लेखकों ने एक ऐसा रोबोट दिमाग बनाया है जो केवल यह नहीं सीखता कि कैसे हिलना है; बल्कि यह भी सीखता है कि वह रोबोट क्या है।

रोबोट के भौतिक शरीर (उसका आकार, वजन और पैर की लंबाई) को एक यूजर मैनुअल (User Manual) के रूप में सोचें।

  • पुराना तरीका: रोबोट कुछ बार लड़खड़ाकर और गिरकर अपने खुद के यूजर मैनुअल का अनुमान लगाने की कोशिश करता है, और फिर धीरे-धीरे यह समझ पाता है कि, "ओह, मेरे पैर छोटे हैं।" इसमें समय लगता है और यह खतरनाक है।
  • नया तरीका (QWM): रोबोट को हिलना शुरू करने से पहले ही एक यूजर मैनुअल थमा दिया जाता है। दिमाग उस मैनुअल को पढ़ता है, इस विशिष्ट शरीर के भौतिक विज्ञान (physics) को समझता है, और तुरंत जानता है कि इसे कैसे चलाना है।

3. यह कैसे काम करता है: तीन जादुई सामग्रियां

शोधकर्ताओं ने इस काम को संभव बनाने के लिए रोबोट के दिमाग में तीन विशेष उपकरण जोड़े हैं:

  • "बॉडी स्कैनर" (Physical Morphology Encoder):
    घुटने या अंदाज़ा लगाने के बजाय, यह सिस्टम रोबोट के डिजिटल ब्लूप्रिंट (एक USD फ़ाइल) को पढ़ता है। यह तथ्यों को निकालता है जैसे "पैर 30 सेमी लंबे हैं" या "शरीर का वजन 10 किलो है।" यह इन तथ्यों को एक सरल कोड (वेक्टर) में बदल देता है जिसे दिमाग समझ सके। यह दिमाग को एक 'चीट शीट' देने जैसा है जो कहती है, "तुम एक गोल्डन रिट्रीवर नहीं, बल्कि एक चिहुआहुआ हो।"

  • "डुअल-ट्रैक" दिमाग (The Dual-Track Brain):
    अधिकांश रोबोट दिमाग "अभी क्या हो रहा है" (तेजी से दौड़ना) और "मैं क्या हूँ" (मैं भारी हूँ) को मिला देते हैं। यह पेपर उन्हें अलग करता है।

    • ट्रैक A (स्मृति/Memory): रोबोट के शरीर के प्रकार को याद रखता (चीट शीट)। यह स्थिर रहता है।
    • ट्रक B (क्रिया/Action): याद रखता है कि अभी क्या हो रहा है (गति, संतुलन, कदम)।
      इन दोनों को अलग रखकर, दिमाग भ्रमित नहीं होता। वह जानता है, "मैं एक भारी रोबोट हूँ (ट्रैक A), और अभी मैं तेजी से दौड़ रहा हूँ (ट्रैक B)।"
  • "फेयरनेस कोच" (Adaptive Reward Normalizer):
    अलग-अलग रोबोट एक ही काम के लिए अलग-अलग स्कोर प्राप्त करते हैं। एक भारी रोबोट चलने के लिए 100 अंक प्राप्त कर सकता है, जबकि एक हल्का रोबोट 10 अंक। यदि आप उन्हें एक साथ प्रशिक्षित करते हैं, तो दिमाग गणित से भ्रमित हो जाता है। यह उपकरण एक कोच की तरह काम करता है जो स्कोर को सामान्य (normalize) करता है, यह कहते हुए, "ठीक है, भारी रोबोट के लिए 100 अंक बहुत अच्छे हैं। हल्के रोबोट के लिए 10 अंक भी उतने ही अच्छे हैं।" यह उन्हें बिना आपस में प्रतिस्पर्धा किए एक साथ सीखने में मदद करता है।

4. परिणाम: ज़ीरो-शॉट मैजिक (Zero-Shot Magic)

सबसे प्रभावशाली हिस्सा ज़ीरो-शॉट जनरलाइजेशन (Zero-Shot Generalization) है।

शोधकर्ताओं ने इस एक दिमाग को सात अलग-अलग प्रकार के रोबोट्स पर प्रशिक्षित किया (कुछ भारी, कुछ हल्के, कुछ अलग पैर के आकार वाले)। फिर, उन्होंने इसे उन दो रोबोटों पर टेस्ट किया जिन्हें इसने पहले कभी नहीं देखा था।

  • उन्होंने दिमाग को फिर से प्रशिक्षित नहीं किया।
  • उन्होंने रोबलेट को अभ्यास करने के लिए नहीं छोड़ा।
  • उन्होंने बस नए रोबोट का "यूजर मैनुअल" (बॉडी कोड) दिमाग को दे दिया।

परिणाम क्या रहा? नए रोबोट ने तुरंत पूरी तरह से चलना शुरू कर दिया। यह एक ड्राइवर को एक नई कार देने जैसा था जिसमें अलग इंजन है, और ड्राइवर को पता था कि उसे कैसे चलाना है, भले ही उसने उस विशिष्ट मॉडल में कभी सवारी न की हो।

5. यह क्यों महत्वपूर्ण है

यह सामान्य उद्देश्य वाले रोबोटों (General Purpose Robots) की दिशा में एक बड़ा कदम है।

  • सुरक्षा: रोबोट को खुद को समझने के लिए बार-बार गिरने और खुद को चोट पहुँचाने की ज़रूरत नहीं है।
  • दक्षता: एक ही दिमाग विभिन्न प्रकार के रोबोटों (छोटे डिलीवरी बॉट्स से लेकर भारी औद्योगिक वॉकर तक) को नियंत्रित कर सकता है।
  • वास्तविक दुनिया: उन्होंने इसे वास्तविक हार्डवेयर पर टेस्ट किया, और यह काम कर गया। रोबोट केवल कंप्यूटर सिमुलेशन में नहीं चला; वह वास्तविक फर्श पर चला।

कमी (The Catch)

पेपर अपनी सीमाओं के बारे में ईमानदार है। यह दिमाग एक "डिस्ट्रीब्यूशन इंटरपोलेटर" है। इसका मतलब है कि यह उन रोबोटों को संभालने में बहुत अच्छा है जो उन रोबोटों के समान हैं जिन पर इसे प्रशिक्षित किया गया था (जैसे कि एक नया मॉडल वाला कुत्ता-नुमा रोबोट)। लेकिन यदि आप इसे पूरी तरह से पराया (alien) रोबोट देते (जैसे छह पैरों वाला रोबोट या एक विशाल टैंक), तो इसे संघर्ष करना पड़ सकता है। यह "क्वाड्रुपेडल फैमिली" का मास्टर है, लेकिन अभी तक ब्रह्मांड की हर चीज़ के लिए एक सार्वभौमिक भौतिकी इंजन (universal physics engine) नहीं है।

संक्षेप में

यह पेपर रोबोटों को हिलना शुरू करने से पहले अपना खुद का निर्देश मैनुअल पढ़ना सिखाता है। "मैं कौन हूँ" को "मैं क्या कर रहा हूँ" से अलग करके, उन्होंने एक ऐसा एकल दिमाग बनाया है जो तुरंत किसी भी चार पैरों वाले रोबोट को नियंत्रित कर सकता है, जिससे "हार्डवेयर लॉटरी" एक ऐसे खेल में बदल जाती है जहाँ हर रोबोट जीतता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →