← नवीनतम पेपर
💻 computer science

LEGS: Fine-Tuning Teleop-Free VLAs for Humanoid Loco-manipulation in an Embodied Gaussian Splatting World

यह शोध पत्र LEGS प्रस्तुत करता है, जो एक हाइब्रिड सिम्युलेटर है जो 3D गॉसियन स्प्लेटिंग बैकग्राउंड्स को मेश फोरग्राउंड्स के साथ जोड़ता है ताकि स्केलेबल, टेलीऑपरेशन-मुक्त सिंथेटिक डेटा उत्पन्न किया जा सके जो विजन-लैंग्वेज-एक्शन पॉलिसियों को ह्यूमनॉइड लोको-मैनिपुलेशन कार्यों में मानव-प्रदर्शन-प्रशिक्षित बेसलाइन्स से बेहतर प्रदर्शन करने में सक्षम बनाता है।

मूल लेखक: Hojune Kim, Timothy Chen, Jiankai Sun, Lars W. Osterberg, Qianzhong Chen, Ke Wang, Mac Schwager

प्रकाशित 2026-06-02
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Hojune Kim, Timothy Chen, Jiankai Sun, Lars W. Osterberg, Qianzhong Chen, Ke Wang, Mac Schwager

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मानव रूपी रोबोट (जैसे कि एक इंसान के आकार की मशीन) को कमरे में घूमना, एक संतरा उठाना और उसे एक प्लेट पर रखना सिखाना चाहते हैं। इसे करने के लिए, रोबोट को उदाहरणों से "सीखना" होगा, ठीक वैसे ही जैसे एक छात्र शिक्षक से सीखता है।

आमतौर पर, इन उदाहरणों को प्राप्त करने का एकमात्र तरीका यह है कि एक इंसान एक विशेष सूट पहने या एक जॉयस्टिक का उपयोग करके भौतिक रूप से रोबोट को बार-बार किसी कार्य के माध्यम से निर्देशित करे। इसे टेलीऑपरेशन (teleoperation) कहा जाता है। यह धीमा, महंगा और थका देने वाला है। यदि आप रोबोट को नया कार्य सिखाना चाहते हैं या उसे किसी अलग कमरे में काम करवाना चाहते हैं, तो आपको फिर से वही मानवीय मार्गदर्शन करना होगा।

स्टैनफोर्ड यूनिवर्सिटी के लेखकों ने एक नई प्रणाली बनाई है जिसे LEGS (लोको-मैनिपुलेशन वाया एम्बोडीड गॉसियन स्प्लेटिंग) कहा जाता है। LEGS को एक अति-यथार्थवादी वीडियो गेम के रूप में समझें जो बिना किसी इंसान के कंट्रोलर छुए, रोबोट के लिए अनंत प्रशिक्षण डेटा उत्पन्न कर सकता है।

LEGS कैसे काम करता है, यहाँ कुछ सरल उपमाओं का उपयोग किया गया है:

1. "जादुई बैकग्राउंड" बनाम "असली रोबोट"

कल्पना कीजिए कि आप एक फिल्म बना रहे हैं।

  • बैकग्राउंड (पृष्ठभूमि): कार्डबोर्ड से बना एक नकली सेट बनाने के बजाय (जो नकली दिखता है), टीम ने एक कमरे का वास्तविक वीडियो लिया और उसे एक 3D फोटो-मोज़ेक (जिसे 3D गॉसियन स्प्लेटिंग कहा जाता है) में बदल दिया। यह बैकग्राउंड इतना असली है कि यदि आप इसमें चलते भी, तो यह बिल्कुल वास्तविक दुनिया जैसा दिखता।
  • फोरग्राउंड (अग्रभूमि): रोबोट और वस्तुएं (जैसे संतरा और प्लेट) डिजिटल 3D मॉडल हैं।
  • ट्रिक: LEGS इस डिजिटल रोबोट को वास्तविक फोटो-मोज़ेक बैकग्राउंड के अंदर रखता है। फिर यह एक विशेष "कलर फिल्टर" का उपयोग करता है ताकि डिजिटल रोबोट की लाइटिंग और रंग वास्तविक बैकग्राउंड के साथ पूरी तरह मेल खा सकें। यह "नकली" और "असली" के बीच के अंतर को खत्म कर देता है।

2. "घोस्ट डायरेक्टर" (भूतिया निर्देशक)

एक सामान्य वीडियो गेम में, आपको अपने पात्र को चलाने के लिए बटन दबाने होते हैं। LEGS में, एक घोस्ट डायरेक्टर (एक प्रोसीजरल जनरेटर) होता है।

  • इस डायरेक्टर को यह बताने के लिए किसी इंसान की ज़रूरत नहीं है कि उसे क्या करना है। यह भौतिकी के नियमों और लक्ष्य (जैसे, "संतरा उठाओ") को जानता है।
  • यह स्वचालित रूप से रोबोट के चलने, पकड़ने और वस्तु रखने के हजारों अलग-अलग तरीके उत्पन्न करता है।
  • क्योंकि रोबोट की मूवमेंट (गति) बैकग्राउंड से अलग रिकॉर्ड की जाती है, टीम एक ही मूवमेंट के सेट को तुरंत एक पूरी तरह से अलग कमरे में या अलग वस्तुओं के साथ (जैसे संतरे को सेब से बदलना) केवल कंप्यूटर पर एक बटन दबाकर "री-रेंडर" कर सकती है।

3. परिणाम: इंसानी शिक्षकों से बेहतर

टीम ने इसे एक वास्तविक रोबोट (Unitree G1) पर तीन अलग-अलग प्रकार के "ब्रेन" सॉफ्टवेयर (जिन्हें VLA मॉडल कहा जाता है) के साथ टेस्ट किया। उन्होंने LEGS की तुलना दो अन्य तरीकों से की:

  1. ह्यूमन टेलीऑपरेशन: एक इंसान द्वारा रोबोट को निर्देशित करना (महंगा और धीमा)।
  2. पुराने ज़माने का सिमुलेशन: कम ग्राफिक्स वाला एक वीडियो गेम (मेश-ओनली)।

निष्कर्ष चौंकाने वाले थे:

  • LEGS ने इंसानों को पछाड़ दिया: केवल LEGS डेटा पर प्रशिक्षित एक रोबोट ने एक इंसान द्वारा निर्देशित रोबोट के समान या उससे भी बेहतर प्रदर्शन किया।
  • LEGS ने नकली ग्राफिक्स को हराया: "फोटो-यथार्थवादी" LEGS बैकग्राउंड पर प्रशिक्षित रोबोट, "कार्टून जैसे" पुराने ज़माने के सिमुलेशन पर प्रशिक्षित रोबोट की तुलना में बहुत अधिक बार सफल रहा। यह साबित करता है कि एक यथार्थवादी दुनिया देखना रोबोट को बेहतर सीखने में मदद करता है।
  • "मैजिक" अनुकूलन: जब उन्होंने कार्य बदला (जैसे, "संतरे के बजाय सेब उठाओ" या "नीली मेज की ओर बढ़ो"), तो LEGS-प्रशिक्षित रोबोट तुरंत अनुकूलित हो गया क्योंकि उन्होंने पुराने डेटा को री-रेंडर कर दिया था। मानव-प्रशिक्षित रोबोट पूरी तरह विफल रहा क्योंकि उसने पहले कभी उन विशिष्ट वस्तुओं को नहीं देखा था।

मुख्य बात (The Bottom Line)

LEGS एक रोबोट ट्रेनिंग जिम की तरह है जो अपने आप चलता है।

  • इंसानों की आवश्यकता नहीं: आपको रोबोट को निर्देशित करने के लिए थके हुए श्रमिकों की आवश्यकता नहीं है।
  • अनंत विविधता: आप बस डिजिटल सेटिंग्स बदलकर कमरे, फर्नीचर या वस्तुओं को तुरंत बदल सकते हैं।
  • सस्ता और तेज़: एक नए दृश्य के लिए डेटा उत्पन्न करने में, वास्तविक दुनिया में जाकर रिकॉर्ड करने की तुलना में, यह बहुत कम समय और पैसा खर्च करता है।

पेपर निष्कर्ष निकालता है कि ह्यूमनॉइड रोबोट को चलने और चीजें पकड़ने के लिए सिखाने के लिए, फोटो-यथार्थवादी सिमुलेशन अब वास्तविक दुनिया के मानवीय प्रशिक्षण का एक आदर्श विकल्प है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →