← नवीनतम पेपर
💻 computer science

HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments

यह शोध पत्र HumanoidVLN को प्रस्तुत करता है, जो NVIDIA Isaac Sim पर निर्मित एक भौतिकी-आधारित (physics-grounded) सिम्युलेटर और बेंचमार्क है जो विविध मानव सदृश रोबोटों (humanoid robots) के लिए विजन-लैंग्वेज नेविगेशन की अनूठी चुनौतियों का समाधान करता है, जिसमें कई एम्बॉडीमेंट्स (embodiments) का समर्थन करना, कोलिजन-अवेयर (collision-aware) निर्देश डेटासेट उत्पन्न करना और मजबूत सिम-टू-रियल ट्रांसफर क्षमताओं का प्रदर्शन करना शामिल है।

मूल लेखक: Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

प्रकाशित 2026-08-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट केवल रिमोट-कंट्रोल कारों की तरह पहियों पर नहीं घूम रहे हैं, बल्कि वे हमारी तरह दो पैरों पर चलना, लड़खड़ाना और संतुलन बनाना सीख रहे हैं। यह "ह्यूमनॉइड रोबोटिक्स" (मानव रूपी रोबोटिक्स) का अग्रिम क्षेत्र है, जो ऐसी मशीनें बनाने की कोशिश कर रहा है जो हमारे अस्त-व्यस्त घरों और कार्यालयों में नेविगेट कर सकें। इन रोबोटों को चलना सिखाने के लिए, वैज्ञानिक विजन-लैंग्वेज नेविगेशन (VLN) नामक क्षेत्र का उपयोग करते हैं। VLN को रोबोट के लिए "साइमन सेज़" (Simon Says) के खेल के रूप में समझें: एक इंसान एक मौखिक निर्देश देता है जैसे "रसोई में जाओ और फ्रिज के पास रुक जाओ," और रोबोट को अपने चारों ओर देखना होता है, शब्दों को समझना होता है, और सही जगह पर शारीरिक रूप से पहुँचना होता है।

जटिल बात यह है कि आज के अधिकांश रोबोट वीडियो गेम या सिमुलेशन में परीक्षण किए जाते हैं जहाँ वे केवल एक स्थान से दूसरे स्थान पर "टेलीपोर्ट" हो सकते हैं, गुरुत्वाकर्षण, संतुलन और इस तथ्य को अनदेखा कर सकते हैं कि चलना कठिन है। लेकिन वास्तविक चलना भौतिकी (फिजिक्स) से भरा होता है; यदि कोई रोबोट बहुत तेज़ी से मुड़ने की कोशिश करता है, तो वह गिर सकता है। यह शोध पत्र एक बड़े सवाल को संबोधित करता है: हम इन चलने वाले रोबोटों को निर्देशों का पालन करना कैसे सिखाएं जब उन्हें बिना गिरे वास्तव में चलना पड़ता है, और हम उनका निष्पक्ष परीक्षण कैसे करें जब हर रोबोट अलग दिखता है और थोड़ा अलग चलता है?


शोध पत्र: HumanoidVLN

इस शोध पत्र के पीछे के शोधकर्ताओं ने महसूस किया कि रोबोट नेविगेशन के पुराने तरीके एक फॉर्मूला 1 कार का परीक्षण एक कच्ची पगडंडी पर करने और फिर उसे साइकिल बताने जैसा था। उन्होंने विशेष रूप से चलने वाले रोबोटों के लिए एक बिल्कुल नया, अत्यंत यथार्थवादी "खेल का मैदान" (एक सिम्युलेटर) बनाया। रोबोटों को टेलीपोर्ट करने देने के बजाय, उनका सिस्टम उन्हें भौतिकी के नियमों का पालन करने के लिए मजबूर करता है। यदि कोई रोबोट ऐसा कदम उठाने की कोशिश करता है जो बहुत बड़ा है या बहुत तीखा मोड़ लेता है, तो वह वास्तव में लड़खड़ा जाएगा और गिर जाएगा, ठीक वैसे ही जैसे एक वास्तविक व्यक्ति गिर सकता है।

उन्होंने इस खेल के मैदान को चार अलग-अलग प्रकार के "ह्यूमनॉइड" रोबोटों के साथ स्थापित किया। ये सभी एक जैसे नहीं हैं; इनमें एक छोटे, 1.17 मीटर के रोबोट (एक लंबे किशोर की ऊंचाई के लगभग) से लेकर 1.80 मीटर के विशालकाय रोबोट तक शामिल हैं। उनके पैरों में जोड़ों (joints) की संख्या भी अलग-अलग है, जिसका अर्थ है कि कुछ अन्य की तुलना में अधिक लचीले हैं। टीम ने उन्हें प्रबंधित करने के लिए एक "पदानुक्रमित नियंत्रण" (hierarchical control) प्रणाली बनाई। आप इसे एक दो-सदस्यीय टीम के रूप में समझ सकते है: एक "लोकोमोशन कोच" (एक सुदृढीकरण लर्निंग पॉलिसी) जो रोबोट को बिना गिरे संतुलन बनाना और चलना सिखाता है, और एक "नेविगेटर" (एक पाथ ट्रैकर) जो कोच को मानव वॉयस कमांड के आधार पर बताता है कि कहाँ जाना है। यह सेटअप सुनिश्चित करता है कि प्रत्येक परीक्षण एक वास्तविक भौतिक चुनौती है, न कि केवल एक वीडियो गेम की ट्रिक।

परीक्षण को निष्पक्ष और यथार्थवादी बनाने के लिए, टीम ने केवल कार्टून जैसे 3D मॉडल का उपयोग नहीं किया। उन्होंने 87 अलग-अलग वातावरण बनाए, जो आरामदायक लिविंग रूम से लेकर व्यस्त कार्यस्थलों तक फैले हुए हैं। उन्होंने यह सुनिश्चित किया कि प्रत्येक कमरा पर्याप्त बड़ा (कम से कम 100 वर्ग मीटर) हो ताकि रोबोट छोटे, असंभव कोनों में न फंस जाए। इनमें से कुछ कमरे कलाकारों द्वारा बनाए गए थे, जबकि अन्य को "3D गॉसियन स्प्लेटिंग" नामक एक शानदार तकनीक का उपयोग करके वास्तविक जीवन से स्कैन किया गया था, जो तस्वीरों को 3D दुनिया में बदल देती है। उन्होंने यह भी सुनिश्चित किया कि कैमरा दृश्य बिल्कुल वैसा ही हिले और डगमगाए जैसा कि एक वास्तविक रोबोट चलते समय होगा, जो द्विपाद चाल (bipedal gait) के डगमगाहट को कैप्चर करता है।

रोबोटों को दिए जाने वाले निर्देश भी सावधानीपूर्वक तैयार किए गए थे। केवल रैंडम वाक्य टाइप करने के बजाय, उन्होंने एक "मल्टी-एजेंट एनोटेशन" प्रणाली का उपयोग किया। कल्पना कीजिए कि AI लेखकों, संपादकों और तथ्य-जांचकर्ताओं की एक टीम मिलकर काम कर रही है। दो AI "जनरेटर" रोबोट के चलने के वीडियो के आधार पर एक मार्ग बनाते हैं, एक "रिव्यूअर" AI जांचता है कि क्या वह मार्ग मानचित्र के विरुद्ध तर्कसंगत है, और फिर एक "पैराफ्रेज़र" निर्देशों को तीन अलग-अलग शैलियों में फिर से लिखता है: औपचारिक (बॉस की तरह), प्राकृतिक (एक दोस्त की तरह), और अनौपचारिक (एक टेक्स्ट मैसेज की तरह)। अंत में, वास्तविक मनुष्यों ने काम की जांच की ताकि यह सुनिश्चित हो सके कि निर्देश सुरक्षित और सटीक हैं। इसके परिणामस्वरूप 933 अद्वितीय परीक्षण एपिसोड प्राप्त हुए।

जब उन्होंने परीक्षण चलाए, तो उन्हें कुछ आश्चर्यजनक बातें पता चलीं। उन्होंने चार अलग-अलग AI नेविगेशन मॉडल का परीक्षण किया यह देखने के लिए कि बिना गिरे निर्देशों का पालन करने में कौन सा सबसे अच्छा है। JanusVLN नामक मॉडल ने सबसे अच्छा प्रदर्शन किया, जो लगभग 43.55% बार सफलतापूर्वक लक्ष्य तक पहुँचा और पथ का बारीकी से पालन किया। हालाँकि, परिणामों ने दिखाया कि रोबोट का शरीर बहुत मायने रखता है। लंबा रोबोट (Unitie H1) अन्य की तुलना में बहुत अधिक संघर्ष करता है, जो कुछ मॉडलों के साथ लगभग 70% प्रयासों में गिर जाता है, जबकि छोटे, अधिक स्थिर रोबोट बहुत कम बार गिरते हैं। यह साबित करता है कि आप केवल एक रोबोट पर एक नेविगेशन AI का परीक्षण नहीं कर सकते और यह मान नहीं सकते कि यह दूसरे पर भी काम करेगा; रोबोट का भौतिक आकार और संतुलन सब कुछ बदल देता है।

टीम ने एक "सिम-टू-रियल" पायलट टेस्ट भी किया, जिसमें उन्होंने एक AI मॉडल को कंप्यूटर से निकालकर एक वास्तविक कमरे में एक वास्तविक रोबोट पर उतारा। उन्होंने पाया कि कंप्यूटर सिमुलेशन में रोबोट का प्रदर्शन वास्तविक दुनिया में उसके प्रदर्शन के लगभग समान था, जिसमें इस बात का बहुत गहरा संबंध था कि वह पथ से कितना भटक गया। यह सुझाव देता है कि उनका भौतिकी-आधारित सिम्युलेटर वास्तविक दुनिया के व्यवहार का एक विश्वसनीय भविष्यवक्ता है।

संक्षेप में, HumanoidVLN केवल एक नया डेटासेट नहीं है; यह रोबोट नेविगेशन के बारे में सोचने का एक नया तरीका है। यह तर्क देता है कि यदि हम चाहते हैं कि रोबोट हमारी सड़कों पर चलें और हमारे घरों की सफाई करें, तो हमें उन्हें ऐसी दुनिया में परीक्षण करना बंद करना होगा जहाँ वे गिर नहीं सकते। उनके परीक्षणों को वास्तविक भौतिकी और विविध रोबोट शरीरों में स्थापित करके, यह शोध पत्र हमें दिखाता है कि चलते हुए मददगार रोबोट तक पहुँचने का रास्ता केवल कोड से नहीं, बल्कि संतुलन से बना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →