← नवीनतम पेपर
💻 computer science

MoMaStage: Skill-State Graph Guided Planning and Closed-Loop Execution for Long-Horizon Indoor Mobile Manipulation

MoMaStage एक संरचित विजन-लैंग्वेज फ्रेमवर्क है जो एक टोपोलॉजी-अवेयर स्किल-स्टेट ग्राफ के माध्यम से टास्क प्लानिंग को निर्देशित करके और भौतिक विचलन का पता चलते ही सिमेंटिक रिप्लानिंग को ट्रिगर करने वाले क्लोज्ड-लूप मैकेनिज्म के माध्यम से निष्पादन विश्वसनीयता सुनिश्चित करके, बिना किसी स्पष्ट सीन मैपिंग की आवश्यकता के, दीर्घकालिक इनडोर मोबाइल मैनिपुलेशन को सक्षम बनाता है।

मूल लेखक: Chenxu Li, Zixuan Chen, Yetao Li, Jiapeng Xu, Hongyu Ding, Jieqi Shi, Jing Huo, Yang Gao

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenxu Li, Zixuan Chen, Yetao Li, Jiapeng Xu, Hongyu Ding, Jieqi Shi, Jing Huo, Yang Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सुशिक्षित रोबोट को एक जटिल काम करने के लिए कह रहे हैं: "रसोई में जाओ, काउंटर पर रखी ग्रे प्लेट को ढूँढो, उसे डाइनिंग टेबल पर लाओ, और उसे वहाँ रख दो।"

सुनने में यह सरल लगता है, है ना? लेकिन एक रोबोट के लिए, यह एक बुरा सपना है। यदि रोबोट इस कार्य को तर्क की एक बड़ी छलांग में करने की कोशिश करता है, तो वह अक्सर भ्रमित हो जाता है। वह शायद किचन तक पहुँचने से पहले ही प्लेट उठाने की कोशिश कर सकता है, या वह प्लेट को तब रख सकता है जब उसके हाथ में कप हो। वास्तविक दुनिया में, चीजें गलत होती हैं: प्लेट फिसल जाती है, रोबोट किसी कुर्सी से टकरा जाता है, या रास्ता बाधित हो जाता है। बिना 'प्लान बी' (Plan B) के, पूरा मिशन विफल हो जाता है।

यह शोध पत्र MoMaStage पेश करता है, जो एक नया तरीका है जिससे रोबोट को बिना भटके या टकराए इन लंबी, जटिल कार्यों को संभालने में मदद मिलती है। यह कैसे काम करता है, यहाँ सरल उपमाओं के माध्यम से समझाया गया है:

1. समस्या: "भ्रमित" मस्तिष्क (The "Hallucinating" Brain)

वर्तमान रोबोट अक्सर "विज़न-लैंग्वेज मॉडल" (VLM) का उपयोग करते हैं। इसे एक अति-बुद्धिमान लेकिन थोड़े लापरवाह लाइब्रेरियन के रूप में समझें।

  • अच्छी बात: लाइब्रेरियन शब्दों का अर्थ जानता है और एक बड़े कार्य को छोटे चरणों में तोड़ सकता है (जैसे, "चलना," "उठाना," "रखना")।
  • बुरी बात: लाइब्रेरियन ने वास्तव में कभी कोई शरीर नहीं चलाया है। वे ऐसा प्लान सुझा सकते हैं जो शब्दों में तो एकदम सही लगता है, लेकिन शारीरिक रूप से असंभव है (जैसे, एक ऐसे हाथ से भारी बॉक्स उठाने की कोशिश करना जो पहले से ही भरा हुआ है)। वे यह भी याद नहीं रखते कि दो कदम पहले क्या हुआ था, जिससे "भ्रम" (hallucinations) की स्थिति पैदा होती है जहाँ रोबोट ऐसी चीजें करने की कोशिश करता है जो वर्तमान स्थिति में तर्कसंगत नहीं लगतीं।

2. समाधान: "ट्रेन ट्रैक" सिस्टम (MoMaStage)

MoMaStage लाइब्रेरियन को पटरी से उतरने देने के बजाय उन्हें वैध ट्रेन पटरियों का एक नक्शा देकर इस समस्या को ठीक करता है।

A. स्किल-स्टेट ग्राफ (ट्रेन ट्रैक्स)

कल्पना कीजिए कि रोबोट के संभावित कार्य ट्रेन स्टेशनों की तरह हैं।

  • नक्शा: MoMaStage एक "स्किल-स्टेट ग्राफ" बनाता है। यह कमरे का नक्शा (जैसे फ्लोर प्लान) नहीं है; यह इस बात का नक्शा है कि रोबोट वर्तमान में क्या पकड़े हुए है या वह कहाँ है, इसके आधार पर वह आगे क्या कर सकता है।
  • नियम: आप तभी ट्रेन ले सकते हैं जब पटरियाँ जुड़ी हों। यदि रोबोट ने एक कप पकड़ा हुआ है, तो "प्लेट उठाओ" वाला ट्रैक टूटा हुआ है और अस्तित्व में नहीं है। यह सिस्टम रोबोट को केवल उन्हीं चरणों को चुनने के लिए मजबूर करता है जो अभी शारीरिक रूप से संभव हैं।
  • लाभ: यह रोबोट को काम शुरू करने से पहले ही तार्किक गलतियाँ करने से रोकता है।

B. क्लोज्ड-लूप निष्पादन (सुरक्षा निरीक्षक)

भले ही आपके पास एक आदर्श नक्शा हो, वास्तविक जीवन अव्यवस्थित है। क्या होगा यदि रोबोट प्लेट गिरा देता है?

  • पुराना तरीका: रोबोट मूल योजना का पालन करने की कोशिश करता रहता, विफल होता, और क्रैश हो जाता।
  • MoMaStage का तरीका: रोबोट के पास एक सुरक्षा निरीक्षक (एक क्लोज्ड-लूप तंत्र) होता है।
    • रोबोट लगातार अपने शरीर की जाँच करता रहता है (जैसे यह देखना कि क्या उसका हाथ अभी भी कप पकड़े हुए है)।
    • यदि कुछ गलत होता है (जैसे, "मैंने प्लेट गिरा दी!"), तो सुरक्षा निरीक्षक तुरंत ट्रेन को रोक देता है।
    • वह घबराता नहीं है। वह वापस ट्रेन ट्रैक्स पर जाता है, वर्तमान स्थिति से एक नया वैध रास्ता खोजता है (जैसे, "वापस रसोई में जाओ, एक नई प्लेट उठाओ"), और फिर से चलना शुरू करता है।

3. यह एक बड़ी बात क्यों है

शोधकर्ताओं ने वास्तविक रोबोटों और जटिल सिमुलेशन पर इसका परीक्षण किया। उन्हें क्या मिला:

  • अब कोई "दिवास्वप्न" नहीं: क्योंकि रोबोट को "ट्रेन ट्रैक्स" का पालन करने के लिए मजबूर किया जाता है, इसलिए वह असंभव चालों के बारे में सोचने में समय बर्बाद करना बंद कर देता है। वह तेजी से योजना बनाता है और कम कंप्यूटर पावर का उपयोग करता है।
  • वापसी की क्षमता (Bouncing Back): जब चीजें गलत होती हैं (जो वास्तविक दुनिया में अक्सर होता है), तो MoMaStage हार नहीं मानता। यह तुरंत एक नया रास्ता पुनर्गणना (recalculate) करता है।
  • लॉन्ग-होरिज़न सफलता: अधिकांश रोबोट 3 या 4 चरणों के बाद विफल हो जाते हैं। MoMaStage ने पिछले तरीकों की तुलना में बहुत अधिक सफलता दर के साथ 17+ चरणों वाले कार्यों (जैसे पूरे घर में घूमना और कई काम करना) को सफलतापूर्वक पूरा किया।

निष्कर्ष

MoMaStage को एक ऐसे स्मार्ट जीपीएस (GPS) के रूप में समझें जो भौतिकी के नियमों को जानता है।

  • केवल यह कहने के बजाय कि "दुकान तक ड्राइव करें," यह कहता है, "आप दुकान तक तभी जा सकते हैं जब आपका टैंक भरा हो और रास्ता अवरुद्ध न हो।"
  • यदि आपका टायर पंचर हो जाता है, तो यह केवल "Error" नहीं कहता। यह तुरंत आपको निकटतम गैस स्टेशन या टायर शॉप तक रीरूट (reroute) करता है।

एक "स्मार्ट ब्रेन" (VLM) को एक "कठोर नियम पुस्तिका" (स्किल-स्टेट ग्राफ) और एक "सुरक्षा जाल" (क्लोज्ड-लूप रिप्लेनिंग) के साथ जोड़कर, MoMaStage रोबोटों को दैनिक जीवन के लंबे, उबाऊ और जटिल कार्यों के लिए बहुत अधिक विश्वसनीय बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →