← नवीनतम पेपर
💻 computer science

MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Model for Embodied Task Planning

यह शोध पत्र MomaGraph, एक एकीकृत, अवस्था-जागरूक (state-aware) सीन ग्राफ प्रतिनिधित्व और एक संगत बड़े पैमाने के डेटासेट एवं मूल्यांकन सुइट के साथ-साथ, MomaGraph-R1 का परिचय देता है, जो इन संसाधनों का लाभ उठाकर कार्य-उन्मुख सीन ग्राफ भविष्यवाणी और एम्बोडीड टास्क प्लानिंग में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एक विजन-लैंग्वेज मॉडल है।

मूल लेखक: Yuanchen Ju, Yongyuan Liang, Yen-Jen Wang, Nandiraju Gireesh, Yuanliang Ju, Seungjae Lee, Qiao Gu, Elvis Hsieh, Furong Huang, Koushil Sreenath

प्रकाशित 2026-02-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yuanchen Ju, Yongyuan Liang, Yen-Jen Wang, Nandiraju Gireesh, Yuanliang Ju, Seungjae Lee, Qiao Gu, Elvis Hsieh, Furong Huang, Koushil Sreenath

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हाई-टेक हवेली में एक मेहमान हैं। आप चाय का एक कप बनाना चाहते हैं, लेकिन आप पहले कभी वहां नहीं गए हैं। आप एक रसोई देखते हैं, लेकिन आपको नहीं पता कि कौन सा नॉब चूल्हे को चालू करता है, कौन सा बटन केतली को शुरू करता है, या जो "हैंडल" आपको दिख रहा है वह दराज के लिए है या अलमारी के लिए।

एक सामान्य रोबोट के लिए, यह हवेली केवल आकारों और रंगों का एक विशाल, भ्रमित करने वाला ढेर है। इसे हल करने के लिए, शोधकर्ताओं ने MomaGraph बनाया है, जो अनिवार्य रूप से रोबोट को एक "मानसिक मानचित्र" देता है जो एक साधारण GPS से कहीं अधिक स्मार्ट है।

यह कैसे काम करता है, इसका विवरण रोजमर्रा के उपमाओं (analogies) का उपयोग करके यहाँ दिया गया है:

1. समस्या: "अंधा पर्यटक" रोबोट

वर्तमान के अधिकांश रोबोट ऐसे पर्यटकों की तरह हैं जो एक छोटी सी स्ट्रॉ (नली) के माध्यम से देख रहे हैं। वे एक वस्तु (जैसे चूल्हा) को देख सकते हैं, लेकिन वे उसकी "व्यक्तित्व" (personality) को नहीं समझते।

  • स्थानिक ज्ञान (Spatial knowledge) यह जानना है कि चूल्हा कहाँ है (वह कोने में है)।
  • कार्यात्मक ज्ञान (Functional knowledge) यह जानना है कि वह कैसे काम करता है (यह नॉब गर्मी को नियंत्रित करता है)।

वर्तमान रोबोटों के पास आमतौर पर इनमें से केवल एक ही होता है। वे जानते हैं कि चूल्हा कहाँ है, लेकिन वे इसे दरवाजे की तरह "खोलने" की कोशिश करते हैं क्योंकि वे नहीं समझते कि इसमें नॉब होते हैं। वे उस व्यक्ति की तरह हैं जो जानता है कि पुस्तकालय कहाँ है, लेकिन उसे यह एहसास नहीं है कि किताब पढ़ने के लिए आपको उसे खोलना पड़ता है।

2. समाधान: MomaGraph (द "स्मार्ट ब्लूप्रिंट")

MomaGraph एक रोबोट को कमरे का "स्मार्ट ब्लूप्रिंट" देने जैसा है। दीवारों के नक्शे के बजाय, इस ब्लूप्रिंट पर हर चीज़ पर "स्टिक नोट्स" लगे हैं।

  • यह बिंदुओं को जोड़ता है: यह केवल यह नहीं कहता कि "वहाँ एक नॉब है" और "वहाँ एक चूल्हा है।" यह उनके बीच एक रेखा खींचता है जो कहती है: "यह विशिष्ट नॉब इस विशिष्ट बर्नर का बॉस है।"
  • यह विवरणों को देखता है: यह केवल एक "फ्रिज" नहीं देखता; यह देखता है कि "हैंडल" एक विशिष्ट हिस्सा है जिसे आपको पकड़ना है।
  • यह कार्य-केंद्रित है: यदि आप रोबोट को कहते हैं "चाय बनाओ," तो वह सोफे के बारे में सोचकर अपनी मानसिक शक्ति बर्बाद नहीं करता। वह केतली, पानी और चूल्हे पर "ज़ूम इन" करता है, ठीक वैसे ही जैसे एक इंसान करता है।

3. मस्तिष्क: MomaGraph-R1 (द "अनुभवी शेफ")

इस ब्लूप्रिंट को बनाने के लिए, उन्होंने MomaGraph-R1 नामक एक मस्तिष्क बनाया है। उन्होंने इसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) का उपयोग करके प्रशिक्षित किया है।

इसे एक पिल्ले या शेफ को प्रशिक्षित करने के रूप में सोचें। केवल रोबोट को हजारों रसोई की तस्वीरें दिखाने के बजाय (जो अधिकांश AI करते हैं), उन्होंने उसे हर बार एक "डिजिटल ट्रीट" (पुरस्कार) दिया जब उसने एक सटीक ब्लूप्रिंट बनाया।

  • यदि रोबोट ने एक ऐसा नक्शा बनाया जो टीवी के साथ रिमोट को सही ढंग से जोड़ता था, तो उसे एक "डिजिटल ट्रीट" मिला।
  • यदि उसने कोई चरण मिस कर दिया (जैसे केतली को प्लग इन करने से पहले पानी उबालने की कोशिश करना), तो उसे ट्रीट नहीं मिला।
    समय के साथ, रोबोट ने केवल चीजों के दिखने का "अनुमान" लगाना बंद कर दिया और यह समझने लगा कि वे कैसे काम करती हैं।

4. "आहा!" क्षण: अवस्था-जागरूकता (द "डिटेक्टिव")

इसका सबसे शानदार हिस्सा यह है कि रोबोट एक डिटेक्टिव (जासूस) है।
कल्पना कीजिए कि एक रसोई में चार एक जैसे चूल्हे के नॉब हैं। रोबोट नहीं जानता कि सही वाला कौन सा है। लेकिन MomaGraph में, रोबोट एक को आज़मा सकता है, देख सकता है कि लौ जल गई है, और कह सकता है, "आहा! मैंने रहस्य सुलझा लिया है। यह नॉब कंट्रोलर है!" यह वास्तविक समय में अपने मानसिक मानचित्र को अपडेट करता है क्योंकि वह दुनिया के साथ इंटरैक्ट करता है। वह अपने स्वयं के कार्यों से सीखता है।

सारांश: यह क्यों मायने रखता है?

संक्षेप में, MomaGraph रोबोट्स को "भोंडे मूवर्स" (जो बिंदु A से बिंदु B तक जा सकते हैं) से बदलकर "सक्षम सहायकों" (जो समझते हैं कि लाइट जलाने के लिए, उन्हें लैंप नहीं, बल्कि स्विच ढूंढना होगा) में बदल देता है।

यह उन्हें एक अस्त-व्यस्त, जटिल कमरे को देखने और यह कहने की क्षमता देता है: "मैं लक्ष्य देख रहा हूँ, मैं उपकरण देख रहा हूँ, और मुझे पता है कि काम पूरा करने के लिए वे आपस में कैसे जुड़े हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →