← नवीनतम पेपर
💻 computer science

CST-WM: A Causally Structured World Model for Embodied Visual Tracking

यह शोध पत्र CST-WM प्रस्तुत करता है, जो एक कारण-संरचित विश्व मॉडल (causally structured world model) है जो अपने लेटेंट स्टेट (latent state) में रोबोट की गति को लक्ष्य के साक्ष्य से स्पष्ट रूप से अलग करके एक्शन-प्रेरित मतिभ्रम (action-induced hallucinations) को रोकता है, जिससे रोबोट को अवरोध (occlusion) और स्व-गति (ego-motion) जैसी चुनौतीपूर्ण स्थितियों में स्थिर विजुअल ट्रैकिंग और लक्ष्य पुन: प्राप्ति (target re-acquisition) दोनों के लिए प्रभावी ढंग से योजना बनाने में सक्षम बनाता है।

मूल लेखक: Junyi Hu, Shuaihang Yuan, Yi Fang

प्रकाशित 2026-09-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junyi Hu, Shuaihang Yuan, Yi Fang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोट भीड़भाड़ वाले कमरे में चल रहा है, जिसे एक विशिष्ट व्यक्ति का पीछा करने का काम सौंपा गया है। लक्ष्य सरल लगता है: व्यक्ति को नज़र में रखना और एक स्थिर दूरी बनाए रखना। फिर भी, एक मशीन के लिए, यह एक गहरा चुनौतीपूर्ण कार्य है। रोबोट केवल वर्तमान क्षण में जो देखता है उस पर प्रतिक्रिया नहीं करता है; इसे भविष्य का अनुमान लगाना होता है। इसे यह अनुमान लगाने की आवश्यकता है कि उसकी अपनी गतिविधियों से आगे क्या दिखाई देगा। यदि व्यक्ति किसी खंभे के पीछे चला जाता है, तो रोबोट केवल रुक नहीं सकता; उसे यह तय करना होगा कि क्या उसे उन्हें फिर से खोजने के लिए बाईं ओर मुड़ना चाहिए या दाईं ओर। इसके लिए दूरदर्शिता के एक रूप की आवश्यकता होती है, "क्या होगा यदि मैं बाईं ओर मुड़ूँ?" बनाम "क्या होगा यदि मैं दाईं ओर मुड़ूँ?" का एक मानसिक सिमुलेशन, यह देखने के लिए कि कौन सा रास्ता उन्हें दृश्यमान रखेगा। मुख्य कठिनाई रोबोट को यह समझाने में है कि उसके कार्य दुनिया को बदलते हैं, और दुनिया वह बदलती है जो वह देखता है, लेकिन क्रिया स्वयं जादू से व्यक्ति को प्रकट नहीं कर सकती।

न्यूयॉर्क यूनिवर्सिटी अबू धाबी के शोधकर्ताओं ने इस समस्या को हल करने के लिए एक नई प्रणाली विकसित की है, जो एक विशिष्ट दोष को संबोधित करती है जहाँ रोबमा अक्सर खुद को यह सोचने के लिए धोखा देते हैं कि वे लक्ष्य को सीधे नियंत्रित कर सकते हैं। अपने कार्य में, उन्होंने एक घटना की पहचान की जिसे वे "कॉज़ल हेलुसिनेशन" (कारण संबंधी मतिभ्रम) कहते हैं। यह तब होता है जब रोबोट का प्रेडिक्टिव मॉडल एक शॉर्टकट सीख लेता है: वह देखता है कि जब रोबोट बाईं ओर मुड़ता है, तो लक्ष्य अक्सर अगले फ्रेम में स्क्रीन के दाईं ओर दिखाई देता है। यह समझने के बजाय कि रोबोट की गति ने कैमरे को शिफ्ट किया, जिसने फिर लक्ष्य को प्रकट किया, मॉडल गलत तरीके से यह सीख लेता है कि मुड़ने की क्रिया ही सीधे लक्ष्य के प्रकट होने का कारण बनती है। यह तर्क की एक सूक्ष्म त्रुटि है जो अल्पकालिक भविष्यवाणियों के लिए तो अच्छी काम करती है लेकिन जब लक्ष्य छिपा हुआ होता है तो विनाशकारी रूप से विफल हो जाती है। रोबोट, यह विश्वास करते हुए कि वह एक साधारण कमांड से लक्ष्य को बुला सकता है, बाधाओं के चारों ओर जाने की कोशिश करना छोड़ देता है और बस लक्ष्य के फिर से प्रकट होने का इंतज़ार करता है, और अक्सर उसे कभी नहीं ढूंढ पाता।

इसे ठीक करने के लिए, टीम ने CST-WM नामक एक प्रणाली बनाई, जिसका अर्थ है "कॉज़ली स्ट्रक्चर्ड वर्ल्ड मॉडल" (Causal Structured World Model)। शोधकर्ताओं ने इस प्रणाली को रोबोट की दुनिया की समझ को तीन अलग-अलग हिस्सों, या शाखाओं में तोड़कर बनाया, जो एक सख्त क्रम में एक-दूसरे से बात करती हैं। पहली शाखा रोबोट की अपनी गति और स्थिति को ट्रैक करती है। दूसरी शाखा पूरी तरह से लक्ष्य के दृश्य साक्ष्य पर केंद्रित है, जैसे कि व्यक्ति दृश्यमान है या नहीं और स्क्रीन पर उनका आकार कितना बड़ा है। तीसरी शाखा सामान्य दृश्य दृश्य (visual scene) को संभालती है। महत्वपूर्ण नवाचार यह है कि ये शाखाएं कैसे परस्पर क्रिया करती हैं। प्रणाली को इस तरह डिज़ाइन किया गया है कि रोबोट के नियंत्रण कमांड केवल अप्रत्यक्ष रूप से लक्ष्य की दृश्यता को प्रभावित कर सकते हैं। कमांड को पहले रोबोट की स्थिति को अपडेट करना चाहिए, और उसके बाद ही वह नई स्थिति लक्ष्य के दृश्य को अपडेट कर सकती है। मॉडल को भौतिक रूप से नियंत्रण कमांड को सीधे लक्ष्य की दृश्यता स्थिति तक कूदने से रोका गया है। यह रोबोट को वास्तविक कारण और प्रभाव की श्रृंखला सीखने के लिए मजबूर करता है: मैं चलता हूँ, कैमरा हिलता है, और फिर मैं लक्ष्य को देखता हूँ।

शोधकर्ताओं ने जटिल आभासी वातावरण में इस दृष्टिकोण का परीक्षण किया जहाँ रोबोटों को चलते हुए लोगों का पीछा करना था। उन्होंने अपनी नई प्रणाली की तुलना मौजूदा विधियों से की जो सरल प्रतिक्रिया या मानक भविष्य कहने वाली मॉडलों पर निर्भर करती थीं। परिणामों ने दिखाया कि नई प्रणाली लक्ष्य को दृष्टि में रखने में काफी बेहतर थी, विशेष रूप से जब व्यक्ति बाधाओं के पीछे गायब हो जाता है या कैमरे के फ्रेम से बाहर चला जाता है। जब लक्ष्य खो जाता था, तो नई प्रणाली उन्हें फिर से खोजने में बहुत तेज़ थी और एक सुरक्षित, अधिक सुसंगत दूरी बनाए रखती थी। उन परीक्षणों में जहाँ रोबोट को पूरी तरह से बाधित होने के बाद रिकवर करना था, नई प्रणाली लगभग 84 प्रतिशत बार लक्ष्य को पुनः प्राप्त करने में सफल रही, जबकि अगली सबसे अच्छी विधि के लिए यह लगभग 71 प्रतिशत थी। इसने लक्ष्य को फिर से खोजने में लगने वाले समय को भी कई चरणों से कम कर दिया, जो एक तेज़-गति वाले वातावरण में एक महत्वपूर्ण लाभ है।

बेहतर ढंग से पीछा करने के अलावा, प्रणाली अपने स्वयं के भविष्यवाणियों के बारे में अधिक ईमानदार साबित हुई। जब शोधकर्ताओं ने भविष्य के बारे में रोबोट के आंतरिक "विचारों" की जांच की, तो उन्होंने पाया कि नई प्रणाली पुरानी मॉडलों की तरह समान तार्किक त्रुटियां नहीं करती है। इसने यह नहीं माना कि पहिया घुमाने से तुरंत छिपा हुआ व्यक्ति दिखाई देने लगेगा। इसके बजाय, इसने सही ढंग से सिमुलेट किया कि रोबोट को व्यक्ति को देखने के लिए शारीरिक रूप से एक नई जगह पर जाना होगा। इस संरचनात्मक ईमानदारी का अर्थ था कि जब रोबोट ने एक पथ की योजना बनाई, तो वह दुनिया की एक वास्तविक समझ के आधार पर क्रियाओं को चुन रहा था, न कि एक जादुई समझ के आधार पर। प्रणाली ने केवल स्क्रीन पर व्यक्ति के आकार का उपयोग करके दूरी का प्रभावी ढंग से अनुमान लगाना भी सीख लिया, बिना सटीक मीटर में दूरी मापने के लिए विशेष सेंसर की आवश्यकता के। इसने इसे एक से तीन मीटर के बीच सुरक्षित पीछा करने की दूरी बनाए रखने की अनुमति दी, और व्यक्ति के चलते रहने पर भी उस सीमा के भीतर रहने के लिए अपनी गति को समायोजित किया।

अध्ययन बताता है कि रोब विस्फोट के लिए रोबोटों को वास्तव में एक चलते हुए लक्ष्य का पीछा करने के लिए केवल एक शक्तिशाली प्रेडिक्शन इंजन की ही नहीं, बल्कि एक ऐसी संरचना की आवश्यकता है जो दुनिया के वास्तविकता के काम करने के तरीके से मेल खाती हो। रोबोट की गति को लक्ष्य की दृश्यता से अलग करके और जानकारी को सही पथ के माध्यम से प्रवाहित होने के लिए मजबूर करके, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो अधिक मजबूत और विश्वसनीय है। हालांकि यह प्रणाली अभी भी व्यक्ति को शुरू में पहचानने के लिए एक डिटेक्टर पर निर्भर करती है, और हालांकि इसका परीक्षण मुख्य रूप से सिमुलेशन में किया गया था, परिणाम संकेत देते हैं कि यह कॉज़ल स्ट्रक्चर एक महत्वपूर्ण प्रगति है। यह दिखाता है कि रोबोट को भविष्य की कल्पना करने के तरीके को सिखाना उतना ही महत्वपूर्ण है जितना कि वह भविष्य जिसकी वह कल्पना करता है। रोबोट को मानसिक शॉर्टकट लेने से रोककर, शोधकर्ताओं ने उसे साझा दुनिया की अव्यवस्थित, अप्रत्याशित वास्तविकता में नेविगेट करने का बेहतर मौका दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →