← नवीनतम पेपर
💻 computer science

Beyond Instance Slots: Semantically Rich World Models for Physical Interaction Planning

यह शोध पत्र सेमैंटिकली रिच वर्ल्ड मॉडल (SR-WM) को प्रस्तुत करता है, जो एक कार्य-सशर्त ढांचा (task-conditioned framework) है जो विविध सिमुलेशन वातावरणों में कार्य-संगत भविष्यों की भविष्यवाणी करने और सुदृढ़ भौतिक इंटरेक्शन प्लानिंग को सक्षम करने के लिए दृश्य संस्थाओं (visual entities) को कार्यात्मक भूमिकाओं (ग्रिपर, लक्ष्य, गोल, संबंध और चरण) में मैप करता है।

मूल लेखक: Juntao Cheng, Jingkai Wang, Yijun Shen, Xiansheng Chen, Zhiwei Yu

प्रकाशित 2026-08-25
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Juntao Cheng, Jingkai Wang, Yijun Shen, Xiansheng Chen, Zhiwei Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से मानव हाथ की सहज तरलता के साथ दुनिया में चलने के लिए संघर्ष कर रहे हैं। जबकि मशीनों को सख्त निर्देशों का पालन करने के लिए प्रोग्राम किया जा सकता है, वे अक्सर तब विफल हो जाती हैं जब वातावरण थोड़ा बदल जाता है या जब किसी कार्य के लिए न केवल यह समझने की आवश्यकता होती है कि कौन सी वस्तुएं मौजूद हैं, बल्कि यह भी कि वे एक विशिष्ट लक्ष्य के लिए एक-दूसरे से कैसे संबंधित हैं। एक रोबोट के लिए कप उठाने और उसे मेज पर रखने के लिए, उसे यह जानना चाहिए कि कौन सा कप है, कौन सी मेज है, और कप को मेज की ओर इस तरह ले जाना चाहिए कि वह गिरे नहीं। पारंपरिक आर्टिफिशियल इंटेलिजेंस मॉडल जो भविष्य की भविष्यवाणी करते हैं, अक्सर इस बात का अनुमान लगाने पर ध्यान केंद्रित करते हैं कि अगली छवि कैसी दिखेगी या कोई छिपा हुआ गणितीय पैटर्न क्या सुझाव देता है। ये मॉडल पिक्सेल की भविष्यवाणी करने में बहुत अच्छे हो सकते हैं, लेकिन ये योजना बनाने में अक्सर कमजोर होते हैं क्योंकि वे यह नहीं समझते कि कार्य की कहानी में वस्तुओं की भूमिका क्या है। वे चीजों का एक संग्रह देखते हैं, लेकिन वे नहीं जानते कि कौन सी चीज अभिनेता है, कौन सी लक्ष्य है, या कौन सा गंतव्य है।

इसे हल करने के लिए, बीजिंग एकेडमी ऑफ आर्टिफिशियल इंटेलिजेंस और शंघाई जियाओ टोंग यूनिवर्सिटी के शोधकर्ताओं ने रोबोट के लिए अपनी दुनिया को समझने का एक नया तरीका विकसित किया है, जिसे 'सेमेंटिकली रिच वर्ल्ड मॉडल' (Semantically Rich World Model) कहा जाता है। एक धुंधली भविष्य की छवि की भविष्यवाणी करने के बजाय, यह प्रणाली एक सरल, अधिक व्यावहारिक प्रश्न पूछती है: यदि रोबोट एक विशिष्ट क्रिया करता है, तो क्या वह महत्वपूर्ण चीजों को सुरक्षित रखते हुए लक्ष्य प्राप्त करेगा? शोधकर्ताओं ने पाया कि रोबोट के मस्तिष्क को उसके द्वारा देखी जाने वाली प्रत्येक वस्तु को विशिष्ट कार्यात्मक भूमिकाओं में वर्गीकृत करने के लिए मजबूर करके—जैसे कि पकड़ने वाला हाथ, उठाया जाने वाला ऑब्जेक्ट, वह स्थान जहाँ इसे जाना है, उनके बीच का संबंध, और कार्य का वर्तमान चरण—रोबोट योजना बनाने में बहुत बेहतर हो जाता है। यह दृष्टिकोण एक अराजक दृश्य को एक संरचित योजना में बदल देता है, जिससे रोबोट अनावश्यक विवरणों में खोए बिना विभिन्न कार्यों का अनुकरण कर सकता है और सफलता की ओर ले जाने वाले विकल्प को चुन सकता है।

इस नए सिस्टम का मूल आधार यह है कि रोबोट दुनिया का प्रतिनिधित्व कैसे करता है। पुराने तरीकों में, एक रोबोट वस्तुओं के एक सेट की पहचान कर सकता था, जैसे कि एक गाजर और एक कंटेनर, लेकिन उसे यह पता नहीं होता कि किसे हिलाया जाना चाहिए या उसे कहाँ जाना चाहिए। नया मॉडल, जो 15 मिलियन पैरामीटर्स के हल्के आधार पर बना है, इन दृश्य संस्थाओं को पांच अलग-अलग भूमिकाओं से जोड़ता है। पहली भूमिका 'ग्रिपर' (gripper) है, जो रोबोट के अपने हाथ का प्रतिनिधित्व करती है। दूसरी भूमिका 'टारगेट' (target) है, वह विशिष्ट वस्तु जिसके साथ रोबोट को अंतःक्रिया करनी है। तीसरी भूमिका 'गोल' (goal) है, गंतव्य या वह स्थिति जिसे रोबोट प्राप्त करना चाहता है, जैसे कि एक कंटेनर का भरा जाना। चौथी भूमिका इन वस्तुओं के बीच के संबंध को ट्रैक करती है, यह समझती है कि क्या टारगेट गोल के अंदर है या उसे छू रहा है। अंतिम भूमिका 'फेज' (phase) की निगरानी करती है, यह ट्रैक रखती है कि रोबोट पास आ रहा है, पकड़ रहा है, चल रहा है, या छोड़ रहा है। इस तरह दुनिया को व्यवस्थित करके, रोबोट यह अनुमान लगा सकता है कि यदि वह अपना हाथ हिलाता है तो क्या होगा, न कि अगली तस्वीर का अनुमान लगाकर, बल्कि यह गणना करके कि क्या टारगेट गोल तक पहुँच जाएगा और क्या उनके बीच का संबंध बना रहेगा।

यह संरचित समझ रोबोट को कई संभावित क्रिया अनुक्रम उत्पन्न करने और फिर केवल दृश्य समानता के बजाय अपने अर्थ के आधार पर उनका मूल्यांकन करने की अनुमति देती है। सिस्टम एक ऐसे भविष्य का अनुकरण कर सकता है जहाँ रोबोट गलत वस्तु पकड़ता है, या जहाँ वह वस्तु को बहुत जल्दी गिरा देता है, और तुरंत इन्हें विफलता के रूप में पहचान लेता है। यह इन विकल्पों को रैंक करने के लिए इस ज्ञान का उपयोग करता है, उस पथ का चयन करता है जो कार्य की आवश्यकताओं को सबसे अच्छी तरह से संतुष्ट करता है। यदि चुना गया पथ आशाजनक दिखता है लेकिन बीच में उसमें कोई दोष है, तो सिस्टम शुरुआत से शुरू करने के बजाय केवल उस हिस्से को ठीक कर सकता है। कार्य की "कहानी" को समझने की यह क्षमता—क्या हो रहा है, क्या होना चाहिए, और क्या संरक्षित किया जाना चाहिए—रोबोट को काफी अधिक मजबूत बनाती है। विभिन्न सिम्युलेटेड वातावरणों में परीक्षणों में, इस पद्धति ने जटिल कार्यों की सफलता दर को लगभग 45 प्रतिशत से बढ़ाकर 83 प्रतिशत से अधिक कर दिया, जो विश्वसनीयता में एक बड़ी छलांग है।

सबसे आश्चर्यजनक निष्कर्षों में से एक यह है कि यह प्रणाली काम करने के लिए पूर्ण दृष्टि (perfect vision) पर निर्भर नहीं है। कई पिछले दृष्टिकोणों में रोबोट को हर वस्तु की एक सटीक, पिक्सेल-परफेक्ट रूपरेखा की आवश्यकता होती थी, जो अक्सर अलग-अलग, भारी-भरकम सॉफ्टवेयर द्वारा उत्पन्न की जाती थी। नया मॉडल इन सटीक रूपरेखाओं के बिना भी प्रभावी ढंग से कार्य कर सकता है, जो केवल कैमरे से प्राप्त कच्चे दृश्य डेटा का उपयोग करता है। यह सेगमेंटेशन मास्क, या रूपरेखाओं को सख्त आवश्यकताओं के बजाय वैकल्पिक संकेतों के रूप में मानता है। इन रूपरेखाओं के बिना परीक्षण किए जाने पर भी, रोबोट ने उच्च सफलता दर हासिल की, जिससे सिद्ध हुआ कि मॉडल दृश्य पैच से सीधे दुनिया की आवश्यक ज्यामिति और संबंधों को सीखता है। यह सिस्टम को वास्तविक दुनिया के उपयोग के लिए बहुत अधिक व्यावहारिक बनाता है, जहाँ प्रकाश परिवर्तन, छाया और अवरोध अक्सर सरल दृष्टि प्रणालियों को भ्रमित कर देते हैं।

शोधकर्ताओं ने यह भी प्रदर्शित किया है कि यह दृष्टिकोण रोबानों को नए कार्यों को बहुत तेज़ी से सीखने की अनुमति देता है। क्योंकि रोबोट वस्तुओं की सामान्य भूमिकाओं को समझता है—यह जानते हुए कि एक "टारगेट" वह है जिसे हिलाया जाना है और एक "गोल" वह है जहाँ इसे जाना है—वह इस ज्ञान को उन नई स्थितियों में लागू कर सकता है जिन्हें उसने पहले कभी नहीं देखा है। जब इसे कार्यों के एक सेट पर प्रशिक्षित किया गया और फिर एक पूरी तरह से अलग सेट पर परीक्षण किया गया, तो इसने सफलता प्राप्त करने की अपनी क्षमता को बनाए रखा, जबकि नए कार्यों पर शून्य से प्रशिक्षित मॉडल काफी खराब प्रदर्शन करते रहे। यह बताता है कि मॉडल ने भौतिक सामान्य ज्ञान (physical common sense) का एक रूप सीखा है जिसे विभिन्न वातावरणों में स्थानांतरित किया जा सकता है। सिस्टम केवल विशिष्ट गतिविधियों को याद नहीं कर रहा है; यह अंतःक्रिया के अंतर्निहित तर्क को सीख रहा है।

हालाँकि यह प्रणाली अत्यधिक प्रभावी है, शोधकर्ता इसकी सीमाओं को लेकर भी सावधान हैं। यह मॉडल एकल-बाहु (single-arm) रोबोट के लिए डिज़ाइन किया गया है जो लक्ष्य-निर्देशित कार्य करते हैं, जैसे कि वस्तुओं को उठाना और रखना। यह अभी दो हाथों के मिलकर काम करने वाले कार्यों, नरम या लचीली वस्तुओं के हेरफेर, या जटिल उपकरणों के उपयोग के लिए नहीं बना है। इसके अलावा, सिस्टम अपने प्रशिक्षण डेटा के लिए सिमुलेशन पर निर्भर करता है, और हालांकि परिणाम उत्साहजनक हैं, भौतिक रोबोटों में संक्रमण के लिए सावधानीपूर्वक सुरक्षा जांच की आवश्यकता है। शोधकर्ताओं ने सिस्टम का परीक्षण एक सिम्युलेटेड वातावरण में किया जहाँ यह सुरक्षित रूप से विफल हो सकता था और उन विफलताओं से सीख सकता था, लेकिन वे जोर देते हैं कि वास्तविक दुनिया में तैनाती के लिए अतिरिक्त सुरक्षा उपायों की आवश्यकता है ताकि यह सुनिश्चित हो सके कि रोबोट खुद को या अपने परिवेश को नुकसान न पहुँचाए।

इस कार्य की सफलता इसकी अवधारणा की सरलता में निहित है। रोबोट को भविष्य की हर छवि के हर विवरण की भविष्यवाणी करने की आवश्यकता है, इसके बजाय विशिष्ट भूमिकाओं और संबंधों पर ध्यान केंद्रित करके, शोधकर्ताओं ने एक ऐसा मॉडल बनाया है जो कुशल और प्रभावी दोनों है। सिस्टम एक कॉम्पैक्ट आर्किटेक्चर का उपयोग करता है जो मानक हार्डवेयर पर चल सकता है, जिससे यह भविष्य के रोबोटिक अनुप्रयोगों के लिए सुलभ हो जाता है। यह इस विचार से हटकर एक बदलाव है कि रोबोट को सब कुछ "देखने" की आवश्यकता है, बजाय इसके कि उसे कार्य की "समझ" विकसित करने के लिए कहा जाए। ऐसा करके, यह कच्चे दृश्य डेटा और बुद्धिमान निर्णय लेने के बीच के अंतर को पाटता है, जो उन रोबोटों की ओर एक स्पष्ट मार्ग प्रदान करता है जो भौतिक दुनिया में उस स्तर की सक्षमता के साथ नेविगेट कर सकते हैं जो पहले पहुंच से बाहर थी। निष्कर्ष बताते हैं कि रोबोटों के लिए वास्तव में दुनिया के साथ बातचीत करने के लिए, उन्हें वस्तुओं को केवल पिक्सेल के रूप में मानना बंद करना होगा और उन्हें एक कहानी के पात्रों के रूप में देखना शुरू करना होगा जिसका एक आरंभ, एक मध्य और एक अंत होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →