Grounded World Model for Semantically Generalizable Planning
यह शोध पत्र एक ग्राउंडेड वर्ल्ड मॉडल (GWM) प्रस्तावित करता है जो विजन-लैंग्वेज अलाइनमेंट को मॉडल प्रिडिक्टिव कंट्रोल में एकीकृत करता है, जिससे पारंपरिक विजन-लैंग्वेज-एक्शन मॉडल्स की तुलना में विसुओमोटर प्लानिंग में काफी बेहतर सिमेंटिक जनरलाइजेशन सक्षम होता है, जैसा कि अनदेखे विजुअल सिग्नल्स और रेफरिंग एक्सप्रेशंस से जुड़े WISER बेंचमार्क पर 87% सफलता दर द्वारा प्रदर्शित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को अपना कमरा साफ करना सिखा रहे हैं। आप चाहते हैं कि वह एक विशिष्ट लाल मोजा उठाए और उसे लॉन्ड्री बास्केट में डाल दे।
पुराना तरीका: "केवल फोटो" वाला शिक्षक
वर्तमान के अधिकांश रोबोट प्लानर्स एक ऐसे शिक्षक की तरह काम करते हैं जो केवल तस्वीरों में बात करता है।
- लक्ष्य: आपको रोबोट को काम शुरू करने से पहले एक "पूरी तरह से साफ कमरे" की तस्वीर (लक्ष्य छवि) दिखानी होती है।
- समस्या: क्या होगा अगर कमरा आज अलग दिखता है? क्या होगा अगर मोजा लाल के बजाय नीला हो? या अगर आप चाहते हैं कि रोबोट मोजे को सामान्य से किसी अलग बास्केट में डाले? रोबोट भ्रमित हो जाता है क्योंकि वह केवल उस सटीक फोटो से मेल खाने को जानता है जो आपने उसे दी थी। यह एक अलग शहर के नक्शे का उपयोग करके शहर में नेविगेट करने जैसा है; यदि सड़कें थोड़ी भी अलग दिखती हैं, तो आप रास्ता भटक जाते हैं।
- परिणाम: ये रोबोट उन विशिष्ट कार्यों को याद रखने में बेहतरीन हैं जो उन्होंने पहले देखे हैं, लेकिन जब आप उनसे कुछ नया करने को कहते हैं, भले ही बुनियादी गतिविधियाँ समान हों, तो वे बुरी तरह विफल हो जाते हैं।
नया तरीका: "ग्राउंडेड वर्ल्ड मॉडल" (GWM)
यह पेपर GWM-MPC नामक एक नया सिस्टम पेश करता है। इसे अपने रोबोट के शिक्षक को "केवल फोटो" वाले शिक्षक से अपग्रेड करके एक द्विभाषी कहानीकार (Bilingual Storyteller) बनाने के रूप में समझें, जो चित्रों और प्राकृतिक भाषा दोनों को समझता है।
यह कैसे काम करता है, इस सरल उपमा का उपयोग करते हुए:
1. एक साझा भाषा में "क्रिस्टल बॉल"
कच्चे पिक्सेल (जैसे एक धुंधली वीडियो) में भविष्य की भविष्यवाणी करने के बजाय, यह रोबोट एक साझा भाषा स्थान में भविष्य की भविष्यवाणी करता है।
- कल्पना कीजिए कि रोबकौट के पास एक "क्रिस्टल बॉल" है जो आपको वीडियो नहीं दिखाती, बल्कि यह दिखाती है कि आगे क्या होने वाला है इसका एक विवरण।
- यह एक सुपर-स्मार्ट AI (Qwen3-VL) का उपयोग करता है जो समझता है कि शब्द "लाल मोजा उठाओ" और लाल मोजा पकड़ते हुए हाथ की छवि, उसके मस्तिष्क के एक ही "पड़ोस" में रहते हैं।
2. "करके देखो और देखो" की रणनीति (MPC)
जब रोबोट को हिलने की आवश्यकता होती है, तो वह केवल एक रास्ता नहीं चुनता। वह अपने दिमाग में "क्या होगा अगर?" का खेल 12 बार खेलता है:
- परिदृश्य A: "क्या होगा अगर मैं नीला कप उठा लूँ?" -> क्रिस्टल बॉल कहता है: "यह आपके निर्देश 'लाल मोजा उठाओ' से मेल नहीं खाता।"
- परिदृश्य B: "क्या होगा अगर मैं लाल मोजा उठा लूँ?" -> क्रिस्टल बॉल कहता है: "परफेक्ट! यह आपके निर्देश से मेल खाता है।"
- परिदृश्य C: "क्या होगा अगर मैं मोजा फर्श पर गिरा दूँ?" -> क्रिस्टल बॉल कहता: "नहीं, यह 'बास्केट में डालो' से मेल नहीं खाता।"
रोबोट फिर उस परिदृश्य को चुनता है जो आपके द्वारा दिए गए अंग्रेजी निर्देश के सबसे करीब लगता है।
3. क्रियाओं के लिए "यूनिवर्सल ट्रांसलेटर"
इसकी एक सबसे शानदार विशेषता रेंडरिंग-आधारित एक्शन टोकनाइजेशन (RAT) है।
- आमतौर पर, एक रोबोट आर्म (जैसे फ्रैंका पांडा) और एक अलग रोबोट आर्म (जैसे xArm6) गति की अलग-अलग "भाषाएं" बोलते हैं। उनके जोड़ों और आकार अलग होते हैं।
- यह नया सिस्टम एक यूनिवर्सल ट्रांसलेटर की तरह काम करता है। यह रोबोट की गतिविधियों को लेता है और उन्हें ऐसी "छवियों" (रेंडरिंग्स) में बदल देता है जिन्हें AI समझ सके।
- जादू: क्योंकि यह गतिविधियों को छवियों में अनुवादित करता है, इसलिए यह एक रोबोट पर सीख सकता है और तुरंत दूसरे पूरी तरह से अलग रोबोट पर काम कर सकता है, बिना कुछ दोबारा सीखे। यह एक सेडान चलाने के कौशल को सीखने और फिर तुरंत ट्रक चलाने में सक्षम होने जैसा है क्योंकि आप बटनों के बजाय 'स्टीयरिंग' की अवधारणा को समझते हैं।
यह क्यों मायने रखता है (परिणाम)
शोधकर्ताओं ने WISER (वर्ल्ड-नॉलेज इंटीग्रेटेड सिमेंटिक एम्बोडीड रीजनिंग) नामक एक कठिन परीक्षण बनाया।
- परीक्षण: उन्होंने रोबोटों को 288 कार्य सिखाए (जैसे "सेब को फ्रांस के मानचित्र पर रखें")। फिर, उन्होंने उन्हें 288 नए कार्यों पर टेस्ट किया जहाँ वस्तुएं और निर्देश पूरी तरह से अलग थे (जैसे "केले को इटली के मानचित्र पर रखें"), लेकिन गति वही थी।
- पुराने रोबोट (VLAs): वे बुरी तरह विफल रहे। उन्होंने नए कार्यों को केवल 22% बार सही किया। उन्होंने प्रशिक्षण डेटा को रट लिया था लेकिन वे नए निर्देशों के अर्थ को नहीं समझ पाए।
- नया रोबोट (GWM-MPC): यह 87% बार सफल रहा! इसने समझ लिया कि "केले को मानचित्र पर रखना" उसी प्रकार की क्रिया है जैसे "सेब को मानचित्र पर रखना", भले ही उसने पहले कभी केला या इटली नहीं देखा हो।
निचोड़ (The Bottom Line)
यह पेपर रोबोटिक्स की एक बड़ी समस्या को हल करता है: सामान्यीकरण (Generalization)।
वर्तमान रोबोट तोते की तरह हैं; वे वही दोहराते हैं जो वे सुनते हैं। यह नया सिस्टम एक समझदार प्रशिक्षु (Smart Apprentice) की तरह है जो आपके शब्दों के पीछे के इरादे को समझता है। यह एक नई स्थिति को देख सकता है, भविष्य की कल्पना कर सकता है, और जो आपने कहा है उसके आधार पर सबसे अच्छा निर्णय ले सकता है, न कि केवल जो आपने इसे दिखाया है। यह उन रोबोटों की ओर एक बड़ा कदम है जो वास्तव में हमारे अस्त-व्यस्त, अप्रत्याशित वास्तविक घरों में हमारी मदद कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।