Large-Language-Model-Guided State Estimation for Partially Observable Task and Motion Planning
यह शोध पत्र CoCo-TAMP प्रस्तुत करता है, जो एक पदानुक्रमित अवस्था अनुमान (hierarchical state estimation) ढांचा है जो वस्तुओं के स्थान और सह-अस्तित्व (co-occurrence) के बारे में सामान्य-ज्ञान (common-sense knowledge) को शामिल करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे आंशिक रूप से दृश्यमान (partially observable) वातावरण में कार्य करने वाले रोबोटों के लिए नियोजन और निष्पादन समय में काफी कमी आती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट हैं जिसे किसी विशिष्ट वस्तु, जैसे कि एक टोस्टर, को खोजने का काम सौंपा गया है, जो एक ऐसे घर में है जिसे आपने पहले कभी नहीं देखा है। पेच यह है कि आप पूरे घर को एक साथ नहीं देख सकते। आप केवल वही देख सकते हैं जो आपकी आँखों के ठीक सामने है, और कई चीजें दरवाजों के पीछे, कैबिनेट के अंदर, या फ्रेम से बाहर छिपी हुई हैं।
यह पार्शियली ऑब्जर्वेबल टास्क एंड मोशन प्लानिंग (PO-TAMP) की समस्या है। यह लुका-छिपी के खेल जैसा है जहाँ आपको अपना पूरा रास्ता पहले ही तय करना होता है, भले ही आपको यह न पता हो कि सब कहाँ छिपे हैं। यदि आपका अनुमान गलत निकलता है, तो आप गलत कमरे में जाने में समय बर्बाद करते हैं, फंस जाते हैं, और अपना प्लान फिर से शुरू करने के लिए मजबूर होते हैं।
यह पेपर एक नया सिस्टम पेश करता है जिसे CoCo-TAMP (को-लोकेशन टास्क एंड मोशन प्लानिंग) कहा जाता है, जो एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग करके रोबोट को "कॉमन सेंस" (सामान्य ज्ञान) वाला दिमाग देने के जरिए इस समस्या को हल करता है—यही वह AI है जो चैटबॉट्स (जैसे कि मैं) को शक्ति देता है।
CoCo-TAMP कैसे काम करता है, इसे सरल उपमाओं के माध्यम से यहाँ समझाया गया है:
1. "अंतर्ज्ञान" (प्रारंभिक विश्वास/Initial Beliefs)
बिना मदद के, एक रोबोट यह सोच सकता है कि टोस्टर बाथरूम में होने की उतनी ही संभावना रखता है जितनी कि किचन में। यह एक खाली स्लेट (blank slate) से शुरुआत करता है।
CoCo-TAMP LLM से पूछता है: "टोस्टर सबसे अधिक संभावना कहाँ होने की है?"
LLM अपने मानव भाषा और संस्कृति पर आधारित प्रशिक्षण का उपयोग करके कहता है, "लगभग निश्चित रूप से किचन में, शायद डाइनिंग रूम में, लेकिन बाथरूम में बिल्कुल नहीं।"
- उपमा: कल्पना कीजिए कि आप अपनी खोई हुई चाबियाँ ढूँढ रहे हैं। बिना कॉमन सेंस वाला रोबोट घर की हर दराज को समान संभावना के साथ चेक करेगा। CoCo-TAMP एक ऐसे दोस्त की तरह है जो कहता है, "तुम हमेशा अपनी चाबियाँ किचन काउंटर पर या सामने वाले दरवाजे के पास छोड़ देते हो। चलो पहले वहीं देखते हैं।" यह "अंतर्ज्ञान" रोबोट को बेकार की खोजों को तुरंत छोड़ने में मदद करता है।
2. "सामाजिक दायरा" (को-लोकेशन/Co-Location)
यह सिस्टम एक दूसरे प्रकार के कॉमन सेंस का भी उपयोग करता है: समानता (Similarity)।
यदि रोबोट को किचन काउंटर पर एक कॉफी मग मिलता है, तो वह अनुमान लगा सकता है कि एक कॉफी पॉट पास में ही होने की संभावना है। यदि उसे एक पेचकश (screwdriver) मिलता है, तो वह अनुमान लगा सकता है कि हथौड़ा उसी टूलबॉक्स में होगा। इसके विपरीत, यदि उसे एक टूथब्रश मिलता है, तो वह जानता है कि टोस्टर उसी स्थान पर होने की संभावना नहीं है।
- उपमा: इसे हाई स्कूल कैफेटेरिया की तरह समझें। यदि आप फुटबॉल खिलाड़ियों के एक समूह को एक मेज पर बैठे देखते हैं, तो आप अनुमान लगा सकते हैं कि अन्य फुटबॉल खिलाड़ी भी उसी मेज पर होंगे, जबकि चेस क्लब के सदस्य शायद किसी दूसरी मेज पर होंगे। CoCo-TAMP वस्तुओं के "सामाजिक दायरे" का उपयोग करके अपने मानचित्र (map) को अपडेट करता है। एक वस्तु का मिलना तुरंत रोबोट के इस विश्वास को अपडेट कर देता है कि अन्य समान वस्तुएँ कहाँ छिपी हो सकती हैं।
3. "स्मार्ट जासूस" (हाइरार्किकल स्टेट एस्टिमेशन)
रोबोट केवल अनुमान नहीं लगाता; वह चीजों के होने की जगह का एक रनिंग स्कोर ("विश्वास") रखता है।
चरण 1: यह कमरे और सतह (जैसे, "किचन, काउंटर") के बारे में एक शिक्षित अनुमान लगाने के लिए LLM का उपयोग करता है।
चरण 2: यह देखने के लिए आगे बढ़ता है। यदि उसे वस्तु दिख जाती है, तो बहुत अच्छा!
चरण 3: यदि उसे वस्तु नहीं मिलती, तो वह हार नहीं मानता। वह पूछता है: "क्या मैंने ठीक से देखा? क्या दृश्य बाधित था?"
चरण 4: यदि उसे कोई दूसरी वस्तु (जैसे कि टोस्टर) मिलती है, तो वह मूल वस्तु (जैसे कॉफी पॉट) के बारे में अपने अनुमान को अपडेट करने के लिए "सामाजिक दायरे" के नियम का उपयोग करता है।
उपमा: यह एक रहस्य सुलझाने वाले जासूस की तरह है।
- खराब जासूस: "मैंने किचन में संदिग्ध को नहीं देखा, इसलिए वह गैरेज में होगा।" (जल्दी हार मान लेना)।
- CoCo-TAMP जासूस: "मैंने किचन में संदिग्ध को नहीं देखा, लेकिन किचन अंधेरा था और मैंने केवल काउंटर को देखा था। साथ ही, मुझे लिविंग रूम में उसकी पसंदीदा टोपी मिली। चूंकि वह अपनी टोपी से प्यार करता है, इसलिए वह शायद लिविंग रूम में ही है। चलो वहीं चलते हैं।"
यह एक बड़ी बात क्यों है?
शोधकर्ताओं ने इसका परीक्षण एक वास्तविक रोबोट (टोयोटा HSR) पर और विशाल कंप्यूटर सिमुलेशन में किया।
- CoCo-TAMP के बिना: रोबोट बिना किसी दिशा के भटकता रहता है, गलत कमरों की जांच करता है, भ्रमित होता है, और कई बार अपना प्लान फिर से शुरू करने के लिए मजबूर होता है। यह धीमा और निराशाजनक है।
- CoCo-TAMP के साथ: रोबोट एक अनुभवी इंसान की तरह व्यवहार करता है। उसे पता है कि पहले कहाँ देखना है और वह एक वस्तु से मिले सुरागों का उपयोग दूसरी वस्तु को खोजने के लिए करता है।
परिणाम:
- सिमुलेशन में, यह 62% तेज़ था।
- वास्तविक दुनिया में, यह 72% तेज़ था।
निचोड़ (The Bottom Line)
CoCo-TAMP रोबोट्स को केवल अंधे मशीनों की तरह सोचने के बजाय इंसानों की तरह सोचने के लिए सिखाता है, जो दुनिया को समझते हैं। रोबोट की चलने-फिरने की क्षमता को AI की दुनिया को "जानने" की क्षमता (चीजें कहाँ होती हैं और क्या चीज़ किसके साथ जाती है) के साथ जोड़कर, रोबोट जटिल कार्यों को बहुत तेज़ी से और कम गलतियों के साथ हल कर सकते हैं।
यह एक ऐसे रोबोट के बीच का अंतर है जो अंधे होकर घर की हर अलमारी को टटोलता है, और एक ऐसे रोबोट के बीच जो सीधे किचन की ओर जाता है क्योंकि उसे पता है कि टोस्टर वहीं रहता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।