Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision
यह शोध पत्र "वर्कस्पेस टोकन" (workspace tokens) प्रस्तुत करता है, जो VLMs से सलिअन्सी-ड्रिवन (saliency-driven) पर्यवेक्षण के माध्यम से प्रशिक्षित एक हल्का लेटेंट मेमोरी रिप्रजेंटेशन है, जो रोबोटिक पॉलिसियों को बिना इन-द-लूप VLM रीजनिंग की आवश्यकता के, डिप्लॉयमेंट के दौरान कुशलतापूर्वक दीर्घकालिक मेमोरी कार्यों को हल करने में सक्षम बनाता है, और साथ ही समग्र प्रदर्शन में भी सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
वास्तविक दुनिया में वस्तुओं को नियंत्रित करने वाले रोबोटों के सामने एक मौलिक चुनौती है: उन्हें यह याद रखने की आवश्यकता होती है कि एक क्षण पहले, या कुछ मिनट पहले क्या हुआ था, ताकि वे वर्तमान में सही निर्णय ले सकें। यदि एक रोबोट ब्लॉक (blocks) को एक के ऊपर एक रख रहा है, तो उसे यह याद रखना चाहिए कि उसने पहले ही कितने रखे हैं। यदि वह एक दराज खोल रहा है, तो उसे याद रखना चाहिए कि किस दराज में वह वस्तु है जिसे वह ढूंढ रहा है। अतीत में, इंजीनियरों ने रोबot के कंप्यूटर में देखी गई हर एक वीडियो फ्रेम को फीड करके इसे हल करने की कोशिश की, लेकिन इस दृष्टिकोण ने अक्सर मशीन को भ्रमित कर दिया, जिससे वह अप्रासंगिक विवरणों पर अटक जाती थी और विफल हो जाती थी। हाल ही में, शोधकर्ताओं ने एक विशाल, शक्तिशाली आर्टिफिशियल इंटेलिजेंस मॉडल का उपयोग करने का प्रयास किया जो मेमोरी के रूप में कार्य करे, और लगातार रोबोट के इतिहास को स्कैन करके यह सारांश निकाले कि क्या महत्वपूर्ण है। हालांकि यह काम करता है, लेकिन यह धीमा और महंगा है, जैसे किसी इंसान से लाइब्रेरी की हर बार एक पन्ना पूछने के लिए लाइब्रेरी की हर किताब पढ़ने को कहना। रोबोटिकिस्टों के लिए मुख्य प्रश्न यह रहा है कि रोबोट को बिना धीमा किए या उसे चलाने के लिए सुपरकंप्यूटर की आवश्यकता के बिना एक विश्वसनीय स्मृति कैसे दी जाए।
MIT और कार्नेगी मेलन यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने एक समाधान प्रस्तावित किया है जिसे वे "वर्कस्पेस मॉडल" (workspace model) कहते हैं। रोबोट के काम करने के दौरान इतिहास का सारांश निकालने के लिए एक शक्तिशाली, धीमे कंप्यूटर पर निर्भर रहने के बजाय, वे प्रशिक्षण चरण (training phase) के दौरान एक छोटे, हल्के मेमोरी सिस्टम को प्रशिक्षित करते हैं। वे केवल रोबोट के सीखने के दौरान एक शक्तिशाली आर्टिफिशियल इंटेलिजेंस मॉडल का उपयोग करते हैं, न कि कार्य करने के दौरान। यह शक्तिशाली मॉडल एक शिक्षक के रूप में कार्य करता है, जो वीडियो के सटीक क्षणों की ओर इशारा करता है—जैसे कि जब रोबोट का ग्रिपर एक ब्लॉक उठाता है या जब एक दराज बंद होती है। इसके बाद शोधकर्ता एक संक्षिप्त, कुशल प्रणाली को इन महत्वपूर्ण क्षणों को एक छोटे, छिपे हुए सारांश में संकुचित करने के लिए प्रशिक्षित करते हैं। एक बार यह प्रशिक्षण पूरा हो जाने के बाद, रोबोट इस छोटे सारांश का उपयोग करके अतीत को तुरंत याद कर सकता है, बिना उस धीमे, शक्तिशाली शिक्षक की सहायता लिए।
शोधकर्ताओं ने इस दृष्टिकोण का परीक्षण कई कठिन कार्यों पर किया जिनमें दीर्घकालिक स्मृति की आवश्यकता होती है। एक सिम्युलेटेड वातावरण में, एक रोबोट को एक कटोरे में ठीक पांच क्यूब्स डालने थे, लेकिन क्यूब्स दृश्य से गायब हो जाते थे क्योंकि वे अंदर चले जाते थे, जिससे रोबोट को उन्हें अपनी स्मृति में गिनना पड़ता था। एक अन्य कार्य में, एक रोबोट को एक विशिष्ट दराज खोलनी थी जिसे एक अन्य रोबोट ने पहले बंद कर दिया था, जिसके लिए उसे यह याद रखना था कि किस दराज में वस्तु थी। उन्होंने एक हार्डवेयर सेटअप पर एक वास्तविक दुनिया के रोबोट का भी परीक्षण किया जहाँ उसे ऐसे बक्सों में क्यूब्स रखने थे जो अंदर देखने के लिए बहुत ऊँचे थे, जिसके लिए फिर से रोबोट को निरंतर गिनती बनाए रखनी थी। इन परीक्षणों में, नया वर्कस्पेस मॉडल 91.5 प्रतिशत प्रयासों में सफल रहा। यह अन्य तरीकों से काफी बेहतर था। एक मानक रोबोट जो केवल पिछले कुछ फ्रेम देखता था, अधिकांश समय विफल हो गया क्योंकि वह अतीत को भूल गया था। एक रोबोट जिसने कार्य के दौरान अतीत के प्रमुख क्षणों को चुनने के लिए एक शक्तिशाली AI मॉडल का उपयोग करने का प्रयास किया, वह बहुत धीमा था और केवल 66.8 प्रतिशत बार सफल हुआ। वर्कस्पेस मॉडल न केवल सबसे सटीक था बल्कि सबसे तेज़ भी था, जिससे रोबोट बिना किसी लैग (lag) के तेजी से प्रतिक्रिया कर सका जो इतिहास को प्रोसेस करने के लिए बड़े कंप्यूटर के इंतजार से उत्पन्न होता है।
इस पद्धति की सफलता इस बात में निहित है कि मेमोरी को कैसे बनाया गया है। पिछले प्रयासों में, शोधकर्ता एक बड़े AI मॉडल से कार्य के दौरान वीडियो स्ट्रीम से महत्वपूर्ण फ्रेम चुनने के लिए कहते थे। इस प्रक्रिया से देरी, या लैग (lag) पैदा होता था, जिससे रोबोट की गतिविधियाँ झटकेदार और कम सटीक हो जाती थीं। नया दृष्टिकोण इस भारी काम को प्रशिक्षण चरण में स्थानांतरित कर देता है। प्रशिक्षण के दौरान, शक्तिशाली AI मॉडल पूरे कार्य के वीडियो की समीक्षा करता है और महत्वपूर्ण घटनाओं की पहचान करता है। फिर यह छोटे वर्कस्पेस मॉडल को इन महत्वपूर्ण दृश्य विवरणों की एक सूची को पुन: निर्मित करने के लिए सिखाता है। छोटा मॉडल इस जानकारी को एक एकल, सघन 'टोकन' (token) में संकुचित करना सीख जाता है—डेटा का एक छोटा सा टुकड़ा जिसमें अतीत का सार होता है। जब रोबोट को वास्तविक दुनिया में तैनात किया जाता है, तो वह बस इस टोकन को देखता है। उसे अतीत का पुन: विश्लेषण करने या बड़े मॉडल के सोचने का इंतजार करने की आवश्यकता नहीं होती; स्मृति पहले से ही संकुचित और तैयार है। यह रोबोट को पिछले तरीकों की बाधाओं के बिना एक स्पष्ट, निरंतर क्रिया प्रवाह बनाए रखने की अनुमति देता है।
शोधकर्ताओं ने पाया कि इस पद्धति ने न केवल गति बढ़ाई, बल्कि वास्तव में रोबोट को स्मार्ट भी बनाया। जब उन्होंने विश्लेषण किया कि अन्य तरीके क्यों विफल हुए, तो उन्होंने पाया कि केवल रोबोट को अधिक फ्रेम देने, या सावधानीपूर्वक चुने गए फ्रेम देने से भी वह भ्रमित हो जाता था। रोबोट गलत गतिविधियों की नकल करने लगता था या अतिरिक्त जानकारी के कारण शोर (noise) पैदा होने से वस्तुओं को पकड़ने में सटीक होने में विफल रहता था। इसके विपरीत, वर्कस्पेस मॉडल ने अतीत का एक सुचारू, निरंतर प्रतिनिधित्व प्रदान किया। क्योंकि छोटे मॉडल को पूरे इतिहास से सबसे महत्वपूर्ण विवरणों को पुन: निर्मित करने के लिए प्रशिक्षित किया गया था, इसलिए इसने विचलित करने वाले शोर को अनदेखा करना और केवल उसी पर ध्यान केंद्रित करना सीखा जो कार्य के लिए महत्वपूर्ण था। इसके परिणामस्वरूप एक ऐसा रोबोट प्राप्त हुआ जो सही ढंग से गिन सकता था, सही दराज ढूंढ सकता था, और वस्तुओं को उस स्तर की सटीकता के साथ पकड़ सकता था जो अन्य तरीकों में नहीं थी।
यह अध्ययन सुझाव देता है कि रोबोटिक मेमोरी का भविष्य रोबोटों को बड़ा या अधिक शक्तिशाली बनाने में नहीं, बल्कि उन्हें याद रखने के लिए कैसे सिखाया जाता है, इसमें निहित है। शक्तिशाली उपकरणों का उपयोग करके सरल, अधिक कुशल प्रणालियों को प्रशिक्षित करके, शोधकर्ता ऐसे रोबोट बना सकते हैं जो तेज़ और जटिल, दीर्घकालिक तर्क करने में सक्षम हों। वर्कस्पेस मॉडल एक सेतु के रूप में कार्य करता है, जो स्मृति के लिए आवश्यक भारी तर्क को एक ऐसे रूप में संकुचित करता है जिसका उपयोग रोबोट वास्तविक समय में कर सके। यह दृष्टिकोण उन रोबोटों के लिए एक मार्ग प्रशस्त करता है जिन्हें गतिशील, अप्रत्याशित वातावरण में काम करने की आवश्यकता होती है जहाँ अतीत को याद रखना वर्तमान को देखने जितना ही महत्वपूर्ण है। यह कार्य प्रदर्शित करता है कि सही प्रशिक्षण रणनीति के साथ, एक रोबोट अनुभव के समृद्ध इतिहास को एक हल्के पैकेज में ले जा सकता है, जो स्पष्टता और गति के साथ कार्य करने के लिए तैयार है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।