GPA-RAM: Grasp-Pretraining Augmented Robotic Attention Mamba for Spatial Task Learning
यह शोध पत्र GPA-RAM का प्रस्ताव करता है, जो एक नवीन ढांचा है जो मैनिपुलेशन सफलता दरों को बढ़ाने के लिए ग्रैस्प-प्रीट्रेनिंग ऑग्मेंटेशन (Grasp-Pretraining Augmentation) को एकीकृत करता है और कुशल, वास्तविक समय में एक्शन जनरेशन के लिए रोबोटिक अटेंशन माम्बा (Robotic Attention Mamba) आर्किटेक्चर का उपयोग करता है, जिससे कई रोबोटिक प्लेटफॉर्म्स पर अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को अपने घर के काम करना सिखाने की कोशिश कर रहे हैं। आप उसे यह बताने के लिए लाखों लाइन का कोड नहीं लिखना चाहते कि आपके घर की हर एक वस्तु के लिए उसे अपनी उंगलियों को बिल्कुल कैसे हिलाना है। इसके बजाय, आप उसे दिखाना चाहते हैं कि क्या करना है, जैसे एक माता-पिता बच्चे को ब्लॉक सजाना या कप में चम्मच रखना सिखाते हैं। यह रोबोट इमिटेशन लर्निंग (robot imitation learning) की दुनिया है। यह विज्ञान की एक शाखा है जहाँ रोबोट इंसानी प्रदर्शनों को देखकर और उनकी नकल करके सीखते हैं। बड़ी चुनौती क्या है? रोबोट अपने हाथ चलाने में तो माहिर होते हैं, लेकिन वे पहले ही कदम में अक्सर बहुत खराब होते हैं: सही चीज़ को सही तरीके से पकड़ना। यदि एक रोबोट कप को हैंडल के बजाय उसके किनारे से पकड़ लेता है, या एक मिलीमीटर की चूक के कारण पेग (peg) को मिस कर देता है, तो पूरा कार्य विफल हो सकता है, और रोबोट को शायद यह समझ न आए कि इसे कैसे ठीक किया जाए। वैज्ञानिक लगातार रोबोट के लिए ऐसे "दिमाग" बनाने की कोशिश कर रहे हैं जो एक बिखरे हुए कमरे को देख सकें, यह तय कर सकें कि किसी वस्तु को पकड़ने का सबसे अच्छा तरीका क्या है, और फिर बिना किसी चीज़ से टकराए उसे पूरी सटीकता से हिला सकें।
अब, GPA-RAM से मिलिए, जो ठीक इसी "पकड़ो-और-चलाओ" (grab-and-go) वाली समस्या को हल करने के लिए डिज़ाइन किया गया एक नया रोबोट दिमाग है। इस प्रोजेक्ट के पीछे के शोधकर्ताओं ने महसूस किया कि कई रोबोट इसलिए विफल हो जाते हैं क्योंकि वे वस्तु को हिलाना शुरू करने से पहले इस बात पर पर्याप्त ध्यान नहीं देते कि वे उसे कैसे पकड़े हुए हैं। उन्होंने एक ऐसा सिस्टम बनाया जो दो चतुर युक्तियों को जोड़ता है। पहला, उन्होंने रोबोट को चीजों को पकड़ने के लिए एक "प्री-ट्रेनिंग" दी, जिसमें उन्हीं वीडियो का उपयोग किया गया जिनका उपयोग वह बाकी कार्य सीखने के लिए करता है। यह एक छात्र को निबंध लिखने के लिए कहने से पहले पेंसिल पकड़ने का एक त्वरित क्विज़ देने जैसा है; रोबोट पहेली को हल करने की कोशिश करने से पहले पकड़ (grip) को सीख जाता है। दूसरा, उन्होंने रोबोट के धीमे, भारी-भरकम इंजन को एक नए, बिजली की तरह तेज़ इंजन से बदल दिया जिसे RAM (रोबोटिक अटेंशन मांबा - Robotic Attention Mamba) कहा जाता है। RAM को एक सुपर-कुशल लाइब्रेरियन के रूप में सोचें जो दृश्य जानकारी के एक विशाल पुस्तकालय को स्कैन कर सकता है और पलक झपकते ही सही किताब ढूंढ सकता है, जबकि पुराने सिस्टम अभिभूत होकर धीमे पड़ जाते थे।
टीम ने इस नए दिमाग का परीक्षण चार अलग-अलग रोबोट सेटअप पर किया, जिसमें वास्तविक भौतिक रोबोट और सिम्युलेटेड (simulated) रोबोट शामिल थे। उन्होंने पाया कि "पकड़ने की प्री-ट्रेनिंग" जोड़ने से, रोबोट कप सजाने, छेद में पेग डालने और दो हाथों के बीच वस्तुओं को ले जाने जैसे कठिन कार्यों में बहुत बेहतर हो गया। RLBench नामक एक मानक परीक्षण पर, नया सिस्टम 87.5% समय सफल रहा, जिसने पिछले सर्वश्रेष्ठ तरीकों को पछाड़ दिया। इससे भी अधिक प्रभावशाली बात यह है कि, एक क्यूब को ले जाने वाले ड्यूल-आर्म (दो हाथों वाले) रोबोट कार्य पर, यह 98% बार सफल रहा, और एक कठिन दो-हाथों वाले इंसर्शन कार्य में, इसकी सफलता दर 16% से उछलकर 56% हो गई। सबसे अच्छी बात? इसने यह सब लगभग 71 फ्रेम्स प्रति सेकंड की गति से किया, जिसका अर्थ है कि यह बिना अटके वास्तविक समय (real-time) में प्रतिक्रिया देने के लिए पर्याप्त तेज़ सोच सकता है। शोधकर्ताओं का सुझाव है कि रोबोट को "पहले पकड़ना, फिर कार्य करना" सिखाने का यह दृष्टिकोण उन्हें वास्तविक दुनिया में बहुत अधिक विश्वसनीय सहायक बना सकता है, जो उन नाजुक कार्यों को संभाल सकते हैं जिनके कारण वे पहले विफल हो जाते थे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।