Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning
यह शोध पत्र R&B-EnCoRe प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित (self-supervised) ढांचा है जो एम्बोडीड रीजनिंग (embodied reasoning) को एक लेटेंट वेरिएबल के रूप में मानकर उसे बूटस्ट्रैप करता है ताकि इंटरनेट-स्केल ज्ञान से एक्शन-प्रेडिक्टिव रणनीतियों को आसवन (distill) किया जा सके, जिससे बिना किसी कठोर टेम्पलेट या बाहरी पुरस्कारों पर निर्भर रहे विभिन्न VLA मॉडलों में हेरफेर (manipulation), नेविगेशन और ड्राइविंग प्रदर्शन में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कोई कार्य करना सिखा रहे हैं, जैसे कि एक लाल मिर्च को पीली टोकरी में डालना। अतीत में, शोधकर्ताओं ने रोबोट को "सोचने" में मदद करने के लिए उसे एक सख्त, पूर्व-लिखित स्क्रिप्ट का पालन करने के लिए मजबूर करके प्रयास किया था। वे रोबोट को बताते थे: "पहले, कमरे में मौजूद हर चीज़ को देखो। दूसरा, तुम्हें दिखने वाली हर एक वस्तु की सूची बनाओ। तीसरा, मौसम के बारे में सोचो। चौथा, अपनी चाल की योजना बनाओ।"
समस्या यह है कि यह "एक ही आकार के लिए सभी" (one-size-fits-all) वाला स्क्रिप्ट अक्सर शोर (noise) से भरा होता है। रोबोट अपनी मानसिक शक्ति उस प्लेट और चम्मच को सूचीबद्ध करने में खर्च कर सकता है जिनका मिर्च से कोई लेना-देना नहीं है, या घर के अंदर होने पर मौसम के बारे में चिंता कर सकता है। यह रोबोट को वास्तविक लक्ष्य से विचलित करता है, जिससे वह धीमा हो जाता है और उसके विफल होने की संभावना बढ़ जाती है।
समाधान: R&B-EnCoRe
यह शोध पत्र एक नई विधि पेश करता है जिसे R&B-EnCoRe (Refine and Bootstrap Embodiment-specific Chain-of-Thought Reasoning) कहा जाता है। इसे एक स्मार्ट संपादक (smart editor) के रूप में समझें जो रोबोट को यह सीखने में मदद करता है कि क्या सोचना है, बजाय इसके कि उसे ठीक से क्या सोचना है।
यह कैसे काम करता है, यहाँ एक सरल उपमा दी गई है:
1. "विचार मंथन" चरण (Warmstarting)
कल्पना कीजिए कि आप किसी व्यंजन के लिए एकदम सही रेसिपी लिखने की कोशिश कर रहे हैं। आपको एक निश्चित रेसिपी देने के बजाय, आपको सामग्रियों का एक बड़ा थैला (तर्क संबंधी विचार) दिया जाता है जैसे "सभी वस्तुओं की सूची बनाएं," "चरणों की योजना बनाएं," "ग्रिपर की स्थिति की जांच करें," या "मौसम के बारे में सोचें।"
R&B-EnCoRe इन सामग्रियों को बेतरतीब ढंग से मिलाने से शुरू होता है। कभी-कभी यह रोबोट को केवल चरणों वाली रेसिपी देता है। कभी-कभी यह सभी वस्तुओं को सूचीबद्ध करने वाली रेसिपी देता है। कभी-कभी इसमें मौसम शामिल होता है, और कभी-कभी नहीं। इसे Reasoning Dropout कहा जाता है। यह एक शेफ की तरह है जो यह देखने के लिए हजारों अलग-अलग सामग्री संयोजनों को आजमा रहा है कि कौन सा वास्तव में व्यंजन का स्वाद बढ़ाता है।
2. "स्वाद परीक्षण" (Self-Supervised Refinement)
अब, रोबोट को कैसे पता चलेगा कि कौन सी रेसिपी सबसे अच्छी है? आमतौर पर, आपको एक मानव स्वाद-परीक्षक की आवश्यकता होगी जो कहे, "यह अच्छी है, वह बुरी है।" लेकिन रोब्वोटिक्स में, हमारे पास हर हरकत को देखते हुए एक मानव उपलब्ध नहीं होता है।
R&B-EnCoRe एक चतुर तकनीक का उपयोग करता है जिसे Importance Weighted Variational Inference कहा जाता है।
- उपमा: कल्पना कीजिए कि रोबोट एक अपराध सुलझाने की कोशिश कर रहा है (कार्य)। वह इस बारे में कई अलग-अलग "सिद्धांतों" (reasoning traces) को उत्पन्न करता है कि क्या हुआ था।
- परीक्षण: रोबोट फिर खुद से पूछता है: "यदि मैं सिद्धांत A का उपयोग करता हूँ, तो अपराधी को पकड़ने (कार्य को सही ढंग से करने) की कितनी संभावना है? यदि मैं सिद्धांत B का उपयोग करता हूँ, तो कितनी संभावना है?"
- परिणाम: यह विधि स्वचालित रूप से प्रत्येक सिद्धांत के लिए एक "स्कोर" की गणना करती है। सिद्धांत जो रोबोट को सही क्रिया का अनुमान लगाने में मदद करते हैं, उन्हें उच्च स्कोर मिलता है। सिद्धांत जो केवल शोर (जैसे अप्रासंगिक वस्तुओं को सूचीबद्ध करना या मौसम के बारे में बात करना) हैं, उन्हें कम स्कोर मिलता है।
3. "अंतिम मेनू" (Bootstrapping)
एक बार जब रोबोट इन हजारों "सिद्धांतों" का परीक्षण कर लेता है, तो वह एक नया, परिष्कृत डेटासेट बनाता है। वह कम स्कोर वाले, विचलित करने वाले विचारों को फेंक देता है और केवल उच्च स्कोर वाले, सहायक विचारों को रखता है।
- एक रोबोटिक हाथ के लिए: वह सीखता है कि "ग्रिपर कहाँ है" और "अगला उप-चरण क्या है" के बारे में सोचना महत्वपूर्ण है, लेकिन कमरे में मौजूद हर एक वस्तु को सूचीबद्ध करना समय की बर्बादी है।
- चलने वाले रोबोट के लिए: वह सीखता है कि इलाके (affordances - जैसे फिसलन भरी बर्फ) के बारे में सोचना महत्वपूर्ण है, लेकिन "सामाजिक मानदंडों" या "मौसम" के बारे में सोचना अप्रासंगिक है।
रोबोट फिर इस नए, साफ "मेनू" के विचारों का उपयोग करके खुद को फिर से प्रशिक्षित करता है। वह केवल उन्हीं चीजों के बारे में सोचना सीखता है जो उसके विशिष्ट शरीर और कार्य के लिए मायने रखती हैं।
परिणाम: कम शोर, अधिक सफलता
शोध पत्र ने तीन बहुत ही अलग प्रकार के रोबोटों पर इसका परीक्षण किया:
- रोबोटिक हाथ (Manipulation): रोबोट कार्य पूरा करने में 28% बेहतर हो गया। उसने अप्रासंगिक वस्तुओं को सूचीबद्ध करने में समय बर्बाद करना बंद कर दिया और मिर्च और टोकरी पर ध्यान केंद्रित किया।
- चलने वाले रोबोट (Legged Navigation): रोबोटों ने अपने नेविगेशन स्कोर में 101% का सुधार किया। उन्होंने अप्रासंगिक विवरणों के बजाय इलाके (terrain) पर ध्यान केंद्रित करना सीखा (क्या यह फिसलन भरा है?)।
- स्व-चालित कारें (Self-Driving Cars): कारों ने अपनी टक्कर दर में 21% की कमी की। उन्होंने विचलित करने वाले विचारों को अनदेखा करना और सड़क और अन्य कारों पर ध्यान केंद्रित करना सीखा।
मुख्य निष्कर्ष
शोध पत्र का दावा है कि "तर्क" (reasoning) को एक छिपे हुए चर (hidden variable) के रूप में मानकर जिसे रोबोट स्वयं खोज और अनुकूलित कर सकता है, हम ऐसे रोबोट बना सकते हैं जो अधिक स्मार्ट, तेज़ और कुशल हों। उन्हें हमारे द्वारा लिखे गए पूर्ण स्क्रिप्ट की आवश्यकता नहीं है। इसके बजाय, वे इंटरनेट के विशाल, अव्यवित ज्ञान को ले सकते हैं, शोर को फ़िल्टर कर सकते हैं, और काम पूरा करने के लिए ठीक वही सोच सकते हैं जो आवश्यक है।
संक्षेप में: R&B-EnCoRe रोबोट को अत्यधिक सोचने के बजाय सही चीजों के बारे में सोचना सिखाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।