SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding
SPEAR-1 एक रोबोटिक फाउंडेशन मॉडल है जो बड़े पैमाने पर, 3D-एनोटेटेड गैर-रोबोटिक डेटा पर प्रशिक्षित 3D स्थानिक तर्क क्षमताओं के साथ एक प्रीट्रेंड विजन-लैंग्वेज मॉडल को बढ़ाकर उत्कृष्ट एम्बोडीड कंट्रोल प्राप्त करता है, जिससे यह 20 कम रोबोटिक प्रदर्शनों का उपयोग करते हुए भी अत्याधुनिक मॉडलों से बेहतर प्रदर्शन करने में सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बच्चे को एक जटिल वीडियो गेम खेलना सिखा रहे हैं। वर्तमान की अधिकांश विधियाँ बच्चे को लाखों घंटों के पेशेवर गेमप्ले को दिखाकर सिखाने की कोशिश करती हैं। बच्चा अंततः यह सीख जाता है कि कौन से बटन दबाने हैं, लेकिन वह वास्तव में यह नहीं समझ पाता कि वह उन्हें क्यों दबा रहा है। यदि आप कंट्रोलर को हिला दें या कमरे की रोशनी बदल दें, तो बच्चा घबरा जाता है क्योंकि वह 3D स्पेस को नहीं समझता—वह केवल बटनों के पैटर्न को जानता है।
SPEAR-1 रोबोट्स को सिखाने का एक नया तरीका है जो उनके पाठ्यक्रम (curriculum) को बदल देता है। केवल उन्हें "कैसे हिलना है" दिखाने के बजाय, यह पहले उन्हें "दुनिया कैसे काम करती है" यह सिखाता है।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, कुछ सरल उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: "नकलची" रोबोट
अधिकांश वर्तमान रोबोट फाउंडेशन मॉडल्स (RFMs) अत्यधिक कुशल नकलचियों की तरह हैं। वे एक इंसान को कप हिलाते हुए देखते हैं और ठीक उसी गति की नकल करने की कोशिश करते हैं। हालाँकि, क्योंकि वे 2D छवियों (सपाट चित्रों) पर प्रशिक्षित हैं, उनमें "स्थानिक गहराई" (spatial depth) की कमी होती है। उनके लिए, एक कप केवल रंगीन पिक्सेल का एक समूह है। यदि आप कप को दो इंच बाईं ओर खिसका देते हैं या मेज का रंग बदल देते हैं, तो "नकलची" भ्रमित हो जाता है क्योंकि 2D पैटर्न बदल गया है।
2. समाधान: "3D विजन" स्कूल (SPEAR-VLM)
इससे पहले कि शोधकर्ता रोबोट को किसी वास्तविक वस्तु को छूने दें, उन्होंने उसे "स्पेशियल अवेयरनेस" (स्थानिक जागरूकता) का बूटकैंप कराया जिसे SPEAR-VLM कहा जाता है।
इसे एक व्यक्ति को केवल स्पर्श की भावना और एक मानसिक मानचित्र का उपयोग करके, आँखों पर पट्टी बांधकर एक कमरे में नेविगेट करना सीखने जैसा समझें। केवल मॉडल को सपाट तस्वीरें दिखाने के बजाय, उन्होंने उसे एक "डेप्थ सेंसर" (जैसे कि सेल्फ-ड्राइविंग कार में सेंसर होते हैं) दिया। फिर उन्होंने उससे ऐसे प्रश्न पूछे जैसे: "चम्मच, कटोरे से कितनी दूर है?" या "उस गाजर के 3D कोने क्या हैं?"
लाखों सामान्य इंटरनेट फोटो (यहाँ तक कि रोबोट वीडियो भी नहीं!) के साथ ऐसा करके, मॉडल ने एक "मानसिक 3D मानचित्र" विकसित किया। उसने सीखा कि वस्तुएं केवल सपाट आकृतियाँ नहीं हैं; वे ठोस चीजें हैं जो ऊंचाई, चौड़ाई और गहराई के साथ एक 3D दुनिया में मौजूद हैं।
3. परिणाम: "स्मार्ट एथलीट" (SPEAR-1)
एक बार जब मॉडल के पास यह 3D "मस्तिष्क" आ गया, तब उन्होंने अंततः इसे वास्तविक रोबोटिक भुजाओं (robot arms) से परिचित कराया। क्योंकि रोबोट पहले से ही 3D स्पेस को समझता था, इसलिए उसे हर एक गतिविधि के लिए अरबों उदाहरण देखने की आवश्यकता नहीं थी।
"20x दक्षता" का चमत्कार:
कल्पना कीजिए कि दो छात्र गणित की परीक्षा के लिए पढ़ाई कर रहे हैं।
- छात्र A (पुराना तरीका) टेक्स्टबुक के हर एक संभावित गणित के सवाल को रटने की कोशिश करता है। पास होने के लिए उन्हें 1,000,000 सवाल देखने की आवश्यकता है।
- छात्र B (SPEAR-1) पहले गणित के वास्तविक नियमों को सीखने में समय बिताता है। क्योंकि वह तर्क (logic) को समझता है, उसे पास होने के लिए केवल 50,000 सवालों को देखने की आवश्यकता है।
SPEAR-1 छात्र B है। इसने दुनिया के सर्वश्रेष्ठ रोबोट्स के समान (या बेहतर) परिणाम प्राप्त किए, जबकि इसमें 20 गुना कम वास्तविक रोबोट प्रदर्शन डेटा का उपयोग किया गया।
यह क्यों मायने रखता है?
वास्तविक रोबोट से डेटा एकत्र करना अविश्वसनीय रूप से महंगा, धीमा और थकाऊ है। आपको एक रोबोटिक हाथ को हजारों बार शारीरिक रूप से हिलाना पड़ता है, जिससे मशीन टूट सकती है या महीनों का मानव श्रम लग सकता है।
SPEAR-1 साबित करता है कि हम सिस्टम को "धोखा" दे सकते हैं। हम इंटरनेट पर पहले से उपलब्ध विशाल मात्रा में 2D छवियों और 3D डेटा का उपयोग करके रोबोट को "शुरुआती बढ़त" (head start) दे सकते हैं। यह हमें उस भविष्य के बहुत करीब लाता है जहाँ रोबोट एक बिल्कुल नए किचन में चल सकते हैं जिसे उन्होंने पहले कभी नहीं देखा है, और वे जानते हैं कि बिना किसी इंसान द्वारा हर एक मूवमेंट सिखाए, मग को कैसे पकड़ना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।