← नवीनतम पेपर
🤖 machine learning

SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding

SPEAR-1 एक रोबोटिक फाउंडेशन मॉडल है जो बड़े पैमाने पर, 3D-एनोटेटेड गैर-रोबोटिक डेटा पर प्रशिक्षित 3D स्थानिक तर्क क्षमताओं के साथ एक प्रीट्रेंड विजन-लैंग्वेज मॉडल को बढ़ाकर उत्कृष्ट एम्बोडीड कंट्रोल प्राप्त करता है, जिससे यह 20×\times कम रोबोटिक प्रदर्शनों का उपयोग करते हुए भी अत्याधुनिक मॉडलों से बेहतर प्रदर्शन करने में सक्षम होता है।

मूल लेखक: Nikolay Nikolov, Giuliano Albanese, Sombit Dey, Aleksandar Yanev, Luc Van Gool, Jan-Nico Zaech, Danda Pani Paudel

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Nikolay Nikolov, Giuliano Albanese, Sombit Dey, Aleksandar Yanev, Luc Van Gool, Jan-Nico Zaech, Danda Pani Paudel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बच्चे को एक जटिल वीडियो गेम खेलना सिखा रहे हैं। वर्तमान की अधिकांश विधियाँ बच्चे को लाखों घंटों के पेशेवर गेमप्ले को दिखाकर सिखाने की कोशिश करती हैं। बच्चा अंततः यह सीख जाता है कि कौन से बटन दबाने हैं, लेकिन वह वास्तव में यह नहीं समझ पाता कि वह उन्हें क्यों दबा रहा है। यदि आप कंट्रोलर को हिला दें या कमरे की रोशनी बदल दें, तो बच्चा घबरा जाता है क्योंकि वह 3D स्पेस को नहीं समझता—वह केवल बटनों के पैटर्न को जानता है।

SPEAR-1 रोबोट्स को सिखाने का एक नया तरीका है जो उनके पाठ्यक्रम (curriculum) को बदल देता है। केवल उन्हें "कैसे हिलना है" दिखाने के बजाय, यह पहले उन्हें "दुनिया कैसे काम करती है" यह सिखाता है।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, कुछ सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "नकलची" रोबोट

अधिकांश वर्तमान रोबोट फाउंडेशन मॉडल्स (RFMs) अत्यधिक कुशल नकलचियों की तरह हैं। वे एक इंसान को कप हिलाते हुए देखते हैं और ठीक उसी गति की नकल करने की कोशिश करते हैं। हालाँकि, क्योंकि वे 2D छवियों (सपाट चित्रों) पर प्रशिक्षित हैं, उनमें "स्थानिक गहराई" (spatial depth) की कमी होती है। उनके लिए, एक कप केवल रंगीन पिक्सेल का एक समूह है। यदि आप कप को दो इंच बाईं ओर खिसका देते हैं या मेज का रंग बदल देते हैं, तो "नकलची" भ्रमित हो जाता है क्योंकि 2D पैटर्न बदल गया है।

2. समाधान: "3D विजन" स्कूल (SPEAR-VLM)

इससे पहले कि शोधकर्ता रोबोट को किसी वास्तविक वस्तु को छूने दें, उन्होंने उसे "स्पेशियल अवेयरनेस" (स्थानिक जागरूकता) का बूटकैंप कराया जिसे SPEAR-VLM कहा जाता है।

इसे एक व्यक्ति को केवल स्पर्श की भावना और एक मानसिक मानचित्र का उपयोग करके, आँखों पर पट्टी बांधकर एक कमरे में नेविगेट करना सीखने जैसा समझें। केवल मॉडल को सपाट तस्वीरें दिखाने के बजाय, उन्होंने उसे एक "डेप्थ सेंसर" (जैसे कि सेल्फ-ड्राइविंग कार में सेंसर होते हैं) दिया। फिर उन्होंने उससे ऐसे प्रश्न पूछे जैसे: "चम्मच, कटोरे से कितनी दूर है?" या "उस गाजर के 3D कोने क्या हैं?"

लाखों सामान्य इंटरनेट फोटो (यहाँ तक कि रोबोट वीडियो भी नहीं!) के साथ ऐसा करके, मॉडल ने एक "मानसिक 3D मानचित्र" विकसित किया। उसने सीखा कि वस्तुएं केवल सपाट आकृतियाँ नहीं हैं; वे ठोस चीजें हैं जो ऊंचाई, चौड़ाई और गहराई के साथ एक 3D दुनिया में मौजूद हैं।

3. परिणाम: "स्मार्ट एथलीट" (SPEAR-1)

एक बार जब मॉडल के पास यह 3D "मस्तिष्क" आ गया, तब उन्होंने अंततः इसे वास्तविक रोबोटिक भुजाओं (robot arms) से परिचित कराया। क्योंकि रोबोट पहले से ही 3D स्पेस को समझता था, इसलिए उसे हर एक गतिविधि के लिए अरबों उदाहरण देखने की आवश्यकता नहीं थी।

"20x दक्षता" का चमत्कार:
कल्पना कीजिए कि दो छात्र गणित की परीक्षा के लिए पढ़ाई कर रहे हैं।

  • छात्र A (पुराना तरीका) टेक्स्टबुक के हर एक संभावित गणित के सवाल को रटने की कोशिश करता है। पास होने के लिए उन्हें 1,000,000 सवाल देखने की आवश्यकता है।
  • छात्र B (SPEAR-1) पहले गणित के वास्तविक नियमों को सीखने में समय बिताता है। क्योंकि वह तर्क (logic) को समझता है, उसे पास होने के लिए केवल 50,000 सवालों को देखने की आवश्यकता है।

SPEAR-1 छात्र B है। इसने दुनिया के सर्वश्रेष्ठ रोबोट्स के समान (या बेहतर) परिणाम प्राप्त किए, जबकि इसमें 20 गुना कम वास्तविक रोबोट प्रदर्शन डेटा का उपयोग किया गया।

यह क्यों मायने रखता है?

वास्तविक रोबोट से डेटा एकत्र करना अविश्वसनीय रूप से महंगा, धीमा और थकाऊ है। आपको एक रोबोटिक हाथ को हजारों बार शारीरिक रूप से हिलाना पड़ता है, जिससे मशीन टूट सकती है या महीनों का मानव श्रम लग सकता है।

SPEAR-1 साबित करता है कि हम सिस्टम को "धोखा" दे सकते हैं। हम इंटरनेट पर पहले से उपलब्ध विशाल मात्रा में 2D छवियों और 3D डेटा का उपयोग करके रोबोट को "शुरुआती बढ़त" (head start) दे सकते हैं। यह हमें उस भविष्य के बहुत करीब लाता है जहाँ रोबोट एक बिल्कुल नए किचन में चल सकते हैं जिसे उन्होंने पहले कभी नहीं देखा है, और वे जानते हैं कि बिना किसी इंसान द्वारा हर एक मूवमेंट सिखाए, मग को कैसे पकड़ना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →