← नवीनतम पेपर
🤖 machine learning

CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining

यह योगदान CLAMP को प्रस्तुत करता है, जो एक नवीन 3D प्री-ट्रेनिंग फ्रेमवर्क है जो सिम्युलेटेड और वास्तविक दुनिया के कार्यों में रोबोट मैनिपुलेशन पॉलिसियों की सैंपल एफिशिएंसी और प्रदर्शन को बेहतर बनाने के लिए मल्टी-व्यू पॉइंट क्लाउड्स और रोबोटिक एक्शन्स पर कंट्रास्टिव लर्निंग का लाभ उठाता है।

मूल लेखक: I-Chun Arthur Liu, Krzysztof Choromanski, Sandy Huang, Connor Schenck

प्रकाशित 2026-05-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: I-Chun Arthur Liu, Krzysztof Choromanski, Sandy Huang, Connor Schenck

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं, जैसे कि प्लेट पर कप रखना या दराज खोलना। अतीत में, वैज्ञानिक रोबोट को इंसानों द्वारा किए जाने वाले कार्यों के हजारों वीडियो दिखाकर सिखाने की कोशिश करते थे। रोबोट उन गतिविधियों की नकल करने का प्रयास करता था लेकिन अक्सर संघर्ष करता था क्योंकि वह दुनिया को "2D" (एक सपाट तस्वीर की तरह) के रूप में देखता था। वह वास्तव में यह नहीं समझ पाता था कि एक कप एक ठोस वस्तु है जिसमें गहराई है या उसे पकड़ने के लिए उसे किसी चीज़ के चारों ओर से पहुंचना होगा।

यह कार्य CLAMP को पेश करता है, जो रोबोट को प्रशिक्षित करने की एक नई विधि है, जो एक तरह से उन्हें विशिष्ट घरेलू कार्यों को सीखना शुरू करने से पहले ही एक "3D मस्तिष्क" प्रदान करती है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: 2D बनाम 3D दृष्टि

एक मानक रोबोट कैमरे की कल्पना करें जैसे कोई व्यक्ति पेंटिंग को देख रहा हो। आप रंग और आकार देख सकते हैं, लेकिन आप गहराई को महसूस नहीं कर सकते। यदि एक रोबोट पेचकस उठाने की कोशिश करता है, तो वह चूक सकता है क्योंकि वह वस्तु के आसपास के 3D स्थान को पूरी तरह से नहीं समझ पाता है।

CLAMP का समाधान: केवल सपाट छवियों को देखने के बजाय, CLAMP एक 3D पॉइंट क्लाउड (point cloud) बनाता है। कल्पना कीजिए कि रोबोट जो कुछ भी देखता है उसके हर सतह को दर्शाने के लिए दस लाख छोटे बिंदुओं का उपयोग किया जाता है। यह रोबोट को दुनिया की एक "ठोस" समझ देता है और उसे यह जानने की अनुमति देता है कि 3D स्थान में वस्तुओं के किनारे और कोने वास्तव में कहाँ स्थित हैं।

2. "जिम" प्रशिक्षण (Pre-training)

किसी विशिष्ट कार्य (जैसे दराज खोलना) को करने का प्रयास करने से पहले, रोबोट एक कंप्यूटर सिमुलेशन में एक बड़े "जिम" सत्र से गुजरता है। इसे प्री-ट्रेनिंग (pre-training) कहा जाता है।

  • वर्कआउट: रोबोट लाखों सिम्युलेटेड रोबोटिक गतिविधियों को देखता है।
  • सबक: यह तीन चीजों को जोड़ना सीखता है:
    1. वह क्या देखता है (वस्तुओं का 3D आकार)।
    2. वह क्या करता है (उसके हाथ की गतिविधियों का इतिहास)।
    3. उसे क्या बताया जाता है (टेक्स्ट विवरण जैसे "कैन ओपनर को बाएं कम्पार्टमेंट में रखें")।
  • जादुई ट्रिक (Contrastive Learning): "मेमोरी" के खेल की कल्पना करें। रोबोट को एक दृश्य की छवि और कार्यों की एक सूची दिखाई जाती है। उसे सही छवि को सही क्रिया के साथ मिलाना होता है। यदि वह पेचकस की छवि को "पेचकस को पकड़ें" की क्रिया के साथ मिलाता है, तो उसे एक अंक मिलता है। यदि वह पेचकस की छवि को "कैंची को पकड़ें" की क्रिया के साथ मिलाता है, तो वह अंक खो देता है। लाखों प्रयासों के बाद, वह देखने और जानने के बीच के गहरे संबंध को सीख जाता है कि किसी वस्तु को पकड़ने के लिए कैसे हिलना है।

3. "रिस्ट-कैमरा" (Wrist-Camera) का लाभ

इस कार्य की एक प्रमुख खोज यह है कि रोबोटों को छत पर लगे फिक्स्ड कैमरे से नहीं, बल्कि अपने हाथों से देखना चाहिए।

  • उपमा: कल्पना कीजिए कि आप सुई में धागा पिरोने की कोशिश कर रहे हैं जबकि कोई दूसरा दीवार पर टॉर्च पकड़कर खड़ा है। वह कठिन है। लेकिन यदि आप स्वयं टॉर्च पकड़ते हैं ("रिस्ट व्यू"), तो आप स्पष्ट रूप से देख सकते हैं कि आप क्या कर रहे हैं।
  • CLAMP का कदम: यह रोबोट की कलाइयों पर लगे कैमरों का अनुकरण करता है। यह रोबोट को वस्तुओं को स्पष्ट रूप से देखने में मदद करता है, भले ही उसके अपने हाथ दृश्य को बाधित कर रहे हों, जो उच्च-परिशुद्धता (high-precision) वाले कार्यों के लिए महत्वपूर्ण है।

4. "हेड स्टार्ट" (Fine-tuning)

अपने "जिम" प्रशिक्षण को पूरा करने के बाद, रोबोट एक वास्तविक कार्य सीखने के लिए तैयार है।

  • पुराना तरीका: आमतौर पर, आपको रोबोट को एक नए कार्य के कुछ सौ उदाहरण दिखाकर शून्य से शुरुआत करनी होती है, और इसमें बहुत समय लगता है।
  • CLAMP का तरीका: चूंकि रोबोट पहले से ही 3D स्थान को समझता है और जानता है कि क्रियाएं वस्तुओं से कैसे संबंधित हैं, इसलिए उसे एक नया कार्य सीखने के लिए केवल बहुत कम उदाहरणों (जैसे 4,500 प्रदर्शनों) की आवश्यकता होती है। यह एक ऐसे छात्र की तरह है जिसने पहले से ही पढ़ना और लिखना सीख लिया है; उन्हें केवल एक नए विषय के लिए विशिष्ट शब्दावली सीखने की आवश्यकता है, न कि पेन पकड़ना फिर से सीखने की।

5. परिणाम

लेखकों ने छह अलग-अलग सिम्युलेटेड कार्यों (जैसे कैन ओपनर को कम्पार्टमेंट में रखना) और पांच वास्तविक दुनिया के कार्यों (जैसे दराज खोलना या रीसाइक्लिंग कैन) पर CLAMP का परीक्षण किया।

  • परिणाम: CLAMP अन्य शीर्ष विधियों की तुलना में काफी बेहतर और तेज़ था। वास्तविक दुनिया में, इसने इस 3D प्री-ट्रेनिंग के बिना प्रशिक्षित रोबोटों की तुलना में दराज खोलने और प्लेट पर कप रखने के कार्य बहुत अधिक बार सफलतापूर्वक पूरे किए।

सारांश

CLAMP एक रोबोट बूटकैंप की तरह है। केवल रोबोट को एक विशिष्ट काम कैसे करना है यह सिखाने के बजाय, यह रोबोट को 3D में दुनिया को देखना और उस स्थान के भीतर उसके शरीर के हिलने-डुलने को सिखाता है। एक बार जब रोबोट के पास 3D वस्तुओं और गतिविधियों के बारे में यह सामान्य "कॉमन सेंस" ज्ञान आ जाता है, तो वह नए, विशिष्ट घरेलू कार्यों को अविश्वसनीय रूप से तेज़ी से और सटीकता से सीख सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →