← नवीनतम पेपर
🤖 machine learning

Grounding Bodily Awareness in Visual Representations for Efficient Policy Learning

यह शोध पत्र ICon को प्रस्तुत करता है, जो विजन ट्रांसफॉर्मर्स के लिए एक कंट्रास्टिव लर्निंग विधि है जो बॉडी-अवेयर विजुअल रिप्रजेंटेशन बनाने के लिए एजेंट-विशिष्ट और एनवायरनमेंट-विशिष्ट टोकन को अलग करता है, जिससे रोबोटिक मैनिपुलेशन कार्यों में पॉलिसी लर्निंग की दक्षता और क्रॉस-रोबोट ट्रांसफरेबिलिटी बढ़ती है।

मूल लेखक: Junlin Wang, Zhiyun Lin

प्रकाशित 2026-02-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junlin Wang, Zhiyun Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं, जैसे बर्तन पर ढक्कन रखना या दराज बंद करना। आप रोबोट को एक इंसान द्वारा ये काम करने के हजारों वीडियो दिखाते हैं। रोबोट के पास एक कैमरा (उसकी आँखें) और एक दिमाग (उसका पॉलिसी नेटवर्क) है जो यह समझने की कोशिश करता है कि आगे क्या करना है।

समस्या: "बहुत अधिक शोर" की दुविधा (The "Too Much Noise" Dilemma)
समस्या यह है कि रोबोट का कैमरा सब कुछ देखता है: रोबोट का अपना हाथ, मेज, बर्तन, बैकग्राउंड की दीवार और लाइटिंग। यह ऐसा है जैसे आप पूरे शहर के स्काईलाइन, अन्य कारों, पेड़ों और सड़क को एक साथ देखते हुए कार चलाना सीखने की कोशिश कर रहे हों। रोबोट भ्रमित हो जाता है। वह "मैं" (रोबोट का हाथ) और "दुनिया" (बाकी सब कुछ) के बीच अंतर करने में संघर्ष करता है।

पारंपरिक AI ट्रेनिंग में, रोबोट एक साथ सब कुछ सीखने की कोशिश करता है। कभी-कभी, वह बैकग्राउंड के विवरणों (जैसे दीवार का रंग) पर इतना ध्यान केंद्रित कर देता है कि वह अपने हाथ पर ध्यान देना भूल जाता है। इससे सीखना धीमा और अनाड़ी हो जाता है।

समाधान: ICon (Inter-token Contrast)
इस पेपर के लेखक, जुनलिन वांग और ज़ियुन लिन ने एक चतुर तकनीक निकाली जिसे ICon कहा जाता है। ICon को रोबोट के लिए एक "आत्म-जागरूकता कोच" (Self-Awareness Coach) के रूप में समझें।

यह कैसे काम करता है, इसके लिए एक सरल उपमा यहाँ दी गई है:

1. "मोज़ेक" दिमाग (Vision Transformers)

आधुनिक रोबोट अक्सर विज़न ट्रांसफॉर्मर नामक प्रकार के AI का उपयोग करते हैं। कल्पना कीजिए कि रोबोट का कैमरा फीड केवल एक बड़ी तस्वीर नहीं है, बल्कि हजारों छोटे टाइल्स (जिन्हें "टोकन" कहा जाता है) से बना एक विशाल मोज़ेक है।

  • कुछ टाइल्स रोबोट का हाथ दिखाते हैं।
  • कुछ टाइल्स बर्तन दिखाते हैं।
  • कुछ टाइल्स बैकग्राउंड दिखाते हैं।

2. "क्लस्टरिंग" गेम

ICon विधि रोबोट को इन टाइल्स के साथ एक सॉर्टिंग गेम खेलने के लिए प्रशिक्षित करती है।

  • नियम: "जो टाइल्स मुझे (रोबोट को) दिखाते हैं, वे एक-दूसरे के बहुत समान होने चाहिए। जो टाइल्स दुनिया को दिखाते हैं, वे भी एक-दूसरे के समान होने चाहिए। लेकिन 'मैं' और 'दुनिया' एक-दूसरे से बहुत अलग होने चाहिए, जैसे तेल और पानी।"
  • परिणाम: रोबोट का दिमाग एक स्पष्ट मानसिक सीमा बनाना सीख जाता है। वह बैकग्राउंड से विचलित होना बंद कर देता है और अपने शरीर की गतिविधियों पर तीव्रता से ध्यान केंद्रित करता है। इसे बॉडीली अवेयरनेस (Bodily Awareness) या विजुअल प्रोप्रियोसेप्शन (Visual Proprioception) कहा जाता है।

3. "फार्टेस्ट पॉइंट" ट्रिक (The "Farthest Point" Trick)

यह सुनिश्चित करने के लिए कि रोबोट अपने हाथ के केवल कुछ यादृच्छिक (random) टाइल्स को सीखने के लिए न चुन ले, लेखक फार्टेस्ट पॉइंट सैंपलिंग (Farthest Point Sampling - FPS) नामक तकनीक का उपयोग करते हैं।

  • उपमा: कल्पना कीजिए कि आप किसी ऐसे व्यक्ति को फुटबॉल के मैदान का वर्णन करने की कोशिश कर रहे हैं जिसने कभी मैदान नहीं देखा है। यदि आप केवल तीन स्थान चुनते हैं जो गोल पोस्ट के बिल्कुल पास हैं, तो आपका वर्णन पक्षपाती होगा।
  • सुधार: FPS रोबोट को ऐसे टाइल्स चुनने के लिए मजबूर करता है जो उसके पूरे शरीर में फैले हुए हों। यह सुनिश्चित करता है कि रोबोट अपने पूरे आकार को समझे, न कि केवल एक छोटे से हिस्से को।

4. "मल्टी-लेवल" गहरी समझ (The "Multi-Level" Deep Dive)

आमतौर पर AI परतों में सीखता है, जैसे प्याज के छिलके उतारना। बाहरी परतें सरल आकृतियाँ (किनारे) देखती हैं, और आंतरिक परतें जटिल वस्तुओं को देखती हैं।

  • लेखकों ने महसूस किया कि केवल अंत में इस "स्वयं बनाम दुनिया" के खेल को सिखाना पर्याप्त नहीं था।
  • इसलिए, उन्होंने इस नियम को मस्तिष्क के प्रत्येक स्तर पर लागू किया, सरल किनारों से लेकर जटिल आकृतियों तक। यह सुनिश्चित करता है कि रोबोट हर स्तर के विवरण पर अपने शरीर को समझता है, "हाथ के आकार" से लेकर "ग्रिपर की गति" तक।

यह क्यों मायने रखता है?

इस पेपर का परीक्षण 8 अलग-अलग कार्यों (जैसे ब्लॉक स्टैकिंग या दरवाजे खोलना) के साथ 3 अलग-अलग प्रकार के रोबोट पर किया गया।

  • बेहतर प्रदर्शन: रोबोट ने अपने कार्यों को तेज़ी से सीखा और वे अधिक सफल रहे।
  • बेहतर ट्रांसफर (Better Transfer): यह सबसे शानदार हिस्सा है। यदि आप एक "फ्रंका" (Franka) आर्म पर एक रोबोट को प्रशिक्षित करते हैं, और फिर उसे एक "किनोवा" (Kinova) आर्म वाले रोबोट को दे देते हैं (जो अलग दिखता है), तो रोबोट बहुत तेज़ी से अनुकूलित हो जाता है। क्योंकि उसने केवल "फ्रंका के हाथ" को याद करने के बजाय "मेरे शरीर" की अवधारणा सीखी है, वह उस ज्ञान को नए शरीरों पर आसानी से लागू कर सकता है।
  • स्थिरता (Stability): अन्य तरीकों के विपरीत जो छवि को "पुनर्निर्मित" (reconstruct) करने की कोशिश करते हैं (जिससे प्रशिक्षण अस्थिर हो सकता है और क्रैश हो सकता है), ICon एक कोमल धक्का है जो प्रशिक्षण को सुचारू और स्थिर रखता है।

निष्कर्ष (The Bottom Line)

यह पेपर रोबोट को खुद को जानने के बारे में है। रोबोट को हर तस्वीर में "मैं" और "दुनिया" के बीच स्पष्ट अंतर करने के लिए मजबूर करके, रोबोट एक बहुत बेहतर, तेज़ और अधिक अनुकूलन योग्य शिक्षार्थी बन जाता है। यह एक ऐसे छात्र के बीच का अंतर है जो कक्षा के शोर से विचलित है और एक ऐसे छात्र के बीच का अंतर है जो पूरी तरह से अपनी गतिविधियों पर केंद्रित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →