← नवीनतम पेपर
💻 computer science

LACE: Latent Visual Representation for Cross-Embodiment Learning

LACE एक ऐसा फ्रेमवर्क है जो मानव और रोबोटिक स्वरूपों के बीच के दृश्य अंतर को कम करने के लिए उनके लेटेंट विजुअल रिप्रेजेंटेशन को विरल, स्वचालित रूप से उत्पन्न शरीर के अंगों के पत्राचार के माध्यम से संरेखित करता है, जिससे रोबट सीमित रोबोट-विशिष्ट प्रशिक्षण डेटा के बावजूद नीति सीखने के लिए प्रचुर मानव प्रदर्शन डेटा का प्रभावी ढंग से लाभ उठा पाते हैं।

मूल लेखक: Yoo Sung Jang, Kanchana Ranasinghe, Cristina Mata, Yichi Zhang, Jorge Mendez-Mendez, Michael S. Ryoo

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yoo Sung Jang, Kanchana Ranasinghe, Cristina Mata, Yichi Zhang, Jorge Mendez-Mendez, Michael S. Ryoo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को खिलौना उठाना सिखाने की कोशिश कर रहे हैं। आपके पास इंसानों द्वारा इसे पूरी तरह से करने के हजारों वीडियो हैं, लेकिन आपके पास रोबोट द्वारा इसे करने के केवल कुछ ही वीडियो हैं।

समस्या यह है कि इंसान और रोबोट बहुत अलग दिखते हैं। एक मानव हाथ में त्वचा, झुर्रियां और पांच उंगलियां होती हैं जो विशिष्ट तरीकों से मुड़ती हैं। एक रोबोट का हाथ धातु से बना हो सकता है, उसमें चार उंगलियां हो सकती हैं, या वह किसी पंजे जैसा दिख सकता है। क्योंकि वे बहुत अलग हैं, रोबोट का "दिमाग" (उसका कंप्यूटर विजन) भ्रमित हो जाता है। वह एक वीडियो में मानव हाथ देखता है और सोचता है, "यह एक इंसान है," लेकिन जब वह अपने स्वयं के धातु के हाथ को देखता है, तो वह सोचता है, "यह कुछ और ही है।" वह दोनों को जोड़ नहीं पाता, इसलिए वह मानव वीडियो से सीख नहीं पाता।

यह पेपर LACE (लेटेंट अलाइनमेंट फॉर क्रॉस-एम्बॉडमेंट लर्निंग) नामक एक समाधान पेश करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "भाषा" की समस्या

रोबोट के दिमाग को एक ऐसे छात्र के रूप में सोचें जो "लेटेंट स्पेस" नामक एक जटिल भाषा बोलता है। इस भाषा का उपयोग वह जो देखता है उसे वर्णित करने के लिए करता है।

  • समस्या: जब रोबोट एक मानव हाथ को देखता है, तो वह इस भाषा की एक बोली (dialect) में उसका वर्णन करता है। जब वह अपने स्वयं के धातु के हाथ को देखता है, तो वह इस भाषा की बिल्कुल अलग बोली में उसका वर्णन करता है। भले ही दोनों "हाथ" हों, रोबोट को लगता है कि वे असंबंधित शब्द हैं।
  • परिणाम: रोबोट मानव वीडियो को अनदेखा कर देता है क्योंकि वह उस "बोली" को नहीं समझ पाता जो इंसान बोल रहा है।

2. LACE समाधान: एक सार्वभौमिक अनुवादक (Universal Translator)

LACE एक सार्वभौमिक अनुवादक की तरह कार्य करता है जो रोबोट को मानव और रोबोट दोनों हाथों के लिए एक ही बोली बोलने में सक्षम बनाता है।

रोबोट के कैमरा इमेज को मानव फोटो जैसा बनाने की कोशिश करने के बजाय (जो कठिन है और अक्सर विफल हो जाता है), LACE रोबोट के दिमाग के भीतर काम करता है। यह कहता है: "हे, भले ही मानव अंगूठा और रोबोट का अंगूठा अलग दिखते हों, वे एक ही काम करते हैं। आइए सुनिश्चित करें कि रोबोट का दिमाग उन्हें एक ही आंतरिक कोड का उपयोग करके वर्णित करे।"

3. यह कैसे सीखता है: "साझा अंगों" की ट्रिक

इस अनुवादक को सिखाने के लिए, आपको हजारों रोबोट वीडियो की आवश्यकता नहीं है। आपको केवल रोबोट के हिलने-डुलने का एक एकल वीडियो चाहिए, साथ ही इंसानों के कुछ मौजूदा वीडियो।

  • मैप (नक्शा): सिस्टम शरीर के अंगों के एक "मैप" का उपयोग करता है। वह जानता है कि एक मानव अंगूठा एक रोबोट अंगूठे के अनुरूप है, एक मानव कलाई एक रोबोट कलाई के अनुरूप है, आदि।
  • पाठ: यह एक मानव हाथ की तस्वीर और एक रोबोट हाथ की तस्वीर लेता है। यह दोनों तस्वीरों में अंगूठे की ओर इशारा करता है और कहता है, "इन दोनों पिक्सेल का रोबोट के दिमाग के लिए एक ही अर्थ होना चाहिए।"
  • जादू: यह रोबोट के दिमाग को इस तरह समायोजित करता है कि जब वह एक रोबोट अंगूठा देखता है, तो उसे वही "आंतरिक संवेदना" महसूस होती है जो मानव अंगूठा देखने पर होती है।

4. सीखने के दो नियम

पेपर में दो विशिष्ट नियमों का उल्लेख किया गया है जिनका पालन सिस्टम यह सुनिश्चित करने के लिए करता है कि वह सब कुछ भूले बिना सही ढंग से सीखे:

  • नियम 1: "मैचमेकर" (सिमेंटिक अलाइनमेंट लॉस): यह नियम रोबोट को मानव और रोबet अंगों का मिलान करने के लिए मजबूर करता है। यह एक शिक्षक की तरह है जो कहता है, "यदि आप एक मानव अंगूठा देखते हैं, तो आपको 'अंगूठे होने के अहसास' के बारे में ठीक उसी तरह सोचना चाहिए जैसे आप एक रोबोट अंगूठे के बारे में सोचते हैं।"
  • नियम 2: "एंकर" (ग्राम लॉस): यह अत्यंत महत्वपूर्ण है। यदि आप केवल रोबोट को अंगूठे के बारे में सिखाते हैं, तो वह कप या कुर्सी को पहचानने का अपना सामान्य ज्ञान भूल सकता है। "एंकर" नियम कहता है, "दुनिया के बारे में अपने सामान्य ज्ञान (जैसे मेज कैसी दिखती है) को बिल्कुल वैसा ही रखें जैसा पहले था। केवल हाथों के बारे में अपनी सोच को बदलें।" यह रोब la को बाकी चीजों के बारे में भ्रमित होने से रोकता है।

5. परिणाम: शून्य से हीरो तक

शोधकर्ताओं ने वास्तविक दुनिया में इसका परीक्षण किया:

  • LACE के बिना: यदि वे रोबोट को शून्य रोबोट प्रशिक्षण वीडियो देते और केवल मानव वीडियो देते, तो रोबोट लगभग 100% बार विफल हो जाता। वह यह भी नहीं समझ पाता कि उसका अपना हाथ कहाँ है।
  • LACE के साथ: इसी सेटअप का उपयोग करते हुए (शून्य रोबोट वीडियो), रोबोट 60% बार सफल रहा। वह एक मानव वीडियो को देख सका, क्रिया को समझ सका, और सफलतापूर्वक इसे अपने धातु के हाथ पर लागू कर सका।
  • कम डेटा: जब उन्होंने रोबोट को अपने स्वयं के थोड़े से वीडियो दिए (आमतौर पर आवश्यक मात्रा का केवल 10%), तब भी LACE ने इसे पहले की तुलना में बहुत बेहतर प्रदर्शन करने में मदद की।

सारांश

LACE एक ऐसी विधि है जो रोबोट को इंसानों और रोबोट्स को दो अलग प्रजातियों के रूप में देखना बंद करने के लिए सिखाती है। साझा शरीर के अंगों (जैसे अंगूठे और कलाई) के लिए एक ही "आंतरिक कोड" का उपयोग करने के लिए रोबोट के दिमाग को सिखाकर, यह रोबोट को इंटरनेट पर उपलब्ध मानव वीडियो के विशाल डेटा से जटिल कौशल सीखने में सक्षम बनाता है, भले ही उसने पहले कभी उस विशिष्ट कार्य को करने वाला रोबोट न देखा हो। यह बहुत कम डेटा के साथ काम करता है और इसके लिए यह आवश्यक नहीं है कि रोबोट इंसान जैसा दिखे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →