← नवीनतम पेपर
💻 computer science

Compositional Motion Generation from Demonstration with Object-Centric Neural Fields

यह शोध पत्र एक जनरेटिव लर्निंग-फ्रॉम-डेमोंस्ट्रेशन फ्रेमवर्क प्रस्तावित करता है जो साझा ऑब्जेक्ट-सेंट्रिक न्यूरल फील्ड्स और एक टेम्पोरल मिक्सचर-ऑफ-एक्सपर्ट्स मैकेनिज्म के माध्यम से धारणा (परसेप्शन) और क्रिया को जोड़कर स्केलेबल और डेटा-कुशल रोबोटिक मोशन जनरेशन प्राप्त करता है, जो न्यूनतम प्रशिक्षण डेटा के साथ विविध दृश्य विन्यासों में व्यवस्थित सामान्यीकरण को सक्षम बनाता है।

मूल लेखक: Ahmet Ercan Tekden, Yasemin Bekiroglu

प्रकाशित 2026-07-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ahmet Ercan Tekden, Yasemin Bekiroglu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बिखरे हुए कमरे को व्यवस्थित करना सिखाना चाहते हैं। इसे सिखाने का पुराना तरीका ऐसा है जैसे आप रोबोट को सफाई करने का एक लंबा वीडियो दिखा रहे हों और यह उम्मीद कर रहे हों कि वह आपकी हर एक मांसपेशी की हरकत को याद कर लेगा। यदि अगली बार आप कुर्सी को थोड़ा अलग तरीके से हिलाते हैं, तो रोबोट भ्रमित हो जाएगा और असफल हो जाएगा।

यह शोध पत्र रोबोट को सिखाने का एक अधिक स्मार्ट, अधिक "कंपोजिशनल" (रचनात्मक) तरीका प्रस्तावित करता है। एक विशाल, कठोर स्क्रिप्ट को याद करने के बजाय, रोबोट कार्यों को छोटे, पुन: प्रयोज्य बिल्डिंग ब्लॉक्स में तोड़ना सीखता है, ठीक वैसे ही जैसे एक शेफ एक पूर्ण भोजन बनाने से पहले अलग-अलग रूप से काटने (chop), भूनने (sauté) और सजाने (plate) का कौशल सीखता है।

यहाँ बताया गया है कि उनका सिस्टम कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "ऑब्जेक्ट-सेंट्रिक" कैमरा (दुनिया को देखना)

अधिकांश रोबोट एक तस्वीर देखते हैं और उसे पिक्सेल के एक विशाल, धुंधले सूप के रूप में देखते हैं। यह शोध पत्र रोबोट को दुनिया को अलग-अलग, विशिष्ट वस्तुओं के संग्रह के रूपă में देखना सिखाता है, जैसे कि लेगो (LEGO) ब्रिक्स के साथ खेलता हुआ एक बच्चा।

  • उपमा: कल्पना कीजिए कि प्लास्टिक की एक पारदर्शी शीट है जिस पर एक कटोरे का चित्र बना है, और एक दूसरी शीट है जिस पर एक टेनिस बॉल है। आप कटोरे वाली शीट को और बॉल वाली शीट को स्वतंत्र रूप से इधर-उधर खिसका सकते हैं।
  • यह कैसे काम करता है: रोबोट एक विशेष "न्यूरल फील्ड" (एक प्रकार का AI मस्तिष्क) का उपयोग करके दृश्य को इन अलग-अलग शीटों में विभाजित करता है। यह प्रत्येक वस्तु के लिए एक संक्षिप्त "कोड" (लेटेंट वेक्टर) सीखता है जो रोबोट को बताता है कि वस्तु कहाँ है और वह कैसी दिखती है। यह रोबोट को यह समझने में सक्षम बनाता है कि कटोरे को हिलाने से बॉल नहीं बदलती, जिससे यह केवल कुछ उदाहरणों से सीखने में बहुत कुशल हो जाता है।

2. "कंडक्टर" (हरकतों का मिश्रण)

एक बार जब रोबोट वस्तुओं को देख लेता है, तो उसे यह तय करने की आवश्यकता होती है कि अपने हाथ को कैसे हिलाना है। लेखक एक प्रणाली का उपयोग करते हैं जिसे मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) कहा जाता है।

  • उपमा: एक संगीत ऑर्केस्ट्रा के बारे में सोचें। आपके पास अलग-अलग विभाग हैं: स्ट्रिंग्स, ब्रास और परकशन। एक मोनोलिथिक दृष्टिकोण में, पूरा ऑर्केस्ट्रा एक ही विशाल, अपरिवर्तनीय गाना बजाता है। इस नए दृष्टिकोण में, एक कंडक्टर (गेटिंग मैकेनिज्म) यह तय करता है कि किस क्षण कौन सा विभाग बजेगा।
  • यह कैसे काम करता है:
    • एक्सपर्ट 1 शायद कप तक पहुँचना जानता हो।
    • एक्सपर्ट 2 शायद एक बॉल उठाना जानता हो।
    • एक्सपर्ट 3 शायद किसी वस्तु को कटोरे में रखना जानता हो।
    • जैसे-जैसे कार्य आगे बढ़ता है (समय बीतता है), "कंडक्टर" इन विशेषज्ञों को एक साथ सहजता से मिलाता है। यदि रोबोट को एक बॉल उठाने और फिर उसे छोड़ने की आवश्यकता है, तो कंडक्टर "पहुँचने" वाले एक्सपर्ट को धीरे-धीरे कम करता है और "छोड़ने" वाले एक्सपर्ट को बढ़ाता है। यह दृश्य में मौजूद वस्तुओं के आधार पर स्वतः होता है।

3. कुछ उदाहरणों से सीखना ("स्केच" बनाम "फोटो")

क्योंकि रोबोट दृश्य की संरचना (वस्तुओं) और गति की संरचना (प्रिमिटिव्स) को समझता है, इसलिए उसे सीखने के लिए हजारों वीडियो की आवश्यकता नहीं होती है।

  • उपमा: यदि आप किसी इंसान को एक स्केच दिखाकर बिल्ली बनाना सिखाते हैं, तो वे एक अलग मुद्रा में भी बिल्ली बना सकते हैं क्योंकि वे "बिल्ली होने" के विचार (कान, पूंछ, शरीर) को समझते हैं। यदि आप रोबोट को बिल्लियों की 10,000 फोटो दिखाकर सिखाते हैं, तो हो सकता है कि वह केवल पिक्सेल को याद कर ले और यदि बिल्ली का रंग अलग हुआ तो विफल हो जाए।
  • परिणाम: यह शोध पत्र दिखाता है कि उनका रोबोट केवल 10 से 30 प्रदर्शनों के साथ जटिल कार्य (जैसे क्यूब्स को स्टैक करना या वस्तुओं को उठाना) सीख सकता है। अन्य विधियाँ जो कच्चे चित्रों (raw images) को देखती हैं, उन्हें समान परिणाम प्राप्त करने के लिए सैकड़ों या हजारों प्रयासों की आवश्यकता होती है।

4. वास्तविक दुनिया का परीक्षण ("सामान्यीकरण" का जादू)

शोधकर्ताओं ने इसे एक कंप्यूटर सिमुलेशन और एक वास्तविक रोबोटिक आर्म के साथ टेस्ट किया।

  • "भाषा" का तरीका: एक प्रयोग में, उन्होंने केवल रोबोट को एक विशिष्ट बॉल की तस्वीर नहीं दिखाई। उन्होंने एक भाषा टूल का उपयोग करके रोबोट को बताया, "बॉल उठाओ।" रोबोट ने प्रशिक्षण के दौरान एक टेनिस बॉल सफलतापूर्वक उठाई और परीक्षण के दौरान एक बेसबॉल उठाया, भले ही उसने पहले कभी बेसबॉल नहीं देखा था। इसने किसी विशिष्ट बनावट को याद करने के बजाय "बॉल" की अवधारणा को समझा।
  • "3D" का तरीका: एक अन्य परीक्षण में, रोबोट को एक दराज खोलनी थी और उसमें एक बॉक्स रखना था। रोबोट ने 3D (डेप्थ मैप की तरह) में कमरे को स्कैन किया और यह पता लगाया कि दराज कैसे खोलनी है और बॉक्स को कैसे पकड़ना है, भले ही शुरुआती स्थितियाँ बदल गई हों। उसने यह काम उन कुछ उदाहरणों के बीच अंतराल भरने (इंटरपोलेशन) के माध्यम से किया जो उसे दिखाए गए थे।

सारांश

संक्षेप में, यह शोध पत्र एक रोबोट लर्निंग सिस्टम पेश करता है जो:

  1. दुनिया को एक अव्यवस्थित तस्वीर के बजाय अलग-अलग, चलने योग्य वस्तुओं के रूप में देखता है।
  2. संगीत को मिलाने वाले कंडक्टर की तरह विभिन्न "कौशलों" (जैसे पहुँचना या छोड़ना) को मिलाकर गति करता है।
  3. अविश्वसनीय रूप से तेज़ी से सीखता है, नए कार्यों में महारत हासिल करने के लिए बहुत कम उदाहरणों की आवश्यकता होती है।
  4. अच्छी तरह से सामान्यीकरण (Generalize) करता है, जिसका अर्थ है कि यह बिना दोबारा प्रशिक्षित हुए नई वस्तुओं या थोड़े अलग कमरे के लेआउट को संभाल सकता है।

लेखकों का दावा है कि यह रोबोट लर्निंग को बहुत अधिक कुशल और मजबूत बनाता है, जिससे रोबट न्यूनतम मानवीय निर्देश के साथ नई स्थितियों के अनुकूल हो सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →