← नवीनतम पेपर
💻 computer science

Ergodic Imitation for Adaptive Exploration around Demonstrations

यह शोध पत्र एक अनुकूली एर्गोडिक इमिटेशन फ्रेमवर्क (adaptive ergodic imitation framework) प्रस्तावित करता है जो पुनर्प्राप्त प्रदर्शनों (retrieved demonstrations) से एक लक्ष्य वितरण का निर्माण करता है ताकि ऐसी प्रक्षेपवक्र (trajectories) उत्पन्न की जा सकें जो ट्रैकिंग और अन्वेषण के बीच गतिशील रूप से इंटरपोलेट करने में सक्षम हों, जिससे रोबोटों को प्रशिक्षण-परिनियोजन विसंगतियों (training-deployment mismatches) से उबरने और पर्यावरणीय परिवर्तनों या अवलोकन त्रुटियों के बावजूद कार्यों को पूरा करने में सक्षम बनाया जा सके।

मूल लेखक: Ziyi Xu, Cem Bilaloglu, Yiming Li, Sylvain Calinon

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziyi Xu, Cem Bilaloglu, Yiming Li, Sylvain Calinon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक मानव द्वारा इसे पूरी तरह से करने के वीडियो दिखाकर उसे एक विशिष्ट भूलभुलैया (maze) के माध्यम से चलना सिखा रहे हैं। इसे इमिटेशन लर्निंग (Imitation Learning) कहा जाता है।

आमतौर पर, रोबोट मानव के पथ की हूबहू नकल करने की कोशिश करता है, कदम-दर-कदम। लेकिन क्या होगा यदि आप भूलभुलैया में एक दीवार को हटा दें या बदल दें? रोबोट, वीडियो का सटीक रूप से पालन करने की कोशिश करते हुए, सीधे दीवार से टकरा जाएगा, फंस जाएगा और असफल हो जाएगा। वह "सोच" नहीं पाता या तालमेल नहीं बिठा पाता क्योंकि वह केवल वीडियो को याद कर रहा था।

यह शोध पत्र रोबोट को सिखाने का एक स्मार्ट तरीका प्रस्तावित करता है, जिसे एडेप्टिव एर्गोडिक इमिटेशन (Adaptive Ergodic Imitation) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "जीपीएस बनाम कोहरा" की उपमा

रोबोट के प्रशिक्षण डेटा (मानव के वीडियो) को एक जीपीएस रूट (GPS route) के रूप में सोचें।

  • सामान्य मोड (ट्रैकिंग): जब रोबोट वीडियो में दिखाए गए पथ पर चल रहा होता है, तो वह एक सख्त जीपीएस की तरह कार्य करता है। वह रेखा का सटीक रूप से अनुसरण करता है।
  • समस्या मोड (फंसना): यदि रोबंतु किसी दीवार से टकराता है या पथ बदल जाता है, तो जीपीएस कहता है, "आप मार्ग से भटक गए हैं!"
  • समाधान (एर्गोडिक एक्सप्लोरेशन): केवल घबराने या हार मान लेने के बजाय, रोबोट "कोहरा मोड" (Fog Mode) में स्विच कर देता है। वह सटीक रेखा का पालन करना छोड़ देता है और मूल पथ के आस-पास के क्षेत्र की खोज करना शुरू कर देता है। वह थोड़ा इधर-उधर घूमता है, बाधा के चारों ओर रास्ता खोजने के लिए, लेकिन वह मूल पथ के करीब रहता है ताकि वह रास्ता न भटक जाए।

2. रोबोट को कब स्विच करना है, यह कैसे पता चलता है

रोबोट के पास एक इन-बिल्ट "स्टैग्नेशन काउंटर" (Stagnation Counter - ठहराव काउंटर) होता है।

  • कल्पना कीजिए कि वीडियो में मौजूद मानव के साथ उसके कदमों के साथ एक आभासी घड़ी (virtual clock) चल रही है।
  • रोबोट के पास भी अपनी घड़ी है।
  • यदि रोबोट मानव की घड़ी के साथ तालमेल बनाए रखता है, तो वह "स्ट्रिक्ट जीपीएस मोड" में रहता है।
  • यदि रोबोट पीछे रह जाता है (क्योंकि वह किसी दीवार से टकरा गया है या भ्रमित है), तो दोनों घड़ियों के बीच का अंतर बहुत बड़ा हो जाता है। यह "कोहरा मोड" में स्विच करने को ट्रिगर करता है। रोबोट को एहसास होता है, "मैं फंस गया हूँ; मुझे नया रास्ता खोजने के लिए खोजबीन (explore) करने की आवश्यकता है।"

3. "चुंबकीय रबर बैंड" (The Magnetic Rubber Band)

यह शोध पत्र इस "कोहरा मोड" को बनाने के लिए एक गणितीय चाल का उपयोग करता है। कल्पना कीजिए कि मूल पथ एक रबर बैंड है।

  • ट्रैकिंग के दौरान: रबर बैंड कसकर बंधा होता है। रोबोट को पथ के केंद्र की ओर मजबूती से खींचा जाता है।
  • एक्सप्लोरेशन के दौरान: रबर बैंड ढीला और खिंचावदार हो जाता है। यह रोबोट को केंद्र से थोड़ा दूर जाने की अनुमति देता है ताकि वह बाधा के बीच का रास्ता ढूंढ सके।
  • आकार: शोध पत्र इस रबर बैंड को "एनिसोट्रोपिक" (anisotropic) बनाता है, जिसका अर्थ है कि यह आगे या पीछे की तुलना में बगल की ओर (दीवारों के चारों ओर जाने के लिए) अधिक खिंचता है। यह रोबोट को सामान्य दिशा में चलते रहने देते हुए भी बाधाओं के बगल से निकलने की अनुमति देता है।

4. सफलता का "हीट मैप" (The Heat Map of Success)

रोबोट केवल अनुमान नहीं लगाता कि उसे कहाँ जाना है। वह उन सभी सफल वीडियो को देखता है जो उसने देखे हैं और एक हीट मैप बनाता है।

  • वे क्षेत्र जहाँ मानव अक्सर चला है, वे "गर्म" (उच्च संभावना) होते हैं।
  • रोबोट यह सुनिश्चित करने के लिए एक विशेष गणितीय उपकरण (जिसे MMD कहा जाता है) का उपयोग करता है कि जैसे-जैसे वह घूमता है, वह बिना गोल-गोल घूमते हुए नए क्षेत्रों को कुशलतापूर्वक कवर करे। यह एक खोज और बचाव कुत्ते (search-and-rescue dog) की तरह है जो जानता है कि व्यक्ति पिछली बार कहाँ देखा गया था, लेकिन यदि सीधा रास्ता अवरुद्ध है, तो वह झाड़ियों के बीच सूंघने के लिए पर्याप्त स्मार्ट है।

परिणाम

अपने परीक्षणों में, शोधकर्ताओं ने रोबोट को संकीर्ण अंतराल वाली एक भूलभुलैया में रखा।

  • उन्होंने अंतराल (बाधाओं) को उन नई जगहों पर स्थानांतरित कर दिया जहाँ रोबोट ने पहले कभी नहीं देखा था।
  • पुराने तरीके: रोबोट मूल वीडियो का पालन करने की कोशिश करेगा, नई दीवार से टकराएगा और 100% बार असफल हो जाएगा।
  • यह नया तरीका: रोबोट को एहसास हुआ कि वह फंस गया है, उसने अपना "रबर बैंड" ढीला किया, मूल पथ के आसपास के क्षेत्र की खोज की, नया अंतराल पाया, और सफलतापूर्वक लक्ष्य तक पहुँच गया।

संक्षेप में: यह शोध पत्र रोबोट को "स्मार्ट फॉलोअर" बनाना सिखाता है। जब चीजें आसान होती हैं तो वे निर्देशों का पूरी तरह से पालन करते हैं, लेकिन यदि वे फंस जाते हैं, तो वे समस्या को हल करने के लिए मूल लक्ष्य को भूले बिना, तत्काल परिवेश की रचनात्मक रूप से खोज करना जानते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →