← नवीनतम पेपर
💻 computer science

Task Parameter Extrapolation via Learning Inverse Tasks from Forward Demonstrations

यह शोध पत्र एक नवीन संयुक्त शिक्षण ढांचे (joint learning framework) का प्रस्ताव करता है जो फॉरवर्ड प्रदर्शनों (forward demonstrations) से इनवर्स कार्यों (inverse tasks) को सीखकर रोबोट नीतियों को नई स्थितियों में विस्तार करने में सक्षम बनाता है, जिससे सटीक ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) प्राप्त होता है और जटिल हेरफेर परिदृश्यों (manipulation scenarios) में डिफ्यूजन-आधारित विकल्पों से बेहतर प्रदर्शन होता है।

मूल लेखक: Serdar Bahar, Fatih Dogangun, Matteo Saveriano, Yukie Nagai, Emre Ugur

प्रकाशित 2026-03-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Serdar Bahar, Fatih Dogangun, Matteo Saveriano, Yukie Nagai, Emre Ugur

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: रोबोट एक ही ढर्रे में फंस जाते हैं

कल्पना कीजिए कि आप एक रोबोट को एक मेज पर एक भारी बॉक्स को धकेलना सिखाते हैं। आप उसे दिखाते हैं कि एक विशिष्ट बॉक्स के साथ, एक विशिष्ट स्थान पर, एक विशिष्ट हाथ की गति का उपयोग करके इसे बिल्कुल कैसे करना है। रोबोट इसे पूरी तरह से सीख लेता है।

लेकिन फिर, आप मेज पर एक अलग बॉक्स रख देते हैं, या शुरुआती स्थान को थोड़ा सा बदल देते हैं। अचानक, रोबोट जम जाता है या बॉक्स को मेज से नीचे धकेल देता है। यह उस छात्र की तरह है जिसने गणित के टेस्ट के उत्तर रट लिए हैं, लेकिन जैसे ही आप नंबर बदल देते हैं, वह फेल हो जाता है।

वर्तमान रोबki सीखने की अधिकांश विधियाँ इंटरपोलेशन (जो उन्होंने देखा है उसके बीच के अंतर का अनुमान लगाना) में बहुत अच्छी हैं, लेकिन एक्सट्रपलेशन (जो उन्होंने देखा है उसकी सीमा से बाहर का अनुमान लगाना) में बहुत खराब हैं। उनमें नई स्थितियों के अनुकूल होने के लिए "कॉमन सेंस" की कमी होती है।

समाधान: "रिवर्स इंजीनियर" ट्रिक

इस पेपर के लेखकों ने एक चतुर वर्कअराउंड प्रस्तावित किया है। उन्होंने महसूस किया कि कई रोबोट कार्य जोड़ों में आते हैं: फॉरवर्ड (Forward) और इनवर्स (Inverse)।

  • फॉरवर्ड: एक लक्ष्य तक बॉक्स को धकेलना।
  • इनवर्स: उसी बॉक्स को वापस शुरुआत में खींचना।
  • फॉरवर्ड: एक खिलौने को जोड़ना।
  • इनवर्स: खिलौने को अलग करना।

मुख्य विचार यह है: यदि एक रोबोट किसी कार्य को उलटे क्रम (reverse) में करने का तरीका समझता है, तो वह अक्सर केवल फॉरवर्ड वर्जन को देखकर, उस कार्य के एक नए वर्जन को उलटे क्रम में करने का तरीका भी समझ सकता है।

इसे साइकिल चलाने के बारे में सीखने जैसा समझें। यदि आप आगे की ओर चलाना जानते हैं, तो आप स्वाभाविक रूप से पीछे की ओर चलाने के लिए आवश्यक संतुलन और मैकेनिक्स को समझते हैं, भले ही आपने पहले कभी ऐसा न किया हो। आपको "पीछे की ओर चलाने" के लिए अलग से शिक्षक की आवश्यकता नहीं है; आप बस "आगे की ओर चलाने" के अपने ज्ञान का उपयोग करके इसे समझ लेते हैं।

यह कैसे काम करता है: "यूनिवर्सल ट्रांसलेटर"

शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो "फॉरवर्ड" और "इनवर्स" दुनियाओं के बीच एक यूनिवर्सल ट्रांसलेटर की तरह काम करता है। यहाँ चरण-दर-चरण प्रक्रिया दी गई है:

1. मैचमेकर (डेटा की जोड़ी बनाना)

सबसे पहले, रोबोट को एक विशिष्ट "पुश" (धकेलना) और उसके मिलान वाले "पुल" (खींचना) के बीच संबंध सीखना होगा।

  • समस्या: रोबलेट के पास "पुश" वीडियो का ढेर है और "पुल" वीडियो का ढेर है, लेकिन वे लेबल नहीं किए गए हैं। कौन सा "पुश" किस "पुल" के साथ जाता है?
  • समाधान: सिस्टम एक मैचमेकर की तरह काम करता है। यह देखता है कि एक "पुश" वीडियो कहाँ समाप्त होता है (बॉक्स यहाँ है) और फिर "पुल" वीडियो को ढूंढता है जो ठीक वहीं से शुरू होता है। यह उन्हें आपस में जोड़ देता है। यदि जोड़ी गड़बड़ (रैंडम) है, तो रोबोट भ्रमित हो जाता है। यदि जोड़ी एकदम सही है, तो रोबोट दोनों क्रियाओं के बीच गहरे संबंध को सीख लेता है।

2. साझा मस्तिष्क (Common Representation)

एक बार जब जोड़ियाँ बन जाती हैं, तो रोबोट यह पता लगाने की कोशिश करता है कि वह "सीक्रेट सॉस" क्या है जो उन्हें काम करने में मदद करता है। यह एक साझा मानसिक मानचित्र (एक कॉमन लेटेंट स्पेस) बनाता है।

  • एक लाइब्रेरी की कल्पना करें जहाँ "धकेलने" और "खींचने" के बारे में किताबें इसलिए एक साथ रखी गई हैं क्योंकि वे एक ही अंतर्निहित तर्क साझा करती हैं।
  • रोबोट सीखता है कि "सिलेंडर को धकेलना" और "सिलेंडर को खींचना" एक ही सिक्के के दो पहलू हैं।

3. जादुई छलांग (Zero-Shot Extrapolation)

यहीं पर जादू होता है।

  • परिदृश्य: आप रोबोट को एक नया ऑब्जेक्ट देते हैं जिसे उसने पहले कभी नहीं देखा है (जैसे, एक अजीब आकार का बॉक्स)।
  • ट्रिक: आप रोबोट को किसी व्यक्ति द्वारा इस नए बॉक्स को धकेलने का एक वीडियो दिखाते हैं।
  • परिणाम: क्योंकि रोबोट ने पिछले जोड़ों से "साझा मस्तिष्क" सीखा है, वह तुरंत जानता है कि उस नए बॉक्स को वापस कैसे खींचना है, भले ही उसने पहले कभी किसी को उस तरह का बॉक्स खींचते हुए न देखा हो। उसे खींचने के लिए अलग से शिक्षक की आवश्यकता नहीं थी; उसने इसे धकेलने से निष्कर्ष निकाला।

प्रयोग: यह साबित करना कि यह काम करता है

टीम ने तीन तरीकों से इसका परीक्षण किया:

  1. गणितीय सिमुलेशन: उन्होंने ग्राफ पर सरल रेखाओं का उपयोग किया। उन्होंने सिद्ध किया कि यदि आप "फॉरवर्ड" और "बैकवर्ड" रेखाओं को सही ढंग से जोड़ते हैं, तो रोबोट तेजी से सीखता है। यदि आप उन्हें रैंडम तरीके से जोड़ते हैं, तो वह बुरी तरह विफल हो जाता है।
  2. रोबोट सिमुलेशन: उन्होंने सिलेंडर, गोले (spheres) और बॉक्स को हिलाने के लिए एक वर्चुअल रोबोट आर्म का उपयोग किया।
    • उन्होंने रोबोट को सिलेंडरों (पुश/पुल जोड़ियों) पर प्रशिक्षित किया।
    • उन्होंने रोबोट को गोलों और बॉक्स के केवल "पुश" वीडियो दिए (इनके लिए कोई "पुल" वीडियो नहीं था)।
    • परिणाम: रोबोट ने सफलतापूर्वक गोलों और बॉक्स को वापस खींचना सीख लिया, और अन्य उन्नत AI विधियों (जैसे डिफ्यूजन मॉडल) से बेहतर प्रदर्शन किया जो नए आकारों को देखकर भ्रमित हो गए थे।
  3. वास्तविक दुनिया: उन्होंने 3D-प्रिंटेड टूल्स (स्टिक, हुक) के साथ एक वास्तविक रोबोट आर्म का उपयोग किया।
    • उन्होंने रोबोट को एक "स्टिक" और एक "L-स्टिक" के साथ क्यूब को धकेलना सिखाया।
    • फिर, उन्होंने उसे एक बिल्कुल नया "हुक" टूल दिया और केवल उसे हुक से धकेलना दिखाया।
    • परिणाम: रोबोट ने शोर-शराबे वाले वास्तविक दुनिया के कैमरा डेटा के बावजूद, हुक का उपयोग करके क्यूब को वापस खींचना सफलतापूर्वक सीख लिया।

यह क्यों महत्वपूर्ण है

  • डेटा दक्षता (Data Efficiency): रोबोट को आमतौर पर सीखने के लिए हजारों घंटों के डेटा की आवश्यकता होती है। इस विधि को बहुत कम डेटा की आवश्यकता होती है क्योंकि यह फॉरवर्ड कार्य से ज्ञान "उधार" लेकर इनवर्स कार्य को हल करती है।
  • सामान्यीकरण (Generalization): यह रोबोट को बिना दोबारा प्रशिक्षित किए नए ऑब्जेक्ट्स और टूल्स को संभालने की अनुमति देता है।
  • "आहा!" वाला क्षण: यह साबित करता है कि रोबोट केवल विशिष्ट गतिविधियों को याद नहीं करते, बल्कि वे किसी कार्य की संरचना को सीखते हैं।

निचोड़

यह पेपर एक ऐसा तरीका पेश करता है जिससे रोबोट सादृश्य (analogy) द्वारा सीख सकते हैं। हर एक संभावित परिदृश्य को रटने के बजाय, रोबोट "करने" और "अनडूइंग" (करने के विपरीत करने) के बीच के संबंध को सीखता है। एक बार जब वह उस संबंध को समझ लेता है, तो वह इसे बिल्कुल नई स्थितियों में लागू कर सकता है, जिससे रोबोट कहीं अधिक अनुकूलन योग्य और वास्तविक दुनिया की अनिश्चितताओं के लिए तैयार हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →