← नवीनतम पेपर
💻 computer science

Self Supervised Learning from Automatically Generated Demonstrations for Visual Robotic Manipulation

यह शोधपत्र एक स्व-पर्यवेक्षित (self-supervised) विजुअल मैनिपुलेशन विधि प्रस्तुत करता है जो सिमुलेशन में स्वचालित रूप से उत्पन्न प्रदर्शनों का उपयोग करके रिस्ट-माउंटेड RGB छवियों से सापेक्ष पोज़ सुधार (relative pose correction) के लिए एक कनवल्शनल नेटवर्क को प्रशिक्षित करता है, जिससे एक UR5e रोबोट सिम्युलेटेड और वास्तविक दुनिया दोनों वातावरणों में कम सेटअप प्रयास और बेहतर प्लानर सटीकता के साथ सफल ग्रैस्प प्राप्त करने में सक्षम होता है।

मूल लेखक: Andres Rivas, Anselmo R. Cukla, Rodrigo S. Guerra, Bruna V. Guterres, Ricardo B. Grando

प्रकाशित 2026-08-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Andres Rivas, Anselmo R. Cukla, Rodrigo S. Guerra, Bruna V. Guterres, Ricardo B. Grando

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कॉफी का मग उठाना सिखाने की कोशिश कर रहे हैं। पुराने दिनों में, इंजीनियरों को हजारों पंक्तियों का कोड लिखना पड़ता था, मग के सटीक आकार को मापना पड़ता था और रोबोट की आँखों को लेजर सटीकता के साथ कैलिब्रेट करना पड़ता था। यह किसी को टायर के दबाव और एरोडायनामिक्स पर मैनुअल देकर साइकिल चलाना सिखाने जैसा था, बजाय इसके कि उन्हें बस साइकिल पर चढ़कर डगमगाना सिखाया जाए। इसने रोबकों को कारखानों के कामों में तो माहिर बना दिया, लेकिन हमारे घरों की अव्यवस्थित और अप्रत्याशित दुनिया को संभालने में उन्हें कमजोर छोड़ दिया।

हाल ही में, वैज्ञानिकों ने एक बेहतर तरीका खोजा है: "डेमोंस्ट्रेशन से सीखना" (Learning from Demonstration)। हर हरकत को कोड करने के बजाय, आप एक इंसान को यह दिखाते हुए छोड़ देते हैं कि इसे कैसे करना है, और रोबोट देखकर सीखता है। लेकिन इसमें एक पेंच है: किसी इंसान द्वारा रोबोट के हाथ को शारीरिक रूप से गाइड करना या जॉयस्टिक से नियंत्रित करना धीमा, उबाऊ और बड़े पैमाने पर करना कठिन है। क्या होगा अगर रोबोट खुद को सिखा सके? क्या होगा अगर वह किसी वस्तु को देख सके, अनुमान लगा सके कि उसे कहाँ पकड़ना है, यह महसूस कर सके कि वह थोड़ा गलत है, और फिर अपने सुधार के लिए बार-बार अभ्यास कर सके जब तक कि वह सही न हो जाए? यह "सेल्फ-सुपरवाइज्ड लर्निंग" (Self-Supervised Learning) की सीमा है, जहाँ रोबोट छात्र और शिक्षक दोनों की भूमिका निभाता है, और बिना किसी इंसान के मार्गदर्शन के अपनी खुद की अभ्यास समस्याएँ उत्पन्न करता है।

यह शोध पत्र एक चतुर नई पद्धति पेश करता है जहाँ एक रोबोट बिल्कुल यही करता है। शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जहाँ कलाई पर कैमरा लगा एक रोबोट स्वचालित रूप से अपने स्वयं के "डेमोंस्ट्रेशन" बनाता है। किसी इंसान द्वारा उसे यह दिखाने के बजाय कि वस्तु को कैसे पकड़ना है, रोबोट एक यादृच्छिक (random) स्थान से शुरू करता है, वस्तु को देखता है, और फिर पकड़ने की आदर्श स्थिति में पहुँच जाता है। वह इस हरकत को एक सबक के रूप में रिकॉर्ड करता है: "जब मैंने वस्तु को इस तरह देखा, तो मुझे लक्ष्य तक पहुँचने के लिए उस दिशा में जाने की आवश्यकता थी।" विभिन्न वस्तुओं के इर्द-गिर्द हजारों बार ऐसा करके, रोबोट बिना किसी मानवीय लेबल या जटिल कैमरा कैलिब्रेशन के "इमेज-टू-मूव" (image-to-move) पाठों का एक विशाल पुस्तकालय बनाता है।

टीम ने इस विचार का दो तरीकों से परीक्षण किया। पहले, उन्होंने एक उच्च-तकनीकी वीडियो गेम सिमुलेशन, 'आइजैक सिम' (Isaac Sim) में इसे चलाया। उन्होंने रोबोट को किसी वस्तु के पास जाने और फिर अपनी स्थिति को सटीक बनाने (fine-tune) के लिए प्रशिक्षित किया। परिणाम उत्साहजनक थे: रोबोट का अंतिम निशाना बहुत सटीक हो गया। सिमुलेशन में, रोबोट जहाँ समाप्त हुआ (वह अंतर जहाँ वह आदर्श स्थान से भटक गया था), उसका "फैलाव" फाइन-ट्यूनिंग चरण के बाद 9.69 मिमी से घटकर केवल 5.38 मिमी रह गया। यह एक ऐसे तीर फेंकने जैसा था जो सामान्यतः निशाने के आसपास गिरता था, और अब वह सीधे बुल्सआई (bullseye) पर लग रहा था।

इसके बाद, वे इस सिस्टम को एक ग्रिपर और एक मानक USB कैमरे से लैस UR5e रोबोट आर्म के साथ वास्तविक दुनिया में ले गए। उन्होंने कैमरे को कैलिब्रेट करने के लिए किसी विशेष रूलर या लेजर गाइड का उपयोग नहीं किया; रोबोट ने बस उसके द्वारा ली गई तस्वीरों से सीखा। उन्होंने इसे अलग-अलग आकारों और बनावट वाली तीन भौतिक वस्तुओं पर परखा। रोबोट ने वस्तु को घुमाए बिना उसे पकड़ने की कोशिश की, और वह एक वस्तु के लिए 66.6% बार और दूसरी के लिए 63.6% बार सफल रहा। जब उन्होंने एक मोड़ जोड़ा—शाब्दिक रूप से वस्तुओं को घुमाना ताकि रोबोट को एक नए कोण से उन्हें पहचानना पड़े—तो सफलता दर गिर गई (क्रमशः 36.4% और 55.5% तक), लेकिन रोबोट फिर भी उन्हें कभी-कभी पकड़ने में सफल रहा।

शोध पत्र सुझाव देता है कि हालांकि यह स्व-शिक्षण विधि समतल सतहों पर करीब पहुँचने और अपने निशाने को सुधारने के लिए अच्छी तरह काम करती है, लेकिन यह गहराई का अनुमान लगाने (depth prediction) में थोड़ा संघर्ष करती है और वस्तुओं के अजीब तरह से मुड़ने पर भ्रमित हो जाती है। हालाँकि, मूल विचार कायम है: रोबोट वास्तव में दृश्य हेरफेर (visual manipulation) सीखने के लिए अपना स्वयं का प्रशिक्षण डेटा उत्पन्न कर सकते हैं, जिससे महंगे मानव शिक्षकों या पूर्ण लैब सेटअप की आवश्यकता समाप्त हो जाती है। यह उन रोबोटों की ओर एक कदम है जो बस एक बिखरी हुई मेज को देख सकते हैं, समझ सकते हैं कि कप को कैसे पकड़ना है, और बिना किसी इंसान द्वारा नियम लिखे, अपनी गलतियों से खुद सीख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →