← नवीनतम पेपर
💻 computer science

Optimization of sim-to-real transfer in the humanoid robot NICO

यह शोधपत्र मानव रूपी रोबोट NICO के लिए एक नवीन, कम लागत वाले सिम-टू-रियल ग्रैस्पिंग पाइपलाइन को प्रस्तुत करता है जो महंगे बाहरी ट्रैकिंग सिस्टमों पर निर्भर हुए बिना टेबलटॉप वस्तुओं को पकड़ने में उच्च सफलता दर प्राप्त करने के लिए YOLO-आधारित डिटेक्शन, स्टीरियो विजन लोकलाइजेशन और विजुअल फीडबैक को संयोजित करता है।

मूल लेखक: Juraj Gavura, Igor Farkaš

प्रकाशित 2026-07-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Juraj Gavura, Igor Farkaš

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट एक नया खेल सीखने की कोशिश कर रहे उत्साही छात्रों की तरह हैं। वे एक वीडियो गेम में अभ्यास करने में बहुत कुशल हैं, जहाँ भौतिकी (physics) एकदम सटीक है, रोशनी आदर्श है, और कुछ भी टूटता नहीं है। लेकिन जब आप उसी रोबोट को उस गेम से बाहर निकलकर वास्तविक दुनिया में कदम रखने के लिए कहते हैं, तो चीजें अस्त-व्यस्त हो जाती हैं। वास्तविक दुनिया में हिलते हुए जोड़, धुंधले कैमरे और ऐसी गुरुत्वाकर्षण शक्ति होती है जो हमेशा कोड में दी गई गणित की तरह व्यवहार नहीं करती। डिजिटल अभ्यास की पूर्णता और वास्तविक जीवन के बिखराव के बीच के इस अंतर को "सिम-टू-रियल" (sim-to-real) गैप कहा जाता है। यही वह कारण है कि एक रोबet सिमुलेशन में एक सुंदर नर्तक की तरह दिख सकता है, लेकिन जब वह कॉफी का कप उठाने की कोशिश करता है, तो अपने ही पैरों में उलझकर गिर जाता है। वैज्ञानिक इस अंतर को पाटने के लिए जुनूनी हैं क्योंकि यदि रोबोट वास्तविक दुनिया में भरोसेमंद तरीके से चीजों को नहीं पकड़ सकते, तो वे घर के कामों में हमारी मदद नहीं कर सकते, चीजें नहीं बना सकते, या लोगों के साथ सुरक्षित रूप से बातचीत नहीं कर सकते। बड़ा सवाल यह है: हम एक रोबोट को अपने नेत्रों और अपनी मांसपेशियों पर भरोसा करना कैसे सिखाएं जब दुनिया उसके प्रशिक्षण मैनुअल से मेल नहीं खाती?

यह शोध पत्र एक ह्यूमनॉइड रोबोट 'NICO' (जिसका अर्थ है न्यूरो-इंस्पायर्ड कॉम्पैनियन) और एक मेज से एक प्लश टमाटर उठाने की कला में महारत हासिल करने की उसकी खोज की कहानी बताता है। शोधकर्ता, जुराज गवुरा और इगोर फारकास, एक कठिन समस्या का सामना कर रहे थे: भले ही उन्होंने पहले ही NICO को स्क्रीन के विशिष्ट स्थानों को उच्च सटीकता के साथ छूना सिखा दिया था, लेकिन किसी वस्तु को उठाना बहुत अधिक कठिन है। इसके लिए रोबोट को वस्तु को देखने, यह समझने की आवश्यकता होती है कि वह 3D स्थान में ठीक कहाँ है, और फिर उसे बिना गिराए पकड़ने के लिए अपने हाथ को आगे बढ़ाना होता है। टीम यह देखना चाहती थी कि क्या उनकी पुरानी "टचस्क्रीन ट्रेनिंग" पद्धति NICO को चीजें पकड़ने में मदद कर सकती थी, या उन्हें एक नई तकनीक की आवश्यकता थी।

उन्होंने दो मुख्य रणनीतियों का परीक्षण किया। पहली रणनीति यह थी कि रोब-ोट की टचस्क्रीन प्रशिक्षण से मिली "मसल मेमोरी" (मांसपेशियों की स्मृति) का उपयोग किया जाए। उन्होंने रोबोट की वास्तविक दुनिया की अनाड़ीपन की भरपाई करने के लिए, रोबोट के हाथ को बिल्कुल कितना धकेलना है, इसका अनुमान लगाने के लिए एक कंप्यूटर मॉडल का उपयोग किया। इसे एक कोच द्वारा खिलाड़ी को यह बताने जैसा समझें कि, "जब तुम बाएं कोने पर निशाना साधते हो, तो वास्तव में दो इंच दाईं ओर निशाना लगाओ क्योंकि तुम्हारा हाथ उस तरफ खिंचता है।" उन्होंने इस कोच के तीन अलग-अलग संस्करणों का परीक्षण किया, जो एक साधारण नियम-आधार_नियम से लेकर एक जटिल न्यूरल नेटवर्क (एक प्रकार का AI मस्तिष्क) तक थे। परिणाम दो दुनियाओं की कहानी थे: उस विशिष्ट क्षेत्र के भीतर जहाँ रोबोट ने अभ्यास किया था, जटिल AI कोच एक सुपरस्टार की तरह था, जिसने NICO को टमाटर सफलतापूर्वक पकड़ने में 96.7% बार मदद की। हालाँकि, एक बार जब रोबोट उस परिचित क्षेत्र से बाहर निकला, तो AI कोच बेतरतीब ढंग से अनुमान लगाने लगा, और सफलता दर काफी गिर गई। यह पता चला कि रोबोट की "मसल मेमोरी" मेज के नए हिस्सों के लिए अच्छी तरह से अनुकूलित नहीं हो पाई।

दूसरी रणनीति रोबोट की अपनी आँखों का उपयोग करके "हॉट एंड कोल्ड" (पास या दूर) के खेल की तरह थी। एक पूर्व-निर्धारित मानचित्र पर निर्भर रहने के बजाय, उन्होंने NICO को एक विजुअल फीडबैक लूप दिया। रोबोट टमाटर के पास अपना हाथ ले जाएगा, देखेगा कि उसका हाथ वास्तव में कहाँ है, और फिर उसे पूरी तरह से संरेखित करने के लिए छोटे-छोटे समायोजन करेगा। यह दर्पण में देखते हुए सुई में धागा पिरोने जैसा है; आप धागे को तब तक हिलाते रहते हैं जब तक कि वह आँख के साथ संरेखित न हो जाए। इस दृष्टिकोण को पूरे कार्यक्षेत्र में एक पूर्व-प्रशिक्षित मानचित्र की आवश्यकता नहीं थी। यह आश्चर्यजनक रूप से अच्छा काम कर गया, जिससे समग्र रूप से 72.7% सफलता दर प्राप्त हुई। वास्तव में, जब रोबोट की आँखें पूरी तरह से काम कर रही थीं और वह अपने हाथ को स्पष्ट रूप से देख पा रहा था, तो इस पद्धति ने 94.1% की सफलता दर हासिल की।

शोध पत्र सुझाव देता है कि जबकि "मसल मेमोरी" अंशांकन (calibration) उस क्षेत्र में अविश्वसनीय रूप से सटीक है जहाँ इसे प्रशिक्षित किया गया था, "विजुअल फीडबैक" विधि पूरी मेज के लिए अधिक मजबूत और अनुकूलनीय है। शोधकर्ताओं ने पाया कि विजुअल फीडबैक को रोकने वाली मुख्य चीज़ रोबोट का मस्तिष्क नहीं था, बल्कि उसकी आँखें थीं: कभी-कभी रोबोट के स्टीरियो कैमरे बैकग्राउंड से भ्रमित हो जाते थे और यह नहीं बता पाते थे कि उसका हाथ ठीक कहाँ है। लेकिन जब आँखें सही काम कर रही थीं, तो रोबोट लगभग हर बार टमाटर पकड़ सकता था। अंततः, यह अध्ययन दिखाता है कि रोबोट को चीजें पकड़ना सिखाने के लिए आपको महंगे, हाई-टेक 3D कैमरों या मोशन कैप्चर सूट की आवश्यकता नहीं है; कम लागत वाले कैमरों, थोड़े से अंशांकन और एक विजुअल फीडबैक लूप का चतुर मिश्रण काम को पूरा कर सकता है। लेखक निष्कर्ष निकालते हैं कि जहाँ अंशांकन पद्धति अपने घरेलू क्षेत्र में चैंपियन है, वहीं विजुअल फीडबैक दृष्टिकोण अराजक और अप्रत्याशित वास्तविक दुनिया के लिए एक बेहतर 'ऑल-राउंडर' है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →