← नवीनतम पेपर
🤖 machine learning

DexSim2Real: Foundation Model-Guided Sim-to-Real Transfer for Generalizable Dexterous Manipulation

यह शोध पत्र DexSim2Real प्रस्तुत करता है, जो एक एकीकृत ढांचा है जो डोमेन रैंडमाइजेशन के लिए विजन-लैंग्वेज फाउंडेशन मॉडल्स, टैक्टाइल-विजुअल क्रॉस-अटेंशन पॉलिसीज़ और प्रोग्रेसिव स्किल करिकुलम का लाभ उठाकर सिम-टू-रियल प्रदर्शन अंतराल को महत्वपूर्ण रूप से कम करता है, जिससे सामान्यीकरण योग्य डेक्सट्रस मैनिपुलेशन कार्यों में 78.2% औसत सफलता दर प्राप्त होती है।

मूल लेखक: Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li, Yuhao Liao

प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li, Yuhao Liao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक हाथ को नाजुक काम करना सिखा रहे हैं, जैसे ब्लॉक को एक के ऊपर एक रखना या पानी डालना। इसे वास्तविक दुनिया में करना धीमा, महंगा और जोखिम भरा है (रोबोट चीजें तोड़ सकते हैं)। इसलिए, वैज्ञानिक आमतौर पर पहले रोबोट को एक वीडियो गेम सिमुलेशन में सिखाते हैं। लेकिन समस्या यह है कि सिमुलेशन कभी भी पूरी तरह से वास्तविक नहीं होता। लाइटिंग थोड़ी अलग हो सकती है, मेज का घर्षण (friction) अलग हो सकता है, और कैमरा एंगल सही नहीं हो सकते। इस अंतर को "सिम-टू-रियल गैप" (Sim-to-Real Gap) कहा जाता है। जब रोबोट गेम से वास्तविक दुनिया में आता है, तो वह अक्सर विफल हो जाता है क्योंकि उसने गेम खेलना सीखा है, न कि वास्तविकता को संभालना।

यह पेपर DexSim2Real पेश करता है, जो एक नया सिस्टम है जिसे इस अंतर को कम करने के लिए डिज़ाइन किया गया है ताकि रोबले गेम में सीख सकें और बिना किसी मानवीय शिक्षक के सीधे वास्तविक दुनिया में सफल हो सकें।

यह कैसे काम करता है, यहाँ तीन सरल भागों में दिया गया है:

1. "आर्ट क्रिटिक" (कला समीक्षक) (FM-DR)

समस्या: आमतौर पर, जब वैज्ञानिक सिमुलेशन को वास्तविक दिखाने की कोशिश करते हैं, तो वे केवल सेटिंग्स का अनुमान लगाते हैं (जैसे "लाइट को थोड़ा उज्जवल करें" या "फर्श को थोड़ा फिसलन भरा बनाएं")। वे भाग्यशाली हो सकते हैं, या वे हफ्तों तक गलत अनुमान लगाने में बिता सकते हैं।

समाधान: लेखक एक फाउंडेशन मॉडल (एक सुपर-स्मार्ट AI जो चित्रों और टेक्स्ट दोनों को समझता है) का उपयोग एक आर्ट क्रिटिक के रूप में करते हैं।

  • यह कैसे काम करता है: सिस्टम सिमुलेशन में रोबोट की एक तस्वीर बनाता है। फिर यह तस्वीर AI क्रिटिक को वास्तविक दुनिया की एक फोटो के साथ दिखाई जाती है।
  • उपमा: कल्पना कीजिए कि आप अपने एक दोस्त का पोर्ट्रेट बनाने की कोशिश कर रहे हैं। आप अपनी पेंटिंग एक पेशेवर आर्ट क्रिटिक को दिखाते हैं। वह केवल यह कहने के बजाय कि "यह ठीक है," इशारा करता है कि "लाइटिंग बहुत तेज है, और शर्ट की बनावट कपास की जगह प्लास्टिक जैसी लग रही है।"
  • परिणाम: सिस्टम फीडबैक के आधार पर सिमुलेशन सेटिंग्स (लाइटिंग, टेक्सचर, फिजिक्स) को स्वचालित रूप से तब तक समायोजित करता है जब तक कि सिमुलेशन वास्तविक फोटो जैसा न दिखने लगे। यह बिना मानवीय अनुमान के स्वचालित रूप से होता है।

2. "सुपर-सेंसेस" (अति-इंद्रियां) (TVCAP)

समस्या: रोबोट अक्सर केवल कैमरों (दृष्टि) पर निर्भर रहते हैं। लेकिन जब एक रोबोट का हाथ किसी चीज़ को छूता है, तो केवल दृष्टि पर्याप्त नहीं होती। उसे दबाव और फिसलन को महसूस करने की आवश्यकता होती है।

समाधान: सिस्टम रोबोट को एक ऐसा मस्तिष्क देता है जो एक विशेष "क्रॉस-अैटेंशन" तंत्र का उपयोग करके दृष्टि (Sight) और स्पर्श (Touch) को जोड़ता है।

  • उपमा: एक व्यक्ति के बारे में सोचें जो पानी का गिलास उठाने की कोशिश कर रहा है। यदि वह केवल उसे देखता है, तो यदि वह फिसलन भरा हुआ तो वह उसे गिरा सकता है। लेकिन यदि वह देखते हुए अपनी उंगलियों से पकड़ को महसूस करता है, तो वह तुरंत सुधार करता है।
  • यह कैसे काम करता है: रोबोट का "मस्तिष्क" केवल विजुअल डेटा और टच डेटा को एक के ऊपर एक नहीं रखता। इसके बजाय, यह "आंखों" को "उंगलियों" से पूछने देता है, "क्या यह फिसलन भरा है?" और "उंगलियों" को "आंखों" से पूछने देता है, "किनारा कहाँ है?" वे गतिशील रूप से एक-दूसरे से बात करते हैं। यह रोबोट को अपने हाथ के अंदर किसी वस्तु को घुमाने या एक तंग छेद में पेग डालने जैसे कठिन कार्यों को संभालने में मदद करता है।

3. "स्मार्ट कोच" (बुद्धिमान प्रशिक्षक) (PSC)

समस्या: एक साथ एक जटिल कौशल सीखना भारी पड़ सकता है। यदि आप रोबोट से तुरंत कहें कि "कप से कटोरे में पानी डालें," तो वह सब कुछ बिखेर देगा और हार मान लेगा।

समाधान: सिस्टम एक प्रोग्रेसिव स्किल करिकुलम का उपयोग करता है, जो एक स्मार्ट कोच की तरह कार्य करता है।

  • उपमा: साइकिल चलाना सीखने की कल्पना करें। आप सीधे ढलान पर दौड़ना शुरू नहीं करते हैं। आप ट्रेनिंग व्हील्स के साथ शुरू करते हैं, फिर एक सपाट ड्राइववे, फिर एक हल्की ढलान।
  • यह कैसे काम करता है: एक लार्ज लैंग्वेज मॉडल (कोच) बड़े कार्य को छोटे चरणों में तोड़ देता है: "1. कप को पकड़ें। 2. इसे उठाएं। 3. इसे कटोरे के ऊपर ले जाएं। 4. झुकाएं।" रोबोट चरण 1 में महारत हासिल करता है, फिर चरण 2, और इसी तरह। एक बार जब वह छोटे चरणों में अच्छा हो जाता है, तो कोच उन्हें पूरे कार्य के लिए एक साथ जोड़ देता है। यह सीखने की प्रक्रिया को बहुत तेज़ और अधिक कुशल बनाता है।

परिणाम: क्या यह काम कर गया?

शोधकर्ताओं ने इस सिस्टम का परीक्षण छह कठिन कार्यों (जैसे ब्लॉक को स्टैक करना, एक छोटे छेद में पेग डालना, और पानी डालना) पर एक वास्तविक रोबोटिक हाथ के साथ किया जिसमें 16 उंगलियां थीं।

  • स्कोर: रोबोट वास्तविक दुनिया में 78.2% बार सफल रहा।
  • तुलना: यह पिछले तरीकों (जो लगभग 50-65% स्कोर करते थे) की तुलना में बहुत बेहतर था।
  • गैप: गेम बनाम वास्तविक दुनिया में प्रदर्शन का अंतर बहुत कम था (केवल 8.3%)। पिछले तरीकों में एक बड़ा अंतर था (अक्सर 20-30% से अधिक), जिसका अर्थ था कि वे गेम में तो शानदार काम करते थे लेकिन वास्तविकता में विफल हो जाते थे।
  • जीरो-शॉट: महत्वपूर्ण रूप से, रोबोट ने पूरी तरह से सिमुलेशन में सीखा। उसने वास्तविक दुनिया से मानव से एक भी प्रदर्शन नहीं देखा। उसने सिस्टम के स्मार्ट समायोजन के माध्यम से अपने कौशल को शुद्ध रूप से स्थानांतरित करना सीखा।

सारांश में

DexSim2Real एक रोबोट ट्रेनिंग कैंप की तरह है जो सफलता सुनिश्चित करने के लिए तीन उपकरणों का उपयोग करता है:

  1. एक AI आर्ट क्रिटिक जो प्रशिक्षण वीडियो गेम को बिल्कुल वास्तविक दुनिया जैसा बनाता है।
  2. एक मल्टी-सेंसरी ब्रेन जो रोबोट को एक साथ "देखने" और "महसूस करने" की अनुमति देता है।
  3. एक स्मार्ट कोच जो बड़े, डरावने कार्यों को छोटे, प्रबंधनीय चरणों में तोड़ देता है।

परिणामस्वरूप, एक ऐसा रोबोट मिलता है जो कंप्यूटर में जटिल, नाजुक हाथों की गतिविधियों को सीख सकता है और लैब से बाहर निकलकर उन्हें वास्तविक दुनिया में लगभग पूरी तरह से कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →