← नवीनतम पेपर
💻 computer science

In-Hand Manipulation of Articulated Tools with Dexterous Robot Hands with Sim-to-Real Transfer

यह शोध पत्र एक सिम-टू-रियल (sim-to-real) इन-हैंड मैनिपुलेशन के लिए एक नवीन दृष्टिकोण प्रस्तुत करता है, जो एक सिमुलेशन-प्रशिक्षित बेस पॉलिसी को एक सेंसर-संचालित रिफाइनमेंट मॉड्यूल के साथ जोड़ता है जो स्पर्श (tactile) और फोर्स-टॉर्क फीडबैक को फ्यूज करने के लिए क्रॉस-अटेंशन का उपयोग करता है, जिससे सटीक भौतिक मॉडलिंग के बिना विविध उपकरणों में वास्तविक दुनिया की जॉइंट घटनाओं और गड़बड़ियों के प्रति ऑनलाइन अनुकूलन सक्षम होता है।

मूल लेखक: Soofiyan Atar, Daniel Huang, Florian Richter, Michael Yip

प्रकाशित 2026-03-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Soofiyan Atar, Daniel Huang, Florian Richter, Michael Yip

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक हाथ को कैंची का उपयोग करना सिखा रहे हैं। यह सुनने में सरल लगता है, है ना? लेकिन एक रोबोट के लिए, यह एक फिसलन भरे फर्श पर यूनिसाइकिल चलाते हुए जग्लिंग करने की कोशिश करने जैसा है।

रोबोट को कैंची को स्थिर पकड़ना (ग्रैस्पिंग) होता है और साथ ही ब्लेड को चलाने के लिए हैंडल को दबाना (आर्टिक्यूलेशन) भी होता है। यदि रोबोट बहुत ज़ोर से दबाता है, तो कैंची फिसल जाती है। यदि वह बहुत हल्का दबाता है, तो वे गिर जाती हैं। और यदि "दुनिया कैसे काम करती है" के बारे में उसका सिमुलेशन थोड़ा भी गलत है, तो वास्तविक दुनिया का भौतिक विज्ञान (जैसे घर्षण या धातु का आपस में रगड़ना) रोबोट को तुरंत विफल कर देगा।

यह पेपर एक चतुर तीन-चरणीय समाधान प्रस्तुत करता है जो एक रोबोटिक हाथ को बिना किसी इंसान के हर सेकंड हाथ थामे रखे, कैंची, प्लायर और सर्जिकल क्लैंप जैसे कठिन औजारों में महारत हासिल करने के लिए सिखाता है।

यहाँ रोजमर्रा के उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "वीडियो गेम बनाम वास्तविकता" का अंतर

कंप्यूटर सिमुलेशन में एक रोबोट को प्रशिक्षित करने को एक वीडियो गेम की तरह सोचें। गेम में, आप भौतिकी (physics) को पूरी तरह से प्रोग्राम कर सकते हैं। लेकिन जब आप उस चरित्र को वास्तविक दुनिया में ले जाते हैं, तो "ग्लिच" (खामियां) दिखाई देने लगती हैं।

  • वास्तविकता का अंतर (The Reality Gap): वास्तविक दुनिया में, धातु के हिस्सों में सूक्ष्म उभार, ग्रीस और "चिपचिपाहट" (घर्षण) होती है जिसे कंप्यूटर ने अनुमानित नहीं किया था।
  • स्पर्श संबंधी अंधापन (The Tactile Blindness): वर्तमान रोबोटिक हाथ मोटे सर्दियों के दस्ताने पहने लोगों की तरह हैं। वे यह महसूस कर सकते हैं कि वे किसी चीज़ को छू रहे हैं, लेकिन वे तुरंत प्रतिक्रिया देने के लिए दबाव या फिसलन को पर्याप्त विस्तार से महसूस नहीं कर सकते।

2. समाधान: एक तीन-अंकों वाला नाटक

लेखकों ने एक पाइपलाइन बनाई है जो एक मास्टर शेफ द्वारा प्रशिक्षु (Apprentice) को प्रशिक्षित करने की तरह कार्य करती है।

अंक 1: "गॉड-मोड" मास्टर (द ओरेकल)

सबसे पहले, वे सिमुलेशन में एक सुपर-स्मार्ट AI को प्रशिक्षित करते हैं। इस AI के पास "गॉड-मोड" के विशेषाधिकार हैं। यह रोबोट के जोड़ों के अंदर देख सकता है, सटीक रूप से जान सकता है कि कितना घर्षण मौजूद है, और उन बलों को महसूस कर सकता है जो वास्तविकता में अस्तित्व में नहीं हैं।

  • ट्रिक: वे केवल इसे एक शांत रसोई में अभ्यास करने के लिए नहीं छोड़ते। वे इसके सामने "रैंडम तूफान" फेंकते हैं—गुरुत्वाकर्षण में बदलाव, अचानक झटके और फिसलन भरी सतहों का अनुकरण करते हैं।
  • परिणाम: AI कैंची को स्थिर पकड़ना सीख जाता है, भले ही दुनिया हिल रही हो। यह स्थिरता का मास्टर बन जाता है।

अंक 2: "प्रशिक्षु" (द स्टूडेंट)

अब, उन्हें इस मास्टर के कौशल को उस रोबोट को सिखाना है जो वास्तव में वास्तविक दुनिया में काम करेगा। लेकिन वास्तविक रोबोट के पास "गॉड-मोड" दृष्टि नहीं है; इसके पास केवल अपने स्वयं के सेंसर (प्रोप्रियोसेप्शन) हैं, जैसे कि यह जानना कि उसकी उंगलियां कितनी मुड़ी हुई हैं।

  • डिस्टिलेशन (Distillation): वे "गॉड-मोड" मास्टर को लेते हैं और उसे एक ऐसे "प्रशिक्षु" को सिखाने के लिए मजबूर करते है जो केवल वही देख सकता है जो एक सामान्य रोबोट देखता है। प्रशिक्षु केवल बुनियादी जानकारी का उपयोग करके मास्टर की गतिविधियों की नकल करना सीखता है।
  • सीमा: प्रशिक्षु अच्छा है, लेकिन यह अभी भी थोड़ा "ओपन-लूप" है। यह एक पियानो वादक की तरह है जो एक गाना पूरी तरह से याद करके बजा रहा है, लेकिन यदि कोई पियानो को टकरा दे, तो उसे अपने हाथों को वास्तविक समय में समायोजित करने का पता नहीं होता।

अंक 3: "स्मार्ट चश्मा" (CATFA)

यही इस पेपर का बड़ा नवाचार है। वे CATFA (क्रॉस-अटेंशन टैक्टाइल फोर्स अडैप्टेशन) नामक एक विशेष मॉड्यूल जोड़ते हैं।

  • रूपक: कल्पना करें कि प्रशिक्षु कार चला रहा है। उसे रास्ता पता है (योजना)। लेकिन अचानक, वह बर्फ की एक परत से टकरा जाता है।
  • CATFA कैसे काम करता है: यह नहीं कि कार का कंप्यूटर पूरे ड्राइविंग प्लान को फिर से लिखने की कोशिश करे, CATFA एक स्मार्ट चश्मे वाले सह-पायलट की तरह कार्य करता है।
    • रोबोट के हाथ में विशेष "त्वचा" (टैक्टाइल सेंसर) होती है जो दबाव और टॉर्क (मरोड़ बल) को महसूस करती है।
    • CATFA रोबोट की इच्छित चाल (योजना) को देखती है और इसकी तुलना उससे करती है जो सेंसर वास्तव में महसूस कर रहे हैं।
    • यदि सेंसर कहते हैं, "हे, कैंची फिसल रही है!" तो CATFA तुरंत रोबोट की उंगलियों को एक सूक्ष्म सुधार फुसफुसाता है: "यहाँ थोड़ा ज़ोर से दबाओ, वहाँ ढीला छोड़ो।"
  • यह क्यों विशेष है: यह रोबोट के मस्तिष्क को ओवरराइट नहीं करता है; यह केवल उस आधार पर एक परत जोड़ता है जो वह अभी महसूस कर रहा है। यह "क्रॉस-अटेंशन" नामक तकनीक का उपयोग करता है, जो रोबोट के ध्यान को केवल हाथ के उस विशिष्ट भाग पर केंद्रित करने जैसा है जहाँ समस्या हो रही है, बजाय इसके कि वह एक साथ सभी डेटा से भ्रमित हो जाए।

3. परिणाम: कैंची, प्लायर और सर्जन

टीम ने इसे पांच अलग-अलग औजारों पर परखा:

  • कैंची और प्लायर: औजार जिनमें पिंच करने और घुमाने की आवश्यकता होती है।
  • सर्जिकल टूल्स: न्यूनतम आक्रामक सर्जरी में उपयोग किए जाने वाले नाजुक उपकरण।
  • स्टेपलर: औजार जिनमें एक तेज़, बलपूर्वक झटके की आवश्यकता होती है।

परिणाम:

  • CATFA के बिना: रोबोट अक्सर औजार को गिरा देता या टकराने पर उसे सही ढंग से खोलने/बंद करने में विफल रहता।
  • CATFA के साथ: रोबट अविश्वसनीय रूप से मजबूत हो गया। यहाँ तक कि जब शोधकर्ताओं ने रोबोटिक हाथ को भौतिक रूप से झटका दिया या औजार का वजन बदल दिया, तब भी रोबोट ने तुरंत अपनी पकड़ को समायोजित किया और काम जारी रखा। इसने बिना किसी अतिरिक्त प्रशिक्षण के "वीडियो गेम" सिमुलेशन से वास्तविक दुनिया में सफलतापूर्वक स्थानांतरण किया।

मुख्य निष्कर्ष

यह पेपर "भंगुर" (brittle) रोबोटों की समस्या को हल करता है। वास्तविक दुनिया का एक आदर्श सिमुलेशन बनाने के बजाय (जो असंभव है), उन्होंने एक ऐसा रोबोट बनाया जो सिमुलेशन में एक ठोस आधार सीखता है और फिर अपनी गलतियों को ठीक करने के लिए रियल-टाइम संवेदी फीडबैक का उपयोग करता है।

यह एक ऐसे रोबोट के बीच का अंतर है जो नृत्य की दिनचर्या को याद करता है और संगीत रुकने पर गिर जाता है, बनाम एक ऐसा रोबोट जो नाच सकता है, फर्श को महसूस कर सकता है, और यदि कोई उसे टक्कर दे तो तुरंत अपने कदमों को समायोजित कर सकता है। यह हमें उन रोबोटों के करीब लाता है जो वास्तव में हमारी अव्यवस्थित, अप्रत्याशित मानव दुनिया में मदद कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →