← नवीनतम पेपर
💻 computer science

SPIDER: Scalable Physics-Informed Dexterous Retargeting

SPIDER एक स्केलेबल, फिजिक्स-इन्फॉर्म्ड रिटारगेटिंग फ्रेमवर्क है जो केवल किनेमैटिक मानव गति डेटा को डायनामिकली फिजिबल रोबोट ट्रैजेक्टरीज में रूपांतरित करता है, जो विविध ह्यूमनॉइड और डेक्सटरस हैंड एम्बॉडिमेंट्स में पॉलिसी लर्निंग दक्षता और सफलता दर में महत्वपूर्ण सुधार करता है।

मूल लेखक: Chaoyi Pan, Changhao Wang, Haozhi Qi, Zixi Liu, Homanga Bharadhwaj, Akash Sharma, Tingfan Wu, Guanya Shi, Jitendra Malik, Francois Hogan

प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chaoyi Pan, Changhao Wang, Haozhi Qi, Zixi Liu, Homanga Bharadhwaj, Akash Sharma, Tingfan Wu, Guanya Shi, Jitendra Malik, Francois Hogan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कोई जटिल कार्य करना सिखाना चाहते हैं, जैसे चाय का कप डालना या गिटार बजाना। आपके पास हजारों वीडियो का एक पुस्तकालय है जो मनुष्यों को ये चीजें पूरी तरह से करते हुए दिखाते हैं। लेकिन एक समस्या है: रोबोट और मनुष्य बहुत अलग तरह से बने होते हैं।

यदि आप केवल मानव हाथों की गतिविधियों को रोबोट पर कॉपी करते हैं, तो रोबोट विफल हो सकता है। क्यों? क्योंकि मनुष्यों में वे मांसपेशियां और संतुलन होता है जो रोबोट के पास नहीं होता, और रोबोट के जोड़ कठोर होते हैं और उनकी उंगलियों का आकार भी अलग होता है। मानव की एक गति जो वीडियो में सहज दिख सकती है, वह रोब로는 मेज से टकरा सकता है, कप गिरा सकता है, या फंस सकता है क्योंकि भौतिकी (physics) मेल नहीं खाती।

यह वह समस्या है जिसे SPIDER हल करता है।

मुख्य विचार: "फिजिक्स ट्रांसलेटर" (भौतिकी अनुवादक)

SPIDER को एक सुपर-स्मार्ट ट्रांसलेटर के रूप में सोचें जो न केवल शब्दों का अनुवाद करता है, बल्कि भौतिकी का भी अनुवाद करता है।

  1. इनपुट (मानव स्क्रिप्ट): आप SPIDER को एक वीडियो या मोशन-कैप्चर डेटा देते हैं जिसमें एक मनुष्य कोई कार्य कर रहा है। यह केवल "काइनेमैटिक" डेटा है—यह आपको बताता है कि हाथ कहाँ गया, लेकिन यह नहीं कि उसने कितनी जोर से धक्का दिया या क्या उसने वास्तव में वस्तु को सही ढंग से छुआ।
  2. समस्या (एम्बॉडिमेंट गैप): यदि आप इस "मानव स्क्रिप्ट" को एक रोबोट पर चलाने की कोशिश करते हैं, तो रोबोट दीवार के आर-पार जाने की कोशिश कर सकता है या कप को ऐसी पकड़ के साथ पकड़ सकता है जिससे कप टूट जाए। यह एक साइकिल के लिए स्टीयरिंग निर्देशों का उपयोग करके फॉर्मूला 1 कार चलाने जैसा है।
  3. SPIDER का समाधान (सिमुलेशन लैब): SPIDER उस मानव स्क्रिप्ट को लेता है और उसे एक आभासी भौतिकी प्रयोगशाला (सिमुलेटर) के माध्यम से चलाता है। यह पूछता है: "यदि एक रोबोट यह करने की कोशिश करे, तो क्या यह काम करेगा?"
    • यदि उत्तर नहीं है, तो SPIDER उस गतिविधि में बदलाव करता है।
    • यह "सैंपलिंग" (एक साथ हजारों सूक्ष्म विविधताओं को आज़माना) नामक विधि का उपयोग करता है ताकि गति का एक ऐसा संस्करण पाया जा सके जो भौतिकी के नियमों का पालन करता हो।
    • यह "वर्चुअल कॉन्टैक्ट गाइडेंस" (एक चतुर तकनीक) का उपयोग करता है ताकि यह सुनिश्चित हो सके कि रोबोट की उंगलियां वास्तव में वस्तु से उसी तरह चिपकी रहें जैसे मानव ने की थीं, न कि फिसल जाएं या गलत जगह पकड़ लें।

रचनात्मक उपमा: "घोस्ट हैंड" (भूतिया हाथ) और "स्टिकी टेप" (चिपकने वाला टेप)

कल्पना कीजिए कि आप एक अनाड़ी रोबोटिक हाथ को एक नाजुक अंडे को उठाने के लिए सिखाने की कोशिश कर रहे हैं।

  • मानव डेमो: आप एक वीडियो दिखाते हैं जिसमें एक मनुष्य धीरे से अंडे को उठा रहा है।
  • रोबोट का भ्रम: रोबोट हाथ के आकार की नकल करने की कोशिश करता है, लेकिन उसकी उंगलियां बहुत बड़ी और सख्त हैं। वह अंडे को कुचल देता है।
  • SPIDER का "घोस्ट हैंड": SPIDER कंप्यूटर में रोबोट का एक "घोस्ट" (भूतिया) संस्करण बनाता है। यह मानव गतिविधि को आज़माता है, देखता है कि अंडा कुचल गया, और कहता है, "नहीं, यह अवैध भौतिकी है।" यह फिर से प्रयास करता है, और बार-बार, समानांतर में लाखों बार, जब तक कि उसे वह तरीका न मिल जाए जिससे रोबोट अंडे को बिना तोड़े पकड़ सके।
  • "स्टिकी टेप" (वर्चुअल कॉन्टैक्ट): कभी-कभी, रोबोट को पता नहीं होता कि अंडे को कहाँ छूना है। SPIDER सिमुलेशन में रोबोट की उंगली और अंडे के बीच एक अदृश्य "वर्चुअल टेप" लगा देता है। यह टेप रोबोट की उंगली को अंडे के सही स्थान की ओर धीरे से खींचता है। जैसे-जैसे रोबोट सही उत्तर के करीब पहुँचता है, टेप कमजोर होता जाता है, जिससे रोबोट स्वाभाविक पकड़ खुद सीख पाता है।

यह एक बड़ी बात क्यों है

पेपर तीन प्रमुख जीत का दावा करता है:

  1. यह तेज़ है: इन गतिविधियों को ठीक करने के पारंपरिक तरीके (जैसे सुदृढीकरण सीखना या Reinforcement Learning) एक कुत्ते को नाचने के लिए प्रशिक्षित करने जैसे हैं जिसमें उसे वर्षों तक अभ्यास करना पड़ता है। SPIDER एक कोच की तरह है जो कुत्ते को एक बार चाल दिखाता है और तुरंत सुधार करता है। पेपर कहता है कि SPIDER इन पुराने तरीकों की तुलना में 10 गुना तेज़ है।
  2. यह हर जगह काम करता है: उन्होंने SPIDER का परीक्षण 9 अलग-अलग प्रकार के रोबोटों (छोटे कुशल हाथों से लेकर पूर्ण आकार के ह्युमनॉइड रोबोट तक) और मानव गतिविधियों के 6 अलग-अलग डेटासेट्स पर किया। यह उन सभी के लिए काम करता है, मानव डेटा को ऐसे रोबोट डेटा में बदल देता है जो वास्तव में काम करता है।
  3. यह एक विशाल पुस्तकालय बनाता है: क्योंकि यह बहुत तेज़ है, SPIDER मानव वीडियो की थोड़ी मात्रा ले सकता है और उसे 2.4 मिलियन फ्रेम के उच्च-गुणवत्ता वाले रोबोट डेटा में बदल सकता है। यह एक एकल रेसिपी बुक को एक विशाल कुकबुक में बदलने जैसा है जो रोबोट को हजारों व्यंजन पकाना सिखाती है।

परिणाम

रोबोटों को शारीरिक रूप से घुमाने के लिए (जो धीमा और महंगा है) भौतिक रूप से डेटा एकत्र करने में वर्षों और लाखों डॉलर खर्च करने के बजाय, शोधकर्ता अब SPIDER का उपयोग कर सकते हैं। वे मौजूदा मानव वीडियो ले सकते हैं, उन्हें इस "फिजिक्स ट्रांसलेटर" के माध्यम से चला सकते हैं, और तुरंत सुरक्षित, व्यवहार्य और सफल रोबोट गतिविधियों का एक पुस्तकालय प्राप्त कर सकते हैं।

पेपर निष्कर्ष निकालता है कि यह रोबोटों को जटिल कौशल बहुत तेज़ी से सीखने की अनुमति देता है, जो इस बात के बीच के अंतर को पाटता है कि मनुष्य कैसे चलते हैं और रोबोट वास्तव में वास्तविक दुनिया में कैसे चल सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →