← नवीनतम पेपर
💻 computer science

DexSynRefine: Synthesizing and Refining Human-Object Interaction Motion for Physically Feasible Dexterous Robot Actions

DexSynRefine एक युग्मित ढांचा (coupled framework) है जो मोशन प्रायर (motion priors) का उपयोग करके प्रक्षेपवक्र निर्माण (trajectory generation) और कॉन्टैक्ट-डायनामिक्स अनुकूलन के साथ टास्क-स्पेस सुदृढीकरण शिक्षण (task-space reinforcement learning) के माध्यम से विरल मानव-वस्तु अंतःक्रिया डेटा से भौतिक रूप से व्यवहार्य दक्ष रोबोटिक क्रियाओं को संश्लेषित करता है, जिससे कि यह किनेमैटिक रिटारगेटिंग की तुलना में वास्तविक दुनिया की सफलता दर में 50–70 प्रतिशत अंक सुधार करता है।

मूल लेखक: Hyesung Lee, Hyunwoo Jung, Si-Hwan Heo, Sungwook Yang

प्रकाशित 2026-06-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyesung Lee, Hyunwoo Jung, Si-Hwan Heo, Sungwook Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को, जिसके पास इंसानों जैसे हाथ हैं, एक नाजुक कार्य करना सिखाना चाहते हैं, जैसे कि हथौड़ा उठाना या वॉटरिंग कैन से पानी डालना। आप किसी इंसान को यह करते हुए रिकॉर्ड करने की कोशिश कर सकते हैं, लेकिन इसमें एक बड़ी समस्या है: इंसानी हाथ और रोबोटिक हाथ अलग तरह से बने होते हैं, और हमारे पास जो डेटा उपलब्ध है वह अक्सर स्पार्स (sparse) होता है (हमारे पास केवल कुछ ही वीडियो होते हैं) और काइनेमैटिक (kinematic) होता है (यह दिखाता है कि चीजें कहाँ हिलती हैं, लेकिन यह नहीं कि वे कितने जोर से दबाव डालती हैं या इसमें शामिल अदृश्य बल क्या हैं)।

यदि आप केवल रोबोट को इंसान की गतिविधियों की नकल करने के लिए कहते हैं, तो वह आमतौर पर विफल हो जाता है क्योंकि रोबोट भौतिकी (physics) या अपनी यांत्रिक सीमाओं को नहीं समझता है।

यह पेपर DexSynRefine पेश करता है, जो एक तीन-चरणीय "रेसिपी" है जो स्पार्स मानव वीडियो को सफल रोबोटिक क्रियाओं में बदल देती है। इसे एक तीन-चरणों वाली अनुवाद प्रक्रिया के रूप में समझें:

1. "क्रिएटिव डायरेक्टर": योजना का संश्लेषण करना (HOI-MMFP)

समस्या: आपके पास बोतल उठाने के कुछ ही वीडियो हैं। क्या होगा अगर बोतल थोड़ी अलग जगह पर हो? रोबोट को नहीं पता कि क्या करना है।
समाधान: सिस्टम एक क्रिएटिव डायरेक्टर की तरह काम करता है जो आपके कुछ वीडियो देखता है और उसी कार्य के सैकड़ों नए संस्करणों की कल्पना करता है।

  • उपमा: कल्पना करें कि आप एक निर्देशक को दरवाजा खोलने वाले व्यक्ति का एक एकल स्केच दिखाते हैं। निर्देशक केवल उस स्केच की नकल नहीं करता; वह दरवाजे के काम करने के अपने ज्ञान का उपयोग करके यह कल्पना करता है कि वह व्यक्ति बाईं ओर, दाईं ओर, या यहाँ तक कि यदि दरवाजा थोड़ा भारी है, तो दरवाजा कैसे खोलेगा।
  • यह क्या करता है: यह आपके स्पार्स मानव डेटा को लेता है और एक सुचारू, सुसंगत "मूवी" बनाता है कि वस्तु के सापेक्ष एक हाथ को कैसे हिलना चाहिए, चाहे वस्तु कहीं भी शुरू हुई हो। यह अंतराल को भर देता है ताकि रोबोट के पास पालन करने के लिए एक पूर्ण योजना हो।

2. "फिजिक्स कोच": योजना को आधार देना (Task-Space Residual RL)

समस्या: एक आदर्श मूवी प्लान के होने के बावजूद, रोबोट अपने जोड़ों को तोड़ने वाले तरीके से अपनी उंगलियों को चलाने की कोशिश कर सकता है या घर्षण (friction) या वजन के कारण वस्तु से फिसल सकता है क्योंकि वह भौतिकी को नहीं समझता है।
समाधान: सिस्टम एक "फिजिक्स कोच" जोड़ता है जो योजना को देखता है और वास्तविक समय में छोटे सुधार करता है।

  • उपमा: एक डांस इंस्ट्रक्टर (नृत्य प्रशिक्षक) के बारे में सोचें। छात्र (रोबोट) कोरियोग्राफी (सिंथेसाइज्ड प्लान) का पालन करने की कोशिश करता है। प्रशिक्षक पूरे नृत्य को फिर से नहीं लिखता; इसके बजाय, वह छात्र के हाथ को यहाँ धीरे से धकेलता है या उनकी पकड़ को वहाँ थोड़ा समायोजित करता है ताकि वे लड़खड़ा न जाएं या दीवार से न टकराएं।
  • यह क्या करता है: यह चरण 1 से मिली "मूवी" को लेता है और छोटे "रेसिड्युअल" (residual) समायोजन जोड़ता है। यह सीखता है कि "ठीक है, योजना कहती है कि यहाँ पकड़ो, लेकिन घर्षण के कारण, मुझे थोड़ा अधिक जोर से दबाना होगा या अपनी कलाई को थोड़ा अलग तरीके से घुमाना होगा।" यह सुनिश्चित करता है कि गति भौतिक रूप से संभव हो।

3. "इंट्यूटिव पायलट": वास्तविकता के अनुकूल होना (Contact & Dynamics Adaptation)

समस्या: कंप्यूटर सिमुलेशन में, रोबोट को ठीक से पता होता है कि वस्तु कितनी भारी है और क्या वह मेज को छू रही है। वास्तविक दुनिया में, रोबोट के सेंसर इन अदृश्य बलों को "देख" नहीं सकते। यह अपनी आँखें बंद करके कार चलाने जैसा है, जहाँ आप सड़क की स्थितियों का अनुमान लगा रहे हैं।
समाधान: सिस्टम रोबोट को उसके अपने शरीर की गतिविधियों (प्रोपियोसेप्शन/proprioception) के माध्यम से दुनिया को "महसूस" करना सिखाता है।

  • उपमा: एक आंखों पर पट्टी बांधे हुए पियानो वादक की कल्पना करें। वे चाबियों को देख नहीं सकते, लेकिन वे तारों के कंपन और चाबियों के प्रतिरोध को महसूस कर सकते हैं ताकि वे जान सकें कि वे कहाँ हैं और वे कितनी जोर से दबा रहे हैं।
  • यह क्या करता है: रोबोट अपने आंदोलनों के इतिहास (उसका हाथ और उंगलियां कैसे हिल रही थीं) को देखकर यह अनुमान लगाता है कि वस्तु के साथ क्या हो रहा है। क्या हथौड़ा अभी कील से टकराया है? क्या पानी छलक रहा है? यह अनुमान लगाने के लिए इन संकेतों का उपयोग करता है ताकि वह तुरंत अपनी पकड़ और बल को अनुकूलित कर सके, जिससे वह बिना किसी कंप्यूटर सिमुलेशन की "चीट शीट" के वास्तविक दुनिया में काम कर सके।

परिणाम

जब शोधकर्ताओं ने इस तीन-चरणीय प्रक्रिया का परीक्षण पांच कठिन कार्यों (जैसे प्रिंगल्स कैन को पुनर्व्यवस्थित करना या कील ठोकना) पर किया, तो परिणाम नाटकीय थे:

  • पुराना तरीका (केवल मानव गति की नकल करना): रोबोट 10% से भी कम समय के लिए सफल हुआ। वह चीजों को गिरा देता था या उन्हें पकड़ने में विफल रहता था।
  • DexSynRefine: रोबोट 50% से 70% अधिक बार सफल हुआ।

संक्षेप में: DexSynRefive केवल रोबोट को यह नहीं बताता कि "इंसान की नकल करो।" यह एक पूर्ण योजना की कल्पना करता है, रोबोट को गति की भौतिकी सिखाता है, और रोबोट को वास्तविक दुनिया में रास्ता खोजने के लिए प्रशिक्षित करता है, जिससे कुछ मानव वीडियो एक विश्वसनीय रोबोटिक कौशल में बदल जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →