← नवीनतम पेपर
💻 computer science

SWIM: Vision-Language-Grounded Soft Whole-Body Interactive Manipulation

SWIM एक विजन-लैंग्वेज-ग्राउंडेड फ्रेमवर्क है जो डिफ्यूजन-आधारित VLA पॉलिसी को विजुअल सॉफ्ट प्रोप्रियोसेप्शन के साथ एकीकृत करके सॉफ्ट कंटीनम रोबोट्स को जटिल होल-बॉडी इंटरेक्टिव मैनिपुलेशन करने में सक्षम बनाता है, ताकि निष्पादन योग्य एक्चुएशन सीक्वेंस उत्पन्न किए जा सकें जो मजबूत भौतिक निष्पादन के लिए अंतर्निहित अनुपालन (इंट्रिन्सिक कंप्लायंस) का लाभ उठाते हैं।

मूल लेखक: Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

प्रकाशित 2026-09-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोटिक्स की दुनिया में, कठोर धातु के फ्रेम से बनी मशीनों और नरम, लचीली सामग्रियों से निर्मित मशीनों के बीच एक स्पष्ट विभाजन है। कठोर रोबोट, जैसे कि कार कारखानों में देखे जाने वाले हाथ, सटीक, पूर्व-निर्धारित निश्चितता के साथ चलते हैं, लेकिन उन्हें तंग जगहों में घुसने या नाजुक, अनियमित वस्तुओं को बिना कुचले संभालने के लिए संघर्ष करना पड़ता है। इसके विपरीत, सॉफ्ट रोबोट लचीली सामग्रियों से बने होते हैं जो जीवित ऊतकों की तरह मुड़ सकते हैं, खिंच सकते हैं और घूम सकते हैं। यह लचीलापन उन्हें वस्तुओं के चारों ओर लिपटने और अपने आकार को परिवेश के अनुसार ढालने की अनुमति देता है, जो सीमित स्थानों में कार्यों के लिए या मनुष्यों के साथ सुरक्षित रूप से बातचीत करने के लिए एक संभावित समाधान प्रदान करता है। हालाँकि, यही लचीलापन एक नई समस्या पैदा करता है: एक ऐसे शरीर को नियंत्रित करना जो अनगिनत तरीकों से विकृत हो सकता है, अत्यंत कठिन है। जब कोई मानव "उसे उठा लो" जैसा सरल आदेश देता है, तो एक कठोर रोबोट अपने हाथ को चलाने के लिए एक एकल पथ की गणना कर सकता है। एक सॉफ्ट रोबोट, जिसका पूरा शरीर आकार बदलने में सक्षम है, को उसी लक्ष्य को प्राप्त करने के लिए अपने पूरे रूप को कैसे मोड़ना है, यह समझना पड़ता है; यह एक ऐसा कार्य है जिसके लिए न केवल वस्तु को, बल्कि वास्तविक समय में रोबोट के अपने जटिल ज्यामिति (geometry) को समझने की आवश्यकता होती है।

शोधकर्ताओं ने इस विशिष्ट चुनौती को हल करने के लिए हाल ही में SWIM नामक एक नई प्रणाली विकसित की है, जो एक सॉफ्ट रोबोट को पूरे शरीर के हेरफेर (whole-body manipulation) को करने के लिए भाषा और दृश्य दृश्यों को समझने के लिए प्रशिक्षित करती है। टीम ने एक सर्पिल (spiral) आकार के रोबोट पर ध्यान केंद्रित किया जो केबलों द्वारा संचालित होता है, ठीक वैसे ही जैसे मांसपेशियां हड्डियों पर खिंचाव डालती हैं, जो इसे मुड़ने, पहुँचने और वस्तुओं के चारों ओर लिपटने की अनुमति देता है। उन्होंने जिस मुख्य कठिनाई को संबोधित किया वह यह थी कि पिछले तरीके अक्सर इन रोबोटों को केवल हाथ के सिरे (tip) पर ध्यान केंद्रित करके नियंत्रित करने की कोशिश करते थे, जिससे शरीर के बाकी हिस्से के जटिल आकार की अनदेखी हो जाती थी। यह दृष्टिकोण विफल रहा क्योंकि सिरे की स्थिति यह पूरी तरह से वर्णित नहीं करती कि बाकी शरीर कैसे मुड़ा हुआ है या वह दुनिया को कैसे छू रहा है। इसे ठीक करने के लिए, शोधकर्ताओं ने एक ऐसी शिक्षण प्रणाली बनाई जो एक साथ रोबोट के पूरे शरीर के आकार, दृश्य दृश्य और बोले गए निर्देश को देखती है। उन्होंने इस प्रणाली को एक सिम्युलेटेड वातावरण में प्रशिक्षित किया जहाँ रोबोट हजारों बार अभ्यास कर सकता था, यह सीखने के लिए कि केबल की गतिविधियों का एक क्रम कैसे अनुमानित किया जाए जो एक लक्ष्य को प्राप्त करे, जैसे कि किसी वस्तु को पैक करना, किसी लक्ष्य तक पहुँचना, या उसे पकड़ना।

उनके तरीके में एक प्रमुख नवाचार एक तकनीक है जिसे वे "विजुअल सॉफ्ट प्रोप्रियोसेप्शन" (visual soft proprioception) कहते हैं। सरल शब्दों में, इसका अर्थ है कि रोबोट कैमरा इमेज से अपने शरीर के आकार को "देखना" सीखता है, जो केबल तनाव के उसके आंतरिक ज्ञान का पूरक बनता है। प्रशिक्षण के दौरान, सिस्टम ने अपनी कॉन्फ़िगरेशन को समझने के लिए वर्तमान टेंडन-लेंथ वेक्टर (tendon-length vector) का प्रोप्रियोसेप्टिव इनपुट के रूप में उपयोग किया, जबकि साथ ही उसे सिमुलेशन में रोबोट के शरीर के कई बिंदुओं के सटीक निर्देशांक (coordinates) भी दिखाए गए। इन बिंदुओं का पूर्वानुमान लगाने के लिए कंप्यूटर मॉडल को मजबूर करके, सिस्टम ने रोबोट की ज्यामिति का एक मानसिक मानचित्र रखना सीख लिया। इसने इसे यह समझने में मदद की कि किसी विशिष्ट वस्तु तक पहुँचने के लिए, रोबोट को अपने मध्य भाग को अलग तरह से मोड़ना पड़ सकता है बजाय इसके कि वह किसी चीज़ को पैक करने के लिए करे। इसके अतिरिक्त, लक्ष्य तक पहुँचने के लिए एक एकल, आदर्श पथ का अनुमान लगाने के बजाय, सिस्टम ने सफल आंदोलनों की एक श्रृंखला का अनुमान लगाना सीखा। यह महत्वपूर्ण है क्योंकि, एक सॉफ्ट बॉडी के साथ, अक्सर किसी वस्तु के चारों ओर लिपटने के कई अलग-अलग तरीके होते हैं, और सिस्टम को किसी एक कठोर योजना पर अटकने के बजाय किसी भी वैध विकल्प को चुनने के लिए पर्याप्त लचीला होना आवश्यक था।

शोधकर्ताओं ने इस दृष्टिकोण का परीक्षण दो तरह से किया: पहले एक कंप्यूटर सिमुलेशन में, और फिर वास्तविक भौतिक रोबोट पर। सिमुलेशन में, सिस्टम उल्लेखनीय रूप से सफल रहा, जिसने पैकिंग कार्यों को 100% बार, लक्ष्यों तक पहुँचने को 96% बार और वस्तुओं को पकड़ने को 88% बार सफलतापूर्वक पूरा किया। ये परिणाम अन्य तरीकों की तुलना में काफी बेहतर थे जिन्होंने शरीर-आकार जागरूकता या लचीले भविष्यवाणी मॉडल का उपयोग नहीं किया था। हालाँकि, असली परीक्षा तब हुई जब वे इस प्रणाली को वास्तविक दुनिया में ले आए। जब उन्होंने वास्तविक मशीन पर सीधे रोबोट के मस्तिष्क को चलाने की कोशिश की, जो कैमरे और मोटरों से वास्तविक समय में जुड़ा हुआ था, तो प्रदर्शन में भारी गिरावट आई। रोबोट 75% प्रयासों में वस्तुओं को पकड़ने में विफल रहा, जिसका मुख्य कारण प्रोसेसिंग में होने वाली मामूली देरी और सिमुलेशन तथा वास्तविकता के बीच का अंतर था, जिसके कारण रोबोट पुराने (outdated) डेटा पर कार्य कर रहा था।

इसे दूर करने के लिए, शोधकर्ताओं ने एक चतुर परिनियोजन रणनीति (deployment strategy) पेश की। रोबोट को चलते समय वास्तविक समय में सोचने और प्रतिक्रिया करने के लिए कहने के बजाय, वे पहले एक वर्चुअल सिमुलेशन में गतिविधियों के पूरे क्रम की योजना बनाने के लिए कहते हैं। रोबोट वास्तविक दुनिया को देखता है, दृश्य का एक डिजिटल ट्विन बनाता है, और फिर अपने मन में कार्य को पूरा करता है, कमांड की एक पूर्ण सूची तैयार करता है। एक बार जब यह पूर्ण अनुक्रम तैयार हो जाता है, तो रोबोट बिना रुके या दोबारा देखे या सोचे, इसे निष्पादित करता है। क्योंकि रोबोट का शरीर स्वाभाविक रूप से सॉफ्ट और लचीला है, इसलिए वह निरंतर कंप्यूटर सुधार की आवश्यकता के बिना छोटे bumps और संपर्क विविधताओं को स्वयं संभाल सकता है। जब उन्होंने इस "योजना बनाओ फिर निष्पादित करो" (plan then execute) पद्धति का उपयोग किया, तो भौतिक रोबोट की सफलता दर बढ़कर पैकिंग के लिए 100%, पहुँचने के लिए 80% और पकड़ने के लिए 75% हो गई। इसने प्रदर्शित किया कि अपने स्वयं के आकार की गहरी समझ को एक ऐसी रणनीति के साथ जोड़कर, जो इसकी प्राकृतिक शारीरिक लचीलेपन का लाभ उठाती है, सॉफ्ट रोबोट को सरल भाषा द्वारा निर्देशित किया जा सकता है ताकि वे जटिल, पूरे शरीर के कार्यों को कर सकें जो पहले पहुंच से बाहर थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →