← नवीनतम पेपर
🤖 AI

DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination

DeCAL एक भौतिक रूप से-आधारित दक्ष विजन-लैंग्वेज-एक्शन मॉडल है जो स्पर्श संबंधी संवेदन (tactile sensing) को गतिशील रूप से एकीकृत करने और भौतिक गतिकी (physical dynamics) को मॉडल करने के लिए एडेप्टिव विज़ुओ-टैक्टाइल फ्यूजन और लेटेंट को-इमेजिनेशन के साथ मिक्स्चर-ऑफ-ट्रांसफॉर्मर आर्किटेक्चर का लाभ उठाता है, ताकि संपर्क-समृद्ध हेरफेर कार्यों में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

प्रकाशित 2026-09-09
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से कारखानों के फर्श के स्वामी रहे हैं, जो पूर्वानुमानित पथों पर भारी वस्तुओं को कठोर सटीकता के साथ चलाते हैं। फिर भी, जब हम उन्हें हमारे घरों में प्रवेश करने और दैनिक जीवन के नाजुक, अव्यवस्थित कार्यों को करने के लिए कहते हैं—जैसे कि बल्ब लगाना, फूलदान पोंछना, या बोतल का ढक्कन घुमाना—तो वे अक्सर लड़खड़ा जाते हैं। दुनिया एक साफ, स्थिर ग्रिड नहीं है; यह निरंतर, सूक्ष्म घर्षण का स्थान है। सफल होने के लिए, एक मशीन को केवल देखना ही नहीं चाहिए; उसे महसूस करना चाहिए। उसे संपर्क के अदृश्य भौतिकी को समझना होगा: वह क्षण जब उंगली फिसलती है, घुंडी घुमाने के लिए आवश्यक दबाव, या जिस तरह से स्पर्श के नीचे एक नरम वस्तु विकृत होती है। दशकों से, वैज्ञानिकों ने रोबोट को आँखें और त्वचा दोनों देकर इस अंतर को पाटने की कोशिश की है, लेकिन एक मशीन को इन संवेदनाओं को एक एकल, तरल सहज ज्ञान में संयोजित करना सिखाना कृत्रिम बुद्धिमत्ता की सबसे कठिन चुनौतियों में से एक बना हुआ है।

शोधकर्ताओं की एक टीम ने अब 'DeCAL' नामक एक नई प्रणाली के साथ एक महत्वपूर्ण कदम आगे बढ़ाया है। यह केवल एक रोबोट नहीं है जो देख और छू सकता है; यह एक ऐसी प्रणाली है जिसे किसी भौतिक संपर्क के होने से पहले ही उसके भविष्य की कल्पना करने के लिए डिज़ाइन किया गया है। समझ, कल्पना और क्रिया को एकीकृत करने वाला एक मॉडल बनाकर, शोधकर्ताओं ने एक ऐसा रोबot नीति (policy) तैयार की है जो मानव हेरफेर की जटिल, संपर्क-युक्त दुनिया में उस स्तर की निपुणता के साथ काम कर सकती है जो पहले कभी नहीं देखी गई थी। इस प्रणाली का परीक्षण छह अलग-अलग कार्यों पर किया गया, जिसमें फूलदान पोंछने से लेकर छोटे पुर्जों को जोड़ने तक शामिल थे, और इसने लगातार मौजूदा उन्नत तरीकों से बेहतर प्रदर्शन किया। इन वास्तविक दुनिया के परीक्षणों में, DeCAL ने सरल कार्यों पर 100 प्रतिशत तक की सफलता दर हासिल की और सभी छह चुनौतियों में 71 प्रतिशत की मजबूत औसत सफलता दर बनाए रखी, भले ही वातावरण अप्रत्याशित तरीकों से बदल गया हो।

मुख्य समस्या जिसे शोधकर्ताओं ने हल किया वह यह है कि केवल दृष्टि अक्सर हेरफेर के सबसे महत्वपूर्ण क्षणों के प्रति अंधी होती है। जब एक रोबोट का हाथ किसी वस्तु की ओर बढ़ता है, तो उंगलियां अक्सर कैमरे के दृश्य को बाधित करती हैं, जिससे ठीक उसी समय एक "ब्लाइंड स्पॉट" बन जाता है जब रोबोट को सबसे अधिक जानकारी की आवश्यकता होती है। इसके अलावा, दृश्य डेटा रोबोट को यह नहीं बता सकता कि वह कितनी जोर से धक्का दे रहा है या क्या कोई वस्तु फिसलने वाली है। पिछले प्रयासों में रोबोट में स्पर्श सेंसर जोड़ना अक्सर उन्हें एक साधारण अतिरिक्त हिस्से के रूप में देखता था, लेकिन DeCAL स्पर्श संबंधी जानकारी को उसकी सोचने की प्रक्रिया के एक मौलिक हिस्से के रूप में एकीकृत करता है। यह प्रणाली प्रत्येक उंगली के सिरे पर उच्च-रिज़ॉल्यूशन वाले सेंसरों का उपयोग करती है जो दबाव के तहत वस्तु की सतह के आकार और सटीक बल का पता लगा सकते हैं। यह रोबोट को दुनिया को उस तरह से "महसूस" करने की अनुमति देता है जो उतना ही समृद्ध और विस्तृत है जितना कि वह देखता है।

DeCAL को जो वास्तव में अद्वितीय बनाता है, वह है इस जानकारी को संसाधित करने का इसका तरीका। वर्तमान क्षण में जो दिखता है या महसूस होता है उस पर केवल प्रतिक्रिया देने के बजाय, यह प्रणाली कल्पना करने के लिए प्रशिक्षित है कि आगे क्या होगा। यह तीन विशिष्ट लेकिन जुड़ी हुई क्षमताओं के साथ कार्य करता है। पहला, यह दृश्य दृश्य को देखकर, भाषा निर्देश को पढ़कर और संपर्क बिंदुओं को महसूस करके वर्तमान स्थिति को समझता है। दूसरा, यह "सह-कल्पना" (co-imagination) के एक रूप में संलग्न होता है, जहाँ यह भविष्यवाणी करता है कि अगले कुछ सेकंड में दृश्य और स्पर्श संवेदनाएं कैसे विकसित होंगी। यह अनिवार्य रूप से खुद से पूछता है, "यदि मैं अभी ढक्कन घुमाता हूँ, तो बल कैसे बदलेगा, और एक क्षण बाद वस्तु कैसी दिखेगी?" अंत में, यह इस कल्पित भविष्य का उपयोग कार्यों को पूरा करने के लिए आवश्यक सटीक गतिविधियों को तय करने के लिए करता है। यह भविष्योन्मुखी दृष्टिकोण रोबोट को पिछले पैटर्न के आधार पर केवल अनुमान लगाने के बजाय, परस्पर क्रिया की भौतिकी के आधार पर अपनी क्रियाओं की योजना बनाने की अनुमति देता है।

इसे काम करने के लिए, शोधकर्ताओं ने यह तय करने के लिए एक विशेष विधि विकसित की कि स्पर्श की संवेदना पर कब भरोसा किया जाए। कई कार्यों में, एक रोबोट हवा में घूम रहा हो सकता है जहाँ स्पर्श अप्रासंगिक है, और फिर अचानक किसी वस्तु के संपर्क में आता है। यदि रोबोट हर समय स्पर्श संकेतों पर समान ध्यान देता, तो वह हवा के शोर या संपर्क की कमी से भ्रमित हो जाता। DeCAL एक स्मार्ट गेटिंग तंत्र (gating mechanism) का उपयोग करता है जो स्पर्श की संवेदना के लिए एक वॉल्यूम नॉब की तरह कार्य करता है। जब रोबोट किसी चीज़ को नहीं छू रहा होता है, तो प्रणाली स्पर्श संकेतों के वॉल्यूम को कम कर देती है, और दृष्टि पर अधिक निर्भर रहती है। जैसे ही संपर्क होता है, प्रणाली तुरंत वॉल्यूम बढ़ा देती है, जिससे स्पर्श डेटा उच्च सटीकता के साथ गति को निर्देशित कर सके। यह गतिशील समायोजन सुनिश्चित करता है कि रोबोट सही समय पर सही संवेदना का उपयोग करे, जिससे संवेदी इनपुट एक-दूसरे के साथ संघर्ष न करें।

इस प्रणाली को बीस-दो उंगलियों वाले हाथों से लैस रोबोटिक भुजाओं के जोड़े के माध्यम से कठोर प्रयोगों में परखा गया। शोधकर्ताओं ने रोबोट को छह अलग-अलग गतिविधियों का कार्य दिया: फूलदान पोंछना, व्हाइटबोर्ड मिटाना, पुर्जे जोड़ना, ढक्कन घुमाना, तरल पदार्थ को पिपेट करना और बल्ब लगाना। ये कार्य इसलिए चुने गए क्योंकि इन सभी के लिए सूक्ष्म नियंत्रण और निरंतर भौतिक संपर्क की आवश्यकता होती है। रोबोट की तुलना कई अन्य अत्याधुनिक मॉडलों से की गई, जिनमें केवल दृष्टि पर आधारित मॉडल और वे मॉडल भी शामिल थे जिन्होंने स्पर्श का उपयोग तो किया लेकिन भविष्य की अवस्थाओं की कल्पना करने की क्षमता नहीं थी। परिणाम स्पष्ट थे: DeCAL अन्य सभी प्रणालियों की तुलना में कार्यों को पूरा करने में कहीं अधिक सफल रहा। उदाहरण के लिए, बल्ब लगाने के कार्य में, जहाँ दृष्टि अक्सर हाथ द्वारा बाधित होती है और कार्य के लिए सटीक टॉर्क की आवश्यकता होती है, DeCAL 40 प्रतिशत बार सफल रहा, जबकि अगले सबसे अच्छे मॉडल ने केवल 35 प्रतिशत सफलता प्राप्त की। फूलदान पोंछने के कार्य पर, DeCAL ने 100 प्रतिशत की पूर्ण सफलता दर हासिल की, जबकि सबसे अच्छा प्रतिस्पर्धी विजन-ओनली मॉडल केवल 30 प्रतिशत बार सफल रहा।

शायद इससे भी अधिक प्रभावशाली सिस्टम की उन स्थितियों को संभालने की क्षमता थी जिन्हें उसने पहले कभी नहीं देखा था। शोधकर्ताओं ने DeCAL का परीक्षण विभिन्न पृष्ठभूमि, बिखरी हुई वस्तुओं, कम रोशनी और पूरी तरह से नए आकार और आकार की वस्तुओं वाले वातावरण में किया। इन "आउट-ऑफ-डिस्ट्रीब्यूशन" परिदृश्यों में, जहाँ रोबोट याद किए गए पैटर्न पर निर्भर नहीं रह सकता था, DeCAL ने मजबूती से प्रदर्शन करना जारी रखा। एक नए, अनदेखे कप पर ढक्कन घुमाने के लिए पूछे जाने पर, सिस्टम 75 प्रतिशत समय सफल रहा, जो अपने प्रतिस्पर्धियों से काफी बेहतर था। यह सुझाव देता है कि रोबोट केवल गतिविधियों के एक विशिष्ट सेट को याद नहीं कर रहा है, बल्कि वह वास्तव में वस्तुओं के बीच परस्पर क्रिया की अंतर्निहित भौतिक सिद्धांतों को सीख रहा है, जिससे वह नई चुनौतियों के अनुकूल हो पा रहा है।

शोधकर्ताओं ने यह भी बारीकी से देखा कि सिस्टम ने भविष्य की भविष्यवाणी करना कैसे सीखा। रोबोट की आंतरिक भविष्यवाणियों का विश्लेषण करके, उन्होंने पाया कि यह उन बलों और विकृतियों का सटीक पूर्वानुमान लगा सकता था जो एक परस्पर क्रिया के दौरान होने वाले थे। जब रोबोट ने भविष्यवाणी की कि ढक्कन घुमाने के लिए कितने बल की आवश्यकता होगी या एक नरम सतह कितनी विकृत होगी, तो ये भविष्यवाणियाँ वास्तविक भौतिक वास्तविकता के साथ निकटता से मेल खाती थीं। भविष्य की कल्पना करने की यह क्षमता रोबोट को उसकी "सामान्य समझ" (common sense) प्रदान करती है। यह सिस्टम को यह समझने में सक्षम बनाती है कि यदि वह बहुत ज़ोर से दबाता है, तो वस्तु फिसल सकती है, या यदि वह बहुत धीरे घूमता है, तो कार्य में बहुत समय लगेगा। भौतिकी का यह अंतर्निहित ज्ञान, जो दृष्टि और स्पर्श के संयोजन से प्राप्त होता है, ही रोबोट को इतनी तरलता और आत्मविश्वास के साथ कार्य करने में सक्षम बनाता है।

इन सफलताओं के बावजूद, लेखक अपने कार्य की सीमाओं को नोट करने में सावधानी बरतते हैं। यह प्रणाली काफी हद तक इसके स्पर्श सेंसरों की सटीकता पर निर्भर करती है, और यदि वे सेंसर शोर युक्त या गलत अंशांकित (miscalibrated) हो जाते हैं, तो रोबोट का प्रदर्शन गिर सकता है। इसके अतिरिक्त, वर्तमान सेटअप के लिए एक मानव ऑपरेटर की आवश्यकता होती है जो टेलीऑपरेशन सिस्टम का उपयोग करके कार्यों का प्रदर्शन करता है, जो ऑपरेटर को स्पर्श की संवेदना प्रदान नहीं करता है। इसका मतलब है कि प्रशिक्षण डेटा शायद उन सूक्ष्म समायोजनों को पूरी तरह से कैप्चर नहीं कर पाता जो एक मनुष्य करता यदि वह स्वयं वस्तु को महसूस कर सकता। शोधकर्ता यह भी बताते हैं कि उनके मॉडल को अभी तक विविध स्पर्श डेटा के विशाल पैमाने पर प्रशिक्षित नहीं किया गया है, जो बताता है कि भविष्य के सुधार और भी व्यापक प्रकार की भौतिक अंतःक्रियाओं के संपर्क में आने से आ सकते हैं।

यह कार्य रोबोटिक बुद्धिमत्ता के बारे में हमारी सोच में एक बदलाव का प्रतिनिधित्व करता है। रोबोटों को केवल तेज़ या अधिक शक्तिशाली बनाने के बजाय, यह दृष्टिकोण मशीनों को एक गतिशील, संवादात्मक स्थान के रूप में भौतिक दुनिया को समझने में सक्षम बनाने पर केंद्रित है। रोबोट को उसके कार्यों के परिणामों की कल्पना करने और अपनी संवेदनाओं को स्थिति के अनुसार ढालने की क्षमता देकर, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो एक मशीन की तरह नहीं बल्कि एक वास्तविक एजेंट की तरह महसूस होती है जो वास्तविक संवाद करने में सक्षम है। जैसे-जैसे यह तकनीक परिपक्व होगी, उम्मीद है कि ये प्रणालियाँ अंततः मानवीय जीवन को परिभाषित करने वाले जटिल, संपर्क-युक्त कार्यों को, खाना पकाने और सफाई से लेकर बुजुर्गों की देखभाल करने तक, उसी निपुणता के साथ करने में सक्षम होंगी जो हमारे अपने कौशल से मेल खाती है। आगे का मार्ग सेंसरों को परिष्कृत करने, प्रशिक्षण डेटा का विस्तार करने और देखने, महसूस करने और करने के बीच के अंतर को पाटने में निरंतर प्रयास करने का है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →