Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model
डायनिन-रोबोटिक्स (Dynin-Robotics) एक ओमनीमॉडल यूनिफाइड डिफ्यूजन मॉडल पेश करता है जो भाषा, दृष्टि और क्रियाओं को डिस्क्रीट टोकन के रूप में मानता है ताकि लक्ष्य भविष्यवाणी, डायनेमिक्स मॉडलिंग और एक्शन जनरेशन को संयुक्त रूप से सीखा जा सके, जिससे साझा प्रक्षेपवक्र मॉडलिंग (shared trajectory modeling) और टेस्ट-टाइम स्केलिंग के माध्यम से कई बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से दुनिया को उस तरह समझने के लिए संघर्ष कर रहे हैं जैसे इंसान समझते हैं। जबकि एक मशीन को एक विशिष्ट निर्देशांक (कोऑर्डिनेट) पर अपना हाथ चलाने के लिए प्रोग्राम किया जा सकता है, वह तब विफल हो जाती है जब कार्य के लिए "मुझे पैकेज काटने के लिए कुछ थमा दो" जैसे अस्पष्ट निर्देश की आवश्यकता होती है। इसे हल करने के लिए, शोधकर्ता ऐसे सिस्टम बना रहे हैं जो भाषा, दृष्टि और शारीरिक गति को एक एकल मस्तिष्क में जोड़ते हैं। ये सिस्टम, जिन्हें विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है, न केवल यह सीखने की कोशिश करते हैं कि कोई वस्तु क्या है, बल्कि यह भी कि वह कैसे व्यवहार करती है और उसे कैसे संचालित किया जाए। चुनौती यह रही है कि अधिकांश वर्तमान दृष्टिकोण इन कौशलों को अलग-अलग मानते हैं: सिस्टम का एक हिस्सा शब्दों को समझ सकता है, दूसरा तस्वीर को पहचान सकता है, और तीसरा मोटर कमांड की गणना कर सकता है। यह अलगाव अक्सर रोबोट को तब भ्रमित कर देता है जब वास्तविक दुनिया बदल जाती है या जब निर्देश अप्रत्याशित तरीकों से कहे जाते हैं।
सियोल नेशनल यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने 'डिनिन-रोबोटिक्स' (Dynin-Robotics) नामक एक नया दृष्टिकोण पेश किया है जो इन अलग-अलग कौशलों को एक सुसंगत मॉडल में एकीकृत करता है। अलग-अलग कार्यों के लिए अलग-अलग मॉड्यूल बनाने के बजाय, उन्होंने एक एकल प्रणाली बनाई है जो एक साथ कई तरीकों से भविष्य की भविष्यवाणी करना सीखती है। कल्पना कीजिए कि एक रोबोट, जब उसे कोई कार्य दिया जाता है, तो वह न केवल अगले कदम की गणना करता है, बल्कि यह भी कल्पना करता है कि उस कदम के बाद दृश्य कैसा दिखेगा, अंतिम लक्ष्य अवस्था क्या होनी चाहिए, और कार्य का वर्णन शब्दों में कैसे किया जाना चाहिए। एक ही मॉडल को इन सभी भविष्यवाणियों को एक साथ संभालने के लिए प्रशिक्षित करके, शोधकर्ताओं ने पाया कि रोबोट निर्देशों का पालन करने में बहुत बेहतर हो जाता है, भले ही वे निर्देश उस तरीके से न बोले गए हों जिस तरह से उसे प्रशिक्षित किया गया था।
इस प्रणाली का मूल 'मास्क्ड डिफ्यूजन' (masked diffusion) नामक एक विधि है। सरल शब्दों में, यह एक सीखने की प्रक्रिया है जहाँ मॉडल को सूचना का एक क्रम दिखाया जाता है—जैसे कि किसी कार्य का वीडियो, एक लिखित निर्देश और रोबोट की गतिविधियाँ—लेकिन उस क्रम के कुछ हिस्सों को छिपा दिया जाता है या "मास्क" कर दिया जाता है। मॉडल का काम दिखाई देने वाले हिस्सों को देखना और यह अनुमान लगाना है कि छिपे हुए हिस्से क्या होने चाहिए। उदाहरण के लिए, यह एक कप की तस्वीर और "कप उठाओ" शब्द देख सकता है, लेकिन गति का डेटा छिपा हुआ है, इसलिए इसे सही गति का अनुमान लगाना होगा। एक अन्य परिदृश्य में, यह गति और निर्देश देख सकता है, लेकिन हाथ में कप की अंतिम तस्वीर छिपी हुई है, इसलिए इसे परिणाम का अनुमान लगाना होगा। 1.3 मिलियन से अधिक रोबोटिक प्रक्षेप पथों (ट्रैजेक्टरीज) के विशाल डेटासेट पर इन विभिन्न प्रकार के अनुमान लगाने वाले खेलों का अभ्यास करके, मॉडल यह सीखता है कि भाषा, दृष्टि और क्रिया एक दूसरे से कैसे जुड़ी हैं।
जो इस दृष्टिकोण को अद्वितीय बनाता है वह यह है कि वही मॉडल तुरंत इन विभिन्न भूमिकाओं के बीच स्विच कर सकता है। यह एक पॉलिसी (नीति) के रूप में कार्य कर सकता है, जो अगला कदम उठाने का निर्णय लेती है; एक वर्ल्ड मॉडल के रूप में, जो भविष्यवाणी करती है कि एक क्रिया के बाद कैमरा क्या देखेगा; एक गोल प्रेडिक्टर (लक्ष्य भविष्यवक्ता) के रूप में, जो कार्य की सफल अंतिम अवस्था को विज़ुअलाइज़ करती है; या एक शिक्षक के रूप में, जो रोबोट के काम करने के वीडियो से मूल निर्देश को पुनर्गठित करती है। यह लचीलापन सिस्टम को अपने स्वयं के अनुमानों का उपयोग करके अपने प्रदर्शन को बेहतर बनाने की अनुमति देता है। उदाहरण के लिए, रोबोट के अपने हाथ को हिलाने का निर्णय लेने से पहले, वह पहले यह अनुमान लगा सकता है कि लक्ष्य अवस्था कैसी दिखती है। फिर वह उस अनुमानित लक्ष्य का उपयोग अपने एक्शन प्लान को परिष्कृत करने के लिए एक मार्गदर्शक के रूप में करता है। आगे देखने और वास्तविक समय में योजना को समायोजित करने की यह प्रक्रिया रोबोट को जटिल कार्यों को संभालने में मदद करती है, जिनमें सटीक संरेखण की आवश्यकता होती है, जैसे कि फूल को फूलदान में डालना या ब्लॉक को एक विशिष्ट क्रम में स्टैक करना।
शोधकर्ताओं ने इस सिस्टम का परीक्षण विभिन्न बेंचमार्क पर किया ताकि यह देखा जा सके कि यह अन्य अग्रणी रोबोट मॉडलों की तुलना में कैसा प्रदर्शन करता है। मानक सिमुलेशन कार्यों पर, मॉडल ने 98.1% सफलता दर हासिल की, जो इसे क्षेत्र के शीर्ष प्रदर्शन करने वालों में शामिल करती है। अधिक महत्वपूर्ण बात यह है कि, उन कार्यों पर परीक्षण किए जाने पर जहाँ निर्देशों को अधिक अप्रत्यक्ष या अमूर्त बनाया गया था, सिस्टम ने अनुकूलन की महत्वपूर्ण क्षमता दिखाई। एक प्रयोग के सेट में, मॉडल का परीक्षण एक कार्य पर किया गया जहाँ उसे "प्राकृतिक रूप से मीठा और रसीला कुछ" जैसे विवरण के आधार पर एक फल चुनना था, बजाय सीधे कमांड "सेब उठाओ" के। जबकि अन्य मॉडल भाषा के इन बदलावों के साथ संघर्ष कर रहे थे, डिनिन-रोबोटिक्स ने उच्च सफलता दर बनाए रखी, जिससे पता चला कि इसने केवल विशिष्ट वाक्यांशों को याद करने के बजाय कार्य की अंतर्निहित अवधारणा को सीख लिया है।
यह सिस्टम वास्तविक दुनिया में भी प्रभावी साबित हुआ। शोधकर्ताओं ने इस मॉडल को 'फ्रंका रिसर्च 3' (Franka Research 3) नामक एक भौतिक रोबोटिक आर्म पर तैनात किया। फल उठाने, रंगीन क्यूब्स को छाँटने और उन्हें विशिष्ट क्रम में स्टैक करने जैसे कार्यों में शामिल वास्तविक दुनिया के परीक्षणों की एक श्रृंखला में, रोबोट ने चार अलग-अलग हेरफेर स्थितियों में औसतन 78.4% की सफलता दर हासिल की। यह प्रदर्शन विशेष रूप से उन कार्यों में मजबूत था जिनमें चरणों के अनुक्रम का पालन करने की आवश्यकता होती है, जैसे कि उपयोगकर्ता द्वारा निर्दिष्ट रंग क्रम में क्यूब्स को स्टैक करना। लक्ष्य और मध्यवर्ती चरणों को विज़ुअलाइज़ करने की क्षमता ने रोबोट को अपनी गलती होने पर अपना रास्ता सुधारने में मदद की, जो एक ऐसी क्षमता है जो अक्सर सरल प्रणालियों में गायब होती है।
अपने नियंत्रण की क्षमता के अलावा, मॉडल ने समझने और विवरण उत्पन्न करने की एक आश्चर्यजनक क्षमता प्रदर्शित की। रोबोट को एक कार्य करते हुए दिखाने पर, सिस्टम सटीक रूप से वर्णन कर सकता था कि क्या हो रहा है, "उठाना", "रखना" और "मोड़ना" जैसे क्रियाओं का उपयोग करते हुए, और वस्तुओं को उनके रंग और स्थान द्वारा पहचानते हुए। इसके विपरीत, कार्य विवरण दिए जाने पर, यह अंतिम दृश्य कैसा दिखेगा इसका विज़ुअल प्रेडिक्शन (दृश्य भविष्यवाणी) उत्पन्न कर सकता था। ये क्षमताएं बताती हैं कि मॉडल ने भौतिक दुनिया का एक समृद्ध, आंतरिक प्रतिनिधित्व बनाया है जो सरल मोटर नियंत्रण से कहीं आगे जाता है।
इस सिस्टम को वास्तविक समय के उपयोग के लिए पर्याप्त तेज़ बनाने के लिए, शोधकर्ताओं ने मॉडल चलाने के लिए एक विशेष विधि भी विकसित की। क्योंकि मॉडल अनुमानों को बार-बार परिष्कृत करके काम करता है, यदि इसे हर एक कदम को एक-एक करके प्रोसेस करना पड़े तो यह धीमा हो सकता है। टीम ने एक ऐसी तकनीक बनाई है जो मॉडल को एक ही समय में गति के कई चरणों का अनुमान लगाने और उन पर प्रतिबद्ध होने की अनुमति देती है। इस अनुकूलन ने रोबोट की निर्णय लेने की प्रक्रिया को मानक पद्धति की तुलना में लगभग 30 गुना तेज कर दिया, जिससे इस जटिल मॉडल को ऐसे हार्डवेयर पर चलाना संभव हो गया जो भौतिक रोबोट की गति के साथ तालमेल बिठा सके।
इस कार्य के निष्कर्ष बताते हैं कि रोबोट लर्निंग को एक एकीकृत भविष्यवाणी समस्या के रूप में मानना एक शक्तिशाली रणनीति है। भाषा को समझने, दृश्य परिवर्तनों की भविष्यवाणी करने और क्रियाओं को उत्पन्न करने की क्षमता को एक एकल ढांचे में जोड़कर, शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जो पिछले मॉडलों की तुलना में अधिक मजबूत और अनुकूलनीय है। डिनिन-रोबोटिक्स की सफलता यह संकेत देती है कि जब एक रोबोट भविष्य की कल्पना कर सकता है और कार्य के संदर्भ को समझ सकता है, तो वह वास्तविक दुनिया की अनिश्चित प्रकृति को संभालने में बहुत अधिक सक्षम हो जाता है। हालांकि अभी भी बहुत कुछ किया जाना बाकी है, विशेष रूप से लंबी और अधिक जटिल क्रियाओं के अनुक्रमों तक इन क्षमताओं का विस्तार करने के लिए, यह दृष्टिकोण ऐसे रोबोटों की ओर एक आशाजनक मार्ग प्रदान करता है जो वास्तव में अपने वातावरण को समझ सकते हैं और उसके साथ बातचीत कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।