← नवीनतम पेपर
💻 computer science

KAN We Flow? Advancing Robotic Manipulation with 3D Flow Matching via KAN & RWKV

यह शोध पत्र KAN-We-Flow को प्रस्तुत करता है, जो रोबोटिक मैनिपुलेशन के लिए एक हल्का और कुशल 3D फ्लो-मैचिंग पॉलिसी है, जो काफी कम मापदंडों (parameters) के साथ अत्याधुनिक प्रदर्शन प्राप्त करने के लिए भारी UNet बैकबोन के स्थान पर एक नवीन RWKV-KAN आर्किटेक्चर और एक्शन कंसिस्टेंसी रेगुलराइजेशन का उपयोग करता है।

मूल लेखक: Zhihao Chen, Yiyuan Ge, Ziyang Wang, Youwei Zhang

प्रकाशित 2026-08-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhihao Chen, Yiyuan Ge, Ziyang Wang, Youwei Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से हेरफेर (manipulation) की सूक्ष्म कला के लिए संघर्ष कर रहे हैं। जबकि वे सीधी रेखाओं में भारी वस्तुओं को चलाने में उत्कृष्ट हैं, मानवीय स्पर्श वाले कार्यों—जैसे सुई में धागा पिरोना, दरवाजे का नॉब घुमाना, या लैपटॉप को असेंबल करना—ने उन्हें कठिन बना दिया है। वर्षों से, शोधकर्ता इन कौशलों को सिखाने के लिए रोबोट को विशेषज्ञों द्वारा किए जाने वाले कार्यों के वीडियो दिखाने की कोशिश कर रहे हैं, जिसे 'इमिटेशन लर्निंग' (imitation learning) कहा जाता है। हाल के सबसे सफल प्रयासों ने जटिल गणितीय मॉडलों पर भरोसा किया है जो एक अनुमान लगाने वाले खेल की तरह काम करते हैं। ये मॉडल एक यादृच्छिक (random), शोर भरे अनुमान से शुरू होते हैं और धीरे-धीरे इसे तब तक चरण-दर-चरण परिष्कृत करते हैं, जब तक कि वह अनुमान गति के एक स्पष्ट योजना में न बदल जाए। हालांकि यह विधि उच्च गुणवत्ता वाली गतियां उत्पन्न करने के लिए अच्छी काम करती है, लेकिन यह बहुत धीमी है। रोबलेट को अपने प्रत्येक कार्य के लिए दर्जनों परिशोधन चरणों (refinement steps) से गुजरना पड़ता है, जिससे एक देरी पैदा होती है जो वास्तविक समय (real-time) के नियंत्रण को असंभव बना देती है। यह एक कार को अगले मोड़ का अनुमान लगाकर, अनुमान को सुधारकर, फिर से अनुमान लगाकर और फिर से सुधारकर चलाने की कोशिश करने जैसा है, और वह भी कार के एक इंच भी चलने से पहले।

इस गति की समस्या को हल करने के लिए, वैज्ञानिकों ने 'फ्लो मैचिंग' (flow matching) नामक एक नए दृष्टिकोण की ओर रुख किया है। एक अनुमान को परिष्कृत करने के लिए कई छोटे कदम उठाने के बजाय, यह विधि एक यादृच्छिक शुरुआती बिंदु से सही क्रिया तक एक सीधा मार्ग सीखने का काम करती है, जो सैद्धांतिक रूप से रोबोट को एक ही चरण में अपना अगला कदम तय करने की अनुमति देती है। हालांकि, एक बड़ी बाधा बनी हुई थी: इन मॉडलों को चलाने वाले कंप्यूटर मस्तिष्क अभी भी बहुत भारी और बोझिल थे। वे विशाल, ऊर्जा-खपत करने वाले आर्किटेक्चर पर निर्भर थे जिन्हें शक्तिशाली सर्वरों की आवश्यकता होती थी, जिससे उन्हें वास्तविक रोबोटों में पाए जाने वाले छोटे, बैटरी से चलने वाले कंप्यूटरों पर चलाना असंभव हो गया। क्षेत्र को पुराने हार्डवेयर के भार के बिना नए तरीके की गति बनाए रखने के तरीके की आवश्यकता थी।

एक नए अध्ययन में, शोधकर्ताओं की एक टीम ने ठीक यही संतुलन प्राप्त करने वाला एक रोबोट पॉलिसी बनाया है। उन्होंने 'KAN-We-Flow' नामक एक प्रणाली पेश की, जो पारंपरिक भारी कंप्यूटर आर्किटेक्चर को एक बहुत ही हल्के और अधिक कुशल डिजाइन से बदल देती है। शोधकर्ताओं ने एक नया प्रकार का प्रोसेसिंग ब्लॉक बनाने के लिए आर्टिफिशियल इंटेलिजेंस के दो हालिया नवाचारों को जोड़ा। पहला भाग समय के प्रवाह को संभालता है, जिससे रोबोट यह समझ पाता है कि उसके कार्य एक अनुक्रम (sequence) में कैसे जुड़ते हैं, ठीक वैसे ही जैसे केवल एक स्थिर चित्र देखने के बजाय एक कहानी का अनुसरण करना। दूसरा भाग एक फाइन-ट्यूनर के रूप में कार्य करता है, जो लचीले, घुमावदार पैटर्न के बजाय कठोर, सीधी रेखाओं के बजाय सीखने की विधि का उपयोग करके रोबोट की गतिविधियों को उच्च स्तर की सटीकता के साथ समायोजित करता है। इन दोनों क्षमताओं को एक साथ बुनकर, टीम ने एक ऐसा मॉडल बनाया जो पिछले सर्वोत्तम तरीकों की तुलना में 86.8% छोटा है, फिर भी यह तेज़ चलता है और कम गलतियाँ करता है।

मानक बेंचमार्क के विरुद्ध इस कार्य के परिणाम आश्चर्यजनक हैं। दरवाजे खोलने, पेन घुमाने और फर्नीचर को असेंबल करने जैसे कार्यों वाले सिम्युलेटेड वातावरण की एक श्रृंखला में, नई प्रणाली ने अपने पूर्ववर्तियों को लगातार पछाड़ दिया। एक कठिन कार्य में जिसमें एक रोबिक हैंड द्वारा पेन को नियंत्रित करना शामिल था, नए मॉडल ने 68% सफलता दर हासिल की, जबकि पिछले अग्रणी तरीके की सफलता दर 55% थी। दरवाजे से जुड़े एक अन्य परीक्षण में, इसने 83% सफलता प्राप्त की, जो अगले सर्वश्रेष्ठ सिस्टम से काफी आगे थी। वास्तविक दुनिया के उपयोग के लिए सबसे महत्वपूर्ण बात यह है कि यह प्रणाली अविश्वसनीय रूप से तेज़ है। यह लगभग 8 से 11 मिलीसेकंड में एक नई क्रिया का निर्णय ले सकती है, जो इतना तेज़ है कि रोबोट को प्रति सेकंड 100 बार अपनी गतिविधियों को नियंत्रित करने की अनुमति देता है। यह गति मानव की प्रतिक्रिया (reflexes) के समान है, जो पुराने तरीकों के बिल्कुल विपरीत है जिन्हें एक चरण के लिए 100 मिलीसेकंड से अधिक समय लगता था, जिससे अक्सर रोबोट लड़खड़ा जाता था या अपना लक्ष्य चूक जाता था।

यह सुनिश्चित करने के लिए कि रोबोट ट्रैक पर रहे, शोधकर्ताओं ने एक विशिष्ट प्रशिक्षण नियम जोड़ा है जो एक सुरक्षा जाल (safety net) के रूप में कार्य करता है। सीखने के चरण के दौरान, सिस्टम को न केवल अगली चाल की भविष्यवाणी करने के लिए सिखाया जाता है, बल्कि यह भी सुनिश्चित करने के लिए सिखाया जाता है कि यदि वह अपने वर्तमान पथ को आगे बढ़ाए, तो वह ठीक वहीं पहुंचेगा जहां एक विशेषज्ञ मानव समाप्त हुआ होता। यह नियम रोबोट को रास्ते से भटकने से रोकता है, विशेष रूप से लंबे और जटिल कार्यों के दौरान। टीम ने पाया कि इस सरल जुड़ाव ने प्रशिक्षण प्रक्रिया को स्थिर किया और निर्णय लेने के लिए किसी भी अतिरिक्त समय की आवश्यकता के बिना अंतिम सटीकता में सुधार किया। पूरे सिस्टम का तीन अलग-अलग कार्यों के सेट पर परीक्षण किया गया, जो साधारण वस्तु हैंडलिंग से लेकर जटिल असेंबली तक विस्तृत थे, और इसने कम कंप्यूटर मेमोरी का उपयोग करते हुए लगातार उच्चतम सफलता दर प्रदान की।

इस कार्य का महत्व रोबोट लर्निंग को प्रयोगशाला से निकालकर फैक्ट्री फ्लोर या घर तक ले जाने की इसकी क्षमता में निहित है। यह सिद्ध करके कि एक हल्का, कुशल मॉडल, विशाल और धीमे मॉडलों से बेहतर प्रदर्शन कर सकता है, शोधकर्ताओं ने तैनाती के लिए एक प्रमुख बाधा को हटा दिया है। इस नई प्रणाली को चलाने के लिए सुपरकंप्यूटर की आवश्यकता नहीं है; यह इतनी छोटी है कि रोबोट पर ही फिट हो सके। इसका मतलब है कि रोबोट अंततः चलते-फिरते नए कौशल सीख सकते हैं, बिना किसी शक्तिशाली क्लाउड सर्वर के निरंतर कनेक्शन के, नए वस्तुओं और वातावरण के अनुकूल हो सकते हैं। अध्ययन सुझाव देता है कि रोबोटिक हेरफेर का भविष्य बड़े, भारी दिमाग बनाने में नहीं है, बल्कि स्मार्ट, अधिक कुशल दिमाग बनाने में है जो तेजी से सोच सकें और मानव हाथ की सटीकता के साथ कार्य कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →