← नवीनतम पेपर
💻 computer science

DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting

DriftingVLA एक नेटिव वन-स्टेप विजन-लैंग्वेज-एक्शन मॉडल है जो सिंगल फॉरवर्ड पास में पूर्ण एक्शन चंक्स जेनरेट करने के लिए पर-डायमेंशन टेम्पोरल ड्रिफ्टिंग के साथ एक डिस्ट्रीब्यूशन-ड्रिफ्टिंग ऑब्जेक्टिव का उपयोग करता है, जो बेंचमार्क कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त करते हुए पारंपरिक मल्टी-स्टेप फ्लो-आधारित विधियों की तुलना में 3.36-गुना गति वृद्धि प्रदान करता है।

मूल लेखक: Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

प्रकाशित 2026-09-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxuan Gao, Shiqi Zhang, Yedong Shen, Yifan Duan, Wenhao Yu, Xin Zhang, Siyuan Cao, Jiajun Deng, Yanyong Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट जो देख सकते हैं, भाषा समझ सकते हैं और मानवीय प्रवाह के साथ चल सकते हैं, लंबे समय से आर्टिफिशियल इंटेलिजेंस का एक सपना रहे हैं। वर्षों से, शोधकर्ताओं ने ऐसे सिस्टम बनाए हैं जो रोबोटिक भुजाओं को नियंत्रित करने की क्षमता के साथ शक्तिशाली दृश्य और भाषाई समझ को जोड़ते हैं। ये सिस्टम, जिन्हें विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है, रोबोट के मस्तिष्क के रूप में कार्य करते हैं, जो कैमरा जो देखता है और इंसान जो बोलता है उसे ग्रहण करते हैं, और फिर किसी कार्य को पूरा करने के लिए रोबोट के जोड़ों को कैसे हिलाना है, इसका निर्णय लेते हैं। हालाँकि, एक महत्वपूर्ण बाधा इन मशीनों को वास्तविक समय की प्रतिक्रियाशीलता से दूर रखे हुए थी। गतिविधियों का एक सुचारू क्रम उत्पन्न करने के लिए, ये मॉडल पारंपरिक रूप से एक जटिल, बहु-चरणीय प्रक्रिया पर निर्भर करते हैं। कल्पना कीजिए कि आप रेखा के प्रत्येक बिंदु पर छोटे, हिचकिचाते हुए सुधार करके एक पूर्ण वृत्त बनाने की कोशिश कर रहे हैं; रोबट को एक पथ की गणना करनी पड़ती है, एक कदम उठाना पड़ता है, अपने काम की जाँच करनी पड़ती है, और फिर एक और कदम उठाना पड़ता है, और प्रत्येक गति के लिए इस चक्र को कई बार दोहराना पड़ता है। जबकि यह विधि उच्च गुणवत्ता वाले परिणाम देती है, यह धीमी है, जिससे एक देरी पैदा होती है जो रोबोट को एक गतिशील दुनिया में सुस्त और गैर-प्रतिक्रियाशील महसूस कराती है।

शोधकर्ताओं की एक टीम ने अब एक नया दृष्टिकोण पेश किया है जो इन रोबोटों के अपने आंदोलनों की योजना बनाने के तरीके को मौलिक रूप से बदल देता है, जिससे वे एक ही क्षण में क्रियाओं का एक पूर्ण अनुक्रम उत्पन्न कर सकते हैं। उनका कार्य, जो एक सिस्टम पर केंद्रित है जिसे वे ड्रिफ्टिंगवीएलए (DriftingVLA) कहते हैं, धीमी, पुनरावृत्ति सुधार प्रक्रिया को एक ऐसी विधि से बदल देता है जो एक ही बार में संपूर्ण भविष्य की गति की भविष्यवाणी करना सीख लेती है। वास्तविक कार्य के दौरान चरण-दर-चरण पथ की गणना करने के बजाय, सिस्टम प्रशिक्षण चरण के दौरान एक यादृच्छिक शुरुआती बिंदु और अंतिम वांछित गति के बीच एक सीधा संबंध बनाना सीख लेता है। यह बदलाव रोबोट को तैनाती के दौरान पूरी पुनरावृत्ति गणनाओं को छोड़कर, सीधे सही क्रिया की ओर जाने की अनुमति देता है। जटिल हेरफेर कार्यों में शामिल परीक्षणों में, इस नई विधि ने न केवल पुराने, धीमे सिस्टम की सटीकता का मुकाबला किया, बल्कि रोबोट को तीन गुना से अधिक तेज़ भी बना दिया, जिससे एक गति पर निर्णय लेने में लगने वाला समय दो सौ मिलीसेकंड से अधिक से घटकर सत्तर मिलीसेकंड से कम हो गया।

इस सफलता का मूल आधार यह है कि शोधकर्ताओं ने रोबोट को उसके विभिन्न चलते हुए हिस्सों के बीच के संबंध को समझने के लिए कैसे सिखाया। एक रोबोटिक भुजा केवल एक सीधी रेखा में नहीं चलती है; इसमें कई जोड़ और स्वतंत्रता के स्तर (degrees of freedom) होते हैं जिन्हें मिलकर काम करना चाहिए, जैसे कि आगे बढ़ना, घूमना और ग्रिपर को खोलना। इन सिस्टम्स को तेज़ बनाने के पिछले प्रयासों में अक्सर पूरे आंदोलन को एक बड़े ब्लॉक के रूप में माना गया या इसे समय के छोटे, असंबद्ध क्षणों में तोड़ दिया गया। हालाँकि, नए दृष्टिकोण ने पहचाना कि गति की प्रत्येक विशिष्ट दिशा—जैसे ग्रिपर का ऊर्ध्वाधर उत्थान या कलाई का घूमना—का अपना अनूठा लय और सांख्यिकीय पैटर्न होता है। शोधकर्ताओं ने 'पर-डायमेंशन टेम्पोरल ड्रिफ्टिंग' नामक एक तकनीक विकसित की, जो प्रत्येक व्यक्तिगत गति दिशा के पूर्ण इतिहास को सीखने के लिए एक अलग इकाई के रूप में मानती है। यह सिस्टम को यह समझने की अनुमति देता है कि ग्रिपर को कैसे खुलना चाहिए या कलाई को कैसे घूमना चाहिए, बिना इन विभिन्न गतियों को एक एकल, कठोर गणितीय नियम के अनुरूप बनाए बिना।

महत्वपूर्ण रूप से, यह विधि अपने अंगों के समन्वय की क्षमता का त्याग नहीं करती है। भले ही सिस्टम प्रत्येक गति दिशा के पैटर्न को अलग-अलग सीखता है, फिर भी यह पूरी क्रिया योजना को एक एकीकृत समग्र के रूप में उत्पन्न करता है। रोबोट का मस्तिष्क, जो भाषा और दृष्टि को समझता है, बरकरार रहता है और उन क्रिया विशेषज्ञों का मार्गदर्शन करना जारी रखता है जो गतिविधियों का उत्पादन करते हैं। सिस्टम को कई "क्या-होगा" (what-if) परिदृश्यों के माध्यम से अपनी भविष्यवाणियों को परिष्कृत करने के लिए प्रशिक्षित करके, शोधकर्ताओं ने यह सुनिश्चित किया कि एकल-चरण निर्णय उतना ही सटीक है जितना कि एक धीमी, बहु-चरणीय गणना का परिणाम। इसका अर्थ है कि रोबोट अभी भी नाजुक कार्य कर सकता है, जैसे एक कंटेनर से दूसरे में तरल डालना या दो भुजाओं के तालमेल में काम करते हुए ब्लॉकों को स्टैक करना, बिना उस हिचकिचाहट के जो पिछले मॉडलों में व्याप्त थी।

शोधकर्ताओं ने इस नए सिस्टम का परीक्षण सिम्युलेटेड वातावरण और वास्तविक दुनिया दोनों में किया ताकि यह देखा जा सके कि क्या गति विश्वसनीयता की कीमत पर आई है। वस्तुओं को उठाने और उन्हें पुनर्व्यवस्थित करने जैसे चुनौतीपूर्ण सिमुलेशन की एक श्रृंखला में, नए सिस्टम ने लगभग 98.3 प्रतिशत की सफलता दर हासिल की, जो मौजूदा सर्वश्रेष्ठ बहु-चरणीय मॉडलों से थोड़ा बेहतर प्रदर्शन करती है। जब इसे भौतिक रोबोटिक भुजाओं के साथ वास्तविक दुनिया के परिवेश में ले जाया गया, तो सिस्टम ने अपना दबदबा बनाए रखा, और छह अलग-अलग कार्यों में, जिनमें एकल-हाथ और दोहरे-हाथ का समन्वय शामिल था, 77.67 प्रतिशत परीक्षणों में सफलता प्राप्त की। यह प्रदर्शन अन्य एक-चरण विधियों की तुलना में उल्लेखनीय रूप से अधिक था जिन्होंने केवल उनकी गणना प्रक्रिया को छोटा करके पुराने सिस्टम को तेज़ करने की कोशिश की थी, जिसके परिणामस्वरूप अक्सर सटीकता में भारी गिरावट आती थी। नए तरीके ने सिद्ध किया कि यह बदलकर कि सिस्टम कैसे सीखता है, न कि केवल यह बदलकर कि वह कैसे गणना करता है, गति और सटीकता दोनों प्राप्त करना संभव है।

कच्चे आंकड़ों के परे, अध्ययन ने पुनरावृत्ति गणना लूप को हटाने से होने वाले दक्षता लाभों पर प्रकाश डाला। वास्तविक दुनिया में, जहाँ हर सेकंड का अंश मायने रखता है, नए सिस्टम ने एक मूवमेंट चंक उत्पन्न करने के लिए आवश्यक समय को 227.61 मिलीसेकंड से घटाकर 67.67 मिलीसेकंड कर दिया। यह तीन गुना से अधिक की गति वृद्धि का प्रतिनिधित्व करता है, जो प्रभावी रूप से उस अंतराल (lag) को समाप्त करता है जो रोबोट को उनके वातावरण से कटा हुआ महसूस कराता है। जबकि प्रशिक्षण प्रक्रिया को कई "क्या-होगा" परिदृश्यों को संभालने के लिए थोड़े अधिक कंप्यूटर पावर की आवश्यकता थी, यह लागत एक बार का निवेश है। एक बार प्रशिक्षित होने के बाद, यह एक लीन, सिंगल-स्टेप दक्षता के साथ संचालित होता है जो अतिरिक्त संसाधनों की मांग नहीं करता है। यह कार्य दर्शाता है कि उत्तरदायी रोबोटिक्स का भविष्य धीमे एल्गोरिदम को चलाने के लिए तेज़ कंप्यूटर बनाने में नहीं, बल्कि एल्गोरिदम को स्वयं स्वाभाविक रूप से प्रत्यक्ष और तत्काल बनाने में निहित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →