← नवीनतम पेपर
💬 NLP

M2{M}^2Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models

यह शोध पत्र M2\mathcal{M}^2Tok का प्रस्ताव करता है, जो एक नवीन मल्टी-हेड मल्टी-कोडबुक एक्शन टोकेनाइज़र है जो सूक्ष्म-स्तरीय एक्शन डायनेमिक्स को बेहतर ढंग से पकड़ने के लिए स्वतंत्र कोडबुक्स के साथ विशिष्ट हेड्स में लेटेंट फीचर्स को विभाजित करके पुनर्निर्माण त्रुटि (reconstruction error) को महत्वपूर्ण रूप से कम करता है और विजन-लैंग्वेज-एक्शन मॉडल के प्रदर्शन को बढ़ाता है।

मूल लेखक: Chunpu Xu, Zhixuan Liang, Yuhao Zhang, Chi-Min Chan, Jessie Wang, Yang Xiao, Mengkang Hu, Xiaokang Yang, Yao Mu

प्रकाशित 2026-09-17
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chunpu Xu, Zhixuan Liang, Yuhao Zhang, Chi-Min Chan, Jessie Wang, Yang Xiao, Mengkang Hu, Xiaokang Yang, Yao Mu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से मानव हाथ की तरल सहजता के साथ चलने के लिए संघर्ष कर रहे हैं। जबकि आधुनिक आर्टिफिशियल इंटेलिजेंस अब कविता लिख सकती है, बीमारियों का निदान कर सकती है और आश्चर्यजनक चित्र बना सकती है, मशीन को दुनिया को भौतिक रूप से संचालित करने की क्षमता देना एक कठिन चुनौती बनी हुई है। समस्या का मूल इस बात में निहित है कि कंप्यूटर गति को कैसे समझते हैं। टेक्स्ट के विपरीत, जो अलग-अलग अक्षरों से बना होता है, या छवियों के विपरीत, जो पिक्सेल से बनी होती हैं, एक रोबोटिक हाथ की भौतिक क्रियाएं डेटा की निरंतर धाराएं होती हैं। एक रोबोटिक हाथ केवल एक स्थिति से दूसरी स्थिति में नहीं कूदता; यह बीच की अनंत सूक्ष्म स्थितियों से होकर बहता है। आज के एआई को चलाने वाले शक्तिशाली लैंग्वेज मॉडल्स का उपयोग करके एक रोबोट को सिखाने के लिए, इंजीनियरों को पहले इस सुचारू, निरंतर गति को चरणों की एक श्रृंखला में अनुवादित करना होगा, ठीक वैसे ही जैसे बहती हुई नदी को व्यक्तिगत मोतियों की एक माला में बदलना। इस अनुवाद प्रक्रिया को टोकेनाइजेशन (tokenization) कहा जाता है। यदि अनुवाद बहुत मोटा (rough) है, तो रोबोट अपनी गति के सूक्ष्म विवरण खो देता है, जिसके परिणामस्वरूप झटकेदार, अपरिष्कृत क्रियाएं होती हैं जो नाजुक कार्यों में विफल हो जाती हैं। यदि अनुवाद बहुत जटिल है, तो कंप्यूटर वास्तविक समय में प्रतिक्रिया देने के लिए इसे पर्याप्त तेजी से प्रोसेस नहीं कर पाता है।

वर्षों से, शोधकर्ताओं ने इस अनुवाद समस्या को हल करने की कोशिश की है, लेकिन मौजूदा तरीके अक्सर एक चौकोर खांचे में गोल खूंटा ठोकने जैसा प्रयास करते हैं। कुछ दृष्टिकोण हर गति को निश्चित श्रेणियों की एक सरल सूची के रूप में देखते हैं, जो चरणों के बीच के सूक्ष्म समय और संबंधों की अनदेखी करता है। अन्य डेटा को समूहों में जोड़कर उसे संकुचित करने की कोशिश करते हैं, लेकिन वे अक्सर सटीक नियंत्रण के लिए आवश्यक विशिष्ट विवरणों को खो देते हैं, जैसे कि कलाई का सटीक कोण या ग्रिपर का कोमल दबाव। विवरण की यह हानि एक बाधा उत्पन्न करती है, जो रोबोट को नाजुक वस्तुओं को रखने या जटिल पुर्जों को जोड़ने जैसे जटिल कौशल सीखने से रोकती है। इसका परिणाम एक ऐसा रोबोट होता है जो व्यापक, सरल कार्य तो कर सकता है लेकिन वास्तविक दुनिया की सूक्ष्म मांगों के सामने लड़खड़ा जाता है।

शोधकर्ताओं के एक दल ने अब इस अनुवाद को संभालने का एक नया तरीका प्रस्तावित किया है, जो एक ऐसी विधि प्रदान करता है जो गति की समृद्धि को बनाए रखते हुए डेटा को आधुनिक एआई के लिए पर्याप्त संक्षिप्त रखती है। वे अपने सिस्टम को M2Tok कहते हैं, जो एक ऐसा उपकरण है जिसे रोबोटिक क्रियाओं की निरंतर धारा को एक ऐसे प्रारूप में तोड़ने के लिए डिज़ाइन किया गया है जिसे लैंग्वेज मॉडल्स समझ सकें, बिना सफलता के लिए आवश्यक सूक्ष्म गतिकी (dynamics) को खोए। रोबोट के पूरे शरीर को डेटा के एक एकल, अखंड ब्लॉक के रूप में मानने के बजाय, उनका दृष्टिकोण गति को अलग-अलग, विशिष्ट चैनलों में विभाजित करता है। कल्पना कीजिए कि एक रोबोटिक हाथ को एक साथ अपने कंधे, कोहनी, कलाई और ग्रिपर को हिलाने की आवश्यकता है। पुराने तरीके इन सभी विभिन्न गतियों को एक ही कोड में संकुचित करने की कोशिश करते थे, जिससे अक्सर सिस्टम को हाथ की सटीकता और ग्रिपर की सटीकता के बीच किसी एक को चुनने के लिए मजबूर होना पड़ता था। हालाँकि, नया तरीका इन गतियों को अलग-अलग समूहों में विभाजित करता है, जिससे एआई को प्रत्येक भाग के विशिष्ट सूक्ष्म विवरणों पर स्वतंत्र रूप से ध्यान केंद्रित करने की अनुमति मिलती है।

शोधकर्ताओं ने यह हासिल करने के लिए रोबोट की गति डेटा को कई 'हेड्स' (heads) में विभाजित किया, जहाँ प्रत्येक हेड गति के एक अलग पहलू के लिए जिम्मेदार है। एक हेड हाथ की स्थिति को ट्रैक कर सकता है, जबकि दूसरा ग्रिपर के खुलने और बंद होने को ट्रैक कर सकता है। महत्वपूर्ण रूप से, इनमें से प्रत्येक हेड गति कोड के अपने स्वतंत्र शब्दकोश (dictionary) का उपयोग करता है। कई शब्दकोशों का समानांतर में उपयोग करके, सिस्टम संयोजनों की एक विशाल संख्या बनाता है, जो एक एकल शब्दकोश द्वारा कभी भी प्रदान की जा सकने वाली संख्या से कहीं अधिक है। यह कॉम्बिनेटोरियल शक्ति सिस्टम को उच्च सटीकता के साथ बहुत अधिक विविध गतिविधियों का प्रतिनिधित्व करने की अनुमति देती है। यह इस तरह है जैसे एक संगीतकार विभिन्न वाद्य यंत्रों पर सीमित स्वरों को मिलाकर अनंत धुनें बना सकता है; नया सिस्टम जटिल क्रियाओं को उल्लेखनीय निष्ठा के साथ पुन: उत्पन्न करने के लिए रोबोट के शरीर के विभिन्न "वाद्य यंत्रों" के बीच सीमित गति कोडों को जोड़ता है।

इस विचार का परीक्षण करने के लिए, शोधकर्ताओं ने सिम्युलेटेड रोबोटिक कार्यों के एक बड़े संग्रह पर अपने सिस्टम को प्रशिक्षित किया, जिसमें ब्लॉक पर हथौड़ा चलाने से लेकर विभिन्न बोतलों को उठाने और प्लेटों पर कंटेनर रखने तक के कार्य शामिल थे। उन्होंने अपने नए तरीके की तुलना क्षेत्र में उपयोग की जाने वाली कई मौजूदा तकनीकों से की। परिणामों ने नए दृष्टिकोण के लिए एक स्पष्ट लाभ दिखाया। बारह विभिन्न सिमुलेशन कार्यों की एक श्रृंखला में, नए तरीके का उपयोग करने वाला रोबोट अपने 51 प्रतिशत प्रयासों में सफल रहा, जो अगले सबसे अच्छे तरीके से काफी बेहतर था, जो केवल 45 प्रतिशत मामलों में सफल हुआ। उच्च सटीकता की आवश्यकता वाले कठिन कार्यों में सुधार और भी नाटकीय था। उदाहरण के लिए, एक डिब्बे को बर्तन में रखने के कार्य में, नया तरीका पिछले सबसे अच्छे दृष्टिकोण की तुलना में लगभग दोगुना बार सफल हुआ। एक अन्य कार्य में, जिसमें बर्गर और फ्राइज़ बॉक्स को ट्रे पर रखना शामिल था, नए तरीके ने 64 प्रतिशत की सफलता दर हासिल की, जबकि पिछले सबसे अच्छे तरीके ने केवल 52 प्रतिशत प्रबंधित किया।

शोधकर्ताओं ने यह देखने के लिए कि क्या कौशल नई स्थितियों में स्थानांतरित हो सकते हैं, सिम्युलेटेड वातावरण के एक अलग सेट पर भी अपने सिस्टम का परीक्षण किया। यहाँ, नए तरीके ने फिर से श्रेष्ठ प्रदर्शन किया, जिसने 21 प्रतिशत के अग्रणी विकल्प की तुलना में 28 प्रतिशत की सफलता दर हासिल की। सबसे उल्लेखनीय अंतर एक कार्य में दिखाई दिया जिसमें रोबोट को एक बैंगन उठाने और उसे टोकरी में रखने की आवश्यकता थी। बैंगन एक अनियमित आकार की वस्तु है जिसे पकड़ना कठिन है, और पिछले तरीके इस कार्य को हल करने में पूरी तरह विफल रहे। हालाँकि, नया तरीका 33 प्रतिशत समय सफल रहा, जो बताता है कि सूक्ष्म विवरणों को पकड़ने की इसकी क्षमता ने इसे उस जटिल ज्यामिति को संभालने की अनुमति दी जहाँ अन्य विफल रहे।

यह सुनिश्चित करने के लिए कि ये परिणाम केवल सिमुलेशन का उत्पाद नहीं हैं, टीम ने अपने प्रशिक्षित मॉडल्स को वास्तविक दुनिया के रोबोटों पर परीक्षण किया। उन्होंने चार रोबोटिक भुजाओं और एक कैमरे से लैस एक मोबाइल प्लेटफॉर्म का उपयोग किया, और रोबोटों को तीन अलग-अलग कार्य करने के लिए कहा: घंटी बजाना, प्लेट पर कंटेनर रखना, और विभिन्न बोतलों को उठाना। ये ज़ीरो-शॉट (zero-shot) परीक्षण थे, जिसका अर्थ है कि रोबोटों ने पहले कभी इन विशिष्ट वास्तविक दुनिया की वस्तुओं या वातावरण को नहीं देखा था; उन्हें पूरी तरह से वही सीखना था जो उन्होंने सिमुलेशन में सीखा था। नया तरीका अन्य तरीकों से बेहतर रहा, जिसने तीन कार्यों में औसतन 33 प्रतिशत की सफलता दर हासिल की, जबकि सबसे अच्छे विकल्प के लिए अधिकतम 28 प्रतिशत थी। इन परीक्षणों से प्राप्त दृश्य साक्ष्य ने दिखाया कि रोबोटों ने वस्तुओं की स्थिति को सफलतापूर्वक पहचाना और सटीक पकड़ संचालन को निष्पादित किया, जिससे पुष्टि हुई कि गति डेटा का उच्च-गुणवत्ता वाला अनुवाद तब भी बना रहा जब रोबोट कंप्यूटर से बाहर निकलकर भौतिक दुनिया में आए।

सटीकता के अलावा, शोधकर्ताओं ने यह भी देखा कि सिस्टम कितनी तेजी से चल सकता है। एक रोबोट के उपयोगी होने के लिए, उसे अपने वातावरण के प्रति प्रतिक्रिया करने के लिए पर्याप्त तेजी से निर्णय लेने चाहिए। नए तरीके ने रोबोट को 8 हर्ट्ज़ से अधिक की आवृत्ति पर संचालित करने की अनुमति दी, जिसका अर्थ है कि वह प्रति सेकंड आठ से अधिक निर्णय ले सकता है। यह पुराने तरीकों की तुलना में एक महत्वपूर्ण सुधार है जो केवल 2 हर्ट्ज़ पर काम करते थे। इसके अलावा, जब शोधकर्ताओं ने एक विशेष प्रोसेसिंग इंजन का उपयोग करके सिस्टम को गति के लिए अनुकूलित किया, तो रोबमाट 56 हर्ट्ज़ की आवृत्ति तक पहुँच सका, जो अधिकांश वास्तविक समय के हेरफेर कार्यों के लिए आवश्यक गति से कहीं अधिक है। उच्च सटीकता और उच्च गति का यह संयोजन सुझाव देता है कि यह नया तरीका गतिशील वातावरण में उन्नत रोबोटों को तैनात करने के लिए एक व्यावहारिक समाधान हो सकता है।

इस कार्य की सफलता इस बात पर टिकी है कि गति डेटा को कैसे संसाधित किया जाता है। यह विचार खारिज करके कि सभी गति को एक एकल, समान कोड में संकुचित किया जाना चाहिए, शोधकर्ताओं ने सिस्टम को रोबोट के शरीर के विभिन्न हिस्सों की अद्वितीय प्रकृति का सम्मान करने की अनुमति दी। स्वतंत्र चैनलों में गति के विभाजन ने, कई विशिष्ट शब्दकोशों के उपयोग के साथ, एक ऐसा सिस्टम बनाया जो गति के सूक्ष्म, उच्च-आवृत्ति विवरणों को पकड़ सकता था जिन्हें पिछले तरीकों ने छोड़ दिया था। इस दृष्टिकोण के लिए रोबोट को चलाने वाले लैंग्वेज मॉडल्स की अंतर्निहित संरचना को बदलने की आवश्यकता नहीं थी; इसके बजाय, इसने उन्हें डेटा फीड करने का एक बेहतर तरीका प्रदान किया। परिणाम एक ऐसा रोबोट है जो भौतिक कार्यों को करने की जटिलता और कुशलता के साथ जटिल भौतिक कार्यों को समझ और निष्पादित कर सकता है, जो लैंग्वेज मॉडल्स की डिजिटल बुद्धिमत्ता और उस दुनिया की भौतिक वास्तविकता के बीच के अंतर को पाटता है जिसे उन्हें नेविगेट करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →