← नवीनतम पेपर
🤖 AI

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

X-Tokenizer एक हल्का, मल्टीमॉडल एक्शन टोकेनाइज़र है जो एक एसिमेट्रिक सिमेंटिक रेसिडुअल क्वांटिज़ेशन आर्किटेक्चर और कॉन्ट्रास्टिव प्रीट्रेनिंग को नियोजित करके एक्शन टोकेनाइज़ेशन को एक सिमेंटिक इंटरफ़ेस लर्निंग टास्क के रूप में पुनर्गठित करता है ताकि विजन-लैंग्वेज रीजनिंग को सटीक निरंतर रोबोट नियंत्रण के साथ जोड़ा जा सके, जो सिमुलेशन और वास्तविक दुनिया के लॉन्ग-होरिज़न कार्यों दोनों में मौजूदा तरीकों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Xirui Kang, Yanpei Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Danpeng Chen, Xiaoyi Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xirui Kang, Yanpei Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Danpeng Chen, Xiaoyi Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कॉफी बनाना सिखाने की कोशिश कर रहे हैं। आपके पास एक शानदार "दिमाग" (एक विजन-लैंग्वेज मॉडल) है जो दुनिया को समझता है, जानता है कि कॉफी कप क्या है, और "सावधानी से कॉफी डालें" जैसे निर्देशों को पढ़ सकता है। हालाँकि, इस दिमाग की भाषा शब्दों और अवधारणाओं (डिस्क्रीट टोकन) में है, जबकि रोबोट के हाथ और मोटर को सुचारू, निरंतर गतिविधियों (जैसे "0.04mm बाएं, फिर 0.02mm ऊपर") में बात करने की आवश्यकता होती है।

समस्या यह है कि इन दोनों की भाषाएँ मेल नहीं खातीं। दिमाग के शब्द कार्यों के लिए बेहतरीन हैं, लेकिन वे मोटर को सीधे नियंत्रित करने के लिए बहुत "चंकी" (बड़े टुकड़ों वाले) हैं।

पुराना तरीका: "ज़िपर" (The Zipper)

पिछले तरीकों ने इस समस्या को हल करने के लिए एक "टोकेनाइज़र" (एक अनुवादक) का उपयोग किया जो केवल गतिविधियों को संक्षिप्त कोड की एक छोटी सूची में कंप्रेस कर देता था, जैसे सूटकेस को ज़िप करना।

  • यह कैसे काम करता था: यह गति को देखता था और कहता, "ठीक है, यह गति कोड #42 जैसी दिखती है, और यह कोड #99 जैसी।"
  • दोष: यह पूरी तरह से एक यांत्रिक संपीड़न (mechanical compression) था। इसने गति के आकार को तो सुरक्षित रखा (ताकि रोबोट उसे फिर से बना सके), लेकिन इसने रोबोट के दिमाग को यह नहीं सिखाया कि उस गति का अर्थ क्या था। दिमाग केवल त्रुटियों को कम करने के लिए रैंडम कोड का अनुमान लगा रहा था, न कि गति के पीछे के इरादे को समझ रहा था। यह एक ऐसे अनुवादक की तरह था जो सूटकेस को ज़िप करना तो जानता है, लेकिन यह नहीं जानता कि उसके अंदर क्या है।

नया तरीका: X-Tokenizer (द स्मार्ट ट्रांसलेटर)

लेखकों ने X-Tokenizer पेश किया है, जिसे वे केवल एक कंप्रेसर नहीं, बल्कि एक सिमेंटिक इंटरफेस (अर्थपूर्ण इंटरफ़ेस) के रूप में वर्णित करते हैं। इसे एक ऐसे अनुवादक के रूप में सोचें जो "रोबोट मोटर" और "मानव अवधारणा" दोनों में पारंगत है।

यह इस प्रकार कार्य करता है, एक रचनात्मक उपमा का उपयोग करते हुए:

1. दो-स्तरीय शब्दकोश (Semantic Residual Quantization)

कल्पना कीजिए कि अनुवादक के पास दो अलग-अलग अनुभागों वाला एक विशेष शब्दकोश है:

  • "बड़ा विचार" अनुभाग (ऊपरी स्तर - The "Big Idea" Section): यह हिस्सा इरादे को सीखता है। यदि रोबोट कप की ओर बढ़ रहा है, तो यह हिस्सा "कप को पकड़ें" के कोड को सीखता है। इसे क्रिया की कहानी समझने के लिए प्रशिक्षित किया गया है।
  • "बारीक विवरण" अनुभाग (गहरा स्तर - The "Fine Details" Section): यह हिस्सा सूक्ष्मता को संभालता है। यह उन छोटे, सटीक समायोजनों को सीखता है जिनकी आवश्यकता कप को बिना गिराए वास्तव में पकड़ने के लिए होती है।

लेख का नवाचार इन दोनों अनुभागों को अलग-अलग तरह से मानना है। "बड़ा विचार" अनुभाग को क्रिया के अर्थ को समझने के लिए प्रशिक्षित किया जाता है, जबकि "बारीक विवरण" वाला हिस्सा केवल इस बात पर ध्यान केंद्रित करता है कि गति एकदम सही दिखे। यह एक साझा भाषा बनाता है जहाँ रोबोट का दिमाग भौतिकी (physics) की चिंता करने से पहले लक्ष्य को समझ लेता है।

2. प्रशिक्षण शिविर (Pretraining)

इससे पहले कि रोबोट किसी वास्तविक वस्तु को छुए, X-Tokenizer 2.4 मिलियन रिकॉर्ड की गई रोबोट गतिविधियों का उपयोग करके एक विशाल प्रशिक्षण शिविर से गुजरता है। यह तीन विशिष्ट कौशल सीखता है:

  • मास्क्ड एक्शन मॉडलिंग (MAM): कल्पना कीजिए कि आप रोबोट की गतिविधियों के साथ "मैड लिब्स" (Mad Libs) जैसा खेल खेल रहे हैं। अनुवादक को क्रियाओं का एक क्रम दिखाया जाता है जिसमें एक हिस्सा गायब होता है और उसे संदर्भ के आधार पर गायब "शब्द" (क्रिया का इरादा) का अनुमान लगाना होता है। यह इसे गति के आकार को नहीं, बल्कि गति के तर्क को सीखने के लिए मजबूर करता है।
  • विज़न-लैंग्वेज अलाइनमेंट (Vision-Language Alignment): अनुवादक को एक वीडियो दिखाया जाता है जिसमें एक रोबोट हिल रहा है और निर्देश दिया जाता है "कप उठाएं।" यह रोबोट की गति के कोड को निर्देश के शब्दों के साथ सीधे जोड़ने के लिए सीखता है। यह सीखता है कि "पहुंचने" (reaching) का कोड "पहुंचने" शब्द से अर्थपूर्ण रूप से जुड़ा हुआ है।
  • भविष्य की भविष्यवाणी (Future Prediction): यह वर्तमान गति को देखता है और भविष्यवाणी करने की कोशिश करता है कि अगले एक सेकंड में रोबोट का "विज़न" कैसा दिखेगा। यह अनुवादक को क्रिया के बजाय क्रिया के परिणामों को समझने में मदद करता है।

3. परिणाम: एक साझा भाषा

प्रशिक्षण के बाद, सभी अतिरिक्त उपकरण हटा दिए जाते हैं, जिससे एक हल्का अनुवादक बचता है। जब रोबोट तैनात किया जाता है:

  • रोबोट का दिमाग (VLM) "बड़े विचार" के कोड (जैसे, "कप की ओर बढ़ें") की भविष्यवाणी करता है।
  • क्योंकि ये कोड दिमाग की भाषा से मेल खाने के लिए प्रशिक्षित किए गए थे, इसलिए रोबोट के दिमाग के आंतरिक "विचार" भौतिक कार्य के साथ बहुत अधिक संरेखित हो जाते हैं।
  • इसके बाद निरंतर मोटर कंट्रोलर इन विचारों को लेता है और गति को सुचारू रूप से निष्पादित करने के लिए "बारीक विवरण" भर देता है।

यह क्यों महत्वपूर्ण है (परिणाम)

लेखकों ने वास्तविक रोबोट और सिमुलेशन (जैसे कि ब्लॉक्स के साथ खेलने या फूलों को सजाने वाला डुअल-आर्म रोबोट) पर इसका परीक्षण किया।

  • बेहतर समझ: रोबोट का दिमाग कार्य के निर्देशों को बहुत बेहतर तरीके से समझ पाया। उन परीक्षणों में जहाँ रोबोट को भाषा के आधार पर वस्तुओं की ओर इशारा करना था, सटीकता 13.5% बढ़ गई।
  • लंबे कार्य: रोबोट लंबे, बहु-चरणीय कार्यों (जैसे "फूलों को सजाएं, फिर लाइट चालू करें") में काफी बेहतर हो गया, जिससे प्रदर्शन में 8.25% का सुधार हुआ।
  • मजबूती (Robustness): भले ही रोबोट की गतिविधियाँ थोड़ी शोर भरी या अस्थिर थीं, X-Tokenizer ने "बड़े विचार" के कोड को स्थिर रखा, जबकि पुराने तरीके भ्रमित होकर पूरी योजना बदल देते थे।

मुख्य निष्कर्ष

X-Tokenizer अनुवादक की भूमिका को बदल देता है। यह केवल एक संपीड़न उपकरण (compression tool) होने के बजाय, जो डेटा को छोटा करता है, एक सिमेंटिक ब्रिज (अर्थपूर्ण सेतु) के रूप में कार्य करता है। यह सुनिश्चित करता है कि जब रोबोट का "दिमाग" किसी क्रिया के बारे में सोचता है, तो वह उन शब्दों में सोच रहा होता है जिन्हें रोबोट का "शरीर" वास्तव में समझ और निष्पादित कर सकता है, जिससे अधिक स्मार्ट और सक्षम रोबोट बनते हैं जो वास्तविक दुनिया में जटिल निर्देशों का पालन कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →