← नवीनतम पेपर
💻 computer science

Ordered Action Tokens for Visuomotor Policy Learning

यह शोध पत्र ऑर्डर्ड एक्शन टोकनाइजेशन (OAT) प्रस्तुत करता है, जो एक सीखा हुआ तरीका है जो निरंतर रोबोटिक एक्शन चंक्स को संरचित, क्रमबद्ध अनुक्रमों में विविक्त (discretize) करता है ताकि उच्च संपीड़न और पूर्ण डिकोडेबिलिटी प्राप्त की जा सके, जिससे लागत और निष्ठा के बीच लचीले इन्फरेंस-टाइम ट्रेडऑफ़ सक्षम होते हैं और विविध सिमुलेशन एवं वास्तविक दुनिया के कार्यों में विसुओमोटर पॉलिसी प्रदर्शन में निरंतर सुधार होता है।

मूल लेखक: Chaoqi Liu, Yue Zhao, Haonan Chen, Xiaoshen Han, Jiawei Gao, Ehsan Adeli, Yilun Du

प्रकाशित 2026-07-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chaoqi Liu, Yue Zhao, Haonan Chen, Xiaoshen Han, Jiawei Gao, Ehsan Adeli, Yilun Du

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को जटिल भोजन बनाना सिखा रहे हैं। आप इसे केवल "पास्ता बनाओ" नहीं कह सकते और उम्मीद नहीं कर सकते कि यह काम कर लेगा; आपको कार्य को बहुत छोटे, विशिष्ट चरणों में तोड़ना होगा: "बर्तन उठाओ," "पानी भरो," "चूल्हा चालू करो," "उबलने का इंतज़ार करो।" रोबोटिक्स की दुनिया में, इसे विज़ुओमोटर पॉलिसी लर्निंग (visuomotor policy learning) कहा जाता है। यह एक रोबोट को दुनिया को देखने (दृष्टि/vision) और चीजें करने के लिए अपने हाथों को चलाने (मोटर नियंत्रण/motor control) के लिए उदाहरणों से सीखने की प्रक्रिया है।

एक रोबोट को सिखाने के लिए, हम आमतौर पर एक विशेष प्रकार के AI का उपयोग करते हैं जिसे विज़न-लैंग्वेज-एक्शन (VLA) मॉडल कहा जाता है। इस मॉडल को एक सुपर-स्मार्ट रोबोट मस्तिष्क के रूप में समझें जिसने हर किताब पढ़ी है और हर वीडियो देखा है। लेकिन पेचीदा हिस्सा यह है कि वास्तविक दुनिया निरंतर और सुचारू होती है, जैसे एक बहती हुई नदी। हालाँकि, रोबोट डिजिटल होते हैं और स्थिर चित्रों की एक श्रृंखला की तरह चरणों में सोचते हैं। रोबोट को सिखाने के लिए, हमें उस सुचारू प्रवाह वाली गति को छोटे टुकड़ों में काटना होगा और उसे एक ऐसी भाषा में बदलना होगा जिसे रोबोट का मस्तिष्क समझ सके। हम गति के इन छोटे टुकड़ों को "टोकन" (tokens) कहते हैं। यह एक लंबे वाक्य को लेगो ब्रिक्स (Lego bricks) की एक स्ट्रिंग में बदलने जैसा है। यदि ईंटें बहुत छोटी हैं, तो वाक्य बनाने के लिए बहुत लंबा हो जाएगा। यदि वे बहुत बड़ी या अव्यवful हैं, तो रोबोट यह नहीं समझ पाएगा कि उन्हें एक वैध चाल बनाने के लिए कैसे जोड़ना है।

लंबे समय से, वैज्ञानिक रोबोट की इन गतिविधियों को टोकन में तोड़ने का सही तरीका खोजने की कोशिश कर रहे हैं। कुछ तरीके उन्हें बहुत बारीक रूप से काट देते हैं, जिससे निर्देशों की एक विशाल, बोझिल सूची बन जाती है। अन्य तरीके उन्हें इस तरह से काटते हैं जो कागज़ पर तो अच्छा दिखता है लेकिन जब रोबोट वास्तव में हिलने की कोशिश करता है तो विफल हो जाता है। बड़ा सवाल यह रहा है: हम रोबोट की गतिविधियों को इस तरह कैसे काटें कि वे छोटी हों, समझने में आसान हों, और हमेशा एक वैध क्रिया का परिणाम दें?

यहीं पर एक नया पेपर आता है जिसमें ऑर्डर्ड एक्शन टोकेनाइज़ेशन (OAT) नामक एक चतुर समाधान दिया गया है। हार्वर्ड और स्टैनफोर्ड के शोधकर्ताओं की एक टीम ने महसूस किया कि जिस तरह से हम गतिविधियों को काटते हैं, वह उतना ही महत्वपूर्ण है जितना कि खुद काटना। उन्होंने एक नया तरीका प्रस्तावित किया जिससे रोबोट की क्रियाओं को टोकन के एक अनुक्रम (sequence) में बदला जा सके जो एक बहुत ही विशिष्ट, सहायक क्रम का पालन करता है।

कल्पना कीजिए कि आप फोन पर अपने दोस्त को एक पेंटिंग का वर्णन कर रहे हैं। यदि आप कहना शुरू करते हैं "यह एक नीला आकाश है, फिर एक हरा पेड़ है, फिर एक लाल घर है," तो आपके दोस्त को केवल एक धुंधली सी समझ मिलेगी। लेकिन यदि आप बड़े चित्र से शुरुआत करते हैं—"यह एक परिदृश्य है जिसमें आकाश, पेड़ और एक घर है"—और फिर विवरण जोड़ते हैं जैसे "आकाश चमकीला नीला है" और "घर की छत लाल है," तो आपका दोस्त चरण दर चरण एक बेहतर मानसिक छवि बनाता है। OAT रोबोट के लिए बिल्कुल यही करता है।

टीम ने पाया कि मौजूदा तरीकों में एक मुख्य घटक गायब था: क्रम (order)। कुछ तरीके बस एक-एक करके गति के हर छोटे विवरण को सूचीबद्ध करते थे, जो बहुत लंबा था। अन्य तरीकों ने गति को एक गुप्त कोड में संकुचित कर दिया, लेकिन उस कोड ने रोबोट को यह नहीं बताया कि गति का कौन सा हिस्सा सबसे महत्वपूर्ण था। नया OAT तरीका रोबोट को पहले गति के "बड़े चित्र" को सीखने और फिर बाद में सूक्ष्म विवरणों को भरने के लिए मजबूर करता है।

यह व्यवहार में इस प्रकार काम करता है:

  1. पहला टोकन एक बड़ा विचार है: रोबोट जो पहला टोकन अनुमानित (predict) करता है, वह उसे क्रिया का सामान्य आकार बताता है। उदाहरण के लिए, "कप के लिए हाथ बढ़ाओ।"
  2. बाद के टोकन विवरण जोड़ते हैं: अगले कुछ टोकन उस विचार को परिष्कृत करते हैं। "कप के लिए हाथ बढ़ाओ... थोड़ा बाईं ओर... हल्के पकड़ के साथ।"
  3. "एनीटाइम" डिकोडिंग (Anytime Decoding) का जादू: यह सबसे शानदार हिस्सा है। क्योंकि टोकन "बड़े विचार" से "सूक्ष्म विवरण" के क्रम में हैं, इसलिए रोबोट को पूरी सूची खत्म होने का इंतज़ार नहीं करना पड़ता। यदि रोबोट जल्दी में है, तो वह केवल पहले कुछ टोकनों के बाद रुक सकता है और फिर भी कप पकड़ने के लिए एक "काफी अच्छा" कार्य कर सकता है। यदि उसके पास अधिक समय है, तो वह एक पूर्ण, सटीक पकड़ पाने के लिए पूरी सूची का इंतज़ार कर सकता है। यह एक टेक्स्ट मैसेज की तरह है जो तब भी समझ में आता है यदि आपने केवल आधा हिस्सा पढ़ा हो।

शोधकर्ताओं ने इस विचार का परीक्षण दो मुख्य तरीकों से किया। पहले, उन्होंने कंप्यूटर सिमुलेशन में और यहाँ तक कि लैब में वास्तविक रोबोटों पर सरल रोबोट मस्तिष्क को सिखाने के लिए इसका उपयोग किया। उन्होंने पाया कि OAT का उपयोग करने से रोबोट पुराने तरीकों की तुलना में अपने कार्यों में बहुत बेहतर प्रदर्शन करते हैं। रोबोट तेजी से सीख सकते थे और कम गलतियाँ करते थे।

दूसent, उन्होंने इसे विशाल, शक्तिशाली AI मॉडलों (उन मॉडलों में जो बात कर सकते हैं और देख सकते हैं) में परखा। भले ही रोबोट सीधे हिलने के लिए टोकन का उपयोग नहीं कर रहा था, बल्कि केवल AI को कार्य के बारे में "सोचने" में मदद करने के लिए उनका उपयोग कर रहा था, फिर भी OAT ने मदद की। यह पता चला कि क्रियाओं के लिए एक स्पष्ट, क्रमित संरचना होने से AI लक्ष्य को बेहतर ढंग से समझ पाता है, जैसे निबंध लिखना शुरू करने से पहले उसका एक स्पष्ट रूपरेखा होना।

पेपर ने यह भी दिखाया कि आप इन विचारों को केवल मिला-जुला नहीं सकते। यदि आप एक "ब्लॉक" विधि (जहाँ रोबोट एक बार में टोकन के पूरे समूह का अनुमान लगाता है) का उपयोग करते हैं जो ऐसे टोकेनाइज़र के साथ नहीं बनाया गया है, तो रोबोट भ्रमित हो जाता है और खराब प्रदर्शन करता है। टोकन का "क्रम" उस तरीके से मेल खाना चाहिए जिससे रोबोट उनका अनुमान लगा रहा है।

संक्षेप में, यह पेपर सुझाव देता है कि रोबोट को सिखाने का रहस्य केवल डेटा को संकुचित करने या उसे छोटा करने के बारे में नहीं है। यह संरचना (structure) के बारे में है। रोबोट की गतिविधियों को एक ऐसे अनुक्रम में व्यवस्थित करके जो "मोटे" से "सूक्ष्म" की ओर जाता है, हम उन्हें एक ऐसा रोडमैप देते हैं जो लचीला, कुशल और पालन करने में बहुत आसान है। चाहे वह लैब में एक छोटा हाथ हो या क्लाउड में एक विशाल AI मस्तिष्क, "कैसे हिलना है" को वर्णित करने का एक स्पष्ट, क्रमित तरीका उन्हें स्मार्ट और अधिक विश्वसनीय बनाने की कुंजी प्रतीत होता है। लेखकों ने पाया कि यह दृष्टिकोण कप रखने से लेकर दराज खोलने जैसे कई अलग-अलग कार्यों में लगातार प्रदर्शन में सुधार करता है, जो यह सिद्ध करता है कि कभी-कभी, कहानी बताने का तरीका खुद कहानी जितना ही महत्वपूर्ण होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →