Ordered Action Tokens for Visuomotor Policy Learning
यह शोध पत्र ऑर्डर्ड एक्शन टोकनाइजेशन (OAT) प्रस्तुत करता है, जो एक सीखा हुआ तरीका है जो निरंतर रोबोटिक एक्शन चंक्स को संरचित, क्रमबद्ध अनुक्रमों में विविक्त (discretize) करता है ताकि उच्च संपीड़न और पूर्ण डिकोडेबिलिटी प्राप्त की जा सके, जिससे लागत और निष्ठा के बीच लचीले इन्फरेंस-टाइम ट्रेडऑफ़ सक्षम होते हैं और विविध सिमुलेशन एवं वास्तविक दुनिया के कार्यों में विसुओमोटर पॉलिसी प्रदर्शन में निरंतर सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को जटिल भोजन बनाना सिखा रहे हैं। आप इसे केवल "पास्ता बनाओ" नहीं कह सकते और उम्मीद नहीं कर सकते कि यह काम कर लेगा; आपको कार्य को बहुत छोटे, विशिष्ट चरणों में तोड़ना होगा: "बर्तन उठाओ," "पानी भरो," "चूल्हा चालू करो," "उबलने का इंतज़ार करो।" रोबोटिक्स की दुनिया में, इसे विज़ुओमोटर पॉलिसी लर्निंग (visuomotor policy learning) कहा जाता है। यह एक रोबोट को दुनिया को देखने (दृष्टि/vision) और चीजें करने के लिए अपने हाथों को चलाने (मोटर नियंत्रण/motor control) के लिए उदाहरणों से सीखने की प्रक्रिया है।
एक रोबोट को सिखाने के लिए, हम आमतौर पर एक विशेष प्रकार के AI का उपयोग करते हैं जिसे विज़न-लैंग्वेज-एक्शन (VLA) मॉडल कहा जाता है। इस मॉडल को एक सुपर-स्मार्ट रोबोट मस्तिष्क के रूप में समझें जिसने हर किताब पढ़ी है और हर वीडियो देखा है। लेकिन पेचीदा हिस्सा यह है कि वास्तविक दुनिया निरंतर और सुचारू होती है, जैसे एक बहती हुई नदी। हालाँकि, रोबोट डिजिटल होते हैं और स्थिर चित्रों की एक श्रृंखला की तरह चरणों में सोचते हैं। रोबोट को सिखाने के लिए, हमें उस सुचारू प्रवाह वाली गति को छोटे टुकड़ों में काटना होगा और उसे एक ऐसी भाषा में बदलना होगा जिसे रोबोट का मस्तिष्क समझ सके। हम गति के इन छोटे टुकड़ों को "टोकन" (tokens) कहते हैं। यह एक लंबे वाक्य को लेगो ब्रिक्स (Lego bricks) की एक स्ट्रिंग में बदलने जैसा है। यदि ईंटें बहुत छोटी हैं, तो वाक्य बनाने के लिए बहुत लंबा हो जाएगा। यदि वे बहुत बड़ी या अव्यवful हैं, तो रोबोट यह नहीं समझ पाएगा कि उन्हें एक वैध चाल बनाने के लिए कैसे जोड़ना है।
लंबे समय से, वैज्ञानिक रोबोट की इन गतिविधियों को टोकन में तोड़ने का सही तरीका खोजने की कोशिश कर रहे हैं। कुछ तरीके उन्हें बहुत बारीक रूप से काट देते हैं, जिससे निर्देशों की एक विशाल, बोझिल सूची बन जाती है। अन्य तरीके उन्हें इस तरह से काटते हैं जो कागज़ पर तो अच्छा दिखता है लेकिन जब रोबोट वास्तव में हिलने की कोशिश करता है तो विफल हो जाता है। बड़ा सवाल यह रहा है: हम रोबोट की गतिविधियों को इस तरह कैसे काटें कि वे छोटी हों, समझने में आसान हों, और हमेशा एक वैध क्रिया का परिणाम दें?
यहीं पर एक नया पेपर आता है जिसमें ऑर्डर्ड एक्शन टोकेनाइज़ेशन (OAT) नामक एक चतुर समाधान दिया गया है। हार्वर्ड और स्टैनफोर्ड के शोधकर्ताओं की एक टीम ने महसूस किया कि जिस तरह से हम गतिविधियों को काटते हैं, वह उतना ही महत्वपूर्ण है जितना कि खुद काटना। उन्होंने एक नया तरीका प्रस्तावित किया जिससे रोबोट की क्रियाओं को टोकन के एक अनुक्रम (sequence) में बदला जा सके जो एक बहुत ही विशिष्ट, सहायक क्रम का पालन करता है।
कल्पना कीजिए कि आप फोन पर अपने दोस्त को एक पेंटिंग का वर्णन कर रहे हैं। यदि आप कहना शुरू करते हैं "यह एक नीला आकाश है, फिर एक हरा पेड़ है, फिर एक लाल घर है," तो आपके दोस्त को केवल एक धुंधली सी समझ मिलेगी। लेकिन यदि आप बड़े चित्र से शुरुआत करते हैं—"यह एक परिदृश्य है जिसमें आकाश, पेड़ और एक घर है"—और फिर विवरण जोड़ते हैं जैसे "आकाश चमकीला नीला है" और "घर की छत लाल है," तो आपका दोस्त चरण दर चरण एक बेहतर मानसिक छवि बनाता है। OAT रोबोट के लिए बिल्कुल यही करता है।
टीम ने पाया कि मौजूदा तरीकों में एक मुख्य घटक गायब था: क्रम (order)। कुछ तरीके बस एक-एक करके गति के हर छोटे विवरण को सूचीबद्ध करते थे, जो बहुत लंबा था। अन्य तरीकों ने गति को एक गुप्त कोड में संकुचित कर दिया, लेकिन उस कोड ने रोबोट को यह नहीं बताया कि गति का कौन सा हिस्सा सबसे महत्वपूर्ण था। नया OAT तरीका रोबोट को पहले गति के "बड़े चित्र" को सीखने और फिर बाद में सूक्ष्म विवरणों को भरने के लिए मजबूर करता है।
यह व्यवहार में इस प्रकार काम करता है:
- पहला टोकन एक बड़ा विचार है: रोबोट जो पहला टोकन अनुमानित (predict) करता है, वह उसे क्रिया का सामान्य आकार बताता है। उदाहरण के लिए, "कप के लिए हाथ बढ़ाओ।"
- बाद के टोकन विवरण जोड़ते हैं: अगले कुछ टोकन उस विचार को परिष्कृत करते हैं। "कप के लिए हाथ बढ़ाओ... थोड़ा बाईं ओर... हल्के पकड़ के साथ।"
- "एनीटाइम" डिकोडिंग (Anytime Decoding) का जादू: यह सबसे शानदार हिस्सा है। क्योंकि टोकन "बड़े विचार" से "सूक्ष्म विवरण" के क्रम में हैं, इसलिए रोबोट को पूरी सूची खत्म होने का इंतज़ार नहीं करना पड़ता। यदि रोबोट जल्दी में है, तो वह केवल पहले कुछ टोकनों के बाद रुक सकता है और फिर भी कप पकड़ने के लिए एक "काफी अच्छा" कार्य कर सकता है। यदि उसके पास अधिक समय है, तो वह एक पूर्ण, सटीक पकड़ पाने के लिए पूरी सूची का इंतज़ार कर सकता है। यह एक टेक्स्ट मैसेज की तरह है जो तब भी समझ में आता है यदि आपने केवल आधा हिस्सा पढ़ा हो।
शोधकर्ताओं ने इस विचार का परीक्षण दो मुख्य तरीकों से किया। पहले, उन्होंने कंप्यूटर सिमुलेशन में और यहाँ तक कि लैब में वास्तविक रोबोटों पर सरल रोबोट मस्तिष्क को सिखाने के लिए इसका उपयोग किया। उन्होंने पाया कि OAT का उपयोग करने से रोबोट पुराने तरीकों की तुलना में अपने कार्यों में बहुत बेहतर प्रदर्शन करते हैं। रोबोट तेजी से सीख सकते थे और कम गलतियाँ करते थे।
दूसent, उन्होंने इसे विशाल, शक्तिशाली AI मॉडलों (उन मॉडलों में जो बात कर सकते हैं और देख सकते हैं) में परखा। भले ही रोबोट सीधे हिलने के लिए टोकन का उपयोग नहीं कर रहा था, बल्कि केवल AI को कार्य के बारे में "सोचने" में मदद करने के लिए उनका उपयोग कर रहा था, फिर भी OAT ने मदद की। यह पता चला कि क्रियाओं के लिए एक स्पष्ट, क्रमित संरचना होने से AI लक्ष्य को बेहतर ढंग से समझ पाता है, जैसे निबंध लिखना शुरू करने से पहले उसका एक स्पष्ट रूपरेखा होना।
पेपर ने यह भी दिखाया कि आप इन विचारों को केवल मिला-जुला नहीं सकते। यदि आप एक "ब्लॉक" विधि (जहाँ रोबोट एक बार में टोकन के पूरे समूह का अनुमान लगाता है) का उपयोग करते हैं जो ऐसे टोकेनाइज़र के साथ नहीं बनाया गया है, तो रोबोट भ्रमित हो जाता है और खराब प्रदर्शन करता है। टोकन का "क्रम" उस तरीके से मेल खाना चाहिए जिससे रोबोट उनका अनुमान लगा रहा है।
संक्षेप में, यह पेपर सुझाव देता है कि रोबोट को सिखाने का रहस्य केवल डेटा को संकुचित करने या उसे छोटा करने के बारे में नहीं है। यह संरचना (structure) के बारे में है। रोबोट की गतिविधियों को एक ऐसे अनुक्रम में व्यवस्थित करके जो "मोटे" से "सूक्ष्म" की ओर जाता है, हम उन्हें एक ऐसा रोडमैप देते हैं जो लचीला, कुशल और पालन करने में बहुत आसान है। चाहे वह लैब में एक छोटा हाथ हो या क्लाउड में एक विशाल AI मस्तिष्क, "कैसे हिलना है" को वर्णित करने का एक स्पष्ट, क्रमित तरीका उन्हें स्मार्ट और अधिक विश्वसनीय बनाने की कुंजी प्रतीत होता है। लेखकों ने पाया कि यह दृष्टिकोण कप रखने से लेकर दराज खोलने जैसे कई अलग-अलग कार्यों में लगातार प्रदर्शन में सुधार करता है, जो यह सिद्ध करता है कि कभी-कभी, कहानी बताने का तरीका खुद कहानी जितना ही महत्वपूर्ण होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।