Steering Autoregressive Vision-Language-Action Policies via Action Token Intervention
यह शोध पत्र टोकन स्टीयरिंग (Token Steering) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त इन्फरेंस-टाइम विधि है जो उपयोगकर्ताओं को एक्शन-टोकन स्पेस में निम्न-आयामी इनपुट इंजेक्ट करके ऑटोरेग्रेसिव विजन-लैंग्वेज-एक्शन पॉलिसियों को गतिशील रूप से निर्देशित करने की अनुमति देती है, जो मॉडल की सीखी हुई निपुणता और प्रायोरिटीज़ को संरक्षित करते हुए घरेलू हेरफेर कार्यों पर सफलता दर में महत्वपूर्ण सुधार करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही प्रतिभाशाली, उच्च प्रशिक्षित रोबोट शेफ है। इस रोबोट ने लाखों कुकिंग वीडियो देखे हैं और खाना काटने, चलाने और परोसने के तरीके को पूरी तरह से सीखा है। वह रेसिपी को कंठस्थ जानता है। हालाँकि, कभी-कभी, सबसे अच्छे शेफ भी छोटी सी गलती कर देते हैं—जैसे कि वे चीनी के बजाय नमक की ओर हाथ बढ़ा देते हैं, या वे अपना हाथ थोड़ा तेज़ी से चलाते हैं और एक कटोरा गिरा देते हैं।
अतीत में, यदि रोबोट कोई गलती करता था, तो आपके पास दो बुरे विकल्प थे:
- रोबोट को पूरी तरह से रोक देना और खुद नियंत्रण अपने हाथ में ले लेना (जैसे कि सेल्फ-ड्राइविंग कार का स्टीयरिंग व्हील छीन लेना), जो धीमा और निराशाजनक है।
- रोबोट को शब्दों में बताना कि "बाएँ जाओ," लेकिन रोबets भाषा के माध्यम से त्वरित, सूक्ष्म सुधारों को समझने में खराब होते हैं। वे इसे गलत समझ सकते हैं या इसे प्रोसेस करने में बहुत अधिक समय ले सकते हैं।
यह पेपर एक नया तरीका पेश करता है जिससे आप रोबोट की मदद कर सकते हैं जिसे टोकन स्टीयरिंग (Token Steering) कहा जाता है। इसे एक "धक्का" (nudge) देने वाली प्रणाली के रूप में सोचें।
"एक्शन टोकन्स" का जादू
यह समझने के लिए कि यह कैसे काम करता है, कल्पना कीजिए कि रोबोट केवल "बाएँ मुड़ें" या "दाएँ मुड़ें" के बारे में नहीं सोचता। इसके बजाय, वह टोकन्स (जैसे कि किसी शब्द के अक्षर) से बने एक गुप्त कोड में सोचता है। जब रोबोट अपनी किसी हरकत की योजना बनाता है, तो वह अपने हाथ के पूरे पथ (path) का वर्णन करने के लिए इन टोकन्स के एक लंबे वाक्य को एक-एक करके लिखता है।
शोधकर्ताओं ने पाया कि वे रोबोट द्वारा यह वाक्य लिखते समय ही इसमें हस्तक्षेप कर सकते हैं। वे रोबोट के कुछ गुप्त कोड शब्दों को अपने स्वयं के "धक्का" (nudge) शब्दों से बदल सकते हैं।
यह कैसे काम करता है: GPS का उदाहरण
रोबोट की योजना को एक GPS रूट की तरह समझें।
- रोबोट: GPS ट्रैफिक और सड़क के नियमों के आधार पर स्टोर तक जाने का सबसे अच्छा रास्ता जानता है। वह टर्न-बाय-टर्न (मोड़-दर-मोड़) सूची तैयार करता है।
- उपयोगकर्ता: आप महसूस करते हैं कि GPS गलत मोड़ लेने वाला है क्योंकि आपने सड़क पर निर्माण कार्य देखा है।
- टोकन स्टीयरिंग: इसके बजाय कि आप GPS पर चिल्लाकर "बाएँ मुड़ो!" कहें (जिसे वह अनदेखा कर सकता है) या उसका स्टीयरिंग व्हील छीन लें, आप बस एक बटन दबाते हैं जिसमें लिखा है "अगला मोड़ छोड़ें (Skip this next turn)"। GPS फिर तुरंत उस नए बिंदु से अपनी पूरी यात्रा की पुनर्गणना (recalculate) करता है, जिससे वह अपनी मौजूदा सहजता और सुरक्षा नियमों को बनाए रखता है।
पेपर के प्रयोग में, एक इंसान एक साधारण कीबोर्ड (जैसे कि एरो कीज़ दबाना) का उपयोग करके "नज" (nudge) टोकन भेजता है। रोबोट इस धक्के को स्वीकार करता है, अपने तात्कालिक पथ को थोड़ा बदलता है, और फिर अपनी सुपर-स्मार्ट बुद्धि का उपयोग करके बाकी की गति को सुचारू रूप से पूरा करता है।
उन्होंने क्या पाया
शोधकर्ताओं ने घरेलू कामों को करने वाले एक रोबोटिक आर्म पर इसका परीक्षण किया, जैसे कि दराज बंद करना या वस्तुओं को बदलना। यहाँ क्या हुआ:
- छोटे धक्के (Small Nudges) सबसे अच्छा काम करते हैं: आपको पूरी गति पर नियंत्रण पाने की आवश्यकता नहीं है। योजना के केवल पहले कुछ चरणों को थोड़ा सा बदलना ही रोबोट का विचार बदलने के लिए पर्याप्त है। यदि आप बहुत अधिक धक्का देते हैं, तो रोबोट भ्रमित हो जाता है और अजीब तरह से चलता है।
- "बड़ी तस्वीर" (Big Picture) मायने रखती है: रोबोट के कोड में "लो-फ्रीक्वेंसी" टोकन्स (गति का बड़ा, सामान्य आकार) और "हाई-फ्रीक्वेंसी" टोकन्स (बारीक विवरण) होते हैं। शोधकर्ताओं ने पाया कि यदि आप बदलना चाहते हैं कि रोबोट कहाँ जाता है, तो आपको "बड़ी तस्वीर" वाले टोकन्स को धक्का देना चाहिए। यदि आप बारीक विवरण वाले टोकन्स को धक्का देते हैं, तो इससे पथ में ज्यादा बदलाव नहीं आता है।
- गलतियों को सुधारना: जब रोबोट एक भाषा कमांड (जैसे कि उसे "हरे रंग के क्यूब" को उठाने के लिए कहा गया था लेकिन उसने "नीले रंग के क्यूब" को पकड़ लिया) से भ्रमित हो गया, तो एक इंसान उसे सही वस्तु की ओर धकेल सका। रोबोट ने सफलतापूर्वक कार्य पूरा किया। बिना धक्के के, वह इन विशिष्ट भ्रमित करने वाले कार्यों में 100% बार विफल रहा।
- वास्तविक दुनिया की सफलता: एक परीक्षण में जहाँ रोबोट को दराज बंद करनी थी, वह अकेले 90% बार विफल रहा क्योंकि वह दराज को गलत कोण पर धकेलता था। मानवीय धक्कों के साथ, वह 72.5% बार सफल हुआ और बहुत तेज़ी से कार्य पूरा किया।
यह क्यों विशेष है
सबसे अच्छी बात यह है कि शोधकर्ताओं को रोबोट को फिर से प्रशिक्षित करने या उसे नई चीजें सिखाने की आवश्यकता नहीं पड़ी। उन्होंने बस रोबोट की अपनी मूल भाषा (टोकन्स) में उससे बात करने का तरीका खोज लिया, जबकि वह सोच रहा था।
यह एक ऐसे जीनियस के साथ बातचीत करने जैसा है जो एक विदेशी भाषा बोलता है। आपको उनकी पूरी भाषा सीखने की ज़रूरत नहीं है ताकि आप उन्हें एक छोटा सा संकेत दे सकें; आपको बस उन कुछ शब्दों को जानने की ज़रूरत है जो उनकी दिशा बदलते हैं, और वे बाकी सब संभाल लेंगे।
इसका उपयोग कौन कर सकता है?
पेपर सुझाव देता है कि यह उन लोगों के लिए बहुत अच्छा है जिनके हाथों पर पूर्ण शारीरिक नियंत्रण नहीं हो सकता है। उदाहरण के लिए, कोई व्यक्ति जो ब्रेन-कंप्यूटर इंटरफेस (जो केवल "ऊपर, नीचे, बाएँ, दाएँ" के सरल संकेत भेज सकता है) का उपयोग कर रहा है, वह इस प्रणाली का उपयोग जटिल रोबोटिक आर्म को निर्देशित करने के लिए कर सकता है। इंसान सरल दिशा प्रदान करता है, और रोबोट की बुद्धिमत्ता चीजों को पकड़ने और हिलाने के लिए आवश्यक जटिल, कुशल गतिविधियों को संभालती है।
संक्षेप में, टोकन स्टीयरिंग मनुष्यों को एक सुपर-स्मार्ट रोबोट को धीरे से निर्देशित करने की अनुमति देता है बिना स्टीयरिंग छीने, जिससे गलतियों को तुरंत सुधारा जा सके और रोबोट को हमारे घरों में बहुत अधिक उपयोगी बनाया जा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।