VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model
यह शोध पत्र VLA-ATTC को प्रस्तुत करता है, जो एक अनिश्चितता-आधारित "कॉग्निटिव क्लच" (cognitive clutch) और युग्मवार क्रिया चयन के लिए एक नवीन 'रिलेटिव एक्शन क्रिटिक' (Relative Action Critic) के माध्यम से अडैप्टिव टेस्ट-टाइम कंप्यूट के साथ विजन-लैंग्वेज-एक्शन मॉडल्स को उन्नत करता है, जो बिना किसी मैनुअल एनोटेशन के जटिल हेरफेर कार्यों में विफलता दर को महत्वपूर्ण रूप से कम करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट सहायक है। यह रोबोट सरल कार्यों में माहिर है, जैसे कप उठाना या दरवाजा खोलना। यह एक रिफ्लेक्स (प्रतिवर्त) की तरह काम करता है: यह वस्तु को देखता है, और इसका मस्तिष्क तुरंत कहता है, "इसे पकड़ो!" यह तेज़ है और आमतौर पर ठीक काम करता है।
हालाँकि, जब रोबोट किसी कठिन स्थिति का सामना करता है—जैसे ब्लॉक का एक डगमगाता हुआ टॉवर बनाना या बिना गिराए पानी डालना—तो इसका "रिफ्लेक्स" मस्तिष्क अक्सर गलती कर देता है। यह बिना सोचे-समझे बहुत तेज़ी से कार्य करता है, जिससे कप गिर जाते हैं या टॉवर ढह जाते हैं।
यह पेपर एक नई प्रणाली पेश करता है जिसे VLA-ATTC कहा जाता है। इसे एक रोबोट को "पॉज़ बटन" (रोकने वाला बटन) और एक "सोचने वाला कोच" देने के रूप में समझें, जो केवल तभी सक्रिय होते हैं जब चीजें जटिल हो जाती हैं।
यह इस प्रकार काम करता है, जिसे सरल भागों में विभाजित किया गया है:
1. "कॉग्निटिव क्लच" (द पॉज़ बटन)
सामान्य तौर पर, रोबोट पूरी गति से आगे बढ़ता है। VLA-ATTC सिस्टम एक विशेष सेंसर जोड़ता है जिसे "कॉग्निटिव क्लच" कहा जाता है।
- यह कैसे काम करता है: चलने से पहले, रोबोट अपने दिमाग में थोड़े अलग "अनुमानों" का उपयोग करके उस चाल का दो बार सिमुलेशन (अनुकरण) करता है।
- जांच: यदि दोनों अनुमान लगभग एक जैसे दिखते हैं, तो रोबोट जानता है, "मैं आश्वस्त हूँ!" और यह बस आगे बढ़ जाता है (फास्ट मोड)।
- ट्रिगर: यदि दो अनुमान बहुत अलग दिखते हैं (जैसे एक कहता है "बाएं पकड़ो" और दूसरा कहता है "दाएं पकड़ो"), तो क्लच लग जाता है। रोबोट को एहसास होता है, "ओह, यह पेचीदा है। मुझे धीमा होना चाहिए और सोचना चाहिए।"
2. "टूर्नामेंट" (सोचने का चरण)
एक बार जब क्लच लग जाता है, तो रोबोट केवल एक बार फिर से अनुमान नहीं लगाता है। इसके बजाय, वह एक साथ कई संभावित चालों की एक पूरी सूची बनाता है (मान लीजिए, वस्तु तक पहुँचने के 16 अलग-अलग तरीके)। यह कुशल है क्योंकि इसे केवल एक बार दृश्य को "देखना" पड़ता है, लेकिन फिर यह कई अलग-अलग परिणामों की कल्पना कर सकता है।
अब, इसे सबसे अच्छी चाल चुननी होगी। यहीं पर रिलेटिव एक्शन क्रिटिक (RAC) काम आता है।
3. "रेफरी" (रिलेटिव एक्शन क्रिटिक)
आमतौर पर, सबसे अच्छी चाल चुनने के लिए, एक कंप्यूटर हर चाल को एक स्कोर देने की कोशिश करता है (जैसे, "यह चाल 8.5/10 है")। पेपर कहता है कि यह कठिन है और अक्सर अविश्वसनीय होता है। यह एक डांस प्रतियोगिता को हर डांसर को एक नंबर देकर जज करने जैसा है; यह व्यक्तिपरक और भ्रमित करने वाला है।
इसके बजाय, VLA-ATTC एक टूर्नामेंट शैली का उपयोग करता है:
- रोबोट दो चालों के बीच मुकाबला कराता है: "क्या चाल A, चाल B से बेहतर है?"
- यह एक ब्रैकेट-स्टाइल टूर्नामेंट की तरह करता है (जैसे टेनिस टूर्नामेंट): चाल A, चाल B से लड़ती है, विजेता चाल C से लड़ता है, और इसी तरह।
- RAC रेफरी है। यह एक छोटा, हल्का मस्तिष्क है जिसे विशेष रूप से केवल इस प्रश्न का उत्तर देने के लिए प्रशिक्षित किया गया है: "इन दोनों में से कौन सा बेहतर है?"
- क्योंकि यह एक बार में केवल दो चीजों की तुलना करता है, इसलिए यह सब कुछ शून्य से स्कोर करने की तुलना में बहुत अधिक सटीक और तेज़ है।
4. "ऑटो-कोच" (बिना इंसानों के प्रशिक्षण)
इस रेफरी (RAC) को यह सिखाने के लिए कि निर्णय कैसे लिया जाए, आपको आमतौर पर इंसानों को वीडियो देखते हुए और यह कहते हुए कि "यह चाल अच्छी थी, वह बुरी थी," की आवश्यकता होती है। इसमें बहुत समय लगता है।
लेखकों ने इस से बचने के लिए एक चतुर तरीका बनाया है:
- वे रोबमान के अपने "परफेक्ट" प्रशिक्षण डेटा का उपयोग करते हैं।
- वे रोबोट को "अच्छी" चालें (अपना समय लेते हुए) और "बुरी" चालें (गणित में जल्दबाजी करते हुए) उत्पन्न करने के लिए कहते हैं।
- चूंकि "जल्दबाजी वाली" चालें स्वाभाविक रूप से खराब होती हैं, इसलिए सिस्टम बिना किसी मानव लेबलिंग के स्वचालित रूप से "अच्छी बनाम बुरी" जोड़ियाँ बना लेता है। यह एक जज को मास्टर शेफ बनाम एक जल्दबाजी करने वाले रसोइये के उदाहरण दिखाकर प्रशिक्षित करने जैसा है, जो स्वयं रसोई द्वारा ही उत्पन्न किए गए हैं।
परिणाम
जब उन्होंने एक रोबोटिक आर्म पर इसका परीक्षण किया:
- गति: रोबोट तेज़ बना रहा। वह केवल तभी सोचने के लिए धीमा हुआ जब वह वास्तव में भ्रमित था। अधिकांश समय, वह पहले की तरह ही तेज़ी से चला।
- सफलता: कठिन कार्यों पर, रोबोट ने बहुत कम गलतियाँ कीं। एक परीक्षण में, इसने विफलता दर को 50% से अधिक कम कर दिया।
- वास्तविक दुनिया: यह न केवल कंप्यूटर सिमुलेशन में, बल्कि एक वास्तविक कमरे में एक वास्तविक भौतिक रोबोटिक आर्म पर भी काम कर गया।
संक्षेप में: VLA-ATTC रोबोटों को आसान कार्यों के लिए "रिफ्लेक्स मोड" और कठिन कार्यों के लिए "डेलिब्रेट मोड" (विचारशील मोड) के बीच स्विच करने की क्षमता देता है, जिसमें एक स्मार्ट रेफरी पूरी प्रक्रिया को धीमा किए बिना सबसे अच्छी योजना चुनने में मदद करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।