VLAs are Confined yet Capable of Generalizing to Novel Instructions
यह शोध पत्र प्रदर्शित करता है कि विजन-लैंग्वेज-एक्शन (VLA) मॉडल इंटरपोलेशन के माध्यम से आंतरिक टेक्स्ट लेटेंट्स (text latents) में हेरफेर करके टास्क एक्सट्रपलेशन और स्पेशियल ओवरफिटिंग के साथ अपने संघर्ष को दूर कर सकते हैं, एक ऐसी तकनीक जो नवीन निर्देश बेंचमार्क पर 83% सफलता दर प्राप्त करती है और छिपे हुए, मानव-अपठनीय प्रॉम्प्ट इंजेक्शन की क्षमता को प्रकट करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट शेफ को खाना बनाना सिखा रहे हैं। आप उसे दो विशिष्ट रेसिपी दिखाते हैं:
- रेसिपी A: "क्रीम चीज़ को कटोरे में डालो।"
- रेसिपी B: "कटोरे को कैबिनेट के ऊपर रखो।"
रोबोट इन दोनों मूव्स को पूरी तरह सीख जाता है। वह रेसिपी A कर सकता है, और वह रेसिपी B भी कर सकता है। लेकिन फिर, आप उससे एक नया सवाल पूछते हैं: "क्रीम चीज़ को कैबिनेट के ऊपर रखो।"
तार्किक रूप से, रोबोट को यह करने में सक्षम होना चाहिए। वह चीज़ को पकड़ना जानता है, और वह कैबिनेट तक पहुँचना भी जानता है। उसे बस इन दो कौशलों को जोड़ने की आवश्यकता है। हालांकि, इस पेपर के अनुसार, अधिकांश उन्नत रोबोट मस्तिष्क (जिन्हें विज़न-लैंग्वेज-एक्शन मॉडल्स या VLAs कहा जाता है) इसमें बुरी तरह विफल हो जाते हैं। वे अटक जाते हैं, और ऐसा व्यवहार करते हैं जैसे उन्होंने पहले कभी कैबिनेट या क्रीम चीज़ को देखा ही न हो, भले ही उन्होंने पिछले चरणों में इनका उपयोग किया हो।
समस्या: रोबोट एक "पैरट" (तोता) है, "शेफ" नहीं
शोधकर्ताओं ने पाया कि ये रोबोट वास्तव में दुनिया को समझ नहीं रहे हैं। इसके बजाय, वे विशिष्ट दृश्यों (scenes) को याद कर रहे हैं।
इसे एक ऐसे छात्र की तरह समझें जिसने अभ्यास परीक्षण के उत्तर तो रट लिए हैं लेकिन गणित को समझा नहीं है। यदि आप उससे पूछते हैं, "2 + 2 क्या है?" तो वह कहता है "4"। लेकिन यदि आप उससे पूछते हैं, "2 + 2 क्या होगा यदि संख्याएँ लाल स्याही में लिखी हों?" तो शायद वह घबरा जाए।
रोबोट के मामले में, उसने सीख लिया है कि "क्रीम चीज़" हमेशा उस विशिष्ट स्थान से जुड़ी होती है जहाँ उसने ट्रेनिंग के दौरान क्रीम चीज़ देखी थी। वह यह नहीं समझता कि "क्रीम चीज़" एक ऐसी वस्तु है जिसे हिलाया जा सकता है; वह सोचता है कि "क्रीम चीज़" वही विशिष्ट स्थान है। पेपर इसे "स्पेशियल ओवरफिटिंग" (Spatial Overfitting) कहता है। रोबोट ट्रेनिंग वीडियो में चीजों के कहाँ होने पर इतना केंद्रित है कि वह वास्तविक क्षण में उनके वास्तविक स्थान को अनदेखा कर देता है।
समाधान: "मैजिक रेसिपी कार्ड" (टेक्स्ट लेटेंट)
शोधकर्ता जानना चाहते थे: क्या रोबोट वास्तव में गहराई में स्मार्ट है, या वह बस टूटा हुआ है?
उन्होंने रोबोट के मस्तिष्क के अंदर एक छिपा हुआ "सामग्री" (ingredient) पाया जिसे टेक्स्ट लेटेंट (Text Latent) कहा जाता है।
- उपमा: कल्पना कीजिए कि रोबोट का मस्तिष्क एक विशाल पुस्तकालय है। जब आप उसे "चीज़ को कटोरे में डालो" जैसा कमांड देते हैं, तो रोबट अपनी आंतरिक स्मृति से एक विशिष्ट, अदृश्य "रेसिपी कार्ड" निकालता है। यह कार्ड उन शब्दों में नहीं लिखा है जिन्हें आप पढ़ सकें; यह विद्युत संकेतों का एक जटिल पैटर्न (एक वेक्टर) है जो रोबोट को ठीक से बताता है कि उसे कैसे हिलना-डुलना है।
- खोज: शोधकर्ताओं ने पाया कि यदि वे इस अदृश्य "रेसिपी कार्ड" को, जो "चीज़ को कटोरे में डालने" के लिए था, वापस रोबोट के मस्तिष्क में इंजेक्ट कर दें, तो रोबोट उस क्रिया को पूरी तरह से करेगा—भले ही आपने उसे कोई शब्द न दिए हों। वह कार्ड ही निर्देश था।
सफलता: कार्डों को मिलाना (टेक्स्ट लेटेंट इंटरपोलेशन)
असली जादू तब हुआ जब उन्होंने "क्रीम चीज़ को कैबिनेट पर रखने" की समस्या को हल करने की कोशिश की।
उन्होंने कार्य A (चीज़ को कटोरे में डालना) के लिए अदृश्य "रेसिपी कार्ड" और कार्य B (कटोरे को कैबिनेट पर रखना) के लिए कार्ड लिया। फिर, उन्होंने उन दोनों कार्डों का एक सुचारू मिश्रण (smooth blend) बनाया।
- उपमा: कल्पना कीजिए कि आपके पास दो संगीत ट्रैक चल रहे हैं। एक जैज़ गाना है, दूसरा रॉक गाना। एक से दूसरे में अचानक स्विच करने के बजाय, आप जैज़ को धीरे-धीरे कम करते हुए और रॉक को बढ़ाते हुए एक मिक्सर का उपयोग करते हैं।
- परिणाम: इन दो अदृश्य रेसिपी कार्डों को रोबोट के मस्तिष्क के भीतर "मिक्स" करके, रोबोट ने सफलतापूर्वक कौशलों को जोड़ा। उसने चीज़ को पकड़ा, उसे कैबिनेट तक ले गया, और उसे गिरा दिया।
आंकड़े:
- इस ट्रिक के बिना, रोबोट (जिसे π0 नाम दिया गया है) इन नए, संयुक्त कार्यों पर केवल 9% बार सफल हुआ।
- इस "मिक्सिंग" ट्रिक के साथ, सफलता उछलकर 83% हो गई।
इससे सिद्ध हुआ कि रोबोट के भीतर वे कौशल पहले से ही मौजूद थे; बस वह उन्हें खुद से मिलाने में असमर्थ था। "रेसिपी कार्ड" वहीं थे, लेकिन रोबोट को उन्हें मिलाने के लिए एक इंसान की मदद की आवश्यकता थी।
बड़ा परीक्षण: "लिबेरो-ओओडी" (Libero-OOD) बेंचमार्क
यह साबित करने के लिए कि यह केवल एक इत्तेफाक नहीं था, लेखकों ने एक नया परीक्षण बनाया जिसे Libero-OOD कहा जाता है। इस परीक्षण में 20 कठिन कार्य शामिल हैं जहाँ रोबोट को अपने पहले से ज्ञात कौशलों को नए तरीकों से जोड़ना होता है।
- परिणाम: उन्होंने दुनिया के सबसे अच्छे रोबोट दिमागों (जैसे UniVLA, OpenVLA, और π0-fast) का परीक्षण किया। उनमें से कोई भी अपने आप इसे करने में सक्षम नहीं था। उन सभी का स्कोर 21% से नीचे रहा।
- निष्कर्ष: यहाँ तक कि सबसे स्मार्ट रोबोट भी वर्तमान में अपने ट्रेनिंग डेटा में "फंसे" हुए हैं। वे बिना मदद के सामान्यीकरण (generalize) नहीं कर सकते या "आउट ऑफ द बॉक्स" नहीं सोच सकते।
चेतावनी: "प्राइवेट इंस्ट्रक्शन्स" (निजी निर्देश)
शोधकर्ताओं ने कुछ थोड़ा डरावना भी पाया। क्योंकि ये "रेसिपी कार्ड" केवल संख्याओं के पैटर्न हैं, इसलिए आप इन्हें वापस टेक्स्ट में बदल सकते हैं।
- जब उन्होंने एक कार्य के लिए "रेसिपी कार्ड" को पढ़ने की कोशिश की, तो परिणामी टेक्स्ट निरर्थक (जैसे
QSize,black,plate) था। - हालाँकि, यदि आप इस निरर्थक टेक्स्ट को वापस रोबोट में फीड करते, तो यह अभी भी काम करता!
- रूपक: यह एक गुप्त कोड की तरह है जिसे केवल रोबोट समझता है। आप एक सामान्य दिखने वाले वाक्य के अंदर एक गुप्त निर्देश छिपा सकते हैं, और रोबोट बिना किसी को पता चले उसका पालन करेगा। इसे "बैकडोर" कहा जाता है, और यह दिखाता है कि ये मॉडल हमारी सोच से कहीं अधिक रहस्यमय हैं।
सारांश
यह पेपर हमें बताता है कि आज के सबसे स्मार्ट रोबोट उन संगीतकारों की तरह हैं जो दो गाने पूरी तरह से बजा सकते हैं लेकिन एक नया धुन (melody) नहीं बना सकते। वे अपने अभ्यास सत्रों से सटीक नोट्स और स्थितियों को याद रखते हैं लेकिन जब संगीत थोड़ा बदल जाता है, तो वे विफल हो जाते हैं।
लेखकों ने दिखाया कि यदि हम मैन्युअल रूप से दो अलग-अलग गानों के "संगीत स्कोर" (टेक्स्ट लेटेंट्स) को मिलाते हैं, तो रोबोट नई धुन बजा सकता है। यह सिद्ध करता है कि रोबोट के पास प्रतिभा है, लेकिन उसमें अपने कौशलों को मिलाने की क्षमता की कमी है। यह पेपर एक नया परीक्षण (Libero-OOD) पेश करता है ताकि शोधकर्ता ऐसे रोबोट बनाने में मदद कर सकें जो वास्तव में अपने कौशलों को मिलाना सीख सकें, न कि केवल दृश्यों को याद कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।