LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization
यह शोध पत्र LIBERO-PRO को पेश करता है, जो एक सुदृढ़ बेंचमार्क है जो वस्तुओं, अवस्थाओं, निर्देशों और वातावरण के सामान्यीकृत व्यवधानों (generalized perturbations) के तहत वर्तमान विजन-लैंग्वेज-एक्शन मॉडलों के प्रदर्शन के पूर्ण पतन को प्रदर्शित करके उनके रटने (rote memorization) पर अत्यधिक निर्भरता को उजागर करता है, जिससे समुदाय को निष्पक्ष मूल्यांकन मानकों को अपनाने के लिए प्रेरित किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट शेफ को सलाद बनाना सिखा रहे हैं। आप उसे एक वीडियो दिखाते हैं जिसमें कोई व्यक्ति सलाद ड्रेसिंग की बोतल उठाकर टोकरी में रख रहा है। रोबोट इसे देखता है, सीखता है, और फिर जब आप उसे वही करने के लिए कहते हैं, तो वह इसे पूरी तरह से करता है। आप उसे एक उच्च स्कोर देते हैं: 95%! आप सोचते हैं, "वाह, यह रोबोट निर्देशों का पालन करने में जीनियस है।"
लेकिन यहाँ एक ट्विस्ट है: रोबोट वास्तव में सोच नहीं रहा है। यह बस एक ऐसे तोते की तरह व्यवहार कर रहा है जिसने एक विशिष्ट स्क्रिप्ट को याद कर लिया है।
यह पेपर LIBERO-PRO की मूल कहानी है। लेखक तर्क देते हैं कि इन "विज़न-लैंग्वेज-एक्शन" (VLA) रोबोटों को टेस्ट करने का वर्तमान तरीका गलत है। यह एक छात्र को गणित का टेस्ट देने जैसा है जहाँ प्रश्न बिल्कुल वही हैं जिनका उन्होंने अभ्यास किया था, बस नंबरों को एक मिलीमीटर खिसका दिया गया है। छात्र 100% स्कोर करता है, लेकिन यदि आप नंबरों को थोड़ा सा भी बदल दें, तो वह पूरी तरह से विफल हो जाता है।
यहाँ इस पेपर द्वारा की गई खोजों का विवरण दिया गया है, सरल उपमाओं का उपयोग करते हुए:
1. "रट्टेबाजी" का जाल (The "Rote Memorization" Trap)
वर्तमान मानक परीक्षण (जिसे LIBERO कहा जाता है) बहुत आसान है। रोबोटों को कुछ कार्यों पर प्रशिक्षित किया जाता है और फिर उन्हें उन्हीं सटीक कार्यों पर टेस्ट किया जाता है, जिनमें केवल बहुत छोटे, लगभग अदृश्य बदलाव होते हैं (जैसे एक कटोरे को एक इंच बाईं ओर खिसका देना)।
- परिणाम: रोबोट 90% से अधिक स्कोर करते हैं।
- वास्तविकता: वे कार्य को समझ नहीं रहे हैं; वे बस उस वीडियो को दोबारा चला रहे हैं जो उन्होंने प्रशिक्षण के दौरान देखा था। वे कमरे के लेआउट और गतिविधियों के क्रम को याद करके "चीटिंग" कर रहे हैं, बजाय इसके कि वे वास्तव में यह समझें कि "टोकरी" या "सलाद ड्रेसिंग" क्या है।
2. "LIBERO-PRO" स्ट्रेस टेस्ट
इसे ठीक करने के लिए, लेखकों ने LIBERO-PRO बनाया। इसे एक "सरप्राइज पॉप क्विज़" के रूप में सोचें जिसे नकल करने वालों को पकड़ने के लिए डिज़ाइन किया गया है। उन्होंने यह देखने के लिए चार चीजों के साथ व्यवस्थित रूप से छेड़छाड़ की कि क्या रोबकी वास्तव में अनुकूलन (adapt) कर सकता है:
- ऑब्जेक्ट स्वैप (The "Imposter" - छद्म रूप):
- टेस्ट: आप रोबोट को कहते हैं, "सलाद ड्रेसिंग उठाओ।" लेकिन दृश्य में, कोई सलाद ड्रेसिंग नहीं है। इसके बजाय, वहाँ अल्फाबेट सूप का एक कैन है।
- रोबोट की प्रतिक्रिया: वह सूप को अनदेखा करता है, उस खाली जगह की ओर देखता है जहाँ ड्रेसिंग आमतौर पर होती है, और खाली हवा को पकड़ने की कोशिश करता है। वह अपनी याददाश्त में इतना फंस गया है कि उसे यह भी पता नहीं चलता कि वस्तु गायब है या अलग है।
- "निरर्थक" निर्देश (The "Nonsense" Instruction):
- टेस्ट: आप रोबोट को कहते हैं, "सलाद ड्रेसिंग उठाओ," लेकिन फिर आप शब्दों को बदलकर "fdsgfdsgsd" जैसे निरर्थक शब्दों से बदल देते हैं।
- रोबोट की प्रतिक्रिया: वह रुकता नहीं है या यह नहीं कहता, "मुझे समझ नहीं आया।" वह फिर भी सलाद ड्रेसिंग उठा लेता है। यह साबित करता है कि रोबोट वास्तव में आपकी बात सुन नहीं रहा है; वह केवल जो वह देख रहा है उसके आधार पर अनुमान लगा रहा है।
- "चलती हुई लक्ष्य" (The "Moving Target" - स्थिति परिवर्तन):
- टेस्ट: आप वस्तु को प्रशिक्षण वीडियो में जहाँ वह थी, उससे थोड़ा सा दूर हटा देते हैं।
- रोबोट की प्रतिक्रिया: वह पुराने स्थान की ओर हाथ बढ़ाता है और वस्तु को पूरी तरह से मिस कर देता है। उसके पास यह समझने की कोई अवधारणा नहीं है कि वस्तु "अभी कहाँ" है; वह केवल यह जानता है कि "उसे कहाँ होना चाहिए था।"
- "कॉम्बो" कार्य (The "Combo" Task):
- टेस्ट: आप रोब-ट को दो सरल कार्य करने के लिए कहते हैं जो वह अलग-अलग जानता है (एक कटोरा उठाना, फिर चूल्हा जलाना) लेकिन उन्हें एक नए निर्देश में मिला देते हैं।
- रोबोट की प्रतिक्रिया: वह विफल हो जाता है। वह एक नया प्लान बनाने के लिए सीखे गए दो कार्यों को जोड़ नहीं सकता। यह एक ऐसे संगीतकार की तरह है जो स्केल और कॉर्ड बजा सकता है, लेकिन यदि आप उसे एक गाना बजाने के लिए कहें, तो वह जम जाता है।
3. बड़ा खुलासा (The Big Reveal)
जब लेखकों ने शीर्ष रोबोटों (जैसे OpenVLA और Pi0) पर ये "स्ट्रेस टेस्ट" चलाए, तो परिणाम चौंकाने वाले थे।
- मानक टेस्ट स्कोर: 90%+ (शानदार दिखता है)।
- LIBERO-PRO स्कोर: 0% (पूर्ण विफलता)।
रोबोट तुरंत ढह गए। वे अलग वस्तु, बदली हुई वस्तु, अजीब निर्देश या कार्यों के नए संयोजन को संभालने में असमर्थ थे।
निष्कर्ष (The Takeaway)
पेपर निष्कर्ष निकालता है कि रोबोटों के परीक्षण के लिए वर्तमान "गोल्ड स्टैंडर्ड" भ्रामक है। यह एक ड्राइवर के कौशल को केवल इस आधार पर आंकने जैसा है कि वह एक बिल्कुल सीधे, खाली ट्रैक पर कितनी अच्छी तरह गाड़ी चला सकता है जिसे उसने हज़ार बार चलाया है।
लेखक वैज्ञानिक समुदाय से पुराने, आसान टेस्ट का उपयोग करना बंद करने का आह्वान कर रहे हैं। वे चाहते हैं कि सभी LIBERO-PRO का उपयोग करें, जो रोबोटों को यह साबित करने के लिए मजबूर करता है कि वे वास्तव में देख सकते हैं, समझ सकते हैं और वास्तविक दुनिया की अव्यवस्थित और अप्रत्याशित स्थितियों के अनुकूल हो सकते हैं, न कि केवल एक रटी-रटाई स्क्रिप्ट को दोहरा सकते हैं।
संक्षेप में: रोबोट अभी स्मार्ट नहीं हैं; वे बस याद रखने में बहुत अच्छे हैं। LIBERO-PRO वह टेस्ट है जो अंततः इस अंतर को उजागर करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।