← नवीनतम पेपर
💻 computer science

LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization

यह शोध पत्र LIBERO-PRO को पेश करता है, जो एक सुदृढ़ बेंचमार्क है जो वस्तुओं, अवस्थाओं, निर्देशों और वातावरण के सामान्यीकृत व्यवधानों (generalized perturbations) के तहत वर्तमान विजन-लैंग्वेज-एक्शन मॉडलों के प्रदर्शन के पूर्ण पतन को प्रदर्शित करके उनके रटने (rote memorization) पर अत्यधिक निर्भरता को उजागर करता है, जिससे समुदाय को निष्पक्ष मूल्यांकन मानकों को अपनाने के लिए प्रेरित किया जा सके।

मूल लेखक: Xueyang Zhou, Yangming Xu, Guiyao Tie, Yongchao Chen, Guowen Zhang, Duanfeng Chu, Pan Zhou, Lichao Sun

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xueyang Zhou, Yangming Xu, Guiyao Tie, Yongchao Chen, Guowen Zhang, Duanfeng Chu, Pan Zhou, Lichao Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट शेफ को सलाद बनाना सिखा रहे हैं। आप उसे एक वीडियो दिखाते हैं जिसमें कोई व्यक्ति सलाद ड्रेसिंग की बोतल उठाकर टोकरी में रख रहा है। रोबोट इसे देखता है, सीखता है, और फिर जब आप उसे वही करने के लिए कहते हैं, तो वह इसे पूरी तरह से करता है। आप उसे एक उच्च स्कोर देते हैं: 95%! आप सोचते हैं, "वाह, यह रोबोट निर्देशों का पालन करने में जीनियस है।"

लेकिन यहाँ एक ट्विस्ट है: रोबोट वास्तव में सोच नहीं रहा है। यह बस एक ऐसे तोते की तरह व्यवहार कर रहा है जिसने एक विशिष्ट स्क्रिप्ट को याद कर लिया है।

यह पेपर LIBERO-PRO की मूल कहानी है। लेखक तर्क देते हैं कि इन "विज़न-लैंग्वेज-एक्शन" (VLA) रोबोटों को टेस्ट करने का वर्तमान तरीका गलत है। यह एक छात्र को गणित का टेस्ट देने जैसा है जहाँ प्रश्न बिल्कुल वही हैं जिनका उन्होंने अभ्यास किया था, बस नंबरों को एक मिलीमीटर खिसका दिया गया है। छात्र 100% स्कोर करता है, लेकिन यदि आप नंबरों को थोड़ा सा भी बदल दें, तो वह पूरी तरह से विफल हो जाता है।

यहाँ इस पेपर द्वारा की गई खोजों का विवरण दिया गया है, सरल उपमाओं का उपयोग करते हुए:

1. "रट्टेबाजी" का जाल (The "Rote Memorization" Trap)

वर्तमान मानक परीक्षण (जिसे LIBERO कहा जाता है) बहुत आसान है। रोबोटों को कुछ कार्यों पर प्रशिक्षित किया जाता है और फिर उन्हें उन्हीं सटीक कार्यों पर टेस्ट किया जाता है, जिनमें केवल बहुत छोटे, लगभग अदृश्य बदलाव होते हैं (जैसे एक कटोरे को एक इंच बाईं ओर खिसका देना)।

  • परिणाम: रोबोट 90% से अधिक स्कोर करते हैं।
  • वास्तविकता: वे कार्य को समझ नहीं रहे हैं; वे बस उस वीडियो को दोबारा चला रहे हैं जो उन्होंने प्रशिक्षण के दौरान देखा था। वे कमरे के लेआउट और गतिविधियों के क्रम को याद करके "चीटिंग" कर रहे हैं, बजाय इसके कि वे वास्तव में यह समझें कि "टोकरी" या "सलाद ड्रेसिंग" क्या है।

2. "LIBERO-PRO" स्ट्रेस टेस्ट

इसे ठीक करने के लिए, लेखकों ने LIBERO-PRO बनाया। इसे एक "सरप्राइज पॉप क्विज़" के रूप में सोचें जिसे नकल करने वालों को पकड़ने के लिए डिज़ाइन किया गया है। उन्होंने यह देखने के लिए चार चीजों के साथ व्यवस्थित रूप से छेड़छाड़ की कि क्या रोबकी वास्तव में अनुकूलन (adapt) कर सकता है:

  • ऑब्जेक्ट स्वैप (The "Imposter" - छद्म रूप):
    • टेस्ट: आप रोबोट को कहते हैं, "सलाद ड्रेसिंग उठाओ।" लेकिन दृश्य में, कोई सलाद ड्रेसिंग नहीं है। इसके बजाय, वहाँ अल्फाबेट सूप का एक कैन है।
    • रोबोट की प्रतिक्रिया: वह सूप को अनदेखा करता है, उस खाली जगह की ओर देखता है जहाँ ड्रेसिंग आमतौर पर होती है, और खाली हवा को पकड़ने की कोशिश करता है। वह अपनी याददाश्त में इतना फंस गया है कि उसे यह भी पता नहीं चलता कि वस्तु गायब है या अलग है।
  • "निरर्थक" निर्देश (The "Nonsense" Instruction):
    • टेस्ट: आप रोबोट को कहते हैं, "सलाद ड्रेसिंग उठाओ," लेकिन फिर आप शब्दों को बदलकर "fdsgfdsgsd" जैसे निरर्थक शब्दों से बदल देते हैं।
    • रोबोट की प्रतिक्रिया: वह रुकता नहीं है या यह नहीं कहता, "मुझे समझ नहीं आया।" वह फिर भी सलाद ड्रेसिंग उठा लेता है। यह साबित करता है कि रोबोट वास्तव में आपकी बात सुन नहीं रहा है; वह केवल जो वह देख रहा है उसके आधार पर अनुमान लगा रहा है।
  • "चलती हुई लक्ष्य" (The "Moving Target" - स्थिति परिवर्तन):
    • टेस्ट: आप वस्तु को प्रशिक्षण वीडियो में जहाँ वह थी, उससे थोड़ा सा दूर हटा देते हैं।
    • रोबोट की प्रतिक्रिया: वह पुराने स्थान की ओर हाथ बढ़ाता है और वस्तु को पूरी तरह से मिस कर देता है। उसके पास यह समझने की कोई अवधारणा नहीं है कि वस्तु "अभी कहाँ" है; वह केवल यह जानता है कि "उसे कहाँ होना चाहिए था।"
  • "कॉम्बो" कार्य (The "Combo" Task):
    • टेस्ट: आप रोब-ट को दो सरल कार्य करने के लिए कहते हैं जो वह अलग-अलग जानता है (एक कटोरा उठाना, फिर चूल्हा जलाना) लेकिन उन्हें एक नए निर्देश में मिला देते हैं।
    • रोबोट की प्रतिक्रिया: वह विफल हो जाता है। वह एक नया प्लान बनाने के लिए सीखे गए दो कार्यों को जोड़ नहीं सकता। यह एक ऐसे संगीतकार की तरह है जो स्केल और कॉर्ड बजा सकता है, लेकिन यदि आप उसे एक गाना बजाने के लिए कहें, तो वह जम जाता है।

3. बड़ा खुलासा (The Big Reveal)

जब लेखकों ने शीर्ष रोबोटों (जैसे OpenVLA और Pi0) पर ये "स्ट्रेस टेस्ट" चलाए, तो परिणाम चौंकाने वाले थे।

  • मानक टेस्ट स्कोर: 90%+ (शानदार दिखता है)।
  • LIBERO-PRO स्कोर: 0% (पूर्ण विफलता)।

रोबोट तुरंत ढह गए। वे अलग वस्तु, बदली हुई वस्तु, अजीब निर्देश या कार्यों के नए संयोजन को संभालने में असमर्थ थे।

निष्कर्ष (The Takeaway)

पेपर निष्कर्ष निकालता है कि रोबोटों के परीक्षण के लिए वर्तमान "गोल्ड स्टैंडर्ड" भ्रामक है। यह एक ड्राइवर के कौशल को केवल इस आधार पर आंकने जैसा है कि वह एक बिल्कुल सीधे, खाली ट्रैक पर कितनी अच्छी तरह गाड़ी चला सकता है जिसे उसने हज़ार बार चलाया है।

लेखक वैज्ञानिक समुदाय से पुराने, आसान टेस्ट का उपयोग करना बंद करने का आह्वान कर रहे हैं। वे चाहते हैं कि सभी LIBERO-PRO का उपयोग करें, जो रोबोटों को यह साबित करने के लिए मजबूर करता है कि वे वास्तव में देख सकते हैं, समझ सकते हैं और वास्तविक दुनिया की अव्यवस्थित और अप्रत्याशित स्थितियों के अनुकूल हो सकते हैं, न कि केवल एक रटी-रटाई स्क्रिप्ट को दोहरा सकते हैं।

संक्षेप में: रोबोट अभी स्मार्ट नहीं हैं; वे बस याद रखने में बहुत अच्छे हैं। LIBERO-PRO वह टेस्ट है जो अंततः इस अंतर को उजागर करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →