← नवीनतम पेपर
💻 computer science

Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models

यह शोध पत्र Act2Answer प्रस्तुत करता है, जो एक नवीन मूल्यांकन प्रोटोकॉल है जो विजन-लैंग्वेज-एक्शन (VLA) मॉडलों में ज्ञान प्रतिधारण (knowledge retention) को व्यवस्थित रूप से मापने और विश्लेषण करने के लिए VLM बेंचमार्क को एक्शन-आधारित टेबलटॉप कार्यों में अनुकूलित करता है, जिससे यह पता चलता है कि जबकि ये मॉडल बुनियादी अवधारणाओं को बनाए रखते हैं, वे अपने स्रोत VLMs की तुलना में समृद्ध अर्थ संबंधी ज्ञान (semantic knowledge) में महत्वपूर्ण अंतराल प्रदर्शित करते हैं।

मूल लेखक: Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin, Nikita Kurlaev, Daria Pugacheva, Albina Burlova, Mikhail Kolosov, Denis Shepelev, Andrey Kuznetsov, Elena Tutubalina, Aleksandr I. Panov, Alexey K.
प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin, Nikita Kurlaev, Daria Pugacheva, Albina Burlova, Mikhail Kolosov, Denis Shepelev, Andrey Kuznetsov, Elena Tutubalina, Aleksandr I. Panov, Alexey K. Kovalev, Vlad Shakhuro

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली छात्र है जिसने पुस्तकालय की हर किताब पढ़ ली है और दुनिया को अंदर से जान लिया है। आप उन्हें "ज्ञानी व्यक्ति" (The Knowledgeable One) कहते हैं। फिर, आप उन्हें एक रोबोट बटलर के रूप में काम करने के लिए काम पर रखते हैं। आप उन्हें कप उठाना, दरवाजे खोलना और फर्नीचर हिलाना सिखाते हैं।

बड़ा सवाल जो यह शोध पत्र पूछता है वह यह है: हाथों को चलाने के प्रशिक्षण के बाद, क्या रोबोट बटलर को वे तथ्य याद रहते हैं जो उन्होंने किताबों से सीखे थे? या क्या "कैसे हिलना है" के प्रशिक्षण ने अनजाने में उनके दिमाग को पूरी तरह साफ कर दिया?

इस पेपर के लेखक, निकिता कचाएव और सहयोगियों के नेतृत्व में, यह पता लगाने का निर्णय लेते हैं। उन्होंने एक नया परीक्षण बनाया जिसे Act2Answer (एक्शन टू आंसर) कहा जाता है।

समस्या: "सफलता" का जाल

आमतौर पर, जब हम रोबोट का परीक्षण करते हैं, तो हम पूछते हैं: "क्या रोबatically ने कप सफलतापूर्वक उठाया?"

  • यदि रोबोट कप उठा लेता है, तो हम कहते हैं, "बहुत अच्छा!"
  • यदि रोबोट कप गिरा देता है, तो हम कहते, "खराब काम।"

लेकिन यह एक छात्र को केवल यह जाँचने जैसा है कि क्या वह अपना नाम लिखना जानता है, बिना यह देखे कि क्या वह वास्तव में गणित के सवाल का जवाब जानता है। एक रोबोट इसलिए कप गिरा सकता है क्योंकि उसके हाथ अनाड़ी हैं (खराब मोटर कौशल), न कि इसलिए कि उसे पता नहीं है कि कप गर्म कॉफी से भरा है और उसे छूना नहीं चाहिए। पुराने परीक्षण "अनाड़ी हाथों" और "खाली दिमाग" को आपस में मिला देते हैं।

समाधान: "एक्शन क्विज़"

इसे ठीक करने के लिए, शोधकर्ताओं ने Act2Answer नामक एक खेल बनाया।

एक मेज की कल्पना करें जिस पर दो चित्र हैं:

  1. एक दुखी व्यक्ति का चित्र।
  2. एक खुश व्यक्ति का चित्र।

रोबोट को एक वॉयस कमांड मिलता है: "क्यूब को दुखी व्यक्ति पर रखें।"

रोबोट के वापस बोलकर "दुखी व्यक्ति बाईं ओर है" कहने के बजाय, रोबोट को भौतिक रूप से एक क्यूब को हिलाना होगा और उसे दुखी व्यक्ति के चित्र पर रखना होगा।

  • यदि वह क्यूब को दुखी चित्र पर रखता है, तो उसे एक अंक मिलता है।
  • यदि वह क्यूब को खुश चित्र पर रखता है, तो उसे शून्य मिलता है।

यह एक "कम जोखिम वाला" (low-stakes) परीक्षण है। रोबोट को कमरे में चलने या भारी सोफा उठाने की आवश्यकता नहीं है। उसे बस एक क्यूब के साथ इशारा करना है। यह रोबोट के ज्ञान को उसके अनाड़ीपन से अलग करता है।

क्या उन्होंने पाया: "सरल बनाम जटिल" का अंतर

शोधकर्ताओं ने 7 अलग-अलग रोबोट दिमागों (VLA मॉडल) का परीक्षण किया और उनकी तुलना उनके "पैरेंट" संस्करणों (स्मार्ट टेक्स्ट-एंड-इमेज मॉडल जो उन्हें चलाने के लिए प्रशिक्षित होने से पहले थे) से की।

यहाँ उनके डेटा की कहानी है:

1. रोबोट "क्या" में माहिर है (सरल चीजें)
यदि आप रोबोट से पूछते हैं, "क्या यह लाल गेंद है या नीली गेंद?" या "क्या यह एक वृत्त है या एक वर्ग?", तो रोब "लगभग पूर्ण" होते हैं। वे अभी भी रंगों और आकारों को पूरी तरह से पहचान सकते हैं। यह ऐसा है जैसे रोबोट को स्टॉप साइन पहचानना याद रहता है।

2. रोबोट "क्यों" और "कौन" में खो जाता है (जटिल चीजें)
लेकिन जब सवाल गहरे होते हैं, तो रोबोट विफल होने लगते हैं।

  • भावनाएं: उन्हें "दुखी" चेहरे और "खुश" चेहरे के बीच अंतर करने में संघर्ष होता है।
  • सामाजिक नियम: वे शायद यह नहीं जानते कि आपको किसी बच्चे के चित्र पर क्यूब नहीं रखना चाहिए यदि निर्देश सुरक्षा का संकेत देते हैं।
  • तथ्य: वे भूल जाते हैं कि प्रसिद्ध लोग कौन हैं या वस्तुओं को सही ढंग से कैसे गिनना है।

ऐसा लगता है जैसे रोबोट ने अपना हाथ चलाना इतनी अच्छी तरह से सीख लिया कि वह इंसान होना भूल गया। "अनाड़ी हाथों" के प्रशिक्षण ने "स्मार्ट ब्रेन" के प्रशिक्षण को हर उस चीज़ के लिए ओवरराइट कर दिया जो एक साधारण आकार या रंग नहीं है।

3. "पैरेंट" बनाम "चाइल्ड"
शोधकर्ताओं ने "पैरेंट" (स्मार्ट टेक्स्ट मॉडल) और "चाइल्ड" (रोबोट) के बीच एक बड़ा अंतर पाया।

  • पैरेंट जटिल सवालों के 90% जवाब सही दे सकता था।
  • चाइल्ड (रोबोट) अक्सर लगभग 50% तक गिर जाता है (जो कि केवल अनुमान लगाना है)।

यह सुझाव देता है कि जब हम एक स्मार्ट AI को रोबोट में बदलते हैं, तो हम अक्सर उसकी सामान्य समझ (common sense) का बहुत सा हिस्सा खो देते हैं।

"छिपे हुए ज्ञान" का रहस्य

शोधकर्ताओं ने रोबोट के दिमाग (इसके आंतरिक परतों) के अंदर झाँका ताकि यह देखा जा सके कि ज्ञान वास्तव में चला गया है या केवल छिपा हुआ है।

उन्होंने पाया कि ज्ञान रोबोट के दिमाग की मध्य परतों में अभी भी मौजूद था। रोबोट आंतरिक रूप से उत्तर "जानता" था। लेकिन जब उसने उस ज्ञान को एक भौतिक क्रिया (क्यूब को हिलाना) में बदलने की कोशिश की, तो सिग्नल खो गया।

उपमा: कल्पना कीजिए कि एक व्यक्ति जो पहेली का उत्तर जानता है लेकिन उसे बोलने में ऐसी समस्या है कि वह इतना हकलाता है कि वह इसे बोल नहीं पाता। ज्ञान वहां है, लेकिन "एक्शन" वाला हिस्सा उस ज्ञान तक नहीं पहुँच पाता।

निष्कर्ष

पेपर का निष्कर्ष यह है कि केवल एक स्मार्ट AI को रोबोटिक हाथ कैसे चलाना सिखाना पर्याप्त नहीं है। हम वर्तमान में रोबोट को "करने" में महान लेकिन दुनिया के बारे में "सोचने" में बेहद खराब बनाने के लिए प्रशिक्षित कर रहे हैं।

एक वास्तव में सहायक रोबोट सहायक बनाने के लिए, हमें यह सीखना होगा कि उन्हें हिलना-डुलना कैसे सिखाया जाए बिना उन्हें उस सामान्य समझ को भुलाए जो उनके पास शुरू में थी। पेपर सुझाव देता है कि रोबोट को चलते समय भाषा और दुनिया के ज्ञान से जोड़े रखना ही कुंजी हो सकती है, लेकिन अभी, वह संतुलन गायब है।

संक्षेप में: रोबोट कप उठा सकते हैं, लेकिन वे शायद यह याद नहीं रख पाएंगे कि कप गर्म है, या जो व्यक्ति उसे पकड़े हुए है वह दुखी है। वे बेहतरीन मूवर्स हैं, लेकिन वे स्मार्ट होना भूल रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →